用 Claude Opus 做科研:一个老科研狗的实测笔记

冯丹
更新于 2026-06-22
分享
Claude OpusAI 科研助手AI 读论文AI 文献综述AI 写论文科研工具Claude vs ChatGPTAI 出图

我带的几个研究生,现在电脑上几乎都常开着一个 Claude 的标签页。有意思的是,问他们拿来干嘛,答案五花八门: 有人用来读文献,有人用来 debug 那段死活跑不通的 R,有人专门用它把审稿人那几句阴阳怪气翻译成"人话"再逐条 回。我自己也一样。一开始我是不太信这套的——总觉得"AI 写科研"听着就不靠谱。用了一年多,态度变了一半:它 确实接管了我工作里很大一块,但接管的不是"科研",而是科研里那些又费时间又不动脑子的杂活。

这篇就是我的实测笔记。哪儿真好用、哪儿差点坑了我、它跟 ChatGPT 和 Gemini 比是个什么定位、跟 Elicit 这类 专门工具怎么分工,我尽量讲具体,少讲虚的。先把结论摆这儿:把它当一个读得飞快、反应又快、但偶尔会一本正经 胡说的同事,你盯着点用,它能帮你省下不少命。

先说清楚:Claude Opus 到底是个什么东西

Claude 是 Anthropic 家的大模型系列,Opus 是里头最能打的一档,当前最新是 Claude Opus 4.81。它不是给 科研专门做的"学术引擎"——没有内置的论文库,默认也不联网。所以别指望它替你查到上周刚出的预印本。

Anthropic Claude 的官方文字标志。 图 1. Claude 是 Anthropic 的大模型系列,Opus 是其中最强的一档。标志来源:Wikimedia Commons(CC)。

那它强在哪?强在三件特别朴素的事:读得多、想得细、写得清楚。听上去平平无奇,可你回想一下自己一周的工作, 是不是有相当大一块就是在读、在想、在写。它正好卡在这块。

那个真正改变用法的数字:100 万 token

如果非要我挑一个最该记住的参数,是上下文窗口:Claude Opus 4.8 一次最多能吃下约 100 万 token,差不多 一千多页文字1

这个数字为什么重要,得举个例子才说得清。早些年用这类工具,最常见的翻车就是你只把"结果"那一段贴给它,它 看不到方法,于是对着一张表瞎评价。现在不一样了:你可以把一篇论文连同附录、把一份标书连同指南原文、 把一整个分析脚本连同它的数据字典,一股脑全塞进去,再问那种"得看完全部才答得上来"的问题。

而且不只是"装得下"。我自己的体感,加上第三方测评的说法是一致的——Claude 这一档是真的把整个窗口用起来, 扔进去一百多页,问到第八十页的某个细节它也能翻出来;有些模型超过十万 token 之后就开始"丢线索"了2。 所以我现在的习惯很简单粗暴:能给全的,绝不切片。

它在我的工作里具体接管了哪些活

这一节我讲得细一点,因为"它能干嘛"光说能力没用,得落到你真按几个键能干成什么。先用一张表把对应关系摆出来, 后面几小节再各自展开。

我手上的活为什么它接得住
读论文并追问100 万 token 装得下全文 + 图 + 附录,能引用、能交叉比对,不只是概括
解读自己的结果分步推理够细,还能用 effort 档位调深浅
读图、读拍下来的表有视觉能力,截图、照片直接喂1
写和清洗代码编码和多步骤任务是第一梯队1
起草与润色文字清楚、结构稳——摘要、cover letter、审稿回复

单细胞转录组的 UMAP 降维聚类图:二维平面上多种颜色的细胞群各自聚成一团。 图 2. 科研里你天天要读、要做的,很多就是这类图——比如单细胞转录组的 UMAP 聚类。把这种图截下来丢给模型,它也能帮你读个大概。

读文献:二十分钟摸清一篇论文的底

把全文贴进去,我一般按这个顺序问:这篇的核心主张是什么?支撑它的证据是哪几条?最薄弱的一环在哪?然后再补 一句——"要让我相信标题里这个结论,我至少得看到哪三个结果?"它列完,我再正经读论文。区别在于,这回我是带着 "该盯哪儿"去读的,效率完全不一样。

解读结果:让它当陪练,别让它当捧场的

跑完一组数据,我会把设计和结果给它,然后下一道死命令:站在我的对立面,挑刺。最可能的混杂因素是什么、一个 难缠的审稿人会先咬哪里。它当陪练比当捧场的有用太多了——而你完全可以直接要求它当陪练,它就老老实实开喷。

写代码:让它把"假设"先吐出来

这是我用得最多、也最省心的一块。一句"这是我 CSV 的列和每列含义,写个脚本做 X,顺便把你做的假设都 print 出来",基本能省掉半小时。重点在最后那半句:你只要扫一眼它打印的假设,就能拦住大多数闷声出错的地方。它在 写代码和跑这种多步骤的活上,确实是第一梯队1

改论文:框架交给它,判断留给你

摘要、cover letter、审稿回复,这些有固定套路、又特别磨人的文字,丢给它起个框架最划算。注意是"框架",不是 最终稿。审稿回复尤其如此:把意见和稿子一起给它,要一份逐条回应的提纲,剩下的实质内容还得你自己填。

它会在哪些地方让你栽跟头

好用归好用,边界得心里有数。下面这几条不是"偶尔",是结构性的,踩了就是踩了。

短板到底怎么回事对你意味着什么
会编造参考文献它按"像不像"来生成,格式完美、内容可能压根不存在任何一条引用,不核 DOI 就别用
默认不联网除非工具给了它检索能力,否则对很新的工作可能过时时效性的活得自己补检索
不是统计学家你让它跑个本不该跑的检验,它照跑不误统计怎么选,还得你拍板
长材料会偷懒输入特别长时,偶尔会略过细节、过度概括关键结论一定回原文核

第一条我得多说两句,因为它害人最深。它编出来的引用,作者、年份、期刊、卷期页码全像模像样,你不点开根本看 不出假。这不是我一个人的牢骚:2026 年有研究专门记录了已发表论文里 AI 伪造引用的明显上升3;另一项对 五万多篇顶会论文、两百多万条引用的大规模分析发现,约 1.07% 的论文里藏着无效或伪造的引用,而且 2025 一年 就涨了八成多4

好消息是,提示给得越具体、越在你熟悉的领域,它编的概率越低5。坏消息是,"越低"不等于"为零"——多篇综述 都把这种"看着规范、其实不存在"的引用列为当前学术诚信的真实风险6 7。所以核对这一步,永远省不掉8

它默认不联网,对很新的工作会过时

它脑子里的知识有个截止点,截止点之后的事它要么不知道,要么瞎猜。我有次问它某个方法的"最新进展",它讲得 头头是道,我一查,引的都是两年前的综述。除非你用的产品明确给它配了联网或检索工具,否则别拿它当文献数据库。 要把某个题目的文献查全,老老实实配上 Elicit、SciSpace 这种有真实索引的工具9 10

它不是统计学家,你让它跑它就跑

这点最隐蔽,因为它不会拒绝。你给它一组本不该做参数检验的数据,它会非常配合地给你跑个 t 检验、再附上一段 解释,看着特别专业。它缺的不是算力,是"该不该做这个检验"的判断。所以统计方法怎么选,最终还得你自己拍板, 它顶多帮你把选好的方法写成代码。

材料一长,它会偷偷"偷懒"

输入特别长的时候——比如你一次塞了一百多页——它偶尔会略过一些细节,或者把某段过度概括成一句话。大体不错, 但你要拿来下结论的那几个关键点,一定要回原文核一遍。我的习惯是:让它给概览没问题,但凡要写进稿子的具体 数字和结论,都按它给的位置翻回去对一眼。

Claude、ChatGPT 还是 Gemini:我的实际感受

这三家我都在日常里轮着用,说点主观但实在的体会(基准分这种东西仅供参考,最后还得看你自己的活实测)。

Claude、ChatGPT(OpenAI)、Gemini 三家模型的官方标志并排。 图 3. 科研里最常被拿来比的三家通用模型。标志来源:Wikimedia Commons(CC)。

模型我会优先用它干的事要留个心眼的地方
Claude Opus啃长材料、写代码、跑多步流程、写长文;调工具在实操里靠谱2没有内置文献库;会编引用
ChatGPT日常通用、插件生态广、上手快据测评,超长上下文(>10 万 token)更容易"断片"2
Gemini纯推理跑分常领先、和 Google 搜索/全家桶贴得紧2终归是通用助手,不是给科研做的

说句扫兴的话——这点差距,在我日常里经常被"你会不会提问"给抹平了。把材料给全、把假设逼出来,比纠结选哪家 重要得多。下面是我具体什么时候开哪个。

我什么时候开 Claude

啃长材料、写代码、跑多步骤的活,我默认开它。一篇论文连附录、一个要改的脚本连数据字典,丢进去问到底,它 不太丢线索;让它写脚本、改流程,返工率也低2。需要它老老实实当陪练挑刺时,它也配合。

我什么时候开 Gemini

要它快速搜点东西、再把搜到的东西揉进答案里,或者我本来就在 Google 那套文档/邮件里转,开 Gemini 更顺手; 它在一些纯推理的基准上分数也亮眼2 11。但它终归是通用助手,碰到要它当"科研搭子"深聊时,我还是回 Claude。

我什么时候开 ChatGPT

图省事、要最广的插件和应用生态、或者团队里别人都在用它、要对齐时,我开 ChatGPT。它通用、上手快。只是 碰到那种"一次塞十几万 token"的超长材料,据测评它比另外两家更容易断片2,这种活我不太交给它。

一个真实例子:从"这趋势是真的吗"到一张能投稿的图

举个我常遇到的场景。你做了个小的剂量-反应实验,手里就那么几个点,想在往下砸时间之前先掂量掂量:这趋势是 真的,还是我看花眼了?

这件事其实分两半。前一半是"想清楚",特别适合交给模型。 把数据和问题甩给它:单调趋势成不成立、用什么 检验合适、样本量这么小要提防什么、要不要先看效应量再谈显著性。它会把推理一步步摆出来,你负责挑里头站不住 的地方。

后一半是"出成品",这时候对话模型就该退场了。 它能写画图代码,但它看不见渲染出来的图长啥样,判断不了 排版顺不顺眼,更交不出一张你能直接塞进稿子、还能继续编辑的矢量图。这最后一公里我一般交给专门的出图工具——我自己用 MindPlot:传上数据、说一句要画什么,它出一张可编辑的图,省得再跟 matplotlib 的字体边距较劲。

一张带显著性标注的分组柱状图:两组(OJ、VC)在三个剂量下的反应,柱上标注了组间 p 值,配误差棒和散点。 图 4. 像这样一张带统计检验、显著性标注的分组图,传上数据说一句就能出,还能在画布上接着改。

一句话概括这个分工:模型负责对数据动脑子,工具负责把成品端出来。两件事别让一个工具硬扛。

通用模型之外,还有一类专门工具

光有通用大模型不够。真要做穷尽式的文献覆盖,专门工具往往更靠谱,因为它们背后是真实的论文索引,而不是模型 脑补。

  • Elicit 擅长在真实论文库上做结构化的筛选和信息抽取,做系统综述、meta 分析时特别顺手;但它窄,基本不 管通用推理和写作9
  • SciSpace 覆盖面更宽,能跨海量论文发现、读、解释、找相关工作,从"发现"一路接到"初稿";但它偏阅读发现, 不是你拿来做通用分析的工具9 12

把通用模型和专门工具放一起看,分工大概是这样:

工具我会优先用它干的事它的真实局限
Claude Opus深度推理、啃长材料、写代码、写作没内置文献库;会编引用
Elicit真索引上做结构化筛选与抽取,系统综述/meta 分析窄,不管通用推理和写作9
SciSpace跨海量论文发现、读、解释、找相关工作偏阅读发现,不是通用分析工具12
MindPlot把分析变成成品——图、幻灯片、文档是产出层,本身不是前沿对话模型

我最后落到的组合是这样的:用前沿模型来想和写,需要把文献查全时用 Elicit / SciSpace 这种带真索引的工具 10,再用 MindPlot 这类生产工具把图、幻灯片、论文这些"成品"做出来。 三类东西是互补的,别逼着一个去干 另一个的活。

学生、博后、PI:同一件工具,三种用法

同一个 Claude,不同阶段的人用法差挺远。说几个我身边真见过的。

如果你是研究生

我见过最划算的用法,是拿它降低"卡壳成本"。代码报错看不懂,整段贴进去让它解释、给最小可复现的修法;英文写 不顺,让它在不改你意思的前提下顺一遍语言(注意是顺语言,不是替你写)。读不动的经典文献,让它先讲个大白话 版本,你心里有底了再去啃原文。一句话:哪儿卡住了,先问它一句,往往能省半天。

如果你是博后

一张 3D 曲面图:在两个自变量构成的平面上,因变量形成起伏的曲面,配色平滑。 图 5. 数据形态复杂时(比如这种 3D 曲面),手画图很费劲——把推理交给模型、把出图交给工具,这种活会轻松不少。

博后的时间最碎,它正好补这种碎活。跑数据时让它写脚本顺带 print 假设;投稿前让它当审稿人预演一遍,把最可能 被咬的点先补上;带学生时让它把你脑子里那套方法学口述整理成可发给学生的文档。它不会替你做研究,但能让你在 同样的时间里多转几圈。

如果你是 PI

到了 PI 这一层,瓶颈常常是"看不过来"。组里的稿子、跨领域的文献、一个还没想清楚的 idea——把材料整段丢进去, 让它先给你一个结构化的概览和几个该追问的点,你再决定往哪儿深挖。它替你做的是"先过一遍、标出重点",省的是 你最贵的那点注意力。

几个我天天在用的提示词

光说方法太虚,直接把我贴了无数遍的几句模板放这儿,你拿去改改就能用。它们都不花哨,重点是把"上下文"和 "我到底要什么"说清楚。

读一篇论文

这是一篇论文的全文(含附录)。请按顺序回答:①它的核心主张是什么;②支撑这个主张的证据有哪几条,分别在 哪一节;③你觉得最薄弱的一环在哪。最后再列:要让我相信标题里的结论,我至少得看到哪三个结果?

解读一组结果

我做了 [实验设计一句话],得到这组数据:[贴数据]。我想知道 [你的问题]。请一步步推理:这个比较成不成立、 用什么统计方法合适、样本量这么小要提防什么。先别急着下结论,把你的推理和假设都摆出来。

让它当陪练挑刺

下面是我的研究设计 [贴设计]。请站在一个挑剔审稿人的立场,告诉我:最可能的混杂因素是什么、方法上最容易 被攻击的点在哪、如果你要拒这篇,你会写哪三条意见。不要安慰我,尽管挑。

写脚本顺带亮假设

这是我 CSV 的列和每列含义:[贴列说明]。写一个 [语言] 脚本完成 [任务],并在运行时 print 出你对数据做的 所有假设(比如默认哪列是数值、怎么处理缺失值)。我要先看假设再看结果。

这几句的共同点你应该看出来了:给全背景、说清要什么、逼它把假设和推理露出来。养成这个习惯,比换哪个模型 管用得多。

多少钱、怎么开始

Claude Opus 有好几种用法,照你的需求挑:

用法适合谁大致成本
claude.ai 网页/订阅个人日常读、写、解读结果有免费额度;要量大就上付费订阅
API(按量计费)想接进自己的脚本/流水线Opus 4.8 约 $5 / 百万输入 token、$25 / 百万输出 token1
Claude Code(命令行)写代码、跑数据分析、做自动化随订阅或 API 用量走

我的建议是别一上来就纠结接 API:先用网页版在你自己的活上试两周,确认它真能帮上忙,再谈怎么接。把它替你 省下的时间和这点钱摆一起算,值不值通常一目了然。

我给新手的几条话

  • 每条引用、每个数字都得自己核。 把它的输出当草稿,别当结论3 6
  • 能给全就别给片段,那 100 万 token 的窗口就是干这个用的。
  • 逼它把假设说出来,代码里、推理里都是,这一个习惯能拦住一大半错。
  • 提示尽量具体:领域、目标、约束写明白,它跑偏和编造都会少很多5
  • 科研那部分判断,永远是你的活。 它快的是机械那一层,判断这块别外包。

我踩过的三个坑

道理讲再多,不如说几个我真摔过的跟头。希望你别重蹈。

坑一:差点把它编的一条引用写进 intro

有回写引言,它给我顺出一段背景,附了三条引用,格式漂亮、年份作者都像那么回事。我当时赶时间,差点直接抄进 去。后来习惯性点了一下 DOI——第二条,根本不存在。那条"论文"的标题、作者、期刊全是它拼出来的。从那以后我 立了条铁规矩:它给的每一条引用,不点开原文核到,绝不进稿子。这不是我一个人会碰到的事,研究里这种伪造引用 正明显增多3 4

坑二:它把"相关"讲成了"因果"

让它解读一组观察数据时,它写得特别顺,顺到把一个明显只是相关的关系,悄悄叙述成了"A 导致 B"。它不是故意骗 你,是语言上"因为…所以…"读起来更通顺,它就那么写了。如果我当时不较真,这个口径很可能就被我带进讨论部分。 现在我让它解读结果时,会专门追一句:"这里能下因果结论吗?还是只是相关?"

坑三:超长输入里,它漏了附录里的一条关键限制

有次我把一篇带长附录的论文整篇丢进去,让它总结方法和局限。它总结得不错,但漏掉了附录里作者自己写明的一个 重要限制——而那条限制恰恰决定了这方法能不能用在我的数据上。材料越长,它越容易把某些细节"概括没了"。所以 凡是要据此做决定的关键点,我都回原文再确认一遍。

常见问题

问:它能替我写论文吗? 能帮你起草、改写、润色,但实质内容得是你的。更稳的用法是让它产框架和草稿,你来填判断和结论,并且每一处 事实和引用都核一遍3

问:它真会编参考文献? 真会,而且是常态不是偶发。研究显示伪造引用在已发表论文里明显在涨3 4。所以任何引用,点开原文核了 DOI 再用。

问:它能联网查最新文献吗? 默认不能。除非你用的产品给它配了检索/联网工具,否则对很新的工作它可能过时。要把文献查全,配上 Elicit、 SciSpace 这种有真索引的工具更踏实9 10

问:科研到底选 Claude、ChatGPT 还是 Gemini? 要稳地处理长材料、写代码、跑多步流程,我多半选 Claude;纯推理跑分和 Google 生态,Gemini 占优;最广的通用 生态和最快上手,ChatGPT 顺手2 11。日常里"怎么提问"经常比"选哪家"更决定结果。

问:它能直接出我要投稿的图吗? 模型能写画图代码,但看不到渲染结果、交不出可编辑矢量图。把推理交给模型、把出图交给 MindPlot 这类生产工具, 是更顺的分工。

写在最后

用了一年多,我的总结其实就几句话。Claude Opus 真正的价值,是读得多、想得细、写得清楚,再加上那个能把完整 材料整段塞进去的超长上下文1。它最大的两个坑,是会编引用和默认不联网——前者核 DOI,后者配专门的检索 工具3 9。不同的活用不同的家伙:模型负责想和写,专门索引负责把文献查全,生产工具负责把成品端出来。 至于科研里真正需要判断的那部分,到今天为止,还得你自己来——我觉得这是好事。


上面那张图用的工具。 把分析变成一张出版级、可编辑、又不用自己写画图代码的图,我用的是 MindPlot 的 AI 协作科学家。它是和 Claude Opus 这类推理模型互补的"生产层":你和模型把 问题想清楚,然后不被最后一公里绊住,把图、幻灯片或初稿做出来。

冯丹给 MindPlot 写科研工作流的文章,常年纠结一个问题:AI 到底在哪儿真帮上了忙,又在哪儿只是看着热闹。

参考文献

  1. Anthropic,《Models overview》(Claude Opus 4.8 的上下文窗口、视觉、定价与规格)。https://platform.claude.com/docs/en/about-claude/models/overview

  2. BenchLM,《ChatGPT vs Claude vs Gemini in 2026: The Definitive Comparison》。https://benchlm.ai/blog/posts/chatgpt-vs-claude-vs-gemini-2026

  3. STAT,《Lancet study finds steep rise in fraudulent AI citations in academic papers》(2026)。https://www.statnews.com/2026/05/07/lancet-study-finds-steep-rise-fraudulent-citations-academic-papers/

  4. 《GhostCite: A Large-Scale Analysis of Citation Validity in the Age of Large Language Models》(arXiv,2026)。https://arxiv.org/pdf/2602.06718

  5. 《Influence of Topic Familiarity and Prompt Specificity on Citation Fabrication ...》(PMC)。https://pmc.ncbi.nlm.nih.gov/articles/PMC12658395/

  6. 《Citation Accuracy Challenges Posed by Large Language Models》(PMC)。https://www.ncbi.nlm.nih.gov/pmc/articles/PMC12037895/

  7. 《Hallucinated citations produced by generative AI may constitute research misconduct ...》(Taylor & Francis)。https://www.tandfonline.com/doi/full/10.1080/08989621.2026.2645390

  8. 《Do Language Models Know When They're Hallucinating References?》(arXiv)。https://arxiv.org/pdf/2305.18248

  9. Paperguide,《Elicit vs. SciSpace: Comparing AI Research Tools (2026)》。https://paperguide.ai/blog/elicit-vs-scispace/

  10. Listen Labs,《AI Research Assistant for Literature Review: Top Tools 2026》。https://listenlabs.ai/articles/ai-research-assistant-literature-review/

  11. Kay Rottmann,《ChatGPT vs. Claude vs. Gemini in 2026: Which model for which job?》。https://www.kay-rottmann.de/en/blog/chatgpt-vs-claude-vs-gemini-2026/

  12. Cybernews,《SciSpace Literature Review 2026》。https://cybernews.com/ai-tools/scispace-literature-review/