我带的几个研究生,现在电脑上几乎都常开着一个 Claude 的标签页。有意思的是,问他们拿来干嘛,答案五花八门: 有人用来读文献,有人用来 debug 那段死活跑不通的 R,有人专门用它把审稿人那几句阴阳怪气翻译成"人话"再逐条 回。我自己也一样。一开始我是不太信这套的——总觉得"AI 写科研"听着就不靠谱。用了一年多,态度变了一半:它 确实接管了我工作里很大一块,但接管的不是"科研",而是科研里那些又费时间又不动脑子的杂活。
这篇就是我的实测笔记。哪儿真好用、哪儿差点坑了我、它跟 ChatGPT 和 Gemini 比是个什么定位、跟 Elicit 这类 专门工具怎么分工,我尽量讲具体,少讲虚的。先把结论摆这儿:把它当一个读得飞快、反应又快、但偶尔会一本正经 胡说的同事,你盯着点用,它能帮你省下不少命。
先说清楚:Claude Opus 到底是个什么东西
Claude 是 Anthropic 家的大模型系列,Opus 是里头最能打的一档,当前最新是 Claude Opus 4.81。它不是给 科研专门做的"学术引擎"——没有内置的论文库,默认也不联网。所以别指望它替你查到上周刚出的预印本。
图 1. Claude 是 Anthropic 的大模型系列,Opus 是其中最强的一档。标志来源:Wikimedia Commons(CC)。
那它强在哪?强在三件特别朴素的事:读得多、想得细、写得清楚。听上去平平无奇,可你回想一下自己一周的工作, 是不是有相当大一块就是在读、在想、在写。它正好卡在这块。
那个真正改变用法的数字:100 万 token
如果非要我挑一个最该记住的参数,是上下文窗口:Claude Opus 4.8 一次最多能吃下约 100 万 token,差不多 一千多页文字1。
这个数字为什么重要,得举个例子才说得清。早些年用这类工具,最常见的翻车就是你只把"结果"那一段贴给它,它 看不到方法,于是对着一张表瞎评价。现在不一样了:你可以把一篇论文连同附录、把一份标书连同指南原文、 把一整个分析脚本连同它的数据字典,一股脑全塞进去,再问那种"得看完全部才答得上来"的问题。
而且不只是"装得下"。我自己的体感,加上第三方测评的说法是一致的——Claude 这一档是真的把整个窗口用起来, 扔进去一百多页,问到第八十页的某个细节它也能翻出来;有些模型超过十万 token 之后就开始"丢线索"了2。 所以我现在的习惯很简单粗暴:能给全的,绝不切片。
它在我的工作里具体接管了哪些活
这一节我讲得细一点,因为"它能干嘛"光说能力没用,得落到你真按几个键能干成什么。先用一张表把对应关系摆出来, 后面几小节再各自展开。
| 我手上的活 | 为什么它接得住 |
|---|---|
| 读论文并追问 | 100 万 token 装得下全文 + 图 + 附录,能引用、能交叉比对,不只是概括 |
| 解读自己的结果 | 分步推理够细,还能用 effort 档位调深浅 |
| 读图、读拍下来的表 | 有视觉能力,截图、照片直接喂1 |
| 写和清洗代码 | 编码和多步骤任务是第一梯队1 |
| 起草与润色 | 文字清楚、结构稳——摘要、cover letter、审稿回复 |
图 2. 科研里你天天要读、要做的,很多就是这类图——比如单细胞转录组的 UMAP 聚类。把这种图截下来丢给模型,它也能帮你读个大概。
读文献:二十分钟摸清一篇论文的底
把全文贴进去,我一般按这个顺序问:这篇的核心主张是什么?支撑它的证据是哪几条?最薄弱的一环在哪?然后再补 一句——"要让我相信标题里这个结论,我至少得看到哪三个结果?"它列完,我再正经读论文。区别在于,这回我是带着 "该盯哪儿"去读的,效率完全不一样。
解读结果:让它当陪练,别让它当捧场的
跑完一组数据,我会把设计和结果给它,然后下一道死命令:站在我的对立面,挑刺。最可能的混杂因素是什么、一个 难缠的审稿人会先咬哪里。它当陪练比当捧场的有用太多了——而你完全可以直接要求它当陪练,它就老老实实开喷。
写代码:让它把"假设"先吐出来
这是我用得最多、也最省心的一块。一句"这是我 CSV 的列和每列含义,写个脚本做 X,顺便把你做的假设都 print 出来",基本能省掉半小时。重点在最后那半句:你只要扫一眼它打印的假设,就能拦住大多数闷声出错的地方。它在 写代码和跑这种多步骤的活上,确实是第一梯队1。
改论文:框架交给它,判断留给你
摘要、cover letter、审稿回复,这些有固定套路、又特别磨人的文字,丢给它起个框架最划算。注意是"框架",不是 最终稿。审稿回复尤其如此:把意见和稿子一起给它,要一份逐条回应的提纲,剩下的实质内容还得你自己填。
它会在哪些地方让你栽跟头
好用归好用,边界得心里有数。下面这几条不是"偶尔",是结构性的,踩了就是踩了。
| 短板 | 到底怎么回事 | 对你意味着什么 |
|---|---|---|
| 会编造参考文献 | 它按"像不像"来生成,格式完美、内容可能压根不存在 | 任何一条引用,不核 DOI 就别用 |
| 默认不联网 | 除非工具给了它检索能力,否则对很新的工作可能过时 | 时效性的活得自己补检索 |
| 不是统计学家 | 你让它跑个本不该跑的检验,它照跑不误 | 统计怎么选,还得你拍板 |
| 长材料会偷懒 | 输入特别长时,偶尔会略过细节、过度概括 | 关键结论一定回原文核 |
第一条我得多说两句,因为它害人最深。它编出来的引用,作者、年份、期刊、卷期页码全像模像样,你不点开根本看 不出假。这不是我一个人的牢骚:2026 年有研究专门记录了已发表论文里 AI 伪造引用的明显上升3;另一项对 五万多篇顶会论文、两百多万条引用的大规模分析发现,约 1.07% 的论文里藏着无效或伪造的引用,而且 2025 一年 就涨了八成多4。
好消息是,提示给得越具体、越在你熟悉的领域,它编的概率越低5。坏消息是,"越低"不等于"为零"——多篇综述 都把这种"看着规范、其实不存在"的引用列为当前学术诚信的真实风险6 7。所以核对这一步,永远省不掉8。
它默认不联网,对很新的工作会过时
它脑子里的知识有个截止点,截止点之后的事它要么不知道,要么瞎猜。我有次问它某个方法的"最新进展",它讲得 头头是道,我一查,引的都是两年前的综述。除非你用的产品明确给它配了联网或检索工具,否则别拿它当文献数据库。 要把某个题目的文献查全,老老实实配上 Elicit、SciSpace 这种有真实索引的工具9 10。
它不是统计学家,你让它跑它就跑
这点最隐蔽,因为它不会拒绝。你给它一组本不该做参数检验的数据,它会非常配合地给你跑个 t 检验、再附上一段 解释,看着特别专业。它缺的不是算力,是"该不该做这个检验"的判断。所以统计方法怎么选,最终还得你自己拍板, 它顶多帮你把选好的方法写成代码。
材料一长,它会偷偷"偷懒"
输入特别长的时候——比如你一次塞了一百多页——它偶尔会略过一些细节,或者把某段过度概括成一句话。大体不错, 但你要拿来下结论的那几个关键点,一定要回原文核一遍。我的习惯是:让它给概览没问题,但凡要写进稿子的具体 数字和结论,都按它给的位置翻回去对一眼。
Claude、ChatGPT 还是 Gemini:我的实际感受
这三家我都在日常里轮着用,说点主观但实在的体会(基准分这种东西仅供参考,最后还得看你自己的活实测)。
图 3. 科研里最常被拿来比的三家通用模型。标志来源:Wikimedia Commons(CC)。
| 模型 | 我会优先用它干的事 | 要留个心眼的地方 |
|---|---|---|
| Claude Opus | 啃长材料、写代码、跑多步流程、写长文;调工具在实操里靠谱2 | 没有内置文献库;会编引用 |
| ChatGPT | 日常通用、插件生态广、上手快 | 据测评,超长上下文(>10 万 token)更容易"断片"2 |
| Gemini | 纯推理跑分常领先、和 Google 搜索/全家桶贴得紧2 | 终归是通用助手,不是给科研做的 |
说句扫兴的话——这点差距,在我日常里经常被"你会不会提问"给抹平了。把材料给全、把假设逼出来,比纠结选哪家 重要得多。下面是我具体什么时候开哪个。
我什么时候开 Claude
啃长材料、写代码、跑多步骤的活,我默认开它。一篇论文连附录、一个要改的脚本连数据字典,丢进去问到底,它 不太丢线索;让它写脚本、改流程,返工率也低2。需要它老老实实当陪练挑刺时,它也配合。
我什么时候开 Gemini
要它快速搜点东西、再把搜到的东西揉进答案里,或者我本来就在 Google 那套文档/邮件里转,开 Gemini 更顺手; 它在一些纯推理的基准上分数也亮眼2 11。但它终归是通用助手,碰到要它当"科研搭子"深聊时,我还是回 Claude。
我什么时候开 ChatGPT
图省事、要最广的插件和应用生态、或者团队里别人都在用它、要对齐时,我开 ChatGPT。它通用、上手快。只是 碰到那种"一次塞十几万 token"的超长材料,据测评它比另外两家更容易断片2,这种活我不太交给它。
一个真实例子:从"这趋势是真的吗"到一张能投稿的图
举个我常遇到的场景。你做了个小的剂量-反应实验,手里就那么几个点,想在往下砸时间之前先掂量掂量:这趋势是 真的,还是我看花眼了?
这件事其实分两半。前一半是"想清楚",特别适合交给模型。 把数据和问题甩给它:单调趋势成不成立、用什么 检验合适、样本量这么小要提防什么、要不要先看效应量再谈显著性。它会把推理一步步摆出来,你负责挑里头站不住 的地方。
后一半是"出成品",这时候对话模型就该退场了。 它能写画图代码,但它看不见渲染出来的图长啥样,判断不了 排版顺不顺眼,更交不出一张你能直接塞进稿子、还能继续编辑的矢量图。这最后一公里我一般交给专门的出图工具——我自己用 MindPlot:传上数据、说一句要画什么,它出一张可编辑的图,省得再跟 matplotlib 的字体边距较劲。
图 4. 像这样一张带统计检验、显著性标注的分组图,传上数据说一句就能出,还能在画布上接着改。
一句话概括这个分工:模型负责对数据动脑子,工具负责把成品端出来。两件事别让一个工具硬扛。
通用模型之外,还有一类专门工具
光有通用大模型不够。真要做穷尽式的文献覆盖,专门工具往往更靠谱,因为它们背后是真实的论文索引,而不是模型 脑补。
- Elicit 擅长在真实论文库上做结构化的筛选和信息抽取,做系统综述、meta 分析时特别顺手;但它窄,基本不 管通用推理和写作9。
- SciSpace 覆盖面更宽,能跨海量论文发现、读、解释、找相关工作,从"发现"一路接到"初稿";但它偏阅读发现, 不是你拿来做通用分析的工具9 12。
把通用模型和专门工具放一起看,分工大概是这样:
| 工具 | 我会优先用它干的事 | 它的真实局限 |
|---|---|---|
| Claude Opus | 深度推理、啃长材料、写代码、写作 | 没内置文献库;会编引用 |
| Elicit | 真索引上做结构化筛选与抽取,系统综述/meta 分析 | 窄,不管通用推理和写作9 |
| SciSpace | 跨海量论文发现、读、解释、找相关工作 | 偏阅读发现,不是通用分析工具12 |
| MindPlot | 把分析变成成品——图、幻灯片、文档 | 是产出层,本身不是前沿对话模型 |
我最后落到的组合是这样的:用前沿模型来想和写,需要把文献查全时用 Elicit / SciSpace 这种带真索引的工具 10,再用 MindPlot 这类生产工具把图、幻灯片、论文这些"成品"做出来。 三类东西是互补的,别逼着一个去干 另一个的活。
学生、博后、PI:同一件工具,三种用法
同一个 Claude,不同阶段的人用法差挺远。说几个我身边真见过的。
如果你是研究生
我见过最划算的用法,是拿它降低"卡壳成本"。代码报错看不懂,整段贴进去让它解释、给最小可复现的修法;英文写 不顺,让它在不改你意思的前提下顺一遍语言(注意是顺语言,不是替你写)。读不动的经典文献,让它先讲个大白话 版本,你心里有底了再去啃原文。一句话:哪儿卡住了,先问它一句,往往能省半天。
如果你是博后
图 5. 数据形态复杂时(比如这种 3D 曲面),手画图很费劲——把推理交给模型、把出图交给工具,这种活会轻松不少。
博后的时间最碎,它正好补这种碎活。跑数据时让它写脚本顺带 print 假设;投稿前让它当审稿人预演一遍,把最可能 被咬的点先补上;带学生时让它把你脑子里那套方法学口述整理成可发给学生的文档。它不会替你做研究,但能让你在 同样的时间里多转几圈。
如果你是 PI
到了 PI 这一层,瓶颈常常是"看不过来"。组里的稿子、跨领域的文献、一个还没想清楚的 idea——把材料整段丢进去, 让它先给你一个结构化的概览和几个该追问的点,你再决定往哪儿深挖。它替你做的是"先过一遍、标出重点",省的是 你最贵的那点注意力。
几个我天天在用的提示词
光说方法太虚,直接把我贴了无数遍的几句模板放这儿,你拿去改改就能用。它们都不花哨,重点是把"上下文"和 "我到底要什么"说清楚。
读一篇论文
这是一篇论文的全文(含附录)。请按顺序回答:①它的核心主张是什么;②支撑这个主张的证据有哪几条,分别在 哪一节;③你觉得最薄弱的一环在哪。最后再列:要让我相信标题里的结论,我至少得看到哪三个结果?
解读一组结果
我做了 [实验设计一句话],得到这组数据:[贴数据]。我想知道 [你的问题]。请一步步推理:这个比较成不成立、 用什么统计方法合适、样本量这么小要提防什么。先别急着下结论,把你的推理和假设都摆出来。
让它当陪练挑刺
下面是我的研究设计 [贴设计]。请站在一个挑剔审稿人的立场,告诉我:最可能的混杂因素是什么、方法上最容易 被攻击的点在哪、如果你要拒这篇,你会写哪三条意见。不要安慰我,尽管挑。
写脚本顺带亮假设
这是我 CSV 的列和每列含义:[贴列说明]。写一个 [语言] 脚本完成 [任务],并在运行时 print 出你对数据做的 所有假设(比如默认哪列是数值、怎么处理缺失值)。我要先看假设再看结果。
这几句的共同点你应该看出来了:给全背景、说清要什么、逼它把假设和推理露出来。养成这个习惯,比换哪个模型 管用得多。
多少钱、怎么开始
Claude Opus 有好几种用法,照你的需求挑:
| 用法 | 适合谁 | 大致成本 |
|---|---|---|
| claude.ai 网页/订阅 | 个人日常读、写、解读结果 | 有免费额度;要量大就上付费订阅 |
| API(按量计费) | 想接进自己的脚本/流水线 | Opus 4.8 约 $5 / 百万输入 token、$25 / 百万输出 token1 |
| Claude Code(命令行) | 写代码、跑数据分析、做自动化 | 随订阅或 API 用量走 |
我的建议是别一上来就纠结接 API:先用网页版在你自己的活上试两周,确认它真能帮上忙,再谈怎么接。把它替你 省下的时间和这点钱摆一起算,值不值通常一目了然。
我给新手的几条话
- 每条引用、每个数字都得自己核。 把它的输出当草稿,别当结论3 6。
- 能给全就别给片段,那 100 万 token 的窗口就是干这个用的。
- 逼它把假设说出来,代码里、推理里都是,这一个习惯能拦住一大半错。
- 提示尽量具体:领域、目标、约束写明白,它跑偏和编造都会少很多5。
- 科研那部分判断,永远是你的活。 它快的是机械那一层,判断这块别外包。
我踩过的三个坑
道理讲再多,不如说几个我真摔过的跟头。希望你别重蹈。
坑一:差点把它编的一条引用写进 intro
有回写引言,它给我顺出一段背景,附了三条引用,格式漂亮、年份作者都像那么回事。我当时赶时间,差点直接抄进 去。后来习惯性点了一下 DOI——第二条,根本不存在。那条"论文"的标题、作者、期刊全是它拼出来的。从那以后我 立了条铁规矩:它给的每一条引用,不点开原文核到,绝不进稿子。这不是我一个人会碰到的事,研究里这种伪造引用 正明显增多3 4。
坑二:它把"相关"讲成了"因果"
让它解读一组观察数据时,它写得特别顺,顺到把一个明显只是相关的关系,悄悄叙述成了"A 导致 B"。它不是故意骗 你,是语言上"因为…所以…"读起来更通顺,它就那么写了。如果我当时不较真,这个口径很可能就被我带进讨论部分。 现在我让它解读结果时,会专门追一句:"这里能下因果结论吗?还是只是相关?"
坑三:超长输入里,它漏了附录里的一条关键限制
有次我把一篇带长附录的论文整篇丢进去,让它总结方法和局限。它总结得不错,但漏掉了附录里作者自己写明的一个 重要限制——而那条限制恰恰决定了这方法能不能用在我的数据上。材料越长,它越容易把某些细节"概括没了"。所以 凡是要据此做决定的关键点,我都回原文再确认一遍。
常见问题
问:它能替我写论文吗? 能帮你起草、改写、润色,但实质内容得是你的。更稳的用法是让它产框架和草稿,你来填判断和结论,并且每一处 事实和引用都核一遍3。
问:它真会编参考文献? 真会,而且是常态不是偶发。研究显示伪造引用在已发表论文里明显在涨3 4。所以任何引用,点开原文核了 DOI 再用。
问:它能联网查最新文献吗? 默认不能。除非你用的产品给它配了检索/联网工具,否则对很新的工作它可能过时。要把文献查全,配上 Elicit、 SciSpace 这种有真索引的工具更踏实9 10。
问:科研到底选 Claude、ChatGPT 还是 Gemini? 要稳地处理长材料、写代码、跑多步流程,我多半选 Claude;纯推理跑分和 Google 生态,Gemini 占优;最广的通用 生态和最快上手,ChatGPT 顺手2 11。日常里"怎么提问"经常比"选哪家"更决定结果。
问:它能直接出我要投稿的图吗? 模型能写画图代码,但看不到渲染结果、交不出可编辑矢量图。把推理交给模型、把出图交给 MindPlot 这类生产工具, 是更顺的分工。
写在最后
用了一年多,我的总结其实就几句话。Claude Opus 真正的价值,是读得多、想得细、写得清楚,再加上那个能把完整 材料整段塞进去的超长上下文1。它最大的两个坑,是会编引用和默认不联网——前者核 DOI,后者配专门的检索 工具3 9。不同的活用不同的家伙:模型负责想和写,专门索引负责把文献查全,生产工具负责把成品端出来。 至于科研里真正需要判断的那部分,到今天为止,还得你自己来——我觉得这是好事。
上面那张图用的工具。 把分析变成一张出版级、可编辑、又不用自己写画图代码的图,我用的是 MindPlot 的 AI 协作科学家。它是和 Claude Opus 这类推理模型互补的"生产层":你和模型把 问题想清楚,然后不被最后一公里绊住,把图、幻灯片或初稿做出来。
冯丹给 MindPlot 写科研工作流的文章,常年纠结一个问题:AI 到底在哪儿真帮上了忙,又在哪儿只是看着热闹。
参考文献
-
Anthropic,《Models overview》(Claude Opus 4.8 的上下文窗口、视觉、定价与规格)。https://platform.claude.com/docs/en/about-claude/models/overview
-
BenchLM,《ChatGPT vs Claude vs Gemini in 2026: The Definitive Comparison》。https://benchlm.ai/blog/posts/chatgpt-vs-claude-vs-gemini-2026
-
STAT,《Lancet study finds steep rise in fraudulent AI citations in academic papers》(2026)。https://www.statnews.com/2026/05/07/lancet-study-finds-steep-rise-fraudulent-citations-academic-papers/
-
《GhostCite: A Large-Scale Analysis of Citation Validity in the Age of Large Language Models》(arXiv,2026)。https://arxiv.org/pdf/2602.06718
-
《Influence of Topic Familiarity and Prompt Specificity on Citation Fabrication ...》(PMC)。https://pmc.ncbi.nlm.nih.gov/articles/PMC12658395/
-
《Citation Accuracy Challenges Posed by Large Language Models》(PMC)。https://www.ncbi.nlm.nih.gov/pmc/articles/PMC12037895/
-
《Hallucinated citations produced by generative AI may constitute research misconduct ...》(Taylor & Francis)。https://www.tandfonline.com/doi/full/10.1080/08989621.2026.2645390
-
《Do Language Models Know When They're Hallucinating References?》(arXiv)。https://arxiv.org/pdf/2305.18248
-
Paperguide,《Elicit vs. SciSpace: Comparing AI Research Tools (2026)》。https://paperguide.ai/blog/elicit-vs-scispace/
-
Listen Labs,《AI Research Assistant for Literature Review: Top Tools 2026》。https://listenlabs.ai/articles/ai-research-assistant-literature-review/
-
Kay Rottmann,《ChatGPT vs. Claude vs. Gemini in 2026: Which model for which job?》。https://www.kay-rottmann.de/en/blog/chatgpt-vs-claude-vs-gemini-2026/
-
Cybernews,《SciSpace Literature Review 2026》。https://cybernews.com/ai-tools/scispace-literature-review/