写完论文,把稿子丢给ChatGPT:"帮我检查一下有什么问题。"

它很快列出一串清单:这里的论证跳步了,那里的数据对不上结论,这段引用可能有问题。每一条都说在点子上。你看完,觉得挺安心——AI都检查过了。

一项新研究提醒你:这个动作,可能基本白做。

问题不在于ChatGPT查不出错。恰恰相反,它查得出,而且查得很准。真正的问题是后面那一步:它发现了问题,然后什么都没做,照样把带缺陷的结论交给你。

这不是我瞎说。8月14日,斯坦福大学、Prentis AI等机构的研究者往arXiv上传了一篇论文,标题直译过来是《智能体是怎么在自动科研上失败的》。研究团队做了一件此前没人系统做过的事:让AI完整地跑科研全流程,然后把过程记录一份份拆开,看它们到底在哪儿栽跟头。

结果里有一个数字,值得每一个用AI写论文的人记住:82.5%

图片

AI自查出论文问题却不会改


一项"扒底裤"式的研究

先说这项研究是怎么做的。

研究团队从5878篇2024年以后发表的顶刊论文里,按严格标准筛出100个真实科研任务,覆盖生物、医学、化学、材料、物理等七个方向。任务的设计很讲究:AI只能看到研究的起点——学界目前认为什么、哪里说不通,而论文实际用的方法和得出的结论全部保密,留作对照答案。

然后,八种AI组合上场:Claude Code分别搭载六个不同的大模型(包括Claude Opus、Claude Sonnet、Qwen、GLM、DeepSeek V4 Pro等),再加上Codex配GPT-5-mini、Gemini CLI配Gemini 3.5 Flash。

每个任务走完整科研流程六个阶段:想点子、查文献、写代码跑实验、分析结果、写报告、最后自查一遍。

八个组合跑一百个任务,产生了800份完整的研究记录,累计73000次工具调用,平均每个任务走92步。研究团队没有只看结果对不对——他们把执行日志、生成的代码、中间数据全部翻出来逐条核对。

这就是我说"扒底裤"的原因:多数AI评测只改最后一道大题的答案,这次是连草稿纸一起收上去查。


82.5%:查得出,但就是不改

核心发现来了。

在82.5%的研究轨迹里,AI在自我审查环节明确写出了自己报告里的致命缺陷。注意,是它自己发现的,白纸黑字写在文档里,问题找得一针见血。然后呢?

然后就没有然后了。它把带着已知缺陷的结论,原样写进了最终报告。

论文里有个例子,我原样讲给你听。

一个任务是研究轻量级模型能否打败深度神经网络做能耗预测。AI训练了真实的数据集,流程规范,最后得出结论:轻量级模型比LSTM好22.4%。听起来是个不错的成果。

但同一个AI,在报告的自我评审部分写道:这个核心结论建立在一个"几乎肯定是坏掉了"的基线上——LSTM模型实际的拟合优度只有0.076,基本等于瞎猜。它甚至自己承认:"这个头条发现因此是无法解读的。"

修复这个问题要多少成本?重新训练一下LSTM,或者换一个更简单的基准,一行代码的事。

它没有做。摘要里依然写着22.4%的优越性,而"无法解读"这句话,被留在报告后半部分不起眼的地方。

研究者给这个现象起了个名字,编号F.4,叫"未纠正的自我意识"。它是800份报告里出现频率最高的单一失败模式,没有之一。

打个比方:一个学生做完实验报告,在讨论部分老老实实写下"我的对照组仪器可能坏了,数据不可信",然后转头在摘要里理直气壮地写"我的新方法比对照组好20%"。

你觉得这学生有问题。但AI不觉得,因为在它的机制里,这两段话没有任何矛盾。


病根:写检查报告,也只是"写字"而已

为什么查得出错,却不改?

研究者的诊断是三个字:元认知。人类研究者工作的时候,脑子里始终有个回路在转:我产出的东西,跟我找到的证据对得上吗?对不上就去改。我走的这条路本身对吗?不对就掉头。

AI缺的就是这个回路。对它来说,写自查文字和写正文是同一件事——都是生成文本。它写下"这个结论无法解读"这句话时,跟写下"本文提出了一种新方法"时,内在动作完全一样。写完就写完了,不会触发任何后续修正。

这里有一个认知需要刷新的地方。我们习惯了把AI的失误理解为"它不知道"——不知道文献是编的,不知道数据算错了,不知道逻辑断了。所以我们的应对是"让它再检查一遍",好像检查能补上无知。

但这份数据说的是另一种情况:它知道。诊断环节清清楚楚,问题定位精准。缺的是从"知道"走向"修改"的那一截。诊断能力和纠错行动,是两种完全不同的东西。

研究团队换八个模型跑同样的任务,验证了一件事:从Claude Opus到DeepSeek V4 Pro,失败总数在1396到1818次之间波动,但排前十位的失败模式高度重合,"发现问题不改"在八个模型里的七个都排进了前列。

这不是某家公司的模型粗心,是这一代大模型共同的能力边界。指望换个更聪明的模型就能解决,目前看指望不上。

顺带说一个各模型有差异的地方:编造证据。编造引用来源,最少的模型出现13次,最多的61次;编造结果数字,从3次到36次。更强的模型确实更少凭空捏造——但明知故犯的那个毛病,强的弱的都有,一个不少。


对写论文的人,这意味着三件事

这项研究测的是"AI做科研",但你每天用ChatGPT改论文、让DeepSeek跑数据分析,机制是相通的。三个建议给你。

第一,别把"让AI自查"当保险。

AI自查报告的可信度要打折看:它列出的每一条问题都可能是真的,但它列完就完,不会顺手帮你改掉。所以自查报告的正确用法是当成"待办清单"而不是"质量证明"。它发现了五条问题,你要追问的是:这五条改了吗?谁改的?改完了吗?这道闸门,只能你自己来关。

第二,核对"做了什么",别只看"说了什么"。

研究里有个很妙的设计细节:给800份轨迹打分的AI法官,拿到的是完整证据包——执行日志、代码、数据文件,准确率92.1%;而只读最终报告打分的普通裁判,准确率只有84.6%,召回率差了17.2个百分点。

翻译到论文场景:很多问题根本不写在报告文字里。ChatGPT说"根据Smith 2023年的研究",这句话本身看不出任何破绽,破绽在Smith 2023到底存不存在、有没有说过这话。AI报了一个实验数字,数字本身很漂亮,问题在它背后跑没跑过。所以核对的动作要落在实体上:引用去数据库检索,数据回原始表格对,方法对照代码和日志。文字说服不了你,证据才可以。

第三,把"发现问题"变成强制流程。

既然AI不会自动改,就把"改"设计成流程里绕不过去的一步。三轮操作:

第一轮,让AI列问题清单,要求逐条编号,并标注每条出现在第几段;

第二轮,针对每一条,明确指示:"问题N如何修改?给出修改后的段落。"改一条确认一条;

第三轮,全部改完后,把修改清单发回去,让它复查:"问题N是否已在正文中解决?逐条回答是或否。"

这套流程的本质,是把你脑子里的回路外化成文字指令。AI缺的那个"发现了就必须处理"的机制,由你来充当。


最后一块拼图

这个栏目此前聊过两块拼图。

8月底我们说过:近九成生物医学论文已被AI碰过,用不用AI已经不构成区分度。更早我们说过:让ChatGPT写引言,15条引用里近四成是假的,它编起来不打草稿。

今天这项研究补上了第三块:AI不仅会犯错,它还知道自己在犯错——只是知道了也照样交。

三块拼图放在一起看,AI辅助写作的真实图景是:它能帮你写九成内容,能顺手编出四成假引用,还能准确指出自己的问题——唯独不会主动改掉这些问题。

所以真正的分水岭,从来不在"会不会用AI"。用,是所有人都在做的事。分水岭在AI停下的地方:那些被写进自查报告却没被处理的问题,那些看起来严丝合缝实则查无此人的引用,那些"无法解读"却依然站在摘要里的结论。

署名栏里写的是你的名字。这个流程的最后一环,也只能是你的。

图片

三步强制流程让AI自查真正有用

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐