8月20日,Nature发了一篇报道,标题里用了"Staggering"——"令人震惊的"。

令人震惊的,是AI写论文写到了什么程度。

德国图宾根大学团队分析了PubMed Central收录的119万篇生物医学论文,追踪了379个ChatGPT偏爱词的词频变化。结论按时间走出了一条没人预料到的曲线:

2023年,约19%的论文有AI痕迹。
2024年,52%。
2025年全年,77%。
2025年12月,89%。

89%。也就是说,2025年底发表在PubMed的英文生物医学论文,平均每10篇里大约有9篇,至少有部分文字经过了ChatGPT等大语言模型的撰写、改写或润色。

研究作者之一Dmitry Kobak拿到数据时自己都不信,原话是:"我肯定哪里算错了。"复查之后,结论没变。


"有AI痕迹"不等于"AI写的"

这个数据需要立刻澄清一件事。

89%指的是论文中至少有部分文字"被LLM碰过"——可能是润色了一段蹩脚英文,可能是重写了Discussion里的一段话,可能是把摘要压缩了50个词。它不意味着89%的论文是AI从头到尾自动生成的,更不意味着数据、实验和结论由AI编造。

这个区分至关重要。

研究团队用的方法也不是那些备受争议的"AI检测器",而是追踪词汇频率:ChatGPT出现以后,一些词(比如"delve""intricate""showcasing")在科学论文中的使用频率突然偏离了2018到2022年的历史趋势。研究者用这些"标志词"的异常增长来估算LLM的渗透率。

这种方法只能反映群体趋势,不能精确判定某一篇论文。研究团队自己也明确说了这一点。


AI最先渗透的是"讲故事"的部分

数据里有一个细节,特别值得学术写作者注意。

研究团队从每个论文部分随机截取255个词进行比较,2025年12月的数据是:

Discussion部分:68%

摘要:67%

Introduction:59%

Results:46%

Methods:32%

Discussion的AI使用率是Methods的两倍。

AI最先渗透的,是论文中"需要组织语言、梳理逻辑、解释意义"的部分——也就是最像"写作"的部分。而方法学部分需要精确描述实验条件、统计方法和研究流程,AI发挥空间有限。

换句话说:研究者最先用AI处理的是"怎么说",而不是"做了什么"。

图片

AI渗透率变化曲线


非英语母语国家用得更多,这件事不简单

按第一作者所在国家看,2025年的估算:

韩国:85%

中国:82%

伊朗:78%

美国:39%

英国:28%

非英语母语国家整体72%,英语母语国家37%。

这个差距恰恰说明了一件事:对于中国、日本、韩国的科研人员来说,英语写作长期是一道发表门槛。实验做得再漂亮,英文表达欠佳,审稿就吃亏。ChatGPT事实上成了一种"语言均衡器"——帮非英语母语的研究者写出更接近母语风格的论文,降低了一道长期存在的不平等。

这也是为什么不能简单地把"论文有AI痕迹"等同于学术不端。润色英文和编造数据,是两件完全不同的事。


另一个极端:8美元、3小时、一篇论文

如果说Nature的89%数据告诉我们"AI已经在论文里了",那么同一天火起来的另一个项目告诉我们"AI还能走多远"。

Spark-to-Paper,一套端到端论文生成系统。从一句研究想法出发,自动完成文献检索、实验设计、实验执行、论文写作、结论修订、图表生成,最后输出可直接编译的完整LaTeX论文。

8个受控研究课题上的成绩单:

引文有效率:99.5%(人类预印本97.8%,单遍生成81%)

图形可编辑率:96.4%(人类58%,同类系统0%)

假结论检出率:92%(单遍生成只有14%)

平均成本:8.1美元/篇

平均耗时:3.2小时

8美元、3小时、一篇论文初稿。而且假结论检出率从单遍的14%提升到了92%——系统内置了多轮自检和对抗式评审,不是"写完就交"。

这个项目被Hugging Face标记为当日第一。开源在GitHub上,任何人都可以跑。


两件事放在一起看

89%的论文已有AI痕迹 + 8美元3小时端到端生成论文。这两条新闻放在一起,信号只有一个:

问题已经从"该不该用AI"变成了"怎么管"。

多伦多大学的Kyle Siler对Nature说了一句话,我觉得是这整件事最好的注脚:

"The toothpaste is out of the tube, and it's not going back."
牙膏已经挤出来了,塞不回去了。

图片

各环节AI渗透率与行动建议


对学术写作者意味着什么

第一,区分"碰过"和"生成过"。

89%的数据让人震惊,但它测量的是"文字被LLM编辑过",不是"结论由AI编的"。真正要警惕的从来不是润色,是让AI替你解释你并没真正理解的数据。如果你已经完成了数据分析和科学推理,只是让AI把一段蹩脚英文改成规范的学术英语,这和传统英文编辑服务没有本质区别。但如果作者开始让AI补充自己没查的参考文献、自动生成Discussion,风险就完全不同了。

第二,AI在不同部分的使用率差异,本身就是一份"安全使用地图"。

Discussion 68%、Methods 32%——这个差距告诉你:AI擅长的是"组织语言",不擅长的是"描述你做了什么"。Methods部分需要你自己写,因为只有你知道实验的具体条件、参数和流程。Discussion可以用AI帮你梳理逻辑,但结论必须基于你的真实数据。

第三,关注"透明披露"而不是"隐藏痕迹"。

89%的渗透率说明,试图用检测器"抓"谁用了AI,已经不现实了——量太大了。真正可行的方向是建立清晰的AI使用披露规范:哪段用了、用来做什么、谁核对过。ICMJE 2026年建议和Nature Portfolio的现行政策立场接近:允许透明使用AI辅助,AI不署名,引文和结论由人负责。


串联我们之前写过的几篇

8月9日,我们写过"ChatGPT帮我写了论文引言,15条引用近40%是假的"。当时说的是AI文献幻觉。89%的数据告诉你:这个问题的规模比我们想象的大得多——当九成论文有AI参与,幻觉风险是系统性的。

8月14日,我们写过Claude隐形水印——"用了就有痕迹"。89%的渗透率意味着,如果Claude的水印检测推广,覆盖面会极其广泛。

8月20日,我们写过AIGC检测红线——各校标准差3倍。89%的数据让这些检测线显得更荒诞:如果九成论文都有AI痕迹,检测到底在抓谁?

这三篇加上今天这篇,讲的是同一个故事的不同阶段:AI从"有人偷偷用"到"几乎人人用",从"检测能抓"到"检测抓不过来"。


今天就能做的三件事

一、检查你正在写的论文,哪些部分用了AI。 不是为了删掉,是为了心里有数。Discussion用了就用了,Methods没写就别让AI替你编。自己先画一条线,比让审稿人替你画好。

二、如果你在非英语母语国家,用AI润色英文是合理的。 89%的数据说明,你的同行早就在用了。但润色只改语言,不改数据、不改结论、不改引用。碰过语言的可以碰,碰过证据的不能碰。

三、开始习惯在论文里写AI使用声明。 不是因为现在所有期刊都要求,是因为这个趋势已经不可逆了。提前养成习惯,比将来被动适应强。声明不需要长:写清楚哪部分用了AI辅助、用来做什么、你是否逐条核验过。


牙膏已经挤出来了。塞回去不可能。

能做的,是确保挤出来的那一段,是你自己能负责的内容。

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐