上周,一篇挂在了arXiv上的预印本研究(还没经过同行评审)抛出了一颗炸弹:2025年12月发表在PubMed Central上的生物医学论文,有90%显示出了AI辅助写作的痕迹。
而就在一年前,同一批研究者用老方法估算,这个数字还只是13.5%。暴涨的速度,比AI自己迭代还快。
各章节的估计LLM使用情况。(a) 利用整段时间估计LLM使用情况。所有估计均基于2025年各节最优阈值计算。标准误以阴影区域表示。(b) 每个部分随机255字的裁剪也同样适用。
论文的共同作者、比利时根特大学的计算机科学家德米特里·科巴克坦言,最初看到这个结果时,他的第一反应是:“我敢肯定我们哪里搞砸了。”
但反复核查后,他不得不承认——数据是牢靠的。
为什么这次数字这么高?科巴克解释说,他们换了一种更灵敏的检测方法,不再只是抓几个“显著”的AI常用词,而是做了一个能直接估算使用比例的模型。新方法一上,连2024年的老数据都被“重新定罪”——从13.5%直接拉高到了31%。
论文的哪个部分最容易被AI“攻陷”?
答案是:讨论部分。2025年12月的论文里,78%的讨论章节有AI味;而方法&结果部分,这个比例是58%。
结果部分好歹要写实验数据、统计方法,AI容易瞎编(也就是大家常说的“幻觉”),所以科学家们还不太敢全权托付。但讨论和引言就不一样了——那更像是“铺陈观点”“包装故事”的地方,让AI润色一下逻辑、顺一顺文气,简直不要太顺手。
可科巴克提醒了一句狠话:AI的偏见会顺着这些“润色”悄无声息地渗透进整个学术圈。 你以为只是在改语法,其实是在把AI的“潜意识”种进科学的主流叙事里。
非英语母语的科学家们使用最多
研究还发现,来自非英语国家的研究人员,使用AI的比例明显更高。
这其实一点都不意外。对于很多科研人员来说,用英文写一篇顶级期刊论文,比做实验本身还痛苦。AI能帮忙翻译、改语法、理顺句式——简直就是救星。
伦敦大学学院的文献计量学专家安德鲁·格雷指出,现在的检测工具根本分不清“AI全篇生成”和“AI只改了改语法”。这就意味着,期刊编辑部想筛选低质量AI稿件,几乎无从下手——因为所有用过AI的论文,看起来都长一个样。
而这篇研究的第一作者莱娜·霍尔茨瓦特说了一句特别戳人的话:
“把想法反复琢磨、硬着头皮写出来的过程,本身就是科学的一部分。如果连这份‘挣扎’都交给AI,那科研还剩下什么?”
她不是反对AI,而是担心我们太舒服了,舒服到忘了思考本身就应该有点疼。
参考文献doi: 10.1038/d41586-026-02551-z
热门跟贴