自大约四年前第一个语言模型问世以来,研究人员向科学期刊投稿的文章数量大幅增加。这些投稿的平均写作质量比以前更差。同行评审的质量也显著下降。

人工智能:使用AI导致科学变得混乱。“系统中没有严格的质量检验。”

这是美国研究人员在一项研究中的发现,该研究分析了近年来提交给《组织科学》期刊的文章。这项最新研究再次表明,研究人员使用人工智能(AI)导致科学出版物变得混乱。例如,医学期刊《柳叶刀》近期报告称,在生物医学文章中,AI导致不存在的来源引用次数在几年内增加了十倍。

研究人员在《组织科学》中写道:“据我们所知,我们是第一个报告AI对审稿过程早期影响的期刊。”他们还声称,驳斥了使用语言模型能提高论文文本质量的观点。

为进行研究,研究人员分析了自2021年以来提交的近7000篇文章和超过10000份审稿文本。2021年是在2022年11月ChatGPT首个版本推出、语言模型使用量激增的前一年。在此期间,投稿文章数量增加了42%。

为判断AI影响的程度,所有论文都接受了AI使用程度的检查。使用了一个名为Pangram的计算机模型,将文本分类为由人类编写还是由语言模型生成。由于无法确定单篇文本中AI具体参与了多大程度的写作,研究选择了分类方式。

AI辅助程度为15%或以下的文本被视为完全由人类编写。15%至30%的分数表示论文与语言模型“合作”。30%至70%意味着语言模型“实质性控制了更多内容”。超过70%则表明文本很可能是由语言模型生成的。在近四年中,唯一比例减少的类别是完全由人类编写的文本,其余类别整体上均有所增加。

为测试文本质量,研究人员使用了基于可读性测试的软件。这些测试开发于20世纪70年代,最初用于美国海军,通过分析多音节词的使用等因素来计算文本难度。

在某些方面,使用(大量)AI句子的文本比科学家自己写的文本表现略好。AI文本中被动语态更少,模糊措辞(如“可能”、“表明”)也更少。然而,研究人员表示,“AI行文更难读”。这是因为频繁使用行话和多音节词。此外,动词常被用作名词(例如“概念化”)。这种名词化风格使文本更难阅读。

在同行评审中撰写投稿文章评论的科学家也在使用AI。他们使用频率不如投稿作者,但AI实质性控制的评论数量仍然大幅增长。评论也变得更难阅读,充斥着行话、长词和名词化风格。研究人员还指出,评论质量下降,更多涉及理论,更少涉及数据。

埃因霍温理工大学研究研究方法和应用统计学的教授丹尼尔·拉肯斯表示,AI并非导致这种退化的原因:“AI只是加剧了科学界早已存在的问题。”例如,有些科学家本来就无法产出高质量工作。“他们现在使用AI,更快地——而且更多地——产出低质量工作。”

拉肯斯认为,根本问题是科学界的“发表或灭亡”文化,即只有写文章才能生存:“拥有长长的发表列表比短列表更容易获得博士职位或工作。”拉肯斯说,这些出版物往往没有被(仔细)阅读:“评价往往是这样:哦,他发表了很多,那他做得不错。”

同行评审也不足以区分良莠,部分原因是科学家常常没有足够时间评审大量文章。拉肯斯说:“评审员也不总是够格。系统中根本就没有严格的质量检验。”

打开网易新闻 查看精彩图片