数学论文里出现"感谢ChatGPT"这类字眼,到底有多普遍?Epoch AI做了一个追踪器,专门统计arXiv数学预印本里的AI使用致谢。他们用AI模型去读论文、给用途分类,相关数据放在GitHub仓库里。
这个追踪器叫AI Use in Math Research explorer。它做的事情很具体:从arXiv的元数据和论文源文本里,找出作者承认用了AI工具的句子,再判断这些AI被用来干什么。
数据从哪来,覆盖到哪
元数据取自1989年至今所有投到arXiv的数学论文,源文本则只覆盖2023年至今的部分。论文按首次提交日期计数,修订日期不计入;按主分类归入子领域,二级分类不参与统计。全文取的是截至2026年9月5日的最新版本,修订时才补上的AI致谢,仍算在论文第一版提交的那天。
判定标准是:只要作者承认用了AI工具,无论什么用途,都算"承认AI使用"。在此基础上,追踪器还会细分具体用途,包括研究、写作、代码与计算、文献综述、形式化这几类。
识别流程分几步走。先用关键词匹配筛出可能相关的论文,再由GPT-5.6 Sol通读全文源文本,找出所有被点名的AI工具——比如OpenAI、Anthropic、Codex、Claude、ChatGPT——并把披露工具名的那句话存下来,之后再把工具名对应到厂商。
作者身份怎么匹配
作者信息从arXiv元数据解析,再匹配到OpenAlex的作者记录。2023年至今出现在arXiv上的论文作者中,有91.5%匹配上了OpenAlex记录,统计截止2026年9月16日。
追踪器还定义了一类"成熟作者":针对某个数学子领域,需要同时满足若干条件。2019到2022年间,共有29,399人向arXiv提交了至少三篇论文;其中24,979人在2023年之后(截至2026年9月)至少提交过一篇。在这24,979人中,有24,906人匹配到了OpenAlex记录,其中23,828人在核心期刊发表过至少五篇论文。
设置这个筛选,是为了观察那些在商业AI工具普及之前就持续发表数学论文的作者,他们的AI致谢行为有什么规律。Epoch AI明确说明,这不是对数学家的评价,而且受方法论本身的局限。
值得一提的是,Jin、Ke和Sui三人的独立工作用了类似的方法。追踪器的数据、方法论和下载入口都集中在AI Use in Math Research这个hub里,有问题可以发到math@epoch.ai。
热门跟贴