能解开千禧数学难题的模型,却复现不了一篇论文。UniPat AI 发布 PaperBenchX,这是首个多学科端到端论文复现基准,测试结果给当下火热的 AI 科研叙事泼了一盆冷水。
13.98% 这个数字意味着什么
打开网易新闻 查看精彩图片
在 PaperBenchX 的评测中,即便是最强的模型 GPT-6 Astra,完整复现率也只有 13.98%。也就是说,一百篇论文交给它,能从头到尾跑通、还原出结果的,不到十四篇。
这个数字之所以扎眼,是因为它和模型在数学解题上的表现形成了强烈反差。能破解千禧数学难题,说明推理能力已经相当可观;但论文复现不是解题,它要求模型自己完成科学验证、生成证据链。
解题和做科研,是两件事
PaperBenchX 的定位是"端到端"复现,覆盖多个学科。它考察的不是模型能不能看懂论文,而是能不能把论文里的方法真正跑出来、拿到一致的结果。
13.98% 的完整复现率,暴露出的是 AI 在科学验证和证据生成上的明显缺口。解题有标准答案,复现有大量隐含前提、实验细节和未写明的操作,这些恰恰是当前模型最难啃的部分。
UniPat AI 用这个基准把差距量化了出来。对关注 AI for Science 的人来说,这个数字比任何宣传都更值得记住。
热门跟贴