这两天如果你刷到"某大模型攻克数学猜想"这类新闻,先别急着转发。这类新闻的保质期,最近常常只有一天。

7 月 20 日,海外科技圈传出一条大消息:某头部 AI 公司的数学家用自家最新大模型,给一个存在近百年的经典猜想"雅可比猜想"找到了反例,相当于证伪了这个猜想在三维以上的情况。消息一出,不少人当成"大模型开始做原创数学研究"的标志性事件在转发。

结果第二天,剧情就反转了。有网友扒出来:这个"反例"跟苏联数学家 Vitushkin 早在 1999 年发表的一篇论文里的构造几乎一模一样,只不过 Vitushkin 当年做的是二维情况,而这次大模型给出的是三维版本。大概率是检索到了那篇旧论文,换了个维度重新包装了一遍。更尴尬的是,雅可比猜想真正被数学家们较劲了几十年的,恰恰是二维情况,三维情况本身在学术圈的分量并不算高。

打开网易新闻 查看精彩图片

事情是怎么"翻车"的

按目前流传出来的说法,这次反转的关键证据很简单:把大模型给出的"反例"和 Vitushkin 1999 年论文里的构造放在一起对比,思路、结构高度相似,区别只是维度从二换成了三。懂行的人一眼就能看出,这更像是"检索+改写",而不是模型自己从零推导出了新结果。

这不是大模型第一次这么干。去年就有一次类似事件:某家 AI 公司宣称自家模型"原创性"解决了一道埃尔多斯猜想,吹了一段时间之后,同样被发现答案其实早就躺在某篇论文里,模型不过是把它检索出来重新表述了一遍。一年时间不到,类似的剧本又演了一遍,只是主角换了一家公司、换了一个猜想。

为什么总有人把"检索"包装成"原创突破"

这里面的逻辑其实不复杂。现在的大模型,最强的能力之一就是海量检索加信息重组:给它一个模糊的问题,它能在浩如烟海的论文、数据库里,把相关的、哪怕是几十年前发表在冷门期刊上的结果给"捞"出来,再用清晰的语言重新表述一遍。这个能力本身非常有价值,能帮研究者、工程师大幅节省查资料的时间。

但"检索到已有答案"和"独立推导出新答案",是完全不同的两件事。前者是效率工具,后者才是真正意义上的科研突破。问题在于,这两者在最终呈现的文本上,有时候看起来几乎一样,都是一段严谨的数学论证,读者很难仅凭结果去分辨这个证明到底是模型"想"出来的,还是"查"出来的。这中间的模糊地带,恰恰给了"包装成原创突破"的空间:公司想要一个亮眼的科研故事去证明自家模型的推理能力,媒体想要一个"AI 超越人类"的爆点标题,两边一拍即合,至于这个结果到底是不是真的原创,往往要等圈内的较真人士花时间去核实才会被戳破。而这次,戳破只用了 24 小时。

影响到谁?吃亏的往往是普通读者

这种"检索包装成原创"的操作,短期内看似没伤害到谁,长期看影响不小。

对学术圈来说,真正扎实的研究成果,会被这种真假混杂的"突破新闻"稀释关注度。较真的同行知道该怎么甄别,但外行很难分辨哪条是真突破、哪条是营销稿。对资本市场来说,"我们的模型解决了 XX 年悬而未决的数学难题"这种叙事,是极佳的估值故事素材,一条这样的新闻能带来的关注度,可能远超一篇扎扎实实的技术报告。

最容易被"背刺"的,其实是普通读者。国内不少科技自媒体在转译海外"AI 破解数学难题"类新闻时,习惯直接照搬海外的通稿口径,很少去核实原始论文出处、也很少等一等圈内人的核验意见,读者刷到的往往就是第一波未经核实的"突破"叙事,却很少能刷到几天后悄悄发生的反转和更正。等真相浮出水面时,热度早就过去了,没人再专门发一条"其实是查资料查出来的"来更正认知。

国内大模型厂商在宣传自家产品的"数学能力""科研能力"时,同样常用"攻克 XX 年未解难题"这类表述。这不是说国内厂商一定存在类似问题,而是提醒一句:同样的核实逻辑,放在任何一家公司身上都适用,不该因为是"自己人"就降低标准。

我的判断:检索能力是真本事,但不该被包装成创造力

大模型的检索加重组能力,是真本事,值得认可,不需要因为这次反转就一棍子打死"AI 做科研没用"。真正需要警惕的,是把"检索"包装成"原创突破"去讲故事的做法。这不是模型的错,是使用和宣传模型的人在夸大其词。

如果你以后再刷到"AI 攻克 XX 年数学难题"这类新闻,不妨多做一步:看看新闻里有没有提到具体的论文出处和同行评审情况,如果只有一句笼统的"AI 独立解决",不妨先打个问号,等等看有没有后续反转,再决定要不要转发。

你有没有被这种"AI 破解难题"的新闻刷屏过后来又发现是反转?评论区聊聊你最近刷到过的类似案例。