打开网易新闻 查看精彩图片

7 月 29 日,三位美国数学家在 arXiv 上传了一篇四页短文,题为《麦克斯韦猜想是错的》(The Maxwell Conjecture is False)。论文中,他们构造出一个精巧的反例,推翻了这一物理学经典猜想。致谢信息显示,反例构建的核心思路,来自 GPT-5.6 Sol。

再早几天,7 月 20 日,Anthropic 一位数论学家宣布借助 Claude Fable 5 推翻雅可比猜想,陶哲轩(Terence Tao)随后快速用 ChatGPT 跟进,并公开了验证过程。7 月 24 日,他在国际数学家大会上发表演讲,警示数学界正从“证明稀缺”进入“证明过剩”的时代。

在密集涌现的 AI 辅助科学发现浪潮中,一篇写就于 2026 年 1 月、题为《大语言模型无法跳跃》(LLMs can't jump)的立场论文突然被广泛传播,给大众的狂欢泼了盆“冷水”。

文章作者是谷歌 DeepMind 研究员、AlphaProof 的核心开发者汤姆·扎哈维(Tom Zahavy)。他判断,当前的大语言模型在科学发现中缺失溯因推理(abduction)这一关键环节,即在数据稀缺、没有现成框架的情况下提出全新解释性假设的能力。而这,恰恰是从无到有发明新理论所必需的。

在他看来,“整合物理上自洽的多模态世界模型是弥合这一鸿沟、开启真正人工智能科学发明的关键。”

(来源:Tom Zahavy)
打开网易新闻 查看精彩图片
(来源:Tom Zahavy)

这篇论文完成的半年多之后,事情的进展远超想象。汤姆的看法放在今天,还立得住吗?

物理学家开始想象“坠落”

汤姆没有在文中泛泛地讨论 AI 能否做科学,而是先像哲学家一样,对科学史展开了深入的剖析。

他援引美国哲学家查尔斯·桑德斯·皮尔士(Charles Sanders Peirce)在 20 世纪初提出的三分法,称所有推理都可以拆解为规则(Rule)、案例(Case)、结果(Result)三要素的不同排列。

演绎(Rule + Case=Result)是从已有前提推出结论,保证真理性;归纳(Case + Result=Rule)是从大量样本中提炼规则,靠统计频率验证;溯因(Rule + Result=Case)则是面对一个反常现象,倒推出一个能解释它的新案例或新规则。

三种排列里,溯因是唯一一种可以生成新前提的推理方式,也是唯一不保证正确的。

AI 在过去几年已经基本掌握了归纳,例如大规模模式识别,也在快速攻克演绎,如 AlphaProof 系统在国际数学奥林匹克上取得银牌水平的成绩,Google DeepMind、DeepSeek 和 OpenAI 的后续模型在 2025 年达到金牌水平。汤姆认为,大模型目前的突出短板集中在溯因层面。

他接着用一个更具体的例子切入:爱因斯坦提出广义相对论并不靠归纳大量实验数据,也不源于演绎。

理论的出现,有时只源于一个“最幸福的思想”:1907 年,爱因斯坦想象一个人从屋顶自由下落,在那一瞬间,这个人感受不到重力。

这个思想实验直接导向了等效原理:均匀引力场在局部与均匀加速度不可区分。整个推理过程只依赖“具身模拟”:将抽象的物理概念锚定于一种想象中的身体感觉。

基于此,汤姆借用哲学家约翰·塞尔(John Searle)在 1980 年提出的“中文屋”概念(一个只按规则操作汉字符号却完全不懂中文的人),将大语言模型比作高维版本的中文屋:它只能处理物理学的语言,却对语言所指向的物理对象束手无策;它可以完美地复述等效原理、演算广义相对论的所有推论,却缺乏“感受”的通道,自然不会冒出“如果一个人自由下落,他会感受到什么”的想法。

(来源:Tom Zahavy)
打开网易新闻 查看精彩图片
(来源:Tom Zahavy)

这些论据指向一个结论: AI 要跨越这道鸿沟,无法依赖更强的语言处理能力,我们必须构建物理一致的世界模型(World Model)。后者作为一个能进行反事实干预的模拟环境,将真正允许 AI 发挥“想象”。

汤姆还顺带给自家产品打了个广告,他特别提到了谷歌 DeepMind 2024 年发布的 Genie 系列世界模型,认为这类允许用户主动干预的生成式环境是一条可能的技术路径。

反例是 AI 的发明吗?

现在,我们把这套框架放进近日一系列 AI 参与的科学发现中。

麦克斯韦猜想的证伪工作为例,从表面上看,这是一个漂亮的结果。物理学家麦克斯韦早在 1873 年就讨论过点电荷电场的平衡点问题,直到 2007 年才被后辈整理为精确的数学命题:预测在空间中放置 N 个非简并点电荷时,其静电场中最多存在 (N-1) 2 个电场平衡点(即势能临界点)。

作为相关领域的重要基石之一,近二十年间,这一猜想的上界被逐步收紧,却没人提出反例。

最近这次成功证伪,是数学家在 GPT-5.6 Sol 的建议下,构建了一个巧妙的“五电荷三角双锥体”,并找出至少 24 个非退化平衡点,远超猜想设定的 16 个平衡点上限。

作者在论文中特别说明,AI 为人类拓展搜索空间、提供关键的结构性线索,最后由人类学者进行严密的验证与推广,证明可以通过添加更多的轴向电荷对将平衡点数量继续放大。

不过,按照汤姆的分类,AI 在这项工作中提出了一个基于既有数学框架的几何构型,并未发明新的电磁学理论,遑论质疑猜想背后的假设体系或引入新的数学对象。因此只属于演绎范畴内的高效探索。

如果扩大对照范围,回顾近日一系列被证明或证伪的猜想,无论推导过程多曲折、多需要创造力,AI 的工作都停留在“给定公理后的推导”。

但爱因斯坦 1907 年的思考不是这样。当时没有现成的猜想,没人提醒他引力与加速度存在某种关联。爱因斯坦不是从故纸堆里翻出了等效原理,而是直接提出新的理论,这才是汤姆所期待的“跳跃”。

问题又来了,AI 难道只有掌握溯因,才能具备参与科学发现的资格吗?

答案也不尽然。在证伪麦克斯韦猜想的过程中,AI 的建议是数学界过去 150 年从未有人系统尝试过的方向,将其归结为纯粹的“符号搜索”是一种低估。汤姆自己也在文中承认,归纳、演绎与溯因在实践中往往交织在一起。

事到如今,已经很少有人全盘否定 AI 对科学的真实贡献,但谈及它们承担的具体角色,行业一直存在争议。

而针对自己的旧文重新被传播,甚至被当作反对 LLM 的例证,汤姆发布最新回应,澄清这并非一篇宣称“LLM 是死路”的“檄文”。

他强调,自己的同事们、其他前沿实验室以及学术界已经用大语言模型做出了许多出色的发现,并将继续做出更多;当时发文的目的很纯粹,就是以广义相对论的发明过程作为对照,探讨要让一个现代 AI 系统达到类似高度,还差什么。

(来源:X@TZahavy)
打开网易新闻 查看精彩图片
(来源:X@TZahavy)

如何让 AI 拥有物理直觉,抑或它们根本不需要?

其实,Google DeepMind 主席戴密斯·哈萨比斯(Demis Hassabis)提出的“爱因斯坦测试”已经验证了汤姆假说的前半句。他设定模型只能了解 1911 年以前的知识,看 AI 能否在 1915 年之前独立推出广义相对论,结果发现,“今天的系统显然做不到。”

但接近尾声,这篇论文没有停在断言“大模型无法实现跳跃”上,它提供了一种方案:在不久的未来,AI 可以通过世界模型等“具身模拟”方案完成“跳跃”。

而这个解法放在现在,只是人们为 sim-real gap(模拟与真实世界之间的鸿沟)搭起的三道桥梁之一。

有人认为,具身经验是不可还原的,任何数字模拟都缺少某种关键的东西,也许是感觉运动反馈的连续性,也许是身体本身的物理约束。为补足这部分缺陷,需要寻求可以真正在物理世界中活动的 AI,比如机器人,这是第一道桥。

但爱因斯坦本人并未亲自坐过自由下坠的电梯,他的思想实验完全在头脑中运行,本质上是一次“内部模拟”,运行在拥有数十年物理学习和身体经验的神经硬件上。

对此,也有观点认为,如果我们能创造出一个足够丰富、高保真的数字模拟环境,叠加主动干预能力(不只预测下一帧,还能“想象”切断电梯绳索的场景),理论上就足以替代物理身体展开“想象”,从而支撑抽象跳跃的实现。这正是世界模型构建者所强调的价值。

而如果我们跳出科学史上人类主导发现的先验,还会看到激进却现实的第三种回应:AI 也许并不需要复刻爱因斯坦的路径,更不需要具备亲身体验和想象的能力。

Google DeepMind 2025 年发布的 AlphaEvolve 已经证实,用一个由大语言模型驱动的进化式代码生成循环,直接在算法层面做变异、评估、筛选,就能绕过所有“物理直觉”,从大规模并行的候选生成和严格的自动化验证中产生新结果。

这套机制某种程度上是用蛮力模拟溯因的效果:AI 的确没有“直觉”,但可以在极短时间内探索人类无法穷举的构造空间。

值得注意的是,三条路径最近正在出现收束的迹象:机器人路线受困于真实世界的采样效率,把世界模型当作训练环境;进化式搜索走到验证阶段,同样可以利用世界模型代替海量且昂贵的线下实验。

汤姆的判断最终或许将以一种出乎意料的方式成立:世界模型会变成一个连结虚拟与现实的中介,串起所有试图将 AI 迁移至真实世界的尝试。

只是我们依然无从确认,这一正在成形的架构,究竟能不能让 AI 在人类还没想到之前,抢先一步提出有价值的问题。

参考内容:

https://www.tomzahavy.com/files/llms-cant-jump.pdf

https://arxiv.org/abs/2607.27197

https://x.com/TZahavy/status/2082401499628376180

https://terrytao.wordpress.com/2026/03/29/mathematical-methods-and-human-thought-in-the-age-of-ai/

https://www.thenews.com.pk/latest/1393338-new-agi-benchmark-demis-hassabis-proposes-einstein-testultimate-challenge-to-prove-true-intelligence

https://arxiv.org/abs/2506.13131

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成