七月盛夏,一条推文像一颗燃烧弹砸进了AI圈的弹药库,"谷歌DeepMind论证:大语言模型永远无法做出开创性的科学发现。"

这条帖子在48小时内被转发数万次。
评论区瞬间撕成两半
一半人高喊"早该说了",另一半人怒斥"标题党"。
而最诡异的一幕是:这篇论文的作者,恰恰是帮AI拿下国际数学奥赛银牌的那个人。

他亲手证明了AI能做什么,然后亲手写下了AI不能做什么。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

▲ 激起争论的二次摘要帖:用"永远无法"的措辞,把一篇谨慎的立场论文改写成了一份宣判书

一封1952年的信,撕开了2026年的伤口

故事要从一封七十多年前的信讲起

1952年前后,阿尔伯特·爱因斯坦给老友莫里斯·索洛文写了一封信。
信里画了一幅简陋却石破天惊的草图,底部是一条横线,标着"E",代表感官经验(Sense Experience);
高处悬着"A",代表公理(Axioms)
E和A之间只画着一条弯弯曲曲的弧线,旁边写着一个词:

Jump

爱因斯坦的意思是:从经验到公理,不存在逻辑通道。
你不能一步步"推"上去
你只能跳
跳上去之后,再用严格的演绎把结论推回来,跟实验对质。
对了,继续;
错了,推倒重来

这幅草图沉睡在科学史文献里大半个世纪。
直到2026年1月,谷歌DeepMind研究员Tom Zahavy把它挖出来,写成了一篇立场论文,标题刺目得像一记耳光,

《LLMs can't jump》

大语言模型,跳不了

打开网易新闻 查看精彩图片

▲ Zahavy个人网站上的论文项目页:E–J–A示意图清晰可见,从感官经验到公理之间,只有那道"跳"

三种推理,AI拿下了两种

Zahavy的论证骨架,借用了19世纪逻辑学家皮尔士的三分法。
你可以把人类所有的推理打包成三个抽屉:

第一个抽屉:演绎
已知规则和条件,推出结果
1+1=2,三段论,形式证明,确定、严密、不创造新东西。
AI在这里已经接近超人
AlphaProof在国际数学奥林匹克上拿了银牌,靠的就是在形式语言里暴力搜索证明路径。

第二个抽屉:归纳
看一万只天鹅都是白的,归纳出"天鹅是白的"。
大语言模型的老本行,从海量数据中压缩出模式。
GPT系列、Claude系列,本质上都是归纳机器的登峰造极。

第三个抽屉:溯因
看到一个不该出现的结果,倒推出一个从未存在过的解释。
侦探看见密室里的尸体,发明一个"凶手从通风管道爬进来"的假设,这个假设此前不在任何数据库里。

Zahavy说:AI已经拿下了前两个抽屉。
第三个,锁着

打开网易新闻 查看精彩图片

▲ AlphaProof在IMO达到银牌水准,演绎推理的"天花板"已经被AI撞穿,但Zahavy追问的是天花板之上的东西

为什么偏偏是广义相对论?

论文没有选一个"AI做不好的基准测试"来举例。
它选了人类智识史上最传奇的一次跳跃

1907年,爱因斯坦坐在伯尔尼专利局的椅子上,突然想到一件事:一个从屋顶自由落下的人,在坠落过程中感受不到重力。
他后来称之为"我一生中最幸福的思想"。

这个念头有多疯狂?
当时牛顿力学依然稳固
它解释了几乎所有已知现象,精度惊人。
唯一一个小麻烦是水星轨道每世纪多偏了43角秒,主流物理学家选择假设太阳旁边还藏着一颗看不见的行星,叫"火神星"

换句话说,数据看上去并不要求新物理,旧理论的损失函数几乎是平坦的。
如果你是一台归纳机器,你看到的世界一片太平,梯度与误差信号都近乎消失,缺少推翻时空结构的力量。

但爱因斯坦跳了

他把"坠落者感受不到重力"这个感觉,提升成了一条原理,等效原理。
然后花了八年,经历无数次失败、折返、与数学家格罗斯曼的合作、与希尔伯特的竞赛,最终在1915年写下了广义相对论的场方程。

Zahavy的论点就扎在这里:场方程写出来之后的一切,验证、推导、计算,AI或许都能做。
但等效原理本身从何而来?
它无法直接从文本中压缩出来
一个人在脑海中做了一次密封电梯里的思想实验,用身体的感觉把两个概念焊在一起。

缺少感知与干预,也无法在想象中剪断电梯缆绳,又该怎样完成那一跳?

最讽刺的身份:给AI夺牌的人,给AI判了刑

故事到这里,已经足够刺激
作者的身份又让它变得不可思议

Tom Zahavy身在AI研发的核心。
他是AlphaProof的核心贡献者之一,就是那个在2024年国际数学奥赛上让AI拿到银牌的系统。
他亲眼看着自己参与打造的系统,在形式化定理证明的赛场上碾压人类选手。

然后他转过身来,写了一篇论文说:这还不够。

能证明定理,不等于能发明公理
能在给定的游戏规则里赢,不等于能改写游戏规则。
AlphaProof是演绎侧的巅峰,但爱因斯坦式的发现,发生在演绎开始之前。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

▲ 当论文被口号化后,Zahavy本人紧急澄清:文章表达的是个人立场,并非公司宣判;他也不认为LLM已经走进死胡同

爬山的人和跳崖的人

论文在ICML 2026以Position Poster亮相后,Jina AI创始人肖涵写了一条引起广泛讨论的长帖,用一个思想实验把问题拧到最紧:

假设你有一个知识截止到1905年的LLM。把那个时代的每一篇论文、每一组数据、每一个方程都喂给它。它能发明广义相对论吗?

他的答案是:不能

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

▲ 肖涵的核心区分:hill-climbing(爬山)是在既定地形上找最高点;jump(跳跃)是发明一片新地形

肖涵把AI科研能力切成两半,泾渭分明,

爬山(hill-climbing):在已有的指标体系和概念框架内,做超人级别的搜索与优化。
这件事AI已经在做,而且做得惊人
自动调参、蛋白质结构预测、材料筛选、数学证明,全是爬山。

跳跃(jump):重组整个领域的概念地基,发明一套新的思考方式。
量子力学、进化论、广义相对论,每一次都是换了一座山。

"今天自动科研交付的绝大多数成果,将是惊人的爬山。跳跃,暂时仍属于我们。"
反对票:人类自己也跳不了

反驳来得又快又猛

有人冷冷地说:"给1905年知识截止的人类同样材料,能发明广义相对论的也只有一个人。"

打开网易新闻 查看精彩图片

▲ 最短促也最有力的反驳:人类自己的"跳跃率"也无限趋近于零

另一位用户更损:"人类也不能跳,99.999999%的人不能。"

打开网易新闻 查看精彩图片

这指向一个尖锐的事实:如果你用"是否等于爱因斯坦"当标尺,人类科学家群体自身的通过率也接近零
我们是否在用一个对自己都不公平的标准,去审判机器?

一条被大量引用的纠偏评论则直接拆解了"永远不能"的措辞:论文并未给出不可能性证明。
它主张当前LLM缺少一个架构组件,即接地、可交互的世界模型。
论文自己就提出了路径:物理一致的多模态世界模型 + 反事实模拟
它的结论聚焦于"当前LLM还差一块拼图"。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

▲ 这条引用评论逐条拆解了种子帖的过度表述:爱因斯坦的洞见也由大量约束、搜索、失败与纠正塑造

工程师Yun-Ta Tsai还提出了一个类比,

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

▲ AlphaGo之前,人类也说围棋的可能性空间大到AI永远无法征服。后来呢?

他提醒所有人:AlphaGo之前,AI围棋领域的"共识"跟今天一模一样。
人们说2×10¹⁷⁰种可能性,没有计算机装得下,AI不可能预判五六十步的走势。
后来怎样?
多数走法不通向胜利,蒙特卡洛树搜索让采样变得可控。
围棋被攻破了

物理方程不过是另一种形式的压缩
爱因斯坦从研究光的性质起步,花了好几年时间,又跟其他物理学家反复交流(类比多智能体协作),才逐渐逼近那次跳跃。
目前的AI智能体会话碎片化、上下文断裂,但这种局面未必永远如此。

争论的焦点:AI还缺什么

喧嚣落定之后,这场争论留下了一条清晰得多的边界线,

第一类能力:在给定问题与指标内的超人搜索。
证明定理、预测蛋白质、筛选材料、优化实验参数,已经在发生。
这不需要"跳"
这是爬山,而AI已经是世界上最强的登山者。

第二类能力:在误差信号稀薄时,发明新前提、新对象、新问题。
这需要跳
论文认为这仍是瓶颈
但瓶颈不等于天堑
作者自己也说:"我可能是错的
单纯扩展现有系统,或许就足以在物理等领域带来新发明。"

一位中文评论者提出了也许最深刻的反问:我们看到的究竟是能力缺失,还是授权缺失?
模型被要求答题而非质疑题目,被要求完成目标而非审判目标,被要求优化路径而非重写终点。
如果我们从来没有允许AI去跳,我们怎么知道它不会?

这个问题没有答案
但它像爱因斯坦那条弯曲的弧线一样,悬在所有人头顶。

计算器可以无限快
但在它学会做梦之前,那一跳,还是跳不了。

至少,暂时还不行