想象一个思想实验
把一台当今最强的大语言模型丢回1905年。
把那个年代所有能搜到的论文、数据、方程式、实验记录,一股脑全灌进去。
然后问它一个问题,
引力的本质是什么?
它会怎么回答?
它会告诉你牛顿万有引力定律 完美无缺 ,精度高达小数点后九位。
它会告诉你水星轨道有一点奇怪的偏差,但最可能的解释是太阳附近还藏着一颗没被发现的行星。
它会把已有数学工具演绎到极致,在既有框架里把每颗螺丝拧到最紧。
但它绝不会告诉你:引力应被重新理解为时空本身的弯曲。
这个场景来自Google DeepMind研究员 Tom Zahavy 在个人立场论文《LLMs can't jump》里反复拷问的核心问题。
作者的身份也让论文格外醒目: 他曾是帮AI拿下国际数学奥林匹克奖牌的AlphaProof核心贡献者。
造出了最强AI数学引擎的人,亲手画出了这台引擎的 能力悬崖 。
《LLMs can't jump》论文首页,Figure 1重绘了爱因斯坦写给友人Solovine的"经验,跳跃,公理"示意图
一封121年前的信,撕开了AI的底牌
论文的切入点,是爱因斯坦写给老友Maurice Solovine的一封信。 信中附了一张粗糙的手绘图,后来被科学哲学界反复引用,
最下方是 全部感官经验(E) ,最上方是 公理系统(A) 。
连接二者的是一条 虚线弧 ,代表一次 无法用形式语言描述的跳跃 (J)。
先跳上去,再从公理出发往下演绎,推出可检验的命题,拿回去和经验碰撞。
Zahavy借美国哲学家皮尔斯的经典三分法,把这张图拆成 三种推理操作 :
- 归纳
:看见一万只白天鹅,总结出"天鹅都是白的"。统计模式匹配,大模型的 绝对主场 。
- 演绎
:已知"所有人都会死"+"苏格拉底是人",推出"苏格拉底会死"。形式化证明,AlphaProof正在 疯狂攻克 的领域。
- 溯因
:早上发现草坪湿了,猜"夜里下过雨",为一个令人惊讶的结果, 发明 一个此前不存在的解释。
论文给出的判决近乎残忍: 生成式AI已经掌握了科学循环三分之二的能力,余下的溯因跳跃决定着科学革命,现有结构却无法完成。
AI资讯账号How To Prompt将论文核心压缩为"掌握了循环的三分之二,却做不了那一跳"
当损失函数逼近零,谁来告诉模型世界是错的?
为什么偏偏拿广义相对论当测试题?
因为它精准地击中了机器学习 最致命的盲区 。
19世纪末的牛顿引力,几乎没有"误差信号"。
惯性质量与引力质量的等价,已被实验精确验证到 10⁻⁹ 量级。
唯一的异常,是水星近日点每世纪多出43角秒的进动。
这个偏差很小,当时的物理学界便假设太阳附近藏着一颗看不见的 "火神星" ,以此保住牛顿体系。
用深度学习的语言翻译: 训练损失已经逼近零,梯度也随之消失。
一个靠最小化预测偏差来学习的系统,在这个历史节点上 根本没有动力 去推翻既有框架。
但爱因斯坦做了什么?
1907年的某一天,他坐在伯尔尼专利局的椅子上,脑中闪过一个念头: 如果一个人从屋顶自由下落,他在下落过程中感受不到自身的重量。
这后来被他称为 "一生中最快乐的思想" 。
这场 概念手术 超出了数据回归和模式匹配:"加速度"与"引力"原本属于 不同词典 ,爱因斯坦却把它们焊接成同一种物理现象。
等效原理由此诞生,继而通向黎曼几何、测地线方程、场方程,以及整个现代宇宙学的地基。
论文尖锐地指出:今天的大模型在公理 已经摆上桌面 之后,或许能完成从场方程推导出水星进动的全部数学。
但公理本身,那个把引力重新定义为时空弯曲的概念跳跃,不在任何训练数据的梯度里。
X上有人用强化学习的语言做了一个绝妙的转述:
"爱因斯坦无视了所有说他错的数据,把时空拆了重建,这种溯因跳跃,没有任何基于梯度的系统会因此获得奖励。"
网友用强化学习语言一针见血:梯度系统不会因"推翻已有框架"而获得奖励
作者亲自灭火:“别替我说得那么绝对”
论文在X上经过多轮转述后,标题迅速升级。
有账号直接写成 "DeepMind认为大模型永远无法完成科学发现" ,这已经比原文走远了好几个街区。
Zahavy本人随即发帖澄清:
"这篇个人立场论文不代表公司对AI做科学的官方观点。作为AlphaProof核心贡献者,我亲眼见证同事们用AI做出惊人发现,未来还会有更多。论文也没有把LLM判为死胡同。"
他的态度要微妙得多: 大模型的科学价值依然成立,能力地图上也确实留有空白。
演绎越强大,AlphaProof解奥赛题、AlphaEvolve在算法发现上进化搜索,越凸显上游那个"公理从哪来"的缺口。
计算器可以无限快,但算什么,谁来定?
Zahavy发帖澄清:这是个人深潜广义相对论发明史后的判断,不代表公司立场
最狠的反驳来了:人类自己不也跳不了?
评论区出现了一个 釜底抽薪式的反转 :
"把1905年全部知识喂给人类试试?实际上也只有一个人完成了广义相对论。人类科学家同样'不能跳',99.999999%不能。"
这刀子够利
如果溯因跳跃在人类中也是极端稀有事件,每个世纪或许只发生几次,那么"AI做不到"到底是结构性缺陷,还是我们在用全人类最顶尖个体的天花板去丈量一种工具?
另一批人追问: 大模型的"幻觉"算什么?
它不就在胡乱跳跃吗?
按照论文的定义,溯因要为令人惊讶的现象 构造具有解释力的新框架 ,并能从中演绎出可检验的预测;
随机生成新句子并不够
幻觉像 无锚的漂移 ,溯因像 有方向的起飞 。
两者的区别,如同在棋盘上随机落子与下出一步惊天妙手,形式上都属于"没见过的走法",价值却天壤之别。
还有一项方法论质疑:有研究者认为麦克斯韦方程与洛伦兹变换 已经在强烈指向新物理 ,爱因斯坦并非在概念真空中跳跃。
更现实的困难是, 我们几乎不可能用充足的1905年前文本训练一个"历史大模型"来做严格对照实验。
这篇文章终究属于立场论文,无法充当实验证明。
下一跳在哪里:从“预测下一帧”到“剪断缆绳”
论文并不止于否定
Zahavy在末尾勾勒了一个清晰的方向: 可干预的世界模型 。
区别在哪?
今天的视频生成模型能预测"下一帧画面长什么样",但你无法在里面 做实验 。
你能看电梯下坠的视频,却不能在模拟里 亲手剪断缆绳 ,然后观察里面的人是否失重。
DeepMind自家的 Genie项目 ,能从视频中学习潜在动作空间的生成式交互环境,被论文视为这条路线的关键起点。
只有当AI能在一致的物理流形上执行反事实干预,才有可能把爱因斯坦"最快乐的思想"从神秘的灵感,降级为可重复的算法操作。
社区里已有人接上了更前沿的拼图: 联合嵌入预测架构(JEPA) 与世界模型的结合,被视为下一代"物理直觉"的候选方案,不再只在token序列上预测下一个符号,而是在潜在空间里模拟 世界如何随行动而变化 。
这让整场讨论逐渐离开"AI行不行",转而追问: 我们正在造的,究竟是一台越来越快的计算器,还是一个能提出新问题的思维者?
判决之后
《Quanta Magazine》曾梳理过另一条"AI发现定律"的脉络: 符号回归 。
从1970年代的BACON系统到今天的贝叶斯机器科学家,算法确实能从海量数据中蒸馏出优美的方程,但前提是 数据充足、误差信号显著 。
这是光谱的一端: 开普勒式发现 ,数据丰富,试错空间可枚举。
广义相对论站在光谱的另一端: 爱因斯坦式发现 ,数据几乎不说话,概念只能靠人去 发明 。
当前所有自动科研系统,包括Sakana的AI Scientist论文流水线与DeepMind自己的AlphaEvolve,都属于开普勒侧的 高速版本 。
它们在既有范式内爬山的速度已经令人瞠目。
但Zahavy那个问题,始终悬在所有人头顶,
当任务变成发现另一座山,计算器再快也没用。
这份判断没有判处大模型死刑,只在能力地图上标出一片空白区域。
这片空白本身,就构成了一道值得跳跃的问题。
热门跟贴