2016 年 3 月,首尔四季酒店。
人机大战第二局进行到中途,AlphaGo 把一颗黑子落在了第五线上。现场解说一时语塞,有人怀疑程序出了 bug,因为在职业棋手的常识里,这手棋近乎于白送。
后来的故事大家都知道了。AlphaGo 不仅赢下了那一局,还以 4:1 的总比分击败了李世石。赛后李世石说了一段被反复引用的话:「我原以为 AlphaGo 只是基于概率计算的机器。但看到那一手,我改变了想法。AlphaGo 一定有创造力。」
那就是著名的第 37 手。
十年过去,当年亲手造出 AlphaGo 的人却站出来说了一句:那一手棋所依赖的能力,今天的 AI 恰恰没有。
说这话的人是 Thore Graepel,AlphaGo 的核心作者之一,长期从事机器学习研究。最近他做了一个颇耐人寻味的决定 —— 离开 Google DeepMind,去创业做一件他认为更要紧的事:给机器装上真正的推理能力。
那个辛辣的观点出自他最近发布在 MIT Technology Review 上的一篇文章,文章标题非常直接,就叫「别被骗了 ——LLMs 不会推理」。看完这篇文章,图灵奖得主 Yann LeCun 表示赞赏,强调「真正的推理必须涉及搜索,LLM 不具备这一能力」。
Thore Graepel 为什么这么说?我们一起来看看这篇文章写了什么。
第 37 手不是「灵光一闪」,而是推理的产物
很多人对第 37 手的叙事是「机器直觉的神话时刻」——AI 电光石火之间,看到了人类千年棋谱之外的妙手。Graepel 说,这是大家对 AlphaGo 最大的误解。
要理解这一点,得先拆开 AlphaGo 的内部构造。它由两套系统组成:一套是策略网络(policy network),通过学习海量人类棋谱,来预测「高手在这一局面会怎么下」,这是直觉的部分。另一套是搜索机制,它不关心某手棋「看起来像不像人下的」,而是显式地构建一棵包含数千个分支的博弈树,逐一推演每个候选落点通向的未来。
关键在于:在策略网络眼里,第 37 手平平无奇 —— 职业人类棋手下出这一手的概率大约只有万分之一。如果只听直觉的,这一手根本不会被选中。是搜索机制在深算之后发现,这手「不像话」的棋通向一个更好的终局。
Graepel 借用了卡尼曼那个著名的框架来解释这件事。人类的思考分为两种模式:系统 1 快、凭直觉、毫不费力;系统 2 慢、一步步来、审慎权衡。AlphaGo 恰好是这两种模式在机器上的罕见合体:神经网络提供「这手棋有戏」「这个局面要赢」的直觉,搜索机制负责把这些直觉放到未来的攻防变化里去检验。缺了任何一半都不行:光有直觉,永远走不出第 37 手;光有暴力搜索,也根本筛不动围棋那天文数字般的可能性。
这里还有一个常被忽略的对比。1997 年深蓝击败卡斯帕罗夫,靠的是人类硬编码的规则,每秒评估 2 亿个棋局位置,向前看六到八步。而围棋的复杂度完全是另一个量级,一颗子的价值取决于几十个回合之后厚势与实地的消长,哪怕只算所有变化的一小部分,超级计算机也得算上几十亿年。所以 AlphaGo 必须学会「一眼看清局势」,甚至创造人类从未想过的下法。它不是靠算力碾压赢的,这一点至关重要。
大语言模型:一个被练到极致的系统 1
再来看今天的 AI。
大语言模型的工作原理,归根到底是一遍又一遍地预测下一个 token。这本质上就是系统 1 在运转:快速、联想式、在几乎所有人类写过的领域里都能完成令人惊艳的模式补全,但它没有「想一想再回答」这个环节。
ChatGPT 横空出世后不久,业界就意识到光有语言流畅度撑不起真正的用处。补救方案大家都很熟悉了:让模型别急着回答,先生成中间步骤,把问题拆开、把中间结果带下去 —— 也就是思维链(chain of thought)。
思维链的提升是实打实的,尤其在数学和代码上。但 Graepel 指出了一个容易被兴奋情绪掩盖的事实:这些中间推理步骤,仍然是同一个「预测下一个 token」的过程,只是在给出最终答案前多迭代了一会儿而已。 它并没有像 AlphaGo 的搜索那样,引入一个真正独立的推理机制。直觉被拉长了,但并没有因此变成审慎。
他进一步列出三个短板,说明聊天机器人做的事为什么够不上「科学家所承认的那种推理」。
第一,模型没有一份明确的、可持续更新的、可供检查的认知状态。它此刻在考虑哪些假设、对各种解释抱有多大信心、在权衡哪些证据、还有哪些问题悬而未决。这些东西本该随着新信息的到来被系统性修订,但模型内部并没有这样一本「开放的账簿」。
第二,模型没有做到「知道什么」和「如何运用知识」之间的分离。知识和推理死死缠绕在神经网络的权重里,不存在一套独立、显式表达的信念体系。
第三,也是最微妙的:思维链看起来像深思熟虑,但研究已经表明,模型经常在事后编造它们。答案是走一条路得出的,报告给你的却是另一条路。一个「听起来很有道理的故事」,和一段「真实发生的推理」,是两回事。
推理是真是假,有那么重要吗?
如果只是聊天闲聊,推理是真是假可能无所谓。但在我们真正在乎的高风险领域 —— 医疗、工程、科学研究 —— 一个系统得出什么结论和如何得出结论同样重要。出了错,比如在诊断和治疗上出了错,我们需要能定位错在哪一环:是推理过程出了问题,是采信了无效证据,还是做了错误假设?一个只会事后编故事的系统,在这类场景里是无法被信任、也无法被追责的。
这也正是 Graepel 离开 DeepMind 的原因。他认为我们需要一种全新的机器推理路径,而灵感恰恰来自十年前的 AlphaGo。
AlphaGo 随时维护着一份它对当前局面全部认知的记录,也就是那棵博弈树。树里装着它考虑过的所有变化、所有可能的未来,每一手、每个局面都标注着神经网络的判断。随着推演深入,它不断更新这棵树,最终综合树里的信息决定落子。
Graepel 认为,通用推理系统也该如此:维护一个认知状态,明确表达哪些是已确认的、哪些存疑、哪些已被排除、哪些问题仍然开放。而「推理」,就是一连串改变这个认知状态的「动作」—— 推导结论、拆解问题,以及最关键的:决定下一步该问什么问题、做什么计算、跑什么实验。
当然,开放世界的推理比下棋难得多。围棋棋盘上的状态完全可见、规则固定;而现实世界里,当前局面只被部分知晓,可选的动作又多又杂,行动的后果充满随机性甚至完全未知。
但好消息是,LLM 和其他神经模型这些年的进展,恰好给这件事提供了零件:LLM 可以基于已知信息和可用资源,提议解决问题的路径;可以通过 API 和代码与工具交互;可以帮助评估一个论断是否被现有证据支持。最重要的是,系统里必须有一个独立的「裁判」,按「这一步究竟消解了多少不确定性」来评估每个推理动作 —— 只有在证据支持的情况下才更新信念。规则一旦立起来,系统就能积累经过认证的知识,并从过去的推理经验中学习、改进自己的推理策略。
Graepel 给这个图景起了一个很形象的说法:打了兴奋剂的科学方法。目标只有一个,产出经得起审视的知识。
更大的系统 1,不会自动长出系统 2
文章的最后,他把态度亮得清清楚楚:靠把系统 1 做得更大,到不了可信任的机器智能。规模能磨利直觉,但磨不出审慎。
第 37 手之所以重要,是因为一台机器守住了一个局面、称量了可能的未来,然后选中了那手连它自己的「直觉」都大概率会否决的棋。
而人类社会恰恰需要更多这样的「神之一手」,在药物发现、新材料、气候、医疗诊断这些领域。那里的棋盘完全不像围棋,甚至没人把规则递到我们手上。这样的洞见,只会来自真正会推理的系统:结论出自一段可审计的证据、推断与信念修正的链条,而不是一个事后编出来的、令人信服的故事。
十年前,AlphaGo 用第 37 手告诉世界,机器可以超越人类的直觉。
十年后,它的创造者之一在提醒我们:别让流畅的语言骗了你,那一次真正的飞跃,至今还没有在 LLM 身上发生第二次。
你说LLM不会推理,站得住脚吗?
这篇观点文发表后,在 X 上引发了不小的争议。
最犀利的质疑来自多伦多大学教授 David Duvenaud(神经 ODE 那篇 NeurIPS 最佳论文的作者之一)。他提到:Graepel 给 LLM 定的三条罪状 —— 没有可检查的认知状态、知识与推理不分离、事后编造解释 —— 放在人类身上同样成立。「按这个标准,我能算会推理吗?」
Graepel 回应说:你单靠自己也推理不好;给你纸笔,就好得多;再让你严格遵循科学方法,才算得上出色的推理者。诀窍从来不是跟着意识流走,而是把过程结构化 —— 否则任何人都逃不过认知偏差。
Duvenaud 立刻抓住了这句话的弦外之音:「那听起来,我们只要给 LLM 配上类似的工具,就能按你的定义实现真正的推理了 —— 这该不会正是你打算做的事吧?」
Graepel 这套「纸笔增强论」还引来了其他网友的质疑。网友 KingBroken 指出,纸笔本质上是工作记忆的外挂,它让你能同时推理更多数据,但并没有「无中生有」地改变推理能力的存在;不过它有个额外的好处:写下来的文字和数字,恰好就是人类「认知状态」可检查的证据。
紧接着,网友 Daniel Grant 问出了一个更尖锐的问题:照这么说,人类的推理方式就等于「现有模型 + 外挂系统」,那你是在构建一个内部推理能力比两者都强的模型?还是我漏掉了什么细微差别?
对于这些质疑,Graepel 还没有给出回复。
另一种声音则压根觉得这场讨论多余。网友 visimo-dino 直言「不敢相信还有人写这种文章」:LLM 已经在太多事情上表现出色,「不会推理」的说法要么可笑、要么无关紧要,况且同类文章早就发过几百篇了。
Graepel 没有纠缠,只丢了三个问题回去:在无法验证的领域它们可靠吗?产出过强有力的新科学理论吗?你敢让它决定你的医疗方案吗?对方倒也坦率,承认「目前还没有」,但把锅甩给了现有的强化学习方法而非 LLM 架构本身 —— 言下之意,假以时日都能解决。这大概是两派人真正的分歧所在:一方认为缺的是时间,方认为缺的是架构。
还有一条评论问出了很多人心里的八卦:DeepMind 为什么不支持这项研究?Graepel 的回答算得上直白:前沿实验室都在押注 scaling,而可审计的推理无法单从 scaling 中涌现,它需要一种不同的架构。「有时候,激进的新想法在大组织内部更难实现」。提问者 Robert Sperry 的失望溢于言表:在所有实验室里,他原本最期待 DeepMind 会是那个最努力寻找 Transformer 之外答案的人。
也有人把矛头指向了更根本的地方。评论者 Katherine Moore 只留下一句话:「语言本身就是错误工具,靠它做不出可靠的推理。」Graepel 认真接住了这个更激进的立场,并顺势抛出一个开放问题:推理确实需要某种知识表示,如果自然语言太模糊,那能不能用形式化语言对现实世界推理?那样的语言会长什么样?。他没有给答案,但这或许正是接下来一些人创业要回答的问题。
参考链接:https://www.technologyreview.com/2026/10/02/1145639/dont-be-fooled-llms-dont-reason/
热门跟贴