2016 年 3 月 10 日,首尔四季酒店。
空气几乎凝固
人机五番棋第二局,韩国传奇九段李世石手握白子,眼神紧盯棋盘。
第 37 手,AlphaGo 执黑,突然落子在五路肩冲。
刹那间,解说席一片死寂
韩国解说嘉宾金成龙九段倒吸一口凉气:“这是错着吧?
电脑莫非死机了?”
在人类千年的围棋理论中,五路落子是公认送给对手实地的愚蠢之举。
然而,李世石盯着这颗黑子,整整长考了 15 分钟,甚至在中途罕见地离场走向走廊,点燃了一支烟来平复狂跳的心脏。
那一手,彻底改写了世界围棋史,也成了整个人类科技史上不可磨灭的图腾。
▲ Thore Graepel 个人网站主页与标志性的第 37 手
十年后的今天,大语言模型席卷全球
从 ChatGPT 到各类宣称具备“深度思考”的新模型,整个科技界都在欢呼:机器终于学会像人类一样思考了!
然而,就在所有人沉浸在狂欢中时,亲手参与打造 AlphaGo 核心搜索系统的奠基人之一,Thore Graepel,突然推开 Google DeepMind 的大门决然离去。
他不仅走了,还在《麻省理工科技评论》(MIT Technology Review)上甩下一篇言辞极其锋利的万字长文:
《Don’t be fooled,LLMs don’t reason》(别被骗了,大语言模型根本不会推理)!
▲ Thore Graepel 发布的公开长文推文
他几乎是指着当红大模型的鼻子冷斥:今天的 AI 根本没有学到当年“第 37 手”哪怕一丁点的灵魂。
你们看到的所谓“思维链”,不过是一场自欺欺人的“事后圆谎”!
01十年谜底揭开:第 37 手无关“机器灵感”,实为一记理性的耳光
世人谈起当年的第 37 手,总喜欢把它浪漫化为“神经网络神秘的灵光一现”。
但 Graepel 在文章中撕碎了这个神话:第 37 手剥离了直觉光环,完全源于底层搜索机制的残酷纠偏。
要理解这一切,得先看懂 AlphaGo 身体里共存的两个灵魂:
- 系统 1(策略网络)
:这是个“直觉模仿器”。它吞噬了 3000 万盘人类高手棋谱,看到盘面就能立刻凭本能报出:“人类高手下一步通常会走哪”。
- 系统 2(蒙特卡洛树搜索,MCTS)
:这是个冷酷的“显式推演者”。它不迷信直觉,而是从当前盘面出发,硬生生劈出成千上万条推演分支,计算每一步的终极胜负。
Graepel 首次披露了一个惊人的底层技术内幕:
面对第 37 手那个局面,AlphaGo 的系统 1 扫过全盘后,给出的专家先验概率只有区区万分之一(1 in 10,000)!
在“机器本能”看来,这一步烂透了
如果按照今天主流大模型的机制,仅凭前向概率采样或者自回归联想,这手棋在诞生的千万分之一秒内,就会被系统当成垃圾直接抹杀!
但为什么它最终震撼了世界?
因为蒙特卡洛树搜索(系统 2)启动了
在极其严苛的搜索公式(PUCT)下,随着常见招法在推演中纷纷触碰到死胡同,探索奖励机制强行让算力流向了这个万分之一的冷门分支。
推演一步步展开
价值网络结合模拟走子,在数千步推演的尽头惊讶地发现:局部虽然亏损,但在极其辽阔的中腹,黑棋竟然铸造了一堵无法撼动的外势铜墙!
最终,搜索机制狠狠推翻了神经网络的初选直觉! 它把被本能打入冷宫的第 37 手,硬生生顶上了历史的舞台。
这才是所谓“创造力”的深层机制:严密推理绝不顺着直觉滑行,核心在于通过审议推演,具备彻底打碎自身偏见的纠错能力。
02大模型的画皮:拉得再长的思维链,也是在盲目猜词
十年后的今天,大模型厂商们搬出了“思维链(Chain of Thought)”,让模型在给出答案前输出长达几千字的“思考过程”。
许多人惊呼:AI 已经拥有了人类的慢思考系统 2!
但在 Graepel 看来,这完全是皇帝的新衣。
今天的大模型底层依然是一个简单的自回归循环:一次又一次猜测下一个 token。
把思考拉长,无非是让同一种下一词概率联想,在敲定最终答案前多空转了一会儿。
它自始至终是一台被疯狂扩容的超强系统 1。
Graepel 直刺现代大模型永远迈不过去的三道天堑:
1. 没有显式、可检查的“认知账簿”
在 AlphaGo 里,每一步搜索推演都有清晰透明的博弈树节点:考虑过哪些选择、排除了哪些变化、胜率几何,全盘写在账簿上。
大模型呢?
它空空如也
它没有一个独立、持久、可供审计的认知状态。
它不知道自己正相信什么,更无法随新证据系统性修正假设。
2. 知识与逻辑被搅成了一团混沌
在严密的理性系统中,“我知道什么事实”与“我如何运用逻辑操纵事实”是泾渭分明的。
而在大语言模型里,牛顿力学、莎士比亚十四行诗与逻辑推理规则,全部被稀释熔铸在那几千亿个黑盒浮点权重里。
只要输入轻轻一变,逻辑就会随之融化变形。
3. 先射箭后画靶:你的推理是“编”出来的
这是最致命的一击
认知科学研究早已表明,现代大语言模型生成的长篇大论,往往是模型在底层潜空间早已有了一个模糊的倾向,再在文本框里倒推出一套听起来头头是道的理由。
模型看似在步步为营,本质却是在事后圆谎。
这在聊天娱乐中无伤大雅,但在科学实验、工程架构、医疗诊断中,是会致命的。
一个病人误诊了,医生必须精准复盘:究竟是化验数据有误,是病理假设错误,还是推理逻辑断裂?
面对一个只会“事后编故事”的模型,人类甚至找不到问责的抓手。
03神仙打架:图灵奖得主拍手,前 Anthropic 大佬反诘
这篇长文在硅谷与学术界激起了巨大回响。
图灵奖得主 Yann LeCun 第一时间表态力挺:“好文章!推理过程必须包含搜索,大语言模型根本不具备这种能力!”
这与 LeCun 多年来倡导的世界模型与显式规划路线一脉相承。
▲ 图灵奖得主 Yann LeCun 回复力挺:推理过程必须包含搜索
但反击很快到来,且刀刀见肉
多伦多大学教授、前 Anthropic 团队负责人 David Duvenaud 直接贴出长文里的三段论,当面发出灵魂拷问:
“没有持久可审计的状态?
知识与推演揉杂?
事后拼凑解释?
这不全是在说人类自己吗?
! 照你这套苛刻的标准,那我本人算会推理吗?”
▲ David Duvenaud 提出硬核反诘:这些标准人类也做不到,难道人类就不会推理了?
这场交锋瞬间触及了认知哲学的最深处。
Graepel 的回复更是毒辣得不留情面:
“没错!人类靠自己的颅内直觉,本来就做不好推理!”
他指出,如果放任人类顺着意识流信马由缰,大脑天然就是一台充斥着认知偏差和事后合理化的机器。
人类文明之所以能建立现代科学,关键在于发明了纸笔、数学符号、预注册实验和双盲同行评审,从而摆脱了脆弱的大脑直觉!
人类是靠外挂的严格工具和结构化流程,才把自己拉出了伪推理的泥潭。
Duvenaud 随后追问:“按这个逻辑,如果我们给大语言模型外挂上类似的工具链,就能实现可靠的推理?
这难道正是你离职想要探索的方向?”
这场高手过招,终于将争论带到了最核心的本质:机器推理不能寄希望于千亿参数的自发涌现,它必须被装上外置的骨骼与缰绳。
04打破盲目扩张的神话:Metis Reasoning 的新路线
Graepel 选择在这个时间节点离开 Google DeepMind,几乎是一次对主流 AI 信仰的公然背叛。
当前全球顶尖的 AI 实验室,依然将海量算力与万亿美元资本全部倾注在 Scaling Law(尺度定律) 上,他们坚信只要堆叠更多 GPU、塞入更多数据、把系统 1 撑得无限大,高级智慧就会像奇迹一样凭空破土。
但 Graepel 冷冷地泼了一盆冰水:规模可以让直觉更加锋利,但绝不会让直觉自动蜕变为审议。
据彭博社等外媒报道,Graepel 在离开后迅速创立了名为 Metis Reasoning 的新公司,正寻求数千万美元初始融资,未来剑指科学研究、高端工程与复杂机器人。
他要做的,就是把 AlphaGo 式的搜索与审议架构带到物理世界。
在开放世界中,机器不再面对 19×19 的方寸棋盘,而是一个充满迷雾与未知的复杂宇宙。
在这里,大语言模型不再充当发号施令的“大脑”,转而作为提议假设与生成工具的“直觉四肢”;
在这之上,必须存在一个独立无私的评估内核,用科学的方法,步步推演,严密验真。
十年前的那个下午,李世石重重地将白子拍在棋盘上,拼尽毕生智慧对抗来自虚空的机器智能。
十年后的今天,当浮躁的科技界沉溺于会说漂亮话的聊天机器人时,当年那个站在机器身后破译棋道的天才,却转身离开聚光灯,走向了最荒凉的冷门无人区。
正如他在长文最后所写的那样:
不要被眼前的流畅所迷惑
要想造出攻克癌症、解开宇宙物理谜题的智能,机器不能仅停留于善于编造解释的模仿者,必须演进为能够推翻自身假设、保持严谨审慎的理性推演系统。
这场关于人类与机器智能本质的探索,才刚刚起步。
热门跟贴