图灵奖得主、强化学习奠基人Richard Sutton近日对AI实验室的核心策略提出了直接批评。在他看来,合成数据无法解决大语言模型(LLM)的扩展瓶颈,原因在于世界的复杂度远超任何模拟所能覆盖的范围。
Sutton是强化学习领域的开创者之一,他撰写了该领域的标准教科书,指导过后来参与AlphaGo项目的David Silver等研究者,并在2019年发表了影响深远的文章《苦涩的教训》。在那篇文章中,Sutton提出一个核心观点:从长远来看,只有那些能随算力扩展的AI方法——比如搜索和学习——才会胜出,而非依赖内置人类知识的方法。
在最近的一次对话中,Sutton介绍了自己与前学生Khurram Javeed共同创立的新公司Oak Lab,并谈到了当前训练方法的局限。
LLM只是"半个胜利"
在Sutton看来,大语言模型既是《苦涩的教训》的好例子,也是坏例子。好的一面在于,它们随算力实现了巨大扩展,可以简单地"吸收整个互联网"。坏的一面在于,它们恰恰在这一点上撞上了墙——互联网是有限的,而真实世界"比我们存储在互联网上的一切东西都要大得多"。到了这个节点,系统过度依赖人类知识,最终反而限制了自身发展。
当被问及合成数据能否突破这一瓶颈时,Sutton直言不讳:"不,那只是一个巨大的错误。"这一判断的依据来自Javeed提出的"大世界假说"(Big World Hypothesis),该假说也是阿尔伯塔团队多年来一直在推进的研究方向。
世界太大,任何模拟都只是"微观"
"大世界假说"的核心假设是:世界具有无限复杂度,"比你的心智、比任何智能体都要复杂得多"。任何对它的模拟都只是"微观"的——一个小程序只能产生一个小世界,而这个小世界与现实并不匹配,比如错误的摩擦系数,或者对机器人电机行为的不准确建模。
Sutton还指出,真实世界中包含许多其他智能体,它们的内在运作方式根本无法通过合成数据生成。"我们不可能为其他人的心智生成合成数据。"
第二个反对理由是"人类瓶颈"。谁来判定哪些合成数据是好的、哪些是坏的?按照Javeed的论证,这需要人类专家。"你需要人类专家来分辨哪些数据集对该方法是好的、哪些是坏的,才能让这种方法扩展。所以它被人类所限制。"
举例来说,如果你想训练一架像蝙蝠一样使用回声定位飞行的无人机,首先得聘请领域专家。这让该方法受限于人类专业知识,无法规模化。即便是用模拟环境训练自动驾驶汽车,最终仍需人类来弥合模拟与现实之间的差距。
Sutton的替代方案:从自身经验中学习
Sutton提出的解决思路是让人类退出循环,让智能体从自身经验中学习。这一方向与他在《苦涩的教训》中的立场一脉相承:与其依赖人类精心构造的知识或数据,不如让系统通过与环境互动、通过自身探索来获取能力。
这一观点与当前主流AI实验室普遍采用合成数据扩展模型能力的做法形成了鲜明对比。Sutton的批评指向了一个根本性问题:当互联网数据被"喝干"之后,大语言模型的下一步扩展路径究竟是什么?
对于这个问题,Sutton给出的答案很明确:不是制造更多模拟数据,而是让智能体直接面对真实世界的复杂性,从自己的经验中学习。在他看来,这才是符合《苦涩的教训》精神的方向——让方法随算力和数据自然扩展,而不是依赖人类预先设定的知识框架。
热门跟贴