把水杯从桌上碰掉会发生什么?问ChatGPT,它会给你一套分步解释:重力如何让容器沿“抛物线轨迹”加速,为什么杯子“如果冲击产生的应力超过材料承受极限”就会碎裂。问我3岁的女儿,她不太在意细节:“杯子碎了,水洒得到处都是!”
放在人工智能的未来语境下,这种差异很有启发性。驱动当下聊天机器人的大语言模型,是通过海量文本来训练预测下一个词的。然而,没有一个语言模型真正把杯子从桌上碰掉过——也没往墙上扔过意面,没把滑板车骑进池塘——这或许构成了它们能力的根本局限。
这正是部分研究者认为AI要迈向新阶段,需要的不是更大的语言模型,而是“世界模型”的原因。所谓世界模型,指的是通过观察来学习、从而能模拟现实世界中行为后果的系统。这类系统正迅速成为AI的下一个前沿,其在自主机器人领域的潜力引来产业界和商业界的巨大关注。
世界模型路线尤其引人遐想之处在于,它表面上也提供了一条通往通用人工智能的路径,即具备人类水平推理能力、可跨任务应用的机器。但问题在于,要分清虚实并不容易。“世界模型”这个词本身就弹性极大,令人困惑。Santa Fe研究所的Melanie Mitchell直言,它已经变成“所有当前AI系统做不好的事情的代名词”。
究竟这些系统该建模什么,目前尚不清晰,更不用说对物理现实的内部表征是否足以支撑那种可泛化的智能——也就是我3岁女儿凭直觉就知道杯子被碰掉会发生什么,即便她说不出原因。
要理解世界模型在AI领域的含义,追溯这一概念在认知科学中的根源会有帮助。AI研究者通常将源头指向1943年,心理学家Kenneth Craik写道,人类心智“携带着一个外部现实及其自身可能行动的小型模型”,让我们能够“尝试各种替代方案”并“在未来的情形出现前做出反应”。
这一思想在随后几十年不断演化,最引人注目的是预测处理理论。该理论认为,感知——甚至意识本身——依赖于大脑不断生成关于外部世界的预测,并根据传入的感官数据加以更新。认知科学家Josh Tenenbaum指出,核心思想始终未变:“智能的关键在于在头脑中构建关于世界的模型,这样我们就能模拟结果并避免代价高昂的错误。”
热门跟贴