来源:市场资讯
(来源:图灵人工智能)
这不是一篇普通的强化学习技术论文。杨立昆团队 对 "智能究竟是什么" 这一根本问题的系统性思考,更是一场从 "数据拟合" 到 "思维生成" 的认知范式革命。作者是 Nadav Timor、Ravid Shwartz-Ziv、Micah Goldblum、Yann LeCun、David Harel
https://arxiv.org/abs/2605.06732
问题一:为什么智能不能只靠真实经验学习?
绝大多数 AI 研究者都默认了一个未经审视的假设:智能是对经验的统计归纳。只要给模型足够多的真实世界数据,让它在足够多的试错中学习,最终就能涌现出智能。但杨立昆一针见血地指出:人类智能的绝大多数知识,从来都不是来自真实试错。
人类并不是每件事都亲自试一遍。我们不会真的把车开向墙壁来学习碰撞后果,也不会真的把每一种人生选择都执行一遍。我们大量依赖一种能力:在内心模拟可能发生的事,然后选择行动。
这就是这篇论文标题中 “imagination” 的真正含义。它不是浪漫意义上的幻想,而是强化学习中的一个技术范式:策略不直接在真实环境里更新,而是在一个学到的动力学模型中生成 imagined rollouts,再由学到的奖励模型对这些轨迹打分。
论文明确说,在这种范式中,策略更新阶段不再查询真实环境。
所以第一个认知转折是:智能并不只是从经验中学习,而是用经验建造一个可反复试错的内部世界。
真实世界太贵、太慢、太危险;想象世界便宜、快速、可重复。AI 如果能在内部世界里训练,就可以把少量真实经验放大成大量虚拟经验。
问题二:所谓“想象”,到底想象了什么?
论文中的想象不是单一模块,而是由两个东西组成:
第一,世界会如何变化。
这对应 learned dynamics model,也就是动力学模型。它回答:“如果我在这个状态下做这个动作,接下来会发生什么?”
第二,发生的事情好不好。
这对应 learned reward model,也就是奖励模型。它回答:“这个结果值得追求吗?”
这点非常关键。一个智能体不是只需要预测未来,还需要评价未来。只知道“会发生什么”,但不知道“值不值得”,它无法选择;只知道“想要什么”,但不知道“怎么到达”,它也无法行动。论文正是把 learned dynamics 和 learned reward 同时放进 training in imagination 的框架中分析。
所以第二个认知转折是:
想象不是单纯的预测,而是“预测未来 + 评价未来”。
这也让“智能”从感知问题变成了一个更深的问题:
AI 不只是要看见世界,而是要在内部生成世界;不只是要生成世界,还要知道哪些世界更值得抵达。
问题三:如果 AI 在自己的想象中训练,最可怕的错误是什么?
直觉上,我们会说:当然是世界模型错了。
比如智能体以为悬崖前还有路,于是在想象中大胆前进,现实中却摔下去。但论文指出另一类同样危险、甚至更隐蔽的错误:奖励模型错了。
动力学模型错,是“我误判了世界会怎样”。
奖励模型错,是“我误判了什么是好”。
前者让 AI 走错路,后者让 AI 追错目标。
论文的第一个主要贡献就是把 return gap 拆成两个可分别控制的来源:dynamics-model error 和 reward-model error。以前一些 simulation-lemma-style 分析没有给这两类误差分别分配独立系数,也没有告诉我们预算该投给动力学样本还是奖励样本;这篇论文正是要把这件事理论化。
这里的深层问题是:
一个智能体失败,究竟是因为它不理解世界,还是因为它误解了价值?
这比“模型准不准”更深。因为一个高度聪明但价值判断偏差的系统,可能比一个能力较弱的系统更危险。它不是不知道怎么到达目标,而是目标本身已经被内部奖励模型扭曲了。
问题四:为什么一点点想象误差会毁掉整个未来?
如果只预测一步,模型稍微错一点也许没关系。
但 training in imagination 的关键在于 rollout:一步接一步,一直往未来推演。
这时问题变成:小错误会不会在时间中滚雪球?
论文用 Lipschitz 常数来刻画这个问题。直观地说,如果一个模型的 Lipschitz 常数很大,就意味着输入状态一点点变化,输出可能剧烈变化。这样的内部世界是不稳定的:一个微小偏差,经过多步想象后,可能变成完全不同的未来。
论文指出,较低的 dynamics、reward 和 policy 的 Lipschitz 常数,可以收紧 return-error bound;也就是说,更平滑、更稳定的内部表征,会让想象轨迹更可靠。
这带来第三个认知转折:
好的世界模型不只是准确,而是稳定。
这就像人的认知。一个成熟的人不是从每个细节重新推理世界,而是拥有稳定的抽象结构:物体会延续存在,行动会带来后果,目标会约束选择。内部世界越稳定,想象越不容易崩坏。
问题五:什么样的内部世界,才适合拿来训练智能?
很多人会以为,最好的世界模型就是最逼真的世界模型:像视频生成一样,把像素、纹理、细节全部还原。
但这篇论文暗示的方向更深:
好的世界模型,是适合行动的世界模型,不一定是最逼真的模型,而是最具有可推演性的模型。
比如逼真的街景,比如极简的可推演地图;逼真的分子动力学模型,不如可推演的牛顿力学;逼真的视频生成模型,不如稀疏因果世界模型。
论文讨论了 latent representation,也就是让动力学、奖励和策略运行在高层潜在空间中,而不是直接运行在原始观测上。它进一步连接到 temporal straightening(时间拉直):如果潜在空间中的连续状态变化方向更一致,长程预测就更像沿着一条较直的轨迹前进,误差也更容易控制。
认知的本质,就是将复杂、弯曲、高维的物理世界,投影到一个简单、平直、低维的内在几何空间中。在这个空间中,预测变得容易,规划变得简单,推理变得可行。
这就把问题从“世界模型是否逼真”推进到:
世界模型是否拥有适合行动的几何结构?
人类认知也是如此。我们不会在脑中渲染完整的物理世界,而是保留对行动有用的结构:距离、因果、障碍、目标、风险、代价。真正重要的不是复刻世界,而是压缩出一个可以推演、可以规划、可以选择的内部空间。
所以:智能的内在世界,不是现实的复制品,而是现实的可行动压缩。
问题六:如果真实数据很贵,应该买哪种数据?
到这里,论文进入一个非常现实的问题:
既然内部世界需要校准,而校准需要数据,那么有限预算应该怎么花?
是买更多 dynamics-transition samples,也就是“状态—动作—下一状态”的样本?
还是买更多 reward samples,也就是“状态—动作—奖励”的样本?
文章证明了一个结论:想象训练与真实训练性能存在严格误差上界,由动力学误差、奖励误差共同决定,加权和低于阈值即可保障现实适配性。
在合理阈值下,想象是高效认知推演;冲破临界阈值,会滋生恶性幻觉。
论文把这两类数据明确区分,并在 power-law scaling 假设下推导了最优的 dynamics-to-reward sample ratio。换句话说,它不是泛泛地说“数据越多越好”,而是需要在训练中回答:当不同数据的成本不同、学习速度不同,预算应该怎样分配,才能最小化想象训练带来的 return error?
这一步非常重要,因为它改变了我们对“数据”的理解。
数据不再只是堆料。数据变成了校准想象的不同工具。
有的数据帮助 AI 更好地预测世界。有的数据帮助 AI 更好地判断价值。
智能体真正需要的不是更多数据,而是“更有效地降低内部世界的关键误差”的数据。
问题七:便宜但有噪声的奖励,值不值得买?
这是论文里最有现实感的问题之一。
在很多场景中,高质量奖励很贵。比如 RLHF 里的人工偏好标注,机器人任务里的专家评估,自动驾驶中的安全判断。你可以花很多钱买少量高质量标注,也可以花较少的钱买大量有噪声标注。
那到底哪种更好?
论文分析了 REINFORCE 在 noisy rewards 下的情况。结论是:如果奖励噪声是零均值的,那么梯度估计仍然是无偏的,只是方差会增加;而这种额外方差可以随着 rollout 数量增加而下降。论文进一步把“买更高保真度奖励”还是“买更多低保真度奖励”的选择,化成一个一维优化问题。
这背后的思想很真实:
随机噪声不可怕,只要它不系统性地骗你。
一个标注者偶尔判断错,可能可以靠更多样本平均掉。
如果整个奖励机制都有偏见,更多样本只会让你更稳定地朝错误方向。
问题八:为什么系统性奖励偏差比噪声更危险?
论文最后特别区分了 zero-mean noise 和 systematic bias。它指出,更多轨迹可以降低方差,但不能消除系统性 reward bias。也就是说,如果奖励模型本身带着方向性的偏差,那么平均再多次,也不会让偏差消失。
这是整篇文章最值得上升到 AI 世界观的一点:
噪声是“不清楚”;偏差是“方向错了”。不清楚可以通过更多观察改善。
方向错了,则会被优化过程不断放大。
这也是为什么 reward model 在“想象训练”中如此关键。一个 AI 在内部世界里训练得越久,越可能把奖励模型中的偏差放大成策略偏差。它不是简单地犯错,而是在自己的想象中反复强化一个错误目标。
更有层次的总括
这篇论文真正提出的,不是“AI 可以不要数据”,而是一个更精确、更深刻的判断:数据的角色正在改变。
在旧范式中,数据是智能的主要来源。AI 看见大量过去,从中拟合规律。
在 training in imagination 的范式中,数据更像是锚点。
AI 用少量真实经验校准内部世界,然后在这个内部世界中大规模推演、试错和优化。
所以问题不再只是:AI 见过多少?而是:AI 能否用见过的东西,构建一个足够稳定、足够准确、足够可评价的内在世界?
智能,不只是从外部世界中提取模式,而是构建一个可推演的内在世界,并在其中预演可能未来的能力。
学习,不只是积累经验,而是不断校准这个内在世界:让它更准确地预测变化,更稳定地承载长程推演,更可靠地判断哪些未来值得追求。
数据,也不再只是被动堆积的训练材料,而是校准想象的真实锚点:一部分数据修正世界会如何变化,另一部分数据修正什么结果值得追求。
《On Training in Imagination》真正揭示的,是 AI 范式的一次重心迁移:
从“外部数据的规模”转向“内部模型的质量”;
从“被动感知世界”转向“主动生成未来”;
从“复刻已经发生的过去”转向“在想象中搜索尚未发生的可能性”。
真正强大的 AI,不是拥有最多记忆的系统,而是拥有最可靠想象力的系统。而可靠的想象力,来自三个条件:世界模型足够准确,内部表征足够稳定,奖励判断足够可信。
更凝练、更有传播感的一版:
智能的核心不是记住世界,而是内部重建世界;不是等待经验发生,而是在想象中预演经验;不是复刻过去,而是在可控的内部宇宙中搜索未来。
AI 的关键能力正在从“数据规模”转向“想象质量”。而想象质量,取决于它是否知道世界会怎样变化、哪些未来值得追求,以及这些内部推演能否在时间中保持稳定。
热门跟贴