斯坦福大学与北京大学联合发表的一篇新论文指出,在学到的世界模型内部训练机器人策略,会继承该模型的每一个错误。随着任务变长、图像变复杂,这些错误会不断累积,最终影响机器人的实际表现。
问题根源:错误在模型内部累积
打开网易新闻 查看精彩图片
研究团队认为,传统方法将策略训练置于世界模型内部,相当于让机器人“带着老师的错误答卷答题”。任务复杂度上升时,模型预测偏差会被逐步放大,导致策略偏离真实环境。
QWM方案:世界模型完全退出训练
论文提出的QWM(基于世界模型的Q学习)方法,核心改动在于:世界模型完全不参与训练过程。它只作为辅助工具,在机器人做选择时提供参考,而策略本身的优化路径不再经过模型内部。
这一设计切断了错误传递链条,让机器人策略直接面向真实交互数据学习,而非间接依赖模型预测。
论文已发布于arxiv(编号2608.17163),题为“Q-Learning With World Models”。
热门跟贴