打开网易新闻 查看精彩图片

人类可以轻松想象一个还没做出的动作会带来什么:手一松,杯子会掉;往前一推,抽屉会合上。动作尚未发生,大脑已经预演了可能的结果。对机器人来说,具身世界模型(Embodied World Model)会根据当前观察和未来的动作,预测动作执行后的未来画面。有了它,机器人可以先在「脑子里」预演,再决定实际怎么做。机器人规划、策略评估和数据生成等任务,都需要建立在这类预测能力之上。

为了能够利用更多的无标注数据对世界模型进行大规模训练,隐动作模型(Latent Action Model,LAM)被设计用于从画面变化里提取「隐动作(Latent Action)」充当伪标签,让世界模型在海量人类视频上预训练(Pre-training),学会「大概怎么动」。之后,仅需要少量带真实动作标注的视频进行后训练(Post-training),即可更快更好地适应真实动作控制。

Aether AI(aetherlabs.ai)与加州大学圣地亚哥分校联合开展的一项新研究发现,这条路线训练出的世界模型有一个重要问题:其画面足够流畅,但给定的动作控制信号却常被无视。通过因果分析,团队发现,问题的根源在于隐动作模型受到了视觉混杂因素的污染。世界模型应该学习「动作导致未来」,动作是因,画面是果。但当隐动作夹带背景和场景信息时,模型可能只靠画面连续性预测下一帧,而忽略真正的控制指令。

团队据此提出 CD-LAM(Causally Debiased Latent Action Model,因果去偏隐动作模型)。它不改动世界模型的主体架构、隐动作维度和动作接口,而是从模型上游净化 LAM 输出的隐动作表征,减少其中夹带的场景与背景信息进行去偏。实验显示,经过 CD-LAM 去偏后,模型的动作误差下降 30% 以上,画面质量也得到显著提升。且后训练仅需 3k-6k 步微调,仅需基线模型约 10% 的训练开销。

打开网易新闻 查看精彩图片

▲ 左三图分别比较动作误差、画面质量和机器人动作微调所需的更新步数;右图说明,普通 LAM 会把背景和场景信息混进隐动作,世界模型因此可能混淆真实动作和视觉因素。通过 CD-LAM 去偏减少这类信息后,模型性能大幅提升,且后训练所需微调更新显著降低。

该研究由 Aether AI 与加州大学圣地亚哥分校合作完成。第一作者 Yufan Wei 是 UC San Diego 博士一年级学生,该工作主要完成于其在 Aether AI 实习期间;项目负责人兼通讯作者是 Kun Zhou。

打开网易新闻 查看精彩图片

  • 论文标题:Causally Debiased Latent Action Model for Embodied Action Conditioned World Models
  • 论文链接:https://arxiv.org/abs/2607.09185
  • 代码链接:https://github.com/yufanwei/CD-LAM
  • 项目主页:https://yufanwei.github.io/CD-LAM-project-page/

一、因果分析:从干预测试追溯到 LAM 的视觉混杂

现有 LAM 大多以视频重建为训练目标,不会区分画面变化究竟由机器人动作、镜头移动还是光照变化造成。为了把下一帧重建得更像,模型可能把场景上下文、背景连续性和物体外观等信息一并编码进 “隐动作”。而在预训练阶段,世界模型对动作的理解主要来自 LAM 的输出,因此也可能继承这条捷径:依靠场景线索猜测下一帧,而不是真正学习控制指令会带来什么变化。

干预是检验因果关系最直接的方式:改变「因」,看「果」变不变。也就是改变动作,看生成结果是否随之变化。因此团队设计了两类干预测试。

  • 静止指令测试:固定初始画面,并把后续机器人动作全部设为零。理想情况下,机械臂应当保持静止,但基线模型生成的机械臂仍然明显运动。

打开网易新闻 查看精彩图片

视频链接:https://mp.weixin.qq.com/s/oIEkUvKFHGzwsATqkhcXog

  • 目标动作测试:保持初始画面不变,将动作输入替换为另一段视频中的动作序列。理想情况下,生成轨迹应当跟随新的动作变化,但基线模型的结果几乎没有随之改变。

打开网易新闻 查看精彩图片

视频链接:https://mp.weixin.qq.com/s/oIEkUvKFHGzwsATqkhcXog

因换了,果没变。

为了追溯问题来源,团队进一步检查了上游的 LAM 编码器。结果显示,基线 LAM 会对相同画面、镜头移动和视频上下文等与动作无关的信息产生明显响应,说明这些视觉因素也被编码进了隐动作。

打开网易新闻 查看精彩图片

▲ LAM 是否把与动作无关的信息编码进隐动作。三项测试分别检查:输入两张相同画面时,模型是否仍会产生非零隐动作;单纯移动镜头是否会明显改变隐动作;以及隐空间是否更多按场景、而不是按动作组织。“场景捷径泄漏” 衡量同一段视频中的不同动作是否会因为共享场景信息,而被错误地编码得更接近。所有测试只评估 LAM 编码器,不涉及世界模型生成;数值越低越好。

二、画面像,不等于动作对

PSNR 等通用指标衡量的,是生成画面与参考画面在像素层面的相似度。但论文分析显示,PSNR 对动作误差的解释力很弱,难以反映模型是否真的遵循了给定动作。为此,团队借鉴视频生成领域基于点跟踪的运动评测方法,提出了面向具身操作的 FDCE,即前景动作偏差距离:先分离机械臂和被操作物体等前景区域,跟踪前景点的运动轨迹,再计算生成轨迹与参考轨迹之间的距离,以衡量动作误差。画面质量则仍通过 PSNR 等通用指标进行评估。

打开网易新闻 查看精彩图片

▲图丨左:FDCE 的计算示意;右:PSNR 与动作误差的分布,表现出画面质量与动作控制的准确性之间存在极弱关联。

三、CD-LAM:先清理隐动作,再接入真实控制

CD-LAM 不改世界模型的主体架构,而是先从上游清理 LAM 输出的隐动作。整个训练分为三步:去偏 LAM → 训练世界模型 → 接入真实机器人动作

打开网易新闻 查看精彩图片

▲ 图丨 CD-LAM 的三阶段训练流程。 第一阶段通过三项训练目标清理 LAM 输出;第二阶段用清理后的隐动作训练世界模型;第三阶段接入真实机器人控制指令。世界模型主体、隐动作维度和输入格式保持不变。

CD-LAM 通过增加三个训练目标达到了对 LAM 的去偏:

打开网易新闻 查看精彩图片

1. 具身中心重建

打开网易新闻 查看精彩图片

其中 ô_{t+1} 与 o_{t+1} 分别是重建下一帧和真实下一帧,W_t 是逐像素权重:SAM3 标出的前景取大权重、背景取小权重。整项将重建错误惩罚的权重偏向于前景部分。

打开网易新闻 查看精彩图片

2. 动作中心对比学习

打开网易新闻 查看精彩图片

其中 v_i 是隐动作投影归一化后的表征,y_ij 标记两段视频是否属于同一动作原语。这一项奖励同动作原语对的高相似度、惩罚异类对的高相似度,即同类拉近、异类推远。

打开网易新闻 查看精彩图片

3. 隐空间校准

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

其中 z_t^0 是输入两张相同帧得到的「零动作」隐向量,分母是普通动作模长的滑动参照。该项只在零动作的模长超过参照的一小截时施加惩罚,把静止压向原点,不碰正常动作。搭配的 L_KL-fb 给每个维度留免罚额度,只约束超出的容量。

打开网易新闻 查看精彩图片

完成 LAM 去偏后,训练继续分两步推进。先以去偏后的隐动作为条件预训练世界模型,使其学习动作如何改变未来画面。再用带真实控制指令的机器人数据进行后训练,并通过轻量适配层将控制指令接入同一隐动作空间。

四、动作误差下降,后训练步数减少

打开网易新闻 查看精彩图片

▲ 去偏微调后、以隐动作为条件的生成结果。左半区:以从视频变化中提取的隐动作为条件正常生成;右半区:目标动作干预,即固定初始画面、把条件替换为目标隐动作。右半区是目标动作测试正,CD-LAM 在两种规模下的动作误差都显著降低。

在只使用隐动作、尚未接入真实机器人控制指令时,2B 和 14B 模型的动作误差分别下降 42% 和 26%,PSNR 分别提升 3.41 dB 和 2.14 dB。在目标动作测试中,两种规模模型相较基线的动作误差分别下降 21% 和 34%。

打开网易新闻 查看精彩图片

▲ 接入真实机器人动作、完成后训练后的结果。

接入真实机器人动作数据进行后训练后,相较于基线 2B 和 14B 模型的动作误差分别下降 34.8% 和 30.4%,PSNR 提升约 0.75 至 1.0 dB。在静止指令测试中,2B 模型的残余运动幅度减半,14B 模型则减少 76.7%。在目标动作测试中,两种规模模型的误差又分别下降 7% 和 15%,说明生成轨迹更能随输入动作变化。

视频示例|CD-LAM 重建的动作轨迹更接近参考运动。

打开网易新闻 查看精彩图片

视频链接:https://mp.weixin.qq.com/s/oIEkUvKFHGzwsATqkhcXog

视频示例|固定同一初始画面并将控制动作换成目标动作后,DreamDojo 的机械臂逐渐偏离目标轨迹,CD-LAM 的生成轨迹更接近目标运动。

打开网易新闻 查看精彩图片

视频链接:https://mp.weixin.qq.com/s/oIEkUvKFHGzwsATqkhcXog

打开网易新闻 查看精彩图片

▲ 图丨机器人动作适配效率。橙色虚线为 DreamDojo 训练 5 万步的参考水平;CD-LAM 的 PSNR 与 FDCE 均在 3000~4000 步内越过基线模型(相当于 10 倍以上的加速), 6000 步的已明显反超。

CD-LAM 同时提升了机器人动作的适配效率,仅用约 3,000 步更新就达到了 DreamDojo 训练 50,000 步的表现,相当于 10 倍多的加速。在训练至约 6,000 步时,主要指标已全面超过基线。

打开网易新闻 查看精彩图片

▲ 表|去偏视频数据量的影响。 各组使用不同时长的视频对 LAM 进行去偏,随后在同一 2B 模型上采用相同的机器人动作后训练设置。第一阶段均固定训练 1,000 步,以排除训练预算差异,单独考察数据量的影响。

值得注意的是,CD-LAM 的去偏本身也不依赖大规模的视频数据。仅使用 1 小时视频数据进行去偏训练,就能获得使用 1,000 小时数据时约 80% 的收益。说明更干净的隐动作本身可以显著减轻后续迁移负担,使世界模型在适配真实机器人动作时,不必再同时纠正预训练阶段对视觉混杂形成的错误依赖。

更多细节见原论文,模型、评测协议与训练代码均已开源。