打开网易新闻 查看精彩图片

Haojie Huang (黄浩杰) 是美国东北大学计算机科学五年级博士生,师从 Robert Platt 和 Robin Walters,研究方向为机器人操作学习与几何深度学习。他早期主要研究利用对称性提升模仿学习的样本效率,并提出 Edge Grasp Net、Fourier Transporter、Imagination Policy 等原创工作;近期聚焦 pose-free action representation 与新的操作学习范式。其成果发表于 IJRR、RSS、CoRL、ICRA、RA-L、ICLR、NeurIPS、ICML 等顶级会议和期刊,并获 CoRL 2024 Outstanding Paper Finalist、RA-L 2026 Best Paper Honorable Mention 等荣誉。曾在 Boston Dynamics AI Institute 和 Amazon Robotics 实习。

If I Had One Bet on Robot Learning, I’d Bet on Cross-Entropy.大语言模型的成功揭示了一个适用于一维序列数据的清晰Scaling Law:通过自回归训练,并采用交叉熵(cross-entropy)目标函数预测下一个 token 的概率分布,模型能够建模非常复杂的语义概率分布,并随着数据规模和模型规模的增长持续提升性能。机器人的动作轨迹同样服从一个非常复杂、且往往具有多模态特性的概率分布。

然而,将这种基于cross-entropy的概率预测范式直接扩展到机器人学习并不容易:我们应该如何定义机器人的动作分类空间,并预测一个时间窗口(temporal horizon)内的动作概率分布?核心困难在于,机器人动作本质上是高维的—— 在时间窗口中的每一个时刻,动作通常至少包含 6 或 7 个自由度(包括夹爪)。如果将每一个动作维度仅仅粗略地离散化为 10 个 bin,并将一个完整的 6 维动作视为一个 joint action token,那么其组合空间就已经达到 10⁶,也就是100 万种可能的动作;且如此粗糙的离散化本身又很难满足高精度操作的需求。如果进一步提高每个维度的离散精度,或者同时预测 temporal horizon 中多个时刻的动作,整个动作空间还会迅速膨胀。

如此巨大的 action space,再一次揭示了机器人操作学习中的一个bitter lesson:the curse of dimensionality(维度灾难)

打开网易新闻 查看精彩图片

Figure1. Comparison of different policy-learning frameworks.

Action Map Policy(AMP)定义了一种新的动作表达(action representation)。它首先将三维运动(orientation + translation)可逆地表示为3D 关键点轨迹,再将这些 3D 关键点投影到多个相机平面上。通过这种方式,原本的三维运动轨迹可以被表示为二维图像空间中的像素轨迹

打开网易新闻 查看精彩图片

  • Project Website: https://haojhuang.github.io/amp_page/
  • Paper Link: https://arxiv.org/abs/2607.10706

关键在于,AMP 并不是通过扩散模型进行降噪,也不是通过回归模型直接预测这些 2D 像素点的位置,而是将动作预测重新定义为一个像素级分类问题:模型预测每一个像素在不同时刻成为目标关键点位置的概率,从而得到每个时间步上的像素概率分布。通过这种巧妙的动作表达,AMP首次将高精度的 3D 闭环机器人操作转化为图像空间中的像素分类问题,同时仍然能够实现毫米级(小于1 mm)的三维动作精度。简单来说,AMP 做的事情,是把一个原本需要在高维连续空间中预测的 3D 动作问题,重新变成了一个我们已经非常熟悉的问题:在图像上做 classification。这个新的动作表达和操作学习范式带来了一些质的变化

  1. 输入空间和输出空间实现了高度统一。类似于 LLM 将输入与输出统一在 token space 中,AMP 将视觉观测和机器人动作统一到image space:输入是 image,输出则是定义在 image 上的 action distribution。动作不再只是一个抽象的低维向量,而成为具有明确空间语义的像素概率分布。
  2. 交叉熵(cross-entropy)目标函数天然具备建模复杂、多模态概率分布的能力。与直接回归一个确定的动作不同,分类模型可以自然地描述 “多个动作都可能是合理选择” 的情况,这对于具有高度多模态性的机器人操作尤其重要。
  3. 模型一次前向推理即可输出完整的动作概率分布。相比需要多步迭代去噪的 diffusion-based policy,AMP 可以通过一次模型推理直接得到不同时刻的动作分布,显著提高机器人推理速度;与此同时,完整的概率分布也使得从中进行action sampling变得非常自然,可以根据同一个观测采样出多个不同但合理的动作候选。

Experiment 1:模型的感知能力与多峰分布表达能力

我们先看一个非常简单、但很有意思的实验,看看这个 formulation 到底带来了什么不同?桌面上放置了四个外观完全相同的木块,实验者用激光笔点亮其中一个木块,模型需要识别这个细粒度的视觉信号,并抓取被激光指中的目标。每个木块收集 10 条 demonstration,一共只有 40 条 demo。这个实验主要测试两个能力:模型对fine-grained visual signal的感知能力,以及对multi-modal action distribution的表达能力。为了尽可能排除空间泛化等其他因素,数据采集时木块的位置变化(spatial variation)非常小,训练和测试时的场景分布基本一致。

打开网易新闻 查看精彩图片

视频链接:https://mp.weixin.qq.com/s/h05elhMfbmVewWxKeCFEFA

Diffusion Policy

打开网易新闻 查看精彩图片

视频链接:https://mp.weixin.qq.com/s/h05elhMfbmVewWxKeCFEFA

Action Map policy

可以看到,Diffusion Policy(DiffPo)在这个看似简单的小测试中出现了明显的类似mode collapse的问题:模型很难根据激光笔的位置,稳定地抓取被指中的木块。因为这个实验本身几乎不包含 spatial variation,因此问题并不来自模型需要泛化到新的物体位置,而更直接地暴露了模型能否捕捉这种细粒度条件信号,并正确表达对应的多峰动作分布。

换句话说,这并不是简单增加更多的数据能够解决的问题。相比之下,AMP 在这个实验中达到了 100% 的成功率,初步展示了它对细粒度视觉信号的感知能力,以及对多峰动作分布的表达能力。下面具体看一下 AMP 是怎么实现的这个新的 action representation。

Method:AMP 架构和主要设计

打开网易新闻 查看精彩图片

Figure2. Architecture of Action Map Policy. The left branches take one in-hand image and two side-view images as input. The center features a multi-view transformer that enables communication between the in-hand features and the side-view context features. The right branch consists of two decoders that generate heatmaps of keypoints across the temporal horizon.

  • AMP 的整体架构采用一套 X-Net 形状的 Encoder–Decoder 设计。X-Net 的左侧分支是 Encoder,将输入图像压缩成latent feature maps,再展开成 tokens;中间部分是Multi-view Transformer,包含in-image attention layerscross-image attention layers,用于在单张图像内部建模特征,同时学习和交换不同相机视角之间的信息;右侧分支是 Decoder,将特征重新解码成与输入图像具有相同空间分辨率的 heatmaps,用于表达不同 keypoint 在不同时刻出现在各个像素位置上的概率分布。
  • 模型训练过程不需要任何显式的 3D 轨迹监督,而是端到端地在图像空间中完成。在推理阶段,模型首先通过 argmax 选取 heatmap 中概率最高的像素位置,从而得到二维图像平面上的 keypoint 运动轨迹;随后结合相机的内参和外参,通过triangulation(三角测量)恢复对应的三维空间轨迹。换一个角度理解,AMP 并不是直接在 3D 空间里 “学 3D”,而是通过学习多个 2D 视角中的动作分布,间接获得对 3D 动作结构的理解。

Experiment 2:3D Closed-Loop 模仿学习的真机实验

AMP 在三个早餐场景任务中进行了验证:制作咖啡、烤面包和蒸鸡蛋。这些任务同时考察了模型的高精度操作能力长时序多步骤任务执行能力。例如,将咖啡胶囊准确放入咖啡机、将面包片插入狭窄的烤槽、按下按钮或拉杆,以及将蒸蛋器的盖子准确盖合,都需要较高的空间精度和稳定的闭环控制。

  • Making Coffee(制作咖啡):机器人需要依次打开咖啡机盖、放入咖啡胶囊、放置杯子,并最终按下启动按钮。
  • Toast Bread(烤面包):机器人需要将两片面包分别放入烤面包机的插槽中,并按下拉杆启动烘烤。
  • Steam Egg(蒸鸡蛋):机器人需要依次将三个鸡蛋放入蒸蛋器对应的槽位中,最后将盖子准确盖到蒸蛋器上。

这三个任务都包含多个连续的操作阶段,因此不仅测试单步动作精度,也测试模型在较长时间范围内保持任务状态并持续完成后续操作的能力。

打开网易新闻 查看精彩图片

视频链接:https://mp.weixin.qq.com/s/h05elhMfbmVewWxKeCFEFA

AMP-Breakfast Combo-Make Coffee

打开网易新闻 查看精彩图片

视频链接:https://mp.weixin.qq.com/s/h05elhMfbmVewWxKeCFEFA

AMP-Breakfast Combo-Toast Bread

打开网易新闻 查看精彩图片

视频链接:https://mp.weixin.qq.com/s/h05elhMfbmVewWxKeCFEFA

AMP-Breakfast Combo-Steam Egg

打开网易新闻 查看精彩图片

Table 1: Real-world performance Comparison.

实验结果表明:1)AMP 在三个任务中显著优于 Diffusion Policy(DiffPo)和 ACT,成功率提升约 50%–70%。当测试场景存在较大的空间变化(spatial variation)或对操作精度要求较高时,两个 baseline 的性能都会明显下降,而 AMP 仍然保持了较强的空间泛化能力和稳定的操作精度。 2)AMP 的推理速度也明显更快。与需要迭代生成动作的方法不同,AMP 只需要一次 forward pass 就可以输出动作,单次推理约为13.80 ms;相比之下,使用 16 步 DDIM 去噪的 DiffPo 需要约93.53 ms。这意味着 AMP 在保持较强性能的同时,也更适合对实时性要求较高的闭环机器人控制。

Additional Experiments

AMP 文章中还系统分析了该方法能够达到的操作精度。实验表明,3D 动作的重建精度与输入图像的分辨率近似呈线性正相关;在 224×224 的图像分辨率下,AMP 可以达到约1 mm 的位置重建误差和 1.3° 的旋转误差。除此之外,文章还包含了大量模拟仿真实验以及详细的ablation study,用于进一步分析动作表达、模型架构和训练设计中不同组件的作用。更多实验结果和分析可以参阅原文。

相比于World Action Model(WAM),AMP 将动作推理聚焦于更加紧凑的像素级关键点表达,而不是像 WAM 那样通过生成图像或视频来表征未来状态,再通过inverse dynamics layers从视觉预测中恢复机器人动作。因此,AMP 避免了高维图像生成所带来的额外计算开销,在动作表达、计算资源需求和推理速度上都更加轻量和高效。