在视觉语言动作模型领域,一直有个挺别扭的技术问题:机器人用眼睛看世界,却要用身体去干活,这两套坐标系压根儿不统一。标准VLA模型的流程是这样的——摄像头拍下RGB画面,模型要从平面像素里推算出机器人关节该执行的三维动作指令。在实验室那种摄像头一旦固定就永远不动的环境里,这套机制问题不大,模型把“画面里这个位置”等同于“手臂向右转十五度”背下来就行,看起来还挺聪明。

真正出麻烦是在场景变复杂的时候。行业在往大规模、多样化数据集的方向走,训练材料来自不同实验室、不同机位、不同机器人本体,有的摄像头挂在天花板上,有的绑在机械臂手腕上,还有的摆在侧面桌台上。一旦摄像头位置变了,之前背下来的映射关系全部作废——同一个物体在画面左边,原来意味着关节往左转,换个机位拍它跑画面右边去了,模型就开始犯糊涂。这种过度依赖特定视角记忆的策略,面对交叉机位的数据时泛化能力相当有限。

机器人中心点图这个思路,本质上做了一件事:把视觉输入强行拉进机器人自己的物理坐标系里。具体怎么做?系统不再直接把原始RGB像素丢进视觉编码器,而是先生成一张点图——画面上每一个像素,存的不是红绿蓝颜色值,而是对应空间点在机器人基座或末端执行器坐标系下的三维坐标。这样一来,不论摄像头装在什么角度、摆多高多远,同一个桌角返回的坐标值总是相对稳定的,模型看到的不再是“画面左上角有个东西”,而是“在机器人正前方零点八米处有个东西”。

设计上还有个很巧妙的点:这些点图保留了密集的H乘W空间网格结构,正好匹配现代视觉编码器的胃口。SigLIP和DINOv2这类视觉Transformer架构习惯处理的正是这种排布规则的数据。换进点图之后,模型几乎不需要改动结构,流程照旧,只是底层信息从颜色分布切换成了机器人的操作空间位置。这意味着空间关系的学习彻底变成视角不敏感的——天花板摄像头和手腕摄像头的画面在纹理上可能完全不一样,但回归到几何坐标后,场景中物体间的相对位置关系变得稳定一致。点图在这里像是做了一次翻译,把视觉世界转换成机器人运动学的语言,让策略网络不再对着不断变化的视角去硬猜动作。

对开发团队来说,这个思路直接改变的可能是训练管线的搭建方式。过去为了让模型扛住不同摄像头角度,工程上往往要靠大量的数据增强手段——随机裁剪、色彩抖动、视角仿真,一套组合拳打下来,确实能在一定程度上拉高泛化能力,但代价是计算资源成倍往上翻,而且增强策略本质上是在帮模型想象一个它从未真正见过的几何空间,效果终究有天花板。机器人中心点图的逻辑是反过来:与其让模型从畸变过的二维画面里去猜三维真相,不如在数据源头就把三维信息给它,省掉那层猜测成本。

数据多样性的问题也跟着变得好处理一些。业界一直在讨论海量真实机器人数据怎么用起来的问题——来自不同实验室的演示数据,记录了不同的硬件平台、不同的摄像头位姿、不同的任务设定,混在一起训练时很容易因为坐标系混乱导致性能不升反降。一旦统一使用机器人中心点图作为中间表示,来自不同来源的物理交互数据就被投射到了同一个空间参考系下,数据集的规模效应才能真正发挥出来,而不是被互不兼容的传感器视角互相拖后腿。

还有一点值得注意:以机器人为中心的空间表示方式,意味着控制策略不再关心“摄像机看到了什么”,而是直接关心“机器人周围有什么”。这种重心的转移可能比它表面看起来更关键——过去机器人操作的研究很多时候是在迁就视觉传感器的特性,调整机位、标定参数、处理遮挡,而一旦把空间理解的责任从摄像头转移到机器人自身的运动学框架里,后续的策略学习就有了一个更干净、更稳定的起点。坐标系统一看起来是个工程层面的事,但在具身智能这条线上,它可能直接决定了模型能不能从几十个场景扩展到几千个场景。