打开网易新闻 查看精彩图片

性能提升来自预训练,不靠外挂增强策略,不靠扩充数据“刷分”。

本文为IPO早知道原创

作者|Stone Jin

据IPO早知道消息,星动纪元世界动作模型(WAM)VPP2(Video Prediction Policy )日前以平均成功率(Avg SR)32.26%、平均得分(Avg Score)39.26分的成绩登顶 “具身智能界的珠穆朗玛峰”RoboDojo榜首,并拿下泛化能力(Generalization)、精细操作(Precision)、记忆能力(Memory)三项成绩第一,一举超越GPT-6 Astra、Physical Intelligence π0.5、英伟达GR00T-N1.7等模型。

打开网易新闻 查看精彩图片

更关键的是,VPP2未使用任何额外数据或Agent RSI,仅仅使用标准数据集就斩获了榜首,更加体现了VPP2模型本身的优越性——性能提升来自预训练,不靠外挂增强策略,不靠扩充数据“刷分”。

这里不妨补充一点,RoboDojo是由香港大学MMLab牵头、全球近20所顶尖学术机构共建的具身智能统一评测基准,以“仿真+真机”全科大考和极致难度著称,被业界称为“具身智能界的珠穆朗玛峰”。它的价值不在于再造一个Benchmark,而在于为整个行业立下一把统一、可复现的标尺——让“看起来很厉害”变成“分数上见真章”,推动具身智能从Demo驱动走向可量化、可比较的工程化竞争。

打开网易新闻 查看精彩图片

至此,星动纪元具身模型一年内连夺全球四榜冠军——今年2月,清华陈建宇团队联合斯坦福 Chelsea Finn团队研发的 Ctrl-World 世界模型具身任务能力斩获全球第一;4月,星动纪元凭借自研VLA具身模型,一举斩获该赛事剥橘子、开锁、翻袜子三项任务全球第一,不仅打破PI此前保持的赛事纪录,更以大幅优势刷新世界纪录,成为该赛事唯一上榜的中国具身企业;5月,星动纪元Era0 模型在 Table30 真机评测系列任务中,成功率(Success Rate)与过程分(Score)两项均位居参测模型首位,分别为 64.33% 与 76.34 分,综合排名位于榜单第一名,同时在17项桌面灵巧操作任务中斩获NO.1。

VPP2在视频预测和动作生成两方面

都具备强零样本泛化能力

不可否认的是,机器人学习领域最主流的范式之一是“世界动作模型”(World Action Models, WAM):把视频生成模型“预测未来画面”的能力,迁移为机器人“该怎么动”的动作能力。直觉上很美好——一个能在脑海中推演未来的机器人,理应知道下一步该做什么。

但实际情况是,几乎所有过往WAM的工作里根本没有任何开放环境的视频预测,都只能放出在特定领域过拟合的视频预测。一旦放到开放式环境中,WAM就经常预测出错误的运动,进而输出错误的动作。

让WAM泛化性丢失的主要有两点原因:

其一、视频底座不是为 "操作" 而生:基础视频模型主要面向创意内容生成与美学质量优化,充满想象力,因此往往难以准确遵循细致的操作指令。

其二、后训练硬塞动作,反而让模型 "变笨" :向预训练视频底座中引入动作专用组件或联合训练目标,会显著削弱其原有泛化能力——模型记住了几个特定动作,却丧失了对千变万化场景的适应力。VPP2的核心目标,就是保留视频模型的泛化性的前提下,加入action动作建模。

值得一提的是,VPP2的最大特点是在视频预测和动作生成两方面都具备强零样本泛化能力。视频预测的质量,决定了动作的上限。因此正确的顺序不是"视频、动作一锅炖",而是把两者解耦、排序。

打开网易新闻 查看精彩图片

已在六条战线上系统验证了方法

具体而言,VPP2在视频预测、指令遵循、真实机器人、LIBERO泛化、RoboDojo仿真、高层规划六条战线上系统验证了方法。

1、视频预测:超越英伟达Cosmos3-Super-64B

图中展示了预训练VPP2对人手和机器人操作的视频预测(30步)。在大规模、多样化操作数据上训练后,模型可泛化到人手与多种机器人载体,并将1–3个摄像机视角编排为T形合成图。

打开网易新闻 查看精彩图片

每一行给出一个任务的多帧预测序列,涵盖“抓取黑色气嘴”“把勺子放在 iPad上”“打开烤箱”“掀开白色瓶盖”“合上笔记本”“用纸巾擦屏幕”“转移拖鞋”“用剪刀剪纸”“擦白板”“装箱”“盖瓶盖”“把绿块放到控制器上”“翻转包装袋”“把方块扫入簸箕”等20组任务。预测序列在物体运动、夹爪轨迹上保持连贯。

打开网易新闻 查看精彩图片

横向堆叠条为“基线获胜 / 平局 / VPP2获胜”的比例,左为人手、右为机器人。对机器人操作,VPP2对Wan-14B 胜率高达96%,对Cosmos3-64B也取得68%胜率;即使在人手数据上,对四个基线也全面占优。

2、指令遵循:复杂空间任务上更可靠

图中用红/绿圈标出目标物体,直观对比VPP2、Wan-14B、Cosmos3-64B的指令遵循能力。可以看到,在需要空间理解的复杂任务上,VPP2更准确地把动作落到指定物体上。

打开网易新闻 查看精彩图片

3、真实世界ALOHA:零样本9/10类任务夺冠

在真实ALOHA平台随机选取的10个任务类别上做零样本成功率测试;为公平比较,π0.5与FastWAM也在VPP2训练数据所包含的全部ALOHA数据上微调。

打开网易新闻 查看精彩图片

堆叠/抓取/放置/折叠/倾倒/拉取/插入/打开/闭合/擦拭 10 类任务上,VPP2(绿)在 9 类上高于 π0.5(紫)与 FastWAM-14B(灰)。平均成功率 58.5%,对比 π0.5 的 40.0%、FastWAM的20.5%;单任务增益最大达47.8%对6.8%。

4、LIBERO-Pro:分布内高分真正转化为泛化

VPP2在LIBERO-Pro上总体成功率达45.0%(VLA基线最高仅11.0%),在 LIBERO-OOD上达63.9%,同时超过专门为弥补该泛化差距设计的Temporal Ratio。

5、RoboDojo:仿真基准双指标第一

RoboDojo是一个统一的双臂仿真基准,含42个双臂任务、覆盖五个能力维度。VPP2取得39.26 的平均得分与32.26%的成功率,超过包括GPT-6-Astra在内的全部对比方法。

6、高层规划增益:与大模型完美配合

团队在五个选定任务组上对比“是否采用基于VLM的子任务规划”(每任务50次试验)。接入规划后平均成功率从27.6%跃升至57.6%。

打开网易新闻 查看精彩图片

五个任务组中,"VPP2+子任务规划"(深蓝)全面高于纯 VPP2(灰)。增益最大的是语言条件方块堆叠(10% → 52%)与井字棋(0% → 38%),平均 27.6% → 57.6%。这证明VLM规划对长程、多步任务尤为关键。

补上物理智能关键一环

回答“怎么做、做得到”

更重要的是,VPP2的价值不止于刷新WAM的SOTA,更在于提供了一套忠实跟随语言快速响应的快系统,将语言指令忠实地映射到物理世界中。

GPT代表“认知智能”,擅长语言理解、推理与规划,回答“做什么、为什么做”;但它没有物理世界的“身体”,不理解重力、碰撞、摩擦,也无法实时感知与闭环——会想,却不一定会做。VPP2补上的正是物理智能这一环:通过视频预测理解物理动力学,把高层指令转化为时序连贯、物理可行的动作轨迹,回答“怎么做、做得到”。

GPT管“想”、VPP2管“做”:物理AI=通用认知×通用物理执行。未来,二者结合可形成“认知—规划—预测—执行—反馈”的完整闭环:GPT当作system2,把模糊目标拆解为子任务;VPP2当作system1,产生条件反射一般的快速响应,把子任务稳稳落地,真实数据再回流反哺两端。相关数据直接验证了这一点:接入VLM分层规划器后,某些任务平均成功率从27.6%跃升至57.6%。未来物理AI的完整能力范式=通用认知×通用物理执行,缺一不可。

当然,技术的价值,最终要在真实场景兑现生产力。星动纪元是最早进入物流行业的具身机器人企业,已率先完成行业首个PMF验证:与中国邮政、顺丰合作,在全国 5 个省市、10 余个物流中心常态化运营,成果获外交部发言人、央视公开点赞——把WAM的技术优势变成了看得见、用得上的新质生产力。

从斩获全球权威四榜冠军,到物流产线规模化上岗,星动纪元正沿着“预测得更好、行动得更好”的方向,向着“打造物理世界通用智能体,让机器人成为人类可靠伙伴”的愿景迈进。