打开网易新闻 查看精彩图片

作者:彭堃方

编辑:吕鑫燚

出品:具身研习社

通用大模型每向前一步,具身智能行业就要重算一遍自己的技术壁垒。GPT-6 Astra 的到来,让这个原本被放在远处的问题,变成了眼下的压力。

这段期间,Astra所代表的通用大模型向机器人领域延伸,让具身智能行业反复回答同一个问题:当更强的认知、推理和多模态能力不断涌入,今天围绕机器人建立的壁垒,还能保留多少?创业公司花费数年打磨的能力,会不会成为大模型下一次升级顺手覆盖的功能?对于身处其中的企业,这道题最终要在机器人能否把事情做成上作答。

当所有人还停留在泛泛而谈的回复阶段时,星动纪元的 VPP2,用实际行动给出了一个值得展开的答案。10月9日,星动纪元登顶 RoboDojo 仿真榜,并在泛化、精度、记忆三个能力维度取得第一,排名超过 GPT-6 Astra、Physical Intelligence 的π0.5 和英伟达 GR00T-N1.7 等模型。星动纪元同时宣布开源 VPP2,跳出行业“榜单不可复现” 的痛点,将技术方案交给更多开发者检验,

RoboDojo 的仿真评测覆盖 42 项双臂任务,考察泛化、记忆、精度、长程执行和开放词汇指令跟随。机器人既要听懂要求,也要处理位置变化、动作衔接和操作细节。语言世界里的能力到了这里,需要换算成任务完成率。

VPP2 给出的切口很明确,让模型更准确地预测一次操作如何发生,再把这种预测能力转化为动作。它把视频底座、训练方法和动作学习重新组织起来,尝试补上通用认知与物理执行之间的距离。

这场比较的意义,在于中国具身智能公司已经拿出自己的模型,与全球头部团队在同一套机器人任务中交锋。同时,星动纪元给具身智能提供了一条更主动的路径,围绕物理世界建立自己的能力,才不会被不断变强的通用大模型冲垮

因此,比“谁在这一次榜单上领先”更值得追问的是,星动纪元究竟做对了什么,以及这套能力能走多远。拆解 VPP2 我们会发现,它既在回应通用大模型带来的压力,也在尝试改变双方的关系,当物理执行有了可靠的底座,GPT 的下一次进步,也可能成为机器人继续向上的台阶。

打开网易新闻 查看精彩图片

通用大模型带来的压力,最终需要在具体任务里衡量。

星动纪元此次拿下RoboDojo仿真榜平均成功率、平均得分双指标第一,给行业提供了一个直接的参照,认知与推理能力越过机器人入口之后,仍有大量物理操作问题等待解决,具身模型在这里有自己的竞争力。

RoboDojo由香港大学MMLab等机构参与构建,覆盖多类操作能力,通过统一任务和评测规则,降低不同模型各自展示、难以横向比较的问题。成功率考察任务是否完成,平均得分记录部分完成进度。前者看能否交出结果,后者看执行究竟走到了哪一步。对需要同时处理指令、空间关系和动作衔接的机器人而言,这比一段经过挑选的演示更有说服力。

此次登顶“具身珠峰”的VPP2是一种世界动作模型。它接收当前画面与任务指令,预测接下来的视觉变化,再利用这些未来信息生成动作。比如,把左边的杯子放进指定盒子,模型需要分清目标杯子与盒子,判断由哪只手操作,以及物体怎样移动。围绕“预测得更准,才有机会做得更好”这一核心主张,他们实现了泛化能力、精细操作、记忆能力三个维度的第一。

打开网易新闻 查看精彩图片

这三个维度的第一,各有产业含义。换一种物品、换一个摆放位置后,能力还能否复用,考验泛化;能否越过简单抓放、处理更细致的操作,考验精度;任务向前推进时,能否利用已经发生的信息,考验记忆。这些能力共同影响机器人进入现场后,需要多少额外训练和人工照看。随着物流等场景开始跨网点复制,现场条件的变化会被放大,模型对变化的适应能力也就有了更直接的商业价值。

按公司披露,此次评测未使用额外数据或Agent RSI,VPP2仅依赖过往训练中,从多源视频和机器人数据建立起来的基础能力。换句话说,裸考背后的学习方法更值得审视,星动纪元并不是靠“过拟合”取得成绩,而是根植于优秀的数据处理管线及科学的训练范式

为验证模型是否只记住了熟悉的操作,还需要把它放到变化后的任务里。在论文展示的LIBERO-Pro评测,正是通过改变物体位置与任务要求检验这种能力:VPP2取得45.0%的整体成功率,表列最强基线为11.0%。当位置和要求发生变化,原先那套动作仍能不能用,才是最大看点。这组实验为VPP2的泛化能力提供了充足证据。

在单纯的能力对比之外,参数规模也是一场值得关注的比较。在论文的操作视频预测实验中,VPP2的14B视频底座在人手、机器人两组测试中的指令跟随成功率分别为80%和90%,Cosmos3-64B则分别为70%和78%,两组平均值相差11个百分点。这是反常识的结论,更大的参数量没有直接换来更好的操作预测;围绕任务组织训练,仍能挖掘出明确的性能空间。对于需要考虑推理资源与部署成本的机器人行业,这种方法上的提升应该值得重视。

最后,预测能力还要接受动作的检验。在ALOHA真机平台的10类任务中,VPP2平均成功率达到58.5%,π0.5为40.0%。VPP2在其中9类任务领先。视频里的未来,开始转化为真机上的操作结果。星动纪元回应通用模型压力的底气,也因此有了预测与执行两端的支撑。

打开网易新闻 查看精彩图片

在WRC 2026的分享中,陈建宇把具身大模型的演进归纳为三个阶段:最初用语言模型增强上层规划,下层仍由传统感知、控制模块完成;随后,在多模态底座上加入动作能力,形成VLA;再往前,世界动作模型把未来世界状态的预测也纳入进来。沿着这条路线,模型正在更深入地学习物理交互。

打开网易新闻 查看精彩图片

星动纪元此次选择Wan2.1-I2V-14B作为VPP2的视频基座,也延续了陈建宇对这一路线的判断:视频保留了物体形态、相对位置和运动过程,能够为机器人操作提供丰富的物理细节。借助已有视频模型,再围绕操作做进一步训练,具身公司可以利用通用底座的积累,发展自己的能力。

但视频模型距离可靠操作,仍隔着一段专门的训练。面向内容创作,画面连贯、观感逼真往往是重要目标;到了机器人这里,抓错杯子、改变物体位置,即使画面看起来合理,也会让任务失败。在星动纪元看来,“一锅炖式”地引入动作模块和动作训练目标,可能损害视频模型原有的泛化能力。底座选对之后,接下来怎样学、先学什么,开始决定模型最终能够留下多少能力。

打开网易新闻 查看精彩图片

VPP2先把学习单位放在完整的操作事件上,“事件级继续预训练”。只给出“把碗放进盒子”的指令,再截取一小段未来画面,这段画面可能是伸手、抓取,也可能是搬运。相同的指令对应不同阶段,模型容易学到模糊甚至偶然的联系。VPP2将数据切分为语义完整的操作子任务,并明确执行末端、目标物体、动作过程与相机视角,让指令对应从起点到任务完成的视觉变化。

这让“数据质量”有了更具体的含义。哪只手在动、拿的是哪个杯子、准备放进哪个盒子,都需要在数据里交代清楚。行业在不断积累视频与操作记录时,分段和标注方式决定了这些积累能为训练提供多明确的信号。对于跨场景应用,模型要能够识别任务中可以复用的关系,减少对某个位置、某段轨迹的依赖,规模化采集的数据才更有机会转化为规模化应用的能力。

接着要解决速度——“块级后训练”。完整事件有长有短,动作控制需要相对稳定的时间尺度,VPP2因此进一步训练固定时长的未来预测,再通过蒸馏压缩生成过程。据技术披露的配置显示,模型预测未来8秒的视觉信息,为约2秒的动作片段提供条件;视频预测部分约耗时0.12秒,动作生成约0.1秒。单个动作片段约0.22秒的推理延迟,达到了处理预测质量与执行效率的平衡。

这样的取舍与具身智能落地紧密相关。机器人需要及时回应环境变化,现场也有连续作业的节奏要求。预测提供的信息再丰富,也要赶得上执行。将多步生成压缩为单步预测,目的就在于让世界模型更接近可以参与实际操作的工具,为后续部署争取效率空间。

最后才是动作能力的接入——“动作DiT预训练”。VPP2引入动作专家,通过MoT结构利用视频模型内部的预测表征学习动作。在动作训练初期,视频主干参数被冻结,仅通过LoRA进行适配,尽量减少新模块对已有能力的扰动。同时,团队统一不同数据集的工作空间和末端坐标,减少相似动作在不同本体中表达相互冲突的问题。保住泛化、处理数据差异,是让多源经验得到复用的必要工作。

陈建宇曾批评早期模块化路线中大量人工定义的特征与接口。VPP2的多阶段训练,着力点则是通过学习建立视频表征与动作之间的联系。先把预测学好,再让它变快,随后接入动作,每一步都在处理具体的能力损耗与工程约束。具身模型的进步因此有了更清晰的落点:能够吸收通用底座的能力,还要能将它保留下来,转化为机器人在不同任务中可用的经验。

打开网易新闻 查看精彩图片

拿出独立成绩之后,具身公司与通用大模型的关系,也可以继续向前推一步。

既然物理操作已经有了自己的能力基础,上游认知与推理的进步,就有机会被接入这套体系。“GPT管想、VPP2管做”,这是星动纪元提出的进一步探索:上层理解需求、拆解任务,下层结合当前观察预测过程、生成动作,执行反馈再帮助上层选择下一步。

这条方向已有VLM子任务规划实验作为支撑。在物体分类、按语言要求堆积木、交换积木、麻将和井字棋五组任务中,加入规划后,平均成功率由27.6%提升至57.6%,提高30个百分点。其中,按语言要求堆积木由10%升至52%,井字棋由0升至38%。这组结果来自五组任务,检验的是VPP2与VLM规划的配合,也为未来接入GPT等更强模型提供了探索依据。

未来更复杂的任务也可能有了解题思路。上层擅长的推理、语义理解,可以帮助机器人选对下一步;VPP2积累的预测与动作能力,则负责将这一步落实。当二者能够通过观察与执行反馈配合,通用模型继续升级,也就可能成为具身系统继续进步的资源。具身公司的主动权,要靠自己的物理执行能力去争取。

而承接这种技术进步的场景,已经开始发生变化。以物流为代表,具身智能落地正进入跨网点复制、常态化运行的规模化阶段。据公司披露,星动纪元已与中国邮政、顺丰合作,在全国5个省市、10余个物流中心常态化运营。对公司而言,机器人面对的已经是多个现场持续产生的需求,技术也需要接受比单点演示更长期的检验。

打开网易新闻 查看精彩图片

规模化会把许多曾经可以逐一处理的问题集中暴露出来。不同网点的物品、摆放和工作环境存在差异,任务会调整,设备也可能变化。每新增一个场景,都依赖专门采集、重新训练和现场调试,复制成本便很难降下来。行业需要的通用能力,要能够穿过这些差异,让上一处现场积累的经验帮助下一处现场更快投入使用。

VPP2对规模化落地的帮助,也应沿着这些具体成本理解。更好的泛化,为减少新任务的重复适配提供可能;更细致的预测与动作能力,有助于应对物品位置和操作条件的变化;面向执行速度的训练与蒸馏,则让世界模型朝着作业节奏要求继续靠近。这些能力最终都将在新任务适配成本、现场干预次数和持续作业表现上兑现。

现有物流运营为星动纪元提供了继续验证这些能力的场所。陈建宇强调“大脑、本体、场景协同进化”,放在规模化阶段看,意义更为清晰:模型需要本体完成交互,场景不断暴露新的问题,真实反馈再推动模型、硬件和系统共同改进。星动纪元同时自研大脑、本体与灵巧手的“深全栈”战略,让这条反馈链能够在同一体系内衔接。VPP2是其模型能力的进一步推进,能在多大程度上降低部署与适配成本,还需要在更多现场中持续积累答案。

随着VPP2开源,这套方法也有机会被更多开发者检验和改进。围绕统一任务复现结果,再进入不同本体与场景测试,可以让一次榜单领先形成更广泛的技术积累。对于正在走向规模化的具身行业,有用的创新既要把能力上限推高,也要让更多团队能够利用这些进步,减少重复摸索。星动纪元此次交出的模型与训练方法,正提供了这样一个继续向前的起点。

结尾

通用大模型还会继续向前,具身智能公司的回答也需要不断更新。VPP2 提供的启发,是把物理世界里的问题拆得更深:怎样预测一次操作,怎样保留泛化,怎样让动作赶上任务,以及怎样利用真实反馈继续学习。这些工作做得越扎实,具身公司就越有机会掌握自己的技术节奏。

沿着这条路,GPT 既可以是检验能力的对手,也可以成为继续向上的台阶。对星动纪元而言,这次榜单成绩打开了讨论的入口;后面的技术分量,要由更多任务、更复杂场景中的稳定表现来增加。通用认知的进步能被机器人吸收多少,最终仍要看它在物理世界里能做成多少事