作者丨邓哲敏
编辑丨齐铖湧
一个模型同时占据四个能力子榜单的榜首,这在具身智能行业里不多见。RoboColiseum 是由智元机器人发起,联合高校、科研机构、开源社区及机器人企业共同建设的评测平台,它把评测拆成四个维度:指令跟随、空间理解、扰动适应、通用操作。参评者只要在任何一个维度上有结构性短板,就会在对应的子榜上掉下来。而原力灵机的通用具身基础模型 DM0.5 在四个子榜上全部排名第一,且目前是唯一做到这一点的模型。
01
一把可信的尺子
演示效果和真实场景之间存在差距,这在机器人行业早不是什么新鲜事。普通商品尚有卖家秀与买家秀之别,遑论技术尚未成熟的具身智能。因此,模型越是层出不穷,行业就越需要可信赖、细颗粒的公共标尺,帮助挑选出真正的强者。然而现实并不乐观,AI科技评论观察到,具身评测行业长期存在几个痛点,让分数的可信度打了折扣。第一个痛点,是仿真跑分高、真机落地差。仿真环境里的物理参数、视觉渲染和真实世界相差甚远,模型在仿真里得了高分,搬到真机上可能是一塌糊涂。市面上大部分仿真评测基准并没有做系统的真机-仿真对比实验,更没有公开结果。针对 Sim2Real 的一致性问题,RoboColiseum 负责人吴墨告诉AI科技评论(雷峰网公众号),平台通过空间智能技术在仿真环境中高保真重建真实世界,配合激光雷达还原几何信息,再对物体的质量、重心、碰撞几何、动静摩擦力、转动惯量,以及机器人本体的相机内外参、刚度阻尼、末端控制响应等物理参数逐项校准。最终验证结果显示,仿真与真机的模型表现一致性达到89.5%,单个任务的成功率差异均小于10%第二个痛点,是评测基准生命周期短。具身模型迭代太快,一套榜单推出后半年,头部模型就把分数堆满了,无法再区分好坏。“刷榜”现象在大语言模型领域早有端倪,原本被设计为终身学习的 LIBERO,从发布到被刷穿,只坚持了不到三年。RoboColiseum 现有 78 个评测任务、超过 3000 个泛化 case,训练集和评测集完全隔离,评测集对每个任务都做了充分的泛化配置,让轨迹回放类方案彻底失效。第三个痛点,是单点能力强不代表真实场景好用。行业里不少评测基准的设计,本质上是在考一道题——把模型在某个原子能力上压榨到极限,然后把这个数字当成模型能力的代理指标。这种评测逻辑在能力单一、任务简单的早期阶段是够用的。但问题在于,真实场景的任务几乎没有一个是单科题。工厂里的分拣机器人,要同时听懂调度指令、判断传送带上包裹的空间位置、应对随机摆放姿态的干扰,最后把一系列原子动作组合成完整的操作流程。单点能力强的模型进了真实场景,这边表现不错,那边掉链子,整体任务完成率依然惨淡。而 RoboColiseum 围绕四个维度展开评测,分别对应机器人在真实世界中完成任务所需要的能力分层:指令是基础,空间是认知,扰动是鲁棒,操作是落地。从语义到物理,从感知到执行,构成了一套相对完整的考察链条。
02
四榜同时第一,远比单项第一难
在四大子榜单上,原力灵机 DM0.5 以指令跟随 0.8444、空间理解 0.6146、扰动适应 0.7344、通用操作 0.6370 的成绩,全部排名第一。四榜同时第一比单项第一难得多,因为这四个维度考的是不同层次的能力,彼此之间并不互相加持。一个记忆能力超强的模型,未必能在空间理解上占优;擅长执行精细操作的模型,未必在扰动适应上稳得住。四个子榜,相当于对模型做了四次独立考核,任何一个短板都会直接体现在对应的排名上,无法被其他维度的优势掩盖。这也是为什么行业里单项能力突出的模型并不少见,但能同时在多个维度维持领先的模型极少。我们仔细研究了 DM0.5 的架构和数据源,每个维度上都有具体的技术支撑。指令跟随方面,DM0.5 在预训练阶段设计了具身思维链:动作生成之前,模型要先走完一套内部推理流程——目标物体在哪、上一步干了什么、这步该不该结束、不这么干会怎样。11 项推理任务覆盖任务规划和动作生成两个层面,逼模型理解“指令×本体×环境”三方的关系,而不是背答案。这一层预训练能力沉淀下来之后,DM0.5 展现出 zero-shot 级别的泛化——在没有见过的任务配置上,仍然能应对多样的动作组合和语言条件约束。空间理解方面,DM0.5 的预训练数据包含 10 万小时 Egocentric 视频,并基于这些数据支持毫米级精度的 3D 空间标注生成。这意味着模型在预训练阶段就在大规模地学习从第一视角理解三维空间,而不是事后用有限的机器人操作数据“打补丁”。我们注意到,原力灵机与天津大学、清华大学合作的论文《GeoVLA: Empowering 3D Representations in Vision-Language-Action Models》入选 IROS 2026 认知机器人最佳论文奖提名,核心工作正是把三维几何表征显式引入 VLA 模型的决策过程——让模型不只在二维图像空间里做判断,而是在具有深度、距离和几何关系的三维世界里理解场景。
03
底座模型能力的直接检验
第一的获取方式,值得拿出来单独说。DM0.5 在 RoboColiseum 上的路径是:强大的预训练底座,没有针对评测任务做专项优化,只是通过常规监督微调将模型能力迁移到了 RoboColiseum 的机器人构型和任务上,完成从底座到榜单任务的适配。
04
其他维度的佐证
原力灵机并非第一次拿到这样的好成绩。
上个月,DM0.5 刚刚登顶 RoboDojo——由香港大学多媒体实验室联合 UC 伯克利、清华大学等全球近 20 所顶尖机构共同发起的权威评测基准。AI 科技评论当时专门做了一篇深度分析,重点在于 Memory 维度。DM0.5 在记忆维度上取得 47.74 分和 47.44% 的成功率,而第二名只有 13.37 分和 12.11%——得分差了 3 倍多,成功率差了接近 4 倍。
跨越仿真与真机、覆盖操作与导航、兼容单一机型与多种异构构型,这些数字共同指向同一个结论:DM0.5 的成绩并非依赖某一个场景或评测框架的特殊适配,而是在多个独立的考场上反复被验证过的。第三个佐证来自国际同行的引用。Physical Intelligence(π)在两次关键输出中,都将原力灵机的 MemoryVLA 纳入了学术参照系:一次是发布具身记忆架构论文 MEM(Multi-Scale Embodied Memory for Vision Language Action Models),一次是将 MEM 的理念落地为旗舰产品 π0.7。
05
推理提速、全面开源、真机落地
DM0.5 目前的状态,可以用三件事来描述。第一件:推理速度进入实时控制的时间窗口。通过 Vision TensorRT、Tuned FlexAttention、FP8 E4M3 Tensor Core、Triton 融合算子和 CUDA Graph 的联合优化,DM0.5 的模型核心延迟从 534 毫秒压到 57.49 毫秒,API 响应控制在 70 毫秒内(p50 67.75 ms,p90 70.01 ms),累计加速 9.29 倍,延迟降低 89.2%。整套 VLA 推理系统快了一个数量级,大模型的智力第一次跑进了实时控制要求的时间窗口。
06
全科优秀,才是真正的通行证
RoboDojo 和 RoboColiseum,一个由顶级学术机构操持,一个由产业机构主导;一个侧重记忆、长程执行和开放语义,一个侧重指令理解、空间认知、鲁棒性和操作组合。两套体系的出题逻辑几乎没有刻意对齐,但 DM0.5 在两个考场上都站在了最高处。具身智能的评测体系还在建立中,行业至今没有一个像大语言模型那样被普遍接受的权威基准。在这个标准尚未收敛的阶段,能在多个不同方向的严格评测上都稳在第一梯队,含金量反而比刷穿某一套题更重。因为它证明的是,在标准统一之前就已经做好了应对任何标准的准备。AI 科技评论之前写道,“全科优秀,才是进入百万小时时代的必要条件,每门课都没有结构性漏洞,数据才会真正转化为能力。”这句话说的是数据 Scaling 的前提。而现在看来,它同样适用于落地:工厂要求鲁棒性和节拍,家庭要求语义理解和精细操作,仓储要求长程稳定性,没有哪个真实场景会迁就你的短板。一个能力有结构性漏洞的模型,在某一类场景里可能跑得不错,但很难真正跨越到普适落地。这也是为什么四榜同时第一,比任何一个单项冠军都更值得关注。只有整个能力谱系足够宽、足够均衡,才能同时承接真实世界里多样的任务要求。物理世界的智能,靠单科状元是不够的。行业最终需要的,是能经得住不同考场、不同考官、不同考题的长期答题者。
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
热门跟贴