Jay 发自 凹非寺
量子位 | 公众号 QbitAI

一觉醒来,机器人大脑的SOTA,易主了。

这次,原力灵机的DM0.5,登顶了具身「珠峰」——RoboDojo

打开网易新闻 查看精彩图片

要知道,这可是RoboDojo啊。。。

魔鬼级的具身评测,由香港大学多媒体实验室联合加州大学伯克利分校、清华大学等全球近20所顶尖学术机构共同发起

这些顶尖学府的「品控」有多严格?

这么说吧,截至2026年7月,仿真榜单头部模型平均成功率仅8.80%,真机榜单仅12.8%。

是的,仍在个位数挣扎。

反正就是难度和真实性极高,专治实验室闭门造车的偏科生。

如今,DM0.5拿下了第一——

  • 综合得分:24.90
  • 平均成功率:19.34%

此外,仔细看了下表格,发现这个模型有个极其突出的强项——

记忆。

具体可以看这个Cover Blocks任务:

机器人先从左到右盖住随机排列的红、绿、蓝三个积木。当颜色被完全遮挡后,再根据此前观测,按红、绿、蓝的顺序依次揭开。

DM0.5在三次随机考试中,都取得了100%成功率。

反映在数据上也很直观,RoboDojo榜单中的Memory维度,DM0.5直接猛砍了47.74分,显著领先。。。

绝对是助力其登顶,最关键的绝杀了。

打开网易新闻 查看精彩图片

这还没完。

其他权威评测,DM0.5也都打爆了。

  • LIBERO:综合成功率99.0%
  • RoboTwin 2.0:简单和复杂场景下成功率分别达到 93.6% 和 93.3%,
  • VLA-Arena:不同难度设置下的成功率分别达到 89.0%、53.6%、44.1%。
  • RoboChallenge Table30 v2:综合得分54.42,成功率43%。

而这个SOTA级别的大脑——

早已开源。

一个基模,六类场景全通过

一个基模,六类场景全通过

榜单数字终究是抽象的。DM0.5的真实能力到底如何,还得看demo。

原力灵机,大概是当前场景demo最丰富的基础模型厂商。

抗干扰、拼积木、学黄瓜、分拣快递……给我看的眼花缭乱。

但回过头来仔细一样,这些看似分散的demo,其实指向同一件事:

基模的泛化能力。

我们一个个说。

1、人类示教。

这是我觉得最有意思的demo。

DM0.5化身卡卡西,人类示教一次,它便能光速复制粘贴。

说实话,这项技能点其实并不陌生,大家都在做这个方向。

毕竟物理世界场景稀碎,你模型做得再好,总有泛化性覆盖不到的长尾任务,这类场景下鲁棒性会骤降特别多。

这就永远到不了具身的ChatGPT时刻。

目前业内的共识解法是:不追求预训练解决一切,而是在落地环节引入Human-in-the-Loop。让人类工作者拍摄一段示范视频,机器人便能像开了「写轮眼」一样即时对齐并跟随完成复杂任务。

让教机器人,变得像教徒弟。

原力灵机做的便是这件事。

而开头提到的「记忆」,则是解法的关键。

DM0.5原生支持最长60秒的记忆能力,机器人能深度记住并连贯审视自己此前做过的所有动作序列。

基于这份长记忆,模型可以直接跨越语言限制,理解人类演示的视频片段

2、精细操作。

原力灵机选择的场景,是积木。

其实今年7月我在上海WAIC看过这个demo,说实话,比视频里的精彩得多。

原力灵机联手阶跃,搁展区里拼了个长城。。。

是的,6台机器人,耗时15小时,用81920块微型积木拼出长3.5米的长城模型

打开网易新闻 查看精彩图片

现场也是挤爆了,钻都钻不进去。

但这绝对不是个「情绪价值」demo。

积木拼装,最小的组件宽度不到1厘米,机器人必须在0.1到1毫米的尺度内完成抓取和扣合。这个精度,已经超越了人手约0.3到1毫米的自然抖动极限。

与此同时,微型积木存在工艺公差,直接大力出奇迹的话,极易错位卡死。

所以如果仔细看视频,你会发现个蛮有意思的细节。

这哥们会寸劲儿啊!

机器人会先对准,再轻轻一震、抖动下压,把积木扣住。

打开网易新闻 查看精彩图片

当然,自动纠错的能力也很关键

毕竟是模型嘛,高精度任务确实没法追求把把zero-shot,还是得靠Loop保证稳定性。

打开网易新闻 查看精彩图片

柔性物体则更需要自动纠错了。

比如这个削黄瓜的demo,一刀下去,黄瓜形态会变。模型需要实时闭环调整。

刀深几分、力道几何,如何削得干净又不伤果肉……全在毫厘之间的拿捏。

打开网易新闻 查看精彩图片

你以为黄瓜到这就完成它的使命了?

不,原力灵机还在继续鞭打黄瓜(bushi)。

但这次侧重点有所不同,是用灵巧手切。

模型通过后训练驾驭高自由度,也是对DM0.5泛化性的展示吧。

打开网易新闻 查看精彩图片

3、长程稳定高节拍。

从这开始,demo就和场景紧密结合起来了。

今年北京亦庄的WRC,原力灵机将快递流水线搬到了现场,直击物流中转站最大痛点——

单件分离。

传送带不停,每个包裹的尺寸、材质、摆放姿态都不一样,传统机械方案根本干不了这类任务。

DM0.5不依赖预设脚本,纯靠实时视觉识别和决策,平均3秒一单,准确率超99%。

打开网易新闻 查看精彩图片

上周我也是在现场近距离看过这个demo的。

说实话,论论情绪价值,我个人觉得还得是工业场景,超解压啊,跟看清洁直播一样。

至少是能看得下去的,不会慢的要死,捡个枕头都一卡一卡的。。。

ADHD患者强推打卡(bushi)。

4、抗干扰。

真实世界不是实验室,相机随时可能骤变视角,人类随时可能「空降」捣乱。

DM0.5的解法是分层双系统,即业界主流的System1与System2架构

Sys2是深思熟虑的高阶大脑。负责理解、拒绝与大局预判,剑指zero-shot;

Sys1则是动作专家网络。就像人类的直觉反射,负责handle长程复杂任务中的琐碎细节。

在这套架构加持下,即便外部视点剧烈变化,DM0.5通用Picking的鲁棒性依然极强

哪怕人类强行打断任务,机器人也能准确理解当前实际状态,自适应修正后续动作。

六类场景,从毫米级到传送带,从刚性到柔性,从执行到模仿。

同一个模型在如此差别很大的场景中都表现优秀,是很少见的。

现在大家都冲百万小时数据,但光看数据量,或许并不符合第一性原理。

如果基模没有强泛化,每个场景都单独训一个模型,demo再多,也不过是一堆散落的珍珠。

偏科是没法的Scaling Up的。

这也是我觉得DM0.5最有意思的Takeaway吧,具身模型本身的能力正在被看见,并且上限可以做到很高。

数据、架构、效率全面升级

数据、架构、效率全面升级

说了这么多,原力灵机究竟是怎么做到的?

这方面,团队也早把他们的经验,毫无保留地全盘托出了。

答案分为三层,也是具身绕不开的三个核心变量:数据、架构、延迟。

先看数据。

数据决定智能上限,这也是整套具身工程中,最重要的一环,没有之一。

DM0.5的数据资产,主要分为三类。

1、真机:5万小时高精度操作,覆盖100+种丰富动作,实现秒级精细指令动作对齐。

2、Ego:10万小时场景视频,支持毫米级高精度3D Landmark生成,实现精准标注。

打开网易新闻 查看精彩图片

3、仿真:100万平空间数据建模复杂室内环境,高精度重建解决Sim2Real Gap。

打开网易新闻 查看精彩图片

感觉他们还是把质量看的很重的,不是光脑门一拍硬采。

数据量的方式则用omni融合思路解决,也是目前行业比较主流的方案,风险最小化。

再看架构。

一句话总结,DM0.5主要有三大创新,对应解决三个问题。

1、怎么记得住?

这个前面提到过,为了降低DM0.5的落地门槛,原力灵机引入了原生长记忆

具体而言,团队在上下文抽象层做了大量工作,通过高效的信息压缩技术,让4B参数的VLM在预训练阶段就能原生学习并记住历史信息。

打开网易新闻 查看精彩图片

2、怎么看得懂?

对此,原力灵机有这么一个判断:

没有语言能力的VLA,就是数据集复读机。

毕竟不管怎么说,语言确实是最方便蒸馏人类思考能力的模态了,有Language这一层赋能,就是很吃香。

于是有了具身思维链任务。

为此,DM0.5设计了具身思维链任务,用11项推理任务驱动模型,对指令、本体、环境进行三方联合建模,赋予动作生成以语义理解和世界预判能力。

这个过程中,团队可以构造了「反事实任务」,故意给出错误指令,迫使模型真正「看懂」而非机械匹配。

3、怎么对得齐?

传统动作监督是对点式的,预测轨迹与真值轨迹之间的偏差会不断累积,最终炸掉。

原力灵机做的事对齐式的动作监督,利用约束动态规划高效计算最优匹配,一次性解决动作轨迹不一致的问题。

打开网易新闻 查看精彩图片

数据和架构双剑合璧,大幅提升了DM0.5的智能上限。

但真正要能用,还得看效率。

具身最终是要在端侧实时跑的。推理不够快,参数就是坨废纸。

为此,原力灵机做了一系列优化,这里就不多做赘述,大家可以直接看官方技术报告。

最后成果如下——

  • 模型核心延迟:534.04 ms → 57.49 ms
  • 累计加速:9.29×
  • 延迟降低:89.2%
  • API 延迟:p50 67.75 ms,p90 70.01 ms
  • LIBERO 成功率:98.45% → 98.40%

硬生生加速了一个数量级啊。。。

而且,精度基本无损。

可以说是让整套VLA推理系统超进化了

打开网易新闻 查看精彩图片

登顶,是为了下山

登顶,是为了下山

「登顶」确实很惊艳,但说实话,这可能真还不是最值得关注的事情。

具身天上一天地上一年,冠军频繁易主,仅仅是成绩单,很容易过期。

真正能在具身周期里刻下痕迹的,是登顶之后,你愿意留下什么。

这可能也是DM0.5选择全面开源原因

不仅仅是模型权重,DM0.5的训练框架、下游任务工作流……已陆续在GitHub与Hugging Face开放,供开发者复现、魔改、扩展。

比如下面这个demo,就是原力灵机基于DM0.5,结合开源机械臂套件,监督微调出来的。

打开网易新闻 查看精彩图片

LLM领域,开源早不是啥新鲜词,从最开始的DeepSeek,到如今的GLM、Kimi、MiniMax……大家早已习惯了开源的声音。

但在具身行业,我觉得,这件事的意义真不太一样。

物理AI实在太早期,太不成熟了,这点是事实。

所以,我们需要更透明的讨论,更真实的评测,更多公开的工作……

如果谷歌当年没有放出Transfomer,OpenAI或许永远也摸索不出通往ChatGPT的路。

RoboDojo的火爆,推动了评估从「单点Demo展示」走向「标准化全科考试」。让具身真的可以被统一度量、被复现、被挑战。

DM0.5的登顶与开源,则进一步兑现了这个Benchmark的价值。让所有人看到登顶的方法论,也让方法论可以被带走、被复用。

这是原力灵机对当下这场具身竞赛的回答。

登上珠峰,从来不是为了留在山顶。

下一步,是下山——

用开源赋能生态,让第一梯队的具身大脑,走进各行各业的流水线。

GitHub:https://github.com/dexmal/opendm
Hugging Face:https://huggingface.co/Dexmal/DM05
Tech Blog:https://www.dexmal.com/blog/dm0.5