打开网易新闻 查看精彩图片

会削黄瓜、切黄瓜、垒长城和分快递。

作者 | 刘俐杉

编辑 | 许丽思

机器人前瞻8月21日报道,在2026世界机器人大会上,一台机器人拿起黄瓜,削皮、切片,动作流畅连贯,1分钟零失误削完一根黄瓜。几步之外,另一台机器人正在将一块块异形积木精准拼插,每10秒完成一次拼装。而在传送带区域,机器臂以3秒一次的节拍完成抓取和放置

打开网易新闻 查看精彩图片

▲削黄瓜

削黄瓜、切黄瓜、搭建积木长城、传送带分拣,四个真实场景,同一个模型。原力灵机带来的具身基础模型DM0.5,正在用同一套“大脑”跨越厨房案板、展台和产线传送带三种截然不同的场景。

今年7月,原力灵机发布DM0.5,该模型定位为面向开放世界的通用具身基础模型。相比上一代DM0,DM0.5拥有更大的数据规模、更先进的架构、更强的开放世界泛化能力。

01.

不只是看图说话

而是对动作和环境进行预测

WRC现场,原力灵机的展台前,机器人正在削黄瓜、垒长城、分快递,具身智能行业发展到现在,机器人已经不再局限于“跳舞”,而是在真正干活。

原力灵机有一个判断:跳舞潮正在退去,模型走向C位的时代到了。过去两年,人形机器人在舞台上翻跟头、跳舞的画面已屡见不鲜,但这些只是表演,离进入真实场景干活还有距离。如今,评判标准已经从“能不能动”转向“能不能干”。

原力灵机认为,具身规模化场景会先于具身的GPT时刻出现。什么意思?业界一直在期待一个“万能模型”的出现,就像ChatGPT出现那样,但具身智能的特殊性在于,模型再强,也要在物理世界里接受检验。

与其等待一个遥不可及的完美时刻,不如让模型先进入真实场景,在具体场景中迭代能力、积累数据。“用起来”本身就比“等一个最好的模型”更重要。

打开网易新闻 查看精彩图片

▲原力灵机创始人、CEO唐文斌

正是基于这一判断,DM0.5在训练数据规模、数据质量、架构创新以及开放世界泛化能力四个方面实现全面升级,意味着DM0.5从传统的“执行固定指令、单次动作重复”,进化为“理解意图、多维连续泛化、长时可靠运行”。

相比上一代DM0,DM0.5的核心优势主要体现在Zero-Shot能力、Fine-Tuning 能力、长记忆能力、动作鲁棒性、多机型适配性五个方面:

第一,Zero-Shot能力。这是DM0.5最核心的提升方向。简单说,就是让模型在陌生的开放环境中,直接听懂用户的自然语言指令并完成任务。

第二,Fine-Tuning高效可靠。基础模型越强,下游的专用模型就越强。DM0.5在特定任务上进行微调时,训练效果更好,成本也更低。

第三,长记忆能力。DM0.5的架构支持历史信息学习,最长可记住60秒内的任务进程。这意味着在执行削黄瓜、垒积木这类长流程任务时,模型清楚自己做到哪一步了,知道前后逻辑关系,不会做着做着就"断片"。

第四,动作更加鲁棒。光线变化、相机视角调整,甚至人为主动干扰……在这些情况下,DM0.5依然能保持稳定的动作表现。

第五,多机型支持。DM0.5已在多种不同型号的机器人上进行训练,模型可以通过后训练快速迁移到从未见过的机型上。换了硬件,大脑依然通用。

在技术架构上,DM0.5延续VLA架构,以4B VLM作为多模态主干,并配置680M Action Expert生成连续机器人动作。

打开网易新闻 查看精彩图片

▲DM0.5架构图

同时,相比DM0,DM0.5的重点不只是扩大模型和数据规模,而是在历史上下文、具身推理、动作监督和数据质量上做系统增强。

传统VLA模型通常在每个控制步只输入当前图像和当前状态,适合短时、局部操作任务。

而DM0.5通过引入历史帧,让模型在决策时能够获得短期情境记忆。

模型会同时接收当前帧和过去若干关键帧,提供长达1分钟的任务进程状态变化,物体是否已经被拿起、区域是否被清理、机器人是否经过了某个地标……

训练时,数据管线会从当前时刻向前采样多个历史slot,每个历史slot通过时间采样和空间抽样,合并为固定数量的视觉token,采用随机历史长度和历史增强,使模型同时适应长历史、短历史和无有效历史的输入状态。

DM0.5在机器人数据中引入11种不同的自回归任务,使训练不仅依赖连续动作监督,也持续强化指令遵循、动作预测和时序环境感知。

在训练过程中,DM0.5的具身推理任务主要分为三类:

1、任务规划。模型需要识别当前任务执行到了哪个阶段,前后步骤是什么关系,整体进度如何。

2、事件与环境预测模型不仅要看当前画面,还要预测下一秒会发生什么。

3、动作生成。在前两种推理的基础上,模型还要生成未来一段时间的动作序列。

该任务设计是为了让模型不只学习当前画面对应的动作,还要学习在当前指令和任务进程下为什么应该执行这段动作,以及未来世界状态会发生的变化。

机器人采集的数据中,同一任务的多次采集存在不同执行节奏,如果把模型预测动作与原始轨迹的固定时间位置强绑定,模型学习的内容会产生偏差。

DM0.5通过动态动作匹配,将监督从“固定时间点对齐”改为“轨迹进展对齐”。

模型输出固定长度的未来动作片段,数据侧保留更细粒度的真实动作轨迹。训练时为每个预测动作在真实轨迹中选择动作锚点,并且为了避免时间反转,要求越靠后的预测动作,只能匹配到越靠后的真实轨迹位置。

每个候选匹配的损失由预测动作与真实动作锚点之间的误差计算,整体匹配通过动态规划进行计算,使所有预测动作的匹配总损失最小。

这一机制能够降低遥操作数据中的时间相位噪声,使模型更关注抓取、对准、接触、释放等任务关键动作变化,从而提高动作生成的平滑性、鲁棒性和跨采集员节奏泛化能力。

02.

从Zero-Shot到Fine-Tuning

DM0.5的真机实验说了什么

为评估模型在未见任务配置下的零样本泛化能力,原力灵机从动作类型与条件约束两个维度系统考察模型性能。

其中,动作维度涵盖8类基础操作原语:pick、put、move、pull、cover、wipe、stack、press;条件维度则包括颜色、形状、尺寸、状态、执行序列、相对位置及绝对位置共7类语义约束。

实验设置上,原力灵机设置每个测试任务均由至少一个动作原语构成,并根据设计可选配若干条件约束,以模拟真实操作中指令的多样性与组合复杂度。

在上述任务集上,原力灵机选取了四组模型X平台的组合开展对比评测,在Franka平台部署Pi0.5-Droid与DM0.5-Droid两个模型;在Dexmal-Mirror平台部署DM0与DM0.5两个模型。

打开网易新闻 查看精彩图片

▲实验结果

实验结果表明,DM0.5在绝大多数评测维度上均显著优于对比模型,已形成较为系统的Zero-Shot动作执行与语言条件理解能力。提升主要体现在动作覆盖范围扩大、基础操作稳定性增强,以及对多类语义约束的指令遵循能力提升。

打开网易新闻 查看精彩图片

▲实验结果

在评估Fine tuning能力时,使用RoboChallenge Table30 v2评测DM0.5的真实机器人桌面操作能力。该评测覆盖多类真实桌面操作场景,包括长期记忆、视觉感知与目标定位、精细抓放等维度。

实验结果表明,DM0.5在Table30 v2上取得了SOTA,整体Success Rate为43%,综合Score为54.42。在盖章定位、按按钮等需要记忆目标状态和动作顺序的任务中,DM0.5的记忆能力显著提升了执行稳定性。

此外,原力灵机在单臂操作环境Libero与双臂操作环境RoboTwin2.0中评估了DM0.5的微调能力;还使用R2R和RxR两个基准评测DM0.5在导航上的性能。

打开网易新闻 查看精彩图片

▲ LIBERO综合评测和RoboTwin2.0评测

结果显示,在真机与仿真评测中,DM0.5均刷新了纪录:在LIBERO中综合成功率达到 99.0% ,在RoboTwin 2.0简单和复杂场景下成功率分别达到 93.6%和93.3% ,VLA-Arena在不同难度设置下的成功率分别达到 89.0%、53.6%、44.1%。

同时,在导航场景仿真测试中,DM0.5在R2R和RxR的Val-Unseen数据集上,成功率分别达到59.7%和 65.5%相比所有基线方法均取得了显著优势。

打开网易新闻 查看精彩图片

▲R2R Val-Unseen数据集评测

03.

削黄瓜、垒长城、分快递

同一个模型的多任务适应能力

WRC现场,DM0.5将用四个真实场景回答同一个问题:一个模型到底能覆盖多少种截然不同的任务?

削黄瓜+切黄瓜,黄瓜是典型的柔性物体,表皮光滑、质地柔软、形状不规则,机器人要完成削皮和切片,需要实时感知接触力、调整刀具角度和速度。

打开网易新闻 查看精彩图片

▲削黄瓜

DM0.5展示的是毫米级手感控制能力,这背后是模型对力反馈的实时理解和对动作的连续调节,而非预设轨迹的机械重复。1分钟无失误削完一根黄瓜。

打开网易新闻 查看精彩图片

▲切黄瓜

多机器人协同搭长城模型,每10秒完成一次拼装。积木长城涉及多块异形积木的识别、对准和插接,精度要求达到亚毫米级。

更重要的是,多机器人协同意味着DM0.5不仅要控制单个机械臂,还要在多个本体之间协调动作序列。

打开网易新闻 查看精彩图片

▲搭长城

混合SKU快节拍物流分拣,3秒完成一次精准抓取和放置,准确率超85%。传送带上的货物品类混杂、位置随机,DM0.5需要在高速运动中完成识别、决策和执行。

打开网易新闻 查看精彩图片

▲物流分拣

04.

结语:具身智能的下一站

是让模型在真实世界里“干活”

过去两年,VLA模型让机器人迈向了视觉、语言与动作的统一建模。机器人不再只是根据固定程序执行动作,而是开始理解自然语言指令、识别开放世界中的物体。

但一个通用机器人基础模型,不能只在固定场景完成既定的任务。它需要真正理解任务的指令,在不同物体状态、不同环境、不同机器人本体和各类干扰下保持稳定可靠执行。

这正是DM0.5的出发点:走出实验室,走向开放世界。

从削黄瓜的毫米级手感,到垒长城的亚毫米级精度,再到传送带上的工业级节拍,通用具身基础模型一步步走向厨房、展台和产线。具身智能离“进入真实世界”的距离,正在被一步步缩短。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片