编辑|冷猫

我们理想中的具身智能模型,是什么样的?

或许可以归结为几个关键词:足够通用,理解真实世界,具备自主决策与行动能力,同时还能自然、高效地与人和环境持续交互。

这些关键词共同指向了一类模型:世界动作模型(WAM)。视频生成模型正在变成机器人世界模型底座,而想要真正让具身智能模型 Scaling 起来,对真实物理世界的理解深度就格外重要。

而这,是具身世界动作模型的新进展,机械手能够稳健地完成相对复杂、精细的现实任务:

视频链接:https://mp.weixin.qq.com/s/aUG63Je6R_eCygzq4QoE4A
打开网易新闻 查看精彩图片
视频链接:https://mp.weixin.qq.com/s/aUG63Je6R_eCygzq4QoE4A

刚刚,穹彻智能发布具身智能预训练模型 Noe-0 ,一个训练全链路采用无本体采集数据的世界动作模型。

打开网易新闻 查看精彩图片

  • 技术博客链接:https://lab.noematrix.ai/blog/1-noe-0-research-preview/

所有自采训练数据都来自人在真实环境中直接完成操作的记录。超 50 个城市、数十万小时、数十万种任务类型。

这是一个相当激进的策略。Noe-0 证明了完全不依靠传统的遥操数据,也可以完成具身世界模型的预训练、后训练,并在真实机器人上形成执行真实任务的能力。

Noe-0:全链路「真实操作」训练的具身模型

什么是真正的「真实操作」

传统的遥操数据,往往是在一个集中场地内搭建大量标准化工位:相似的桌面、有限的物体,以及提前设计好的任务流程。这样的环境虽然也可以被称为「真实场景」,但本质上仍是为了数据采集而人为构造出来的。

换句话说,数据工厂可以复制工位,却很难复制真实世界本身。

因此,要想让机器人学习真实世界的知识,就必须摆脱机器人本体和固定工位。数据采集真正进入家庭、门店等日常环境,采集员直接面对真实空间中的物体和任务,数据才能自然包含不同的视角、光照、摆放方式、操作习惯以及大量难以预先设计的长尾情况。相比标准化工位,这类数据更接近机器人未来实际面对的世界,也更能体现真实世界的复杂性和多样性。

此外,研究团队观察到,同一任务通过遥操作完成通常需要直接操作的 3 至 5 倍时间,不仅增加采集成本,也容易产生缓慢、机械的动作数据。所以,在摆脱标准化工位的数采势在必行。

为了实现在真实世界里的数据采集,穹彻智能打造了高效,自然,设计优化的数据采集设备RoboPocket(RP)

团队发现,如果直接沿用面向机器人执行设计的夹爪形态,会限制采集员在真实环境中的操作范围。为此,RP 将夹爪、末端形态、传感器和采集方式放在一起设计,强调「同构设计」:采集端与机器人末端尽可能保持一致,同时兼顾人的操作舒适度和采集效率。

RoboPocket(RP)示意图
打开网易新闻 查看精彩图片
RoboPocket(RP)示意图

全链路无本体数据

对 Noe-0 而言,无本体数据,「真实操作」的数据,是同时支撑预训练和后训练的数据基础。

众所周知,大模型的训练链路较长,预训练和后训练都对模型的最终能力有巨大的影响。值得注意的是,Noe-0 在预训练和后训练阶段都使用无本体数据。

打开网易新闻 查看精彩图片

预训练阶段,Noe-0 使用大规模分布式无本体数据,让模型尽可能见到更多场景、物体和任务,从中学习跨任务的视觉变化、状态转移与动作规律,建立面向真实世界的基础能力。进入后训练阶段后,团队再围绕具体任务采集更聚焦的无本体数据,用于任务适配和能力强化。

更重要的是,这种数据范式贯穿了整个训练链路。

如果预训练使用无本体数据,后训练却重新切回遥操作数据,两个阶段之间就会出现数据分布和动作模式的断层:模型在预训练中学到的自然操作规律,还需要在后训练中重新适配一套不匹配的动作表达。

Noe-0 从预训练到后训练始终沿用同一种无本体数据路线,让基础能力学习和具体任务适配保持连续,也避免后训练重新成为整条链路的能力瓶颈。

打开网易新闻 查看精彩图片

World Action Model:真实世界经验的转化

当数据真正走出标准化工位、进入真实世界后,数据的丰富性也随之带来了新的挑战,传统的 VLA 技术路线因其泛化能力受限早已不再能够满足需求。不同环境、物体、光照、视角,以及更加复杂、连续的交互过程,都要求模型具备更强的多样视频理解与世界建模能力。

这也是为什么,真实世界数据越丰富,对新一代的 World Action Model 的需求反而越迫切。

在最近的 Robotics' End Game 中,英伟达 Jim Fan 就说道:「VLAs are dead, long live World Action Models.」

World Action Model 将策略模型的骨干从语言模型替换为视频世界模型,能够回答世界的下一步状态是什么,以及机器人该如何行动来实现它。

因此,Noe-0 采用 World Action Model 架构,以视频预测作为核心的高层学习目标。模型接收连续历史帧与相关状态信息,预测未来的视觉状态。既要学习真实世界在交互过程中如何变化,也要把这种对状态变化的理解转化为机器人可以执行的动作。

打开网易新闻 查看精彩图片

Noe-0 的 World Action Model 架构也为后续本体升级留出了空间。

视频预测部分可以尽量复用对环境变化的理解,动作预测部分则针对不同末端执行器进行适配。由于动作侧模型规模相对较小,更换末端构型时无需重新训练整套模型,也不需要投入特别大的新增数据量。

此外,穹彻团队在实践中发现了一个关键结论,一个此前鲜为人知的结论:即使采集数据和最终推理部署之间存在本体差异,Pixel Prediction 依然能显著提升跨本体迁移的效果。

原因在于 Pixel Prediction 为模型提供了一种隐式的反事实推理能力。当模型被要求预测未来视觉帧时,它必须从纷繁的像素信息中区分出哪些视觉变化与任务完成相关、哪些只是本体外观或背景的差异。这种训练压力迫使模型学会过滤掉与本体绑定的表面信息,抓取真正驱动任务进展的物理本质。

这一发现具有战略价值:它意味着无本体数据不仅是一种低成本,高质量的采集方案,更说明无本体数据与 World Action Model 能够实现完美的匹配,更好地帮助我们从无本体数据迁移到机器人智能。

对 Noe-0 而言,World Action Model 与全链路无本体数据是相互支撑的两个核心:模型架构决定了如何从视觉经验中学习物理规律并转化为动作能力,数据路线决定了模型能够看到多广、多真实的世界。两者共同构成了 Noe-0 的技术基座。

AI-Native 的数据基础设施

具身智能模型需要大规模数据,这一点已经是行业共识。但「大规模」这个词经常被用来指代两种完全不同的东西。

第一种是数据量的规模化:同一类任务被重复采集更多次。第二种是经验分布的规模化:模型见过更多种类的任务、更多种物体、更多种空间、更多种现实世界中的变化。

真正能够进行 Scaling 的大规模数据是什么样的?穹彻的研究团队认为,第二种规模化更加重要:

Distributional Scaling = More Data × More Tasks × More Objects × More Spaces × More Real-world Variation

打开网易新闻 查看精彩图片

为了真正实现数据的分布规模化,实现 Noe-0 的全链路无本体数据训练,穹彻的团队决定打造一系列 AI-Native 的数据方案,打造了一个全新的「真实世界」数据基础设施

让采集完全脱离机器人本体,进入真实世界。

RoboPocket:进入真实世界的端侧入口

在真实世界数据采集方面,穹彻是一个完完全全的老玩家。

2021 年 7 月,穹彻智能开始探索基于遥操作的大规模机器人数据采集,同年开始启动全球范围内最早的无本体数据采集研究之一。

2023 年,穹彻智能开源国内最早的大规模具身智能数据集 rh20t,并发布 AirExo 方案,用便携式外骨骼在真实环境中记录人的操作过程,是行业内较早实践无本体 in-the-wild 数据采集的团队。

2026 年初推出的 RoboPocket(RP)进一步将采集设备做到可大规模分发的形态。

目前,RoboPocket 已覆盖超过 50 个城市,18 个省级行政区。设备包含对应左右手和头部的三组传感器,主要采集两类数据:视觉数据和动作轨迹数据。团队累计采集已达数十万小时,峰值时期有超过 1000 名采集员同时参与,累计参与人数达到数万名。

打开网易新闻 查看精彩图片

这数十万小时数据中,没有任何一条来自为采集而搭建的模拟环境。

采集员进入自己面对的真实场景后,根据身边的物体和实际需求自主构想任务。任务由采集者在真实场景中自主产生,任务类型不断变化。让我们来看几个采集案例,无一例外,任务都非常复杂。

打开网易新闻 查看精彩图片

煮方便面。在锅具、包装和食材之间切换,完成连续多步骤的食物处理。甚至包含水雾遮挡镜头的部分。

打开网易新闻 查看精彩图片

开关接线与装配。区分线材、端子与开关结构,按顺序完成接线、固定和最终检查。

打开网易新闻 查看精彩图片

填充植物周围缝隙。在植株、容器与松散填充物之间规划动作,覆盖不规则空间。

这产生了一个惊人的数据特征:数十万小时数据对应了数十万种任务类型,平均每种任务类型约一小时数据。数据的广度远大于深度。

AI-native Data Engine:在云上让数据真正可用

数据的多样性上来了,新的难题也随之而来。

数千名采集员分布在几十个城市,独自在不同场景中执行任务,人员、任务和数据的管理就成了全新的问题。

与此同时,任务类型不断增加,固定的标注模板和质检规则难以覆盖所有情况。真实、多样的数据有利于模型训练,却也大幅增加了数据管理和标注的复杂度。

在实践中,数据标注成本已超过采集成本。如果质检和标注人力随数据规模同步增长,分布式采集带来的规模优势最终会被后端成本抵消。

因此,想要实现高效高质量的数据采集,一个由 AI 深度参与的数据引擎是不可或缺的。

穹彻智能将从端侧采集到训练数据交付的全过程拆解为八个环节,贯穿统一的数据生产管线。

打开网易新闻 查看精彩图片

RoboPocket 与 DM3 将三视角数据送入审核、筛选和交付;Data Agent 连接数采管理员与数采员。

在生产管线之上,穹彻智能搭建了一个名为Data Agent的智能体。它通过自然语言交互,将数据管理者和分散在各地的数据采集员连接在同一个可追踪的工作流中。

Data Agent 覆盖五项核心功能:任务生成、数据查询与统计、质量问题处理、通知推送,以及权限管控。

这让质量修正精确到人、精确到问题类型,并且在下一次采集之前就完成干预。管理者不再需要逐人沟通,采集员也能在具体反馈的引导下快速调整。

From AI for AI ,是大规模智能产生的决定性因素。

穹彻智能让 AI 能力运用到具身智能产生的每一个阶段,打造了AI-native Data Engine,将 AI 嵌入从任务产生、数据采集到质量改进的完整管理闭环,让 AI 能力覆盖整条链路:

  • AI 辅助任务审核:自动初筛任务目标、描述和采集要求,实现新任务的规模化审核。
  • AI 自动化质检:结合端侧与云端能力,自动检查数据完整性、规范性、自然度和可用性。
  • AI 自动化标注:自动处理高置信样本,人工集中解决低置信和长尾数据。
  • AI 驱动端侧反馈:将质检问题和调整建议及时反馈给采集员,帮助其快速纠正。

穹彻智能搭建的系统,正是一种具身 AI 原生的基础设施

它让真实世界中正在发生的人类操作行为,能够被持续、规模化地转化为机器人的学习材料。采集工具足够便携可以进入任何场景,Data Engine 能够消化任何新出现的任务类型,模型架构能够从越来越广阔的经验分布中持续获益。

尾声:让现实转化为智能的未来

Noe-0 是具身智能世界动作模型的一大里程碑。

它验证了不依赖传统遥操作数据,也可以完成从预训练、后训练到真实机器人执行的完整闭环。与此同时,穹彻智能也打造了一套全新的基础设施,实现了让分散在真实世界中的人类操作,被持续转化为可训练、可管理、可扩展的数据。

当基础设施成熟到一定程度,数据的来源将不再局限于专门的采集行为。人类每天在真实世界中完成的无数操作,本身就是具身智能模型可以学习的素材。社区里的日常生活、商业空间中的服务流程、工业场景中的操作规范,都可能通过足够便携和无感的采集方式被数字化,源源不断地流入模型的训练体系。

把模型学习新任务的起点,从专门构造的机器人采集环境,前移到真实世界中广泛存在的人类经验,是一条更具扩展性的技术路径。数据采集、预训练、后训练和机器人执行不再彼此割裂,而是共同服务于模型能力的形成。

穹彻智能的全栈能力也体现在这里,跑通了真实世界经验进入模型、模型转化为机器人能力,再由真实执行反馈推动模型迭代的完整链路。基础设施为模型提供持续进化的条件,而模型始终是整个体系的核心。

这正是 Noe-0 想要建立的最终能力,是在不先为每个新任务架设专用工位的情况下,更快捷地把真实世界中的任务转化为机器人能力。

模型面对的真实任务越多,流入的真实世界经验越丰富,模型的能力边界就广阔。

具身智能真正的 Scaling,或许才刚刚开始。