打开网易新闻 查看精彩图片

黄小艺 H997Hbiu

Yoky|yokyliu617

今年 WRC 会场,“概念热”正在褪去。

去年还被反复挂在展台、演讲和采访里的 VLA,今年很少再被当作一个完整答案来讲,“端到端”也退到了更靠后的位置;接棒的新热词“世界模型”,尽管还没有一个确定的答案:有人生成未来视频,有人预测事件,还有人在潜空间里预演,但像去年那种围绕技术路线产生争论的场面也不见了。

更多人开始意识到:所有没有数据支撑的算法路线之争,最后都是梦幻泡影。

无论做 VLA、世界模型,还是端到端具身大模型,最后都会回到数据。没有足够多的真实物理交互数据,VLA 只是把视觉、语言和动作连在一起;端到端只是把模块边界藏进模型里;世界模型也很难真正知道,一个动作之后,世界会怎样变化。

所以今年,问题从“谁才是机器人大脑的最终路线”,变成了更具体的两件事:到底要采什么样的数据?又该怎么采?

我们和行业里重要的6家公司聊了聊,也参考了各家的公开演讲,整理出了四个核心观察。

1

一、VLA 是真的被淘汰了吗?

去年行业还在争论 VLA 是不是机器人大脑的答案。今年更准确的问题变成了:VLA 到底被“淘汰”到了什么程度?从多家公司的回答看,VLA 没有消失,但它正在从独立技术路线,变成系统里的一环。真正被淘汰的,是“只靠 VLA 就够了”的想象。

擎朗智能:VLA是骨架,世界模型让它“先想后做”

行业去年在端到端、VLA、世界模型等路线上确实讨论很多,各有拥趸。但从我们的实践来看,今年已经能看到一些清晰的方向——不是“单靠VLA够不够”的问题,而是如何让VLA真正在真实场景里稳定干活的问题。行业不再争论到底是VLA还是世界模型,而是转向混合架构;世界模型的焦点从“要不要”变为“做在哪一层”。

所以我们的思路很明确:VLA是核心骨架,世界模型是让它“先想后做”的大脑皮层。机器人执行动作前先在内部预演一遍物理结果,预测物体受力后的运动轨迹、多步骤操作的因果链条,从源头规避失败。这不是用世界模型替代VLA,而是用世界模型让VLA更强。

星海图:VLA与世界模型同源共生,最终会走向融合

现在行业有些过度关注技术概念,忽略了技术实质。在我们看来二者内核相通。不管是VLA还是世界模型,本质都是把输入转化为Token,通过Transformer多层神经网络完成编码,再通过自监督方式开展预训练,基本逻辑是一致的。

二者区别仅在于自监督训练的方式不一样,世界模型主要依靠视频预测来做自监督训练。二者同源共生,未来也会走向融合。

乐享科技-元点机器人:单一模型解决不了真实世界,机器人需要一套持续进化的系统

今年行业确实在形成一个更清晰的共识:单一技术路线很难独立解决具身智能在真实物理世界中的全部问题。VLA让机器人具备了从视觉、语言到动作的直接映射能力,是非常重要的基础;但面对家庭等非结构化场景,仅靠VLA往往还不够,还需要数据闭环、任务规划、动作控制、异常恢复以及持续学习机制共同支撑。

元点的路线与行业共识相同的一点,是都认为机器人智能必须从“预设执行”走向“数据驱动”和“持续进化”。不同之处在于,我们不是只围绕单一模型做能力叠加,而是通过OpenBridge这一开源的开发者生态平台把数据平台、训练平台、Skill Hub和Bridge本体连接起来,让能力能够在开源平台被上创建、复用、共享和迭代。

1

二、世界模型是下一个“VLA”概念股么?

所有人都在讲世界模型,但和去年的VLA一样,它还没有形成稳定定义。有人生成未来视频,有人预测动作后果,有人按事件来理解状态变化,还人在潜空间里预演。大家使用同一个词,做的却未必是同一种模型。现在真正值得比较的是它究竟输入什么、预测什么,又怎么影响机器人的动作。

宇树科技:最大瓶颈是,AI模型的输入和输出与真实世界之间仍然存在偏差

今年大家可能听到最多的还是世界模型这个方向。其实我们在2020年初就开始做基于视频生成的世界模型,但是到2020年底,做出来的效果不是特别理想,所以中间稍微搁置了一段时间。从去年开始,我们又重新大力发展基于视频生成的世界模型。

目前全球具身智能最大的瓶颈,就是AI模型的输入和输出,与真实世界之间仍然存在偏差。比如让机器人移动,把一些东西装配在一起,或者把一个物体搬到另一个位置。从大的趋势来看,现在的模型其实没有太大问题,大差不差能够执行你的任务。问题往往发生在最后几个厘米,甚至最后几个毫米。

自变量:VLA回答“做什么”,世界模型回答“做完会怎样”

世界模型接收机器人当前和历史的视觉信息、语言任务、动作及本体状态等数据,预测采取一个动作后,物体和环境将发生怎样的变化。VLA主要回答“下一步做什么”,这部分能力则帮助机器人理解“这样做以后会发生什么”。

两者不是替代关系,也不只是一个模型给另一个模型生成的动作打分,而是会逐渐在统一模型中融合。我们的WALL-WM通过以完整事件对齐视觉、语言和动作,让机器人同时理解动作过程、状态变化和最终结果。

擎朗智能:VLA的架构下,在潜空间里推演物理结果

擎朗KOM 3.0时,我们在VLA架构里融合了潜空间世界模型。

服务机器人面对的不是实验室里固定的桌面,而是餐厅、酒店、咖啡店这种高动态、非结构化的环境。机器人要做的往往是长序列任务——比如做一杯咖啡,要取杯、承接、递送,中间任何一步出错整个任务就失败。如果只靠VLA做“感知-决策-执行”的端到端映射,缺少对物理结果的预判能力,在复杂场景下的成功率会断崖式下降。

机器人执行动作前先在内部预演一遍物理结果,预测物体受力后的运动轨迹、多步骤操作的因果链条,从源头规避失败。

1

三、有多少人工,就有多少智能?

如果 VLA 不是答案,世界模型也不是一个现成答案,那关键问题反而回到了最朴素的地方:数据。去年行业还在讨论算法不行还是数据不够,今年更明确的回答是:数据不够,所以算法才不行。仿真、合成、互联网视频都可以作为补充,但机器人要理解物理世界,最终还是要回到真实交互数据。

奥比中光:无本体数采,要从临时方案变成标准化基础设施

这轮热潮背后首先是真实的数据短板。具身智能模型需要的不只是互联网中的图像和文本,而是大量包含空间、动作、物体状态变化和任务过程的真实世界交互数据。

现阶段,直接依靠机器人本体采集数据,通常面临本体成本较高、部署效率有限、硬件尚未完全定型等问题。无本体数据采集则可以较低成本覆盖更多场景、任务和操作流程,尤其适合采集第一视角下的环境信息、空间关系和长链条任务过程。

这类需求来自多种类型的客户,既包括具身智能模型公司、机器人本体厂商,也包括专业数据采集服务商、数据运营公司以及其他算法驱动型企业。不同客户的共同诉求,是把真实世界数据采集从临时搭建的设备方案,逐步变成可标准化部署和批量交付的基础设施。

智身科技:自研、自采,外部数据无法替代自己的机器人自主运行数据

真人穿戴采集、机器人遥操作、机器人自主运行和仿真数据我们都有在做,因为不同数据源有各自的优缺点。

真人穿戴采集主要用来快速学习;机器人遥操作用来提升操作灵活性;因为智身下半年主打的就是“能干活”,机器人自主运行就是用来提升落地效果,解决真实物理世界中会遇到的各种翻车问题,这个是其它数据源不具有的优势。

仿真数据,量大,能帮我们做场景、任务的多样性扩充,但sim to real的问题让我们没办法把这些数据拿来直接用,都要用真实数据做微调。

对我们来说,缺的不是哪一种数据,其实是“有用的数据”,现在海量的数据里很多其实是“无效数据”。

我们的数据都是自己的,包括数采设备这些,都是自研的。在我们看来,数据质量是一方面,另外是外部提供的数据场景分布不匹配,“它的世界≠我的世界”,数据规模再大,没办法替代我们自己机器人在真实目标场景下产生的交互数据。

自变量:无本体数采扩大数据规模,但不能取代真机数据

当下的这波热潮是“无本体数采”,即不依赖机器人本体,通过头环、手套等穿戴设备等采集人的动作。

无本体数采比真机遥操作更容易规模化,能够以更低成本覆盖更多任务和场景,行业已经基本解决了“能采”的问题,但从数据可回放、可迁移到真正提升模型能力,仍处于早期阶段。自变量推出QUANXTA Zero无本体数采方案,具备全身移动数采和移动采集数据本体回放能力,数据入库有效率超过85%。

但它无法完全取代真机数据,因为人的身体结构和动作方式与机器人不同,也难以完整呈现机器人执行时的接触、误差和失败。

从技术路线上来看,世界模型也可以减少对单一任务真机示范数据的依赖。VLA更需要语言指令、机器人观察和动作轨迹准确对齐的示范数据;世界模型则更关注动作发生前后的连续状态和事件演化,可以使用真机、无本体、视频以及仿真和合成等不同来源的数据。它真正解决的不只是减少数据量,而是提高数据利用效率,让模型学习可以迁移的物理规律,从而提升跨场景泛化和长程任务能力。

擎朗智能:采集到的只是“原油”,真正的瓶颈是“数据炼油”

真人数据无法完全替代真机数据,两者的关系是互补而非替代。

真人第一视角数据可以高效采集人类完成任务的完整过程,用来训练基座模型、构建场景认知和任务理解能力。但最终要让机器人本体精准执行,还是需要真机数据来做后训练微调——因为真机数据包含了机器人特定本体的运动学特性、关节力矩、力反馈这些真人数据里根本没有的信号。

现在采集数据本身不难,难的是让采集到的数据真正提升模型能力。不是戴个头环拍几小时视频,数据就能直接用。从原始视频到可训练的结构化数据,中间要经过去畸变、姿态估计、深度重建、手物分割、自动标注等一系列处理环节。如果这整套“数据炼油”能力跟不上,采集再多原始数据也只是“原油”,没法变成驱动模型的“燃料”。

仿真到真实的“sim-to-real”鸿沟在服务场景里尤其明显——物理引擎再逼真,也模拟不出真实咖啡机出水口的微妙差异、不同材质杯子表面的摩擦力变化、顾客临时伸手干扰操作轨迹这些真实世界的“意外”。

1

四、感知数据能否补位?

今年最先被规模化讨论的,仍然是视觉数据:第一视角、RGB-D、腕部近场、多视角、IMU 和时间同步。但与此同时,触觉、力觉、滑移、材质、接触反馈这些更贴近物理交互的数据,也开始从供应商侧浮出来。

一目科技:视触觉,把每一次接触变成“物理真值”

视触觉路线是最类人的路线。它不是传统力传感器,而是在柔性材料内部建立光学观测系统,当机器人与物体接触时,用图像捕捉材料的微小形变,再把形变转化成压力、摩擦、滑移、软硬、纹理等物理信号。

Physical AI 不能只靠模型继续变大,真正重要的是机器人能不能持续获得来自现实世界的物理真值。每一次接触,都是机器人认识世界的一次学习;每一次抓取,都会产生新的 Ground Truth。

如果世界模型只看视频,它可以学习画面变化,但不一定知道接触瞬间发生了什么。触觉数据的意义,是把机器人和物体接触时的物理结果,也变成模型能学习的东西。一目科技正在做的TouchNet,就是想把真实接触中的压力、纹理、滑动、材质、力反馈这些数据变成可复用的数据基础设施。

帕西尼:触觉既是机器人的能力,也是模型训练的数据

感知是机器人进入物理世界的第一道关口。帕西尼从触觉传感器起步,业务继续延伸到灵巧手、本体、数据集与模型,希望把感知、决策和执行连成一套完整技术生态。

帕西尼同时在做两条线:机器人端的触觉传感器和灵巧手,以及真人穿戴的数据采集系统,让真人佩戴触觉采集手套完成任务,同步记录触觉、视觉和动作轨迹等多模态信息,以更高效率覆盖真实场景。

比如拿起杯子、拧螺丝、整理衣物,都依赖稳定、可控的接触。在这些精细操作中,触觉已经成为基础能力:它既影响动作能否成功,也能为模型记录接触产生的物理结果。

奥比中光:硬件决定数据质量的起点和上限

今年我们推出 EGO、UMI、WristCam 和 Hub,是希望覆盖真实交互里的关键视角。EGO 主要解决第一视角和环境空间信息采集;WristCam 和UMI更靠近手部及操作区域,用于补充腕部近场观察、遮挡条件下的手-物交互细节;Hub 则负责多设备同步。客户往往不是单独选择某一种设备,而是根据任务、视角和数据模态,把不同设备组合成采集方案。

从客户价值看,客户最终需要的当然不是设备本身,而是能够有效提升模型能力的数据。但“可训练的数据”并不是从采集完成之后才开始形成的。传感器配置、视角设计、深度质量、时间同步和标定精度,都会直接决定后续数据能不能用,以及需要付出多大的清洗和修正成本。

所以客户表面上购买的是硬件和定制服务,实际付费的是一种持续获得高质量、可复用训练数据的能力。硬件不是最终目的,但它决定了数据质量的起点和上限。

目前行业已经基本跨过“能不能采到数据”的第一阶段,正在进入“采什么数据、如何评价数据、哪些数据真正提升模型”的阶段。下一步竞争重点不会只是设备数量或数据总量,而是数据是否具备准确的空间信息、完整的任务链条、稳定的多模态同步,以及能否通过训练结果证明其有效性。

未来的世界模型如果真的要理解物理世界,触觉和力觉不太可能只是控制系统里的边缘信号。它们会变成世界模型的一部分。

在今年人挤人的WRC上,你反而感到具身公司们变得安静了,关于算法的争吵让位给同一件事:采数据。

过去两年,行业习惯把具身智能理解成给大模型装上一副身体:摄像头负责看,关节负责动,灵巧手负责执行,所有人的注意力都放在“大脑”上。

等机器人真的开始进入餐厅、仓库和家庭,身体反过来卡住了大脑。最后几厘米的偏差、接触瞬间的滑移、不同杯子的摩擦力,都无法从语言和互联网视频里直接长出来。身体过去更像模型的输出接口,现在开始成为智能的输入源。

所以,今年展馆里真正的变化,发生在那些最不像“大脑”的地方:头环、腕部相机、触觉手套、灵巧手、遥操作台和数据工厂,在找到终极路线之前,先一条条地把物理世界喂给模型。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

点个爱心,再走 吧