今年的世界机器人大会(WRC),行业谈论机器人的方式变了。去年,讨论还大量集中在本体和全身运动控制上;今年,"大脑"和大模型成了绝对的主角。
转变有现实背景。今年 4 月,第二届北京亦庄人形机器人半程马拉松开跑,参赛规模较首届扩容近 5 倍、超过百支赛队,具备自主导航能力的选手占到近四成——而一年前同一条赛道上,陪跑、换电、中途摔倒还是赛场上的常见画面。
运动控制的进步肉眼可见;但越来越会"动",离真正会"干活"仍有一段距离——到了产线和家庭,问题很快从跑得稳不稳,变成能不能抓取、放置、使用工具。正是这块短板,把行业注意力推向了模型。
机器人需要大模型,已是共识;这个模型究竟应该是什么,分歧才刚刚开始。8 月 20 日,自变量创始人兼 CEO 王潜在本届大会发表主题演讲《构建物理世界基础模型》,系统给出了自己的答案。
▍物理世界需要自己的基础模型
目前在业内,主流路线是 VLA——把动作模块接在现成的多模态模型上,数据底子还是互联网那套图文视频。这条路能不能走通,取决于一个隐含前提:物理世界的智能,可以从数字世界的数据里长出来。
对这个前提,自变量有不同的判断。它的方案是为物理世界单独造一个基础模型,平行于语言模型和多模态模型。在王潜看来,迁移这条路自己和整个社区都尝试过很多次,效果始终不太好。
迁移失效的根源,在于动作模态的特殊性。尽管行业习惯把 action 与 vision、language 并列讨论,三者的可互通性却差别很大:视觉和语言之间或多或少还能互相转换,动作在维度和表征性质上则与两者存在本质差异。
王潜举了一个直观的例子:两瓶矿泉水,从视觉上看只差几个像素,但其中一瓶被扎了小孔,机器人把它们翻过来,一个会漏水、一个不会。几个像素的差别背后,是接触、受力、物体状态以及动作后果的一整套物理推理。
这类知识的获取难度,从一个现状就能看出来:到今天为止,即使是最简单的通用抓取(general grasping),仍然是精细操作里相对困难的一件事。
按照这一判断,互联网视频对这类行为的描述质量很差;即便是一度被寄予厚望、由不同形态机器人采集的异构数据,对物理过程的表述也不够理想,只是比视频强得多。结论因此指向一个方向:更多去做预训练,并且依赖真实的物理接触数据。
认知层面还有一组脑科学的旁证。王潜常用一个类比:造飞机不必复制鸟的扑翼,但人身上观察到的东西,有助于厘清智能的本质。人脑中负责精细操作的脑区规模非常大,与语言、高级思维所需的脑区面积相当,而且是进化上最后出现的最高级脑区。
人类能从动物中脱颖而出,靠的是两样东西:使用工具和使用语言。这恰好说明了问题的本质——使用工具所需的精细操作,复杂度和语言处在同一水平;把它当作语言模型的下游任务附带解决,是低估了问题。
这套模型的目标形态也不止于输出动作。它更接近某种意义上的大统一模型:视觉、语言、动作等模态都能输入;输出侧除了动作生成,还要能产生视频、语言、三维重建的结果,甚至注意力热图等其他表征。
逻辑在于,动作模态过于特殊,无法直接与其他模态建立桥梁,只能把所有任务放进同一个模型,让它学到跨模态、跨任务的通识,无论逻辑还是物理规律。真正的全模态,多模态进、多模态出。
▍为什么必须是端到端
精细操作的难,首先难在问题的形状。真实物理接触中包含大量极度复杂的物理过程,当这些过程撞上巨大的解空间和参数空间,复杂度会爆炸式膨胀。
AI 领域的历史经验指向同一个方向:越是发散、解空间越大的问题,完全端到端的模型表现越好——语言模型走过的路就是先例。
这个判断还有一层生物学依据。人脑所有脑区中,唯独负责手部精细操作的最高级皮层,拥有直达脊髓的跨层直连;负责全身运动控制、负责语言的脑区,走的都是逐层向下控制的结构。大自然的设计本身就是端到端的:最高级皮层直接控制最低级运动,这不光是工程上的最佳实践,也是自然演化的结果。
选择端到端,也就绕开了另一条路线。"感知—规划—控制"的分层方案工程上更可控、责任边界更清晰,至今仍是不少机器人公司的主流选择;端到端方案的通用性上限更高,代价是对数据和训练的要求也高得多。
行业围绕两条路线的探索已持续数年,各有拥趸。自变量把重心放在端到端一侧,等于主动扛起更高的训练门槛——其在数据和 Infra 上的重投入,正是这条逻辑链的下游环节。
▍水面之下:数据、Infra 与组织管理
路线选定之后,问题就落到了成本上。王潜有一个冰山划分:外界看到的模型只是水面上的部分,水面下的部分重得多——主要是数据和 Infra,还有组织管理。
今年行业的一个明显变化是,数据的重要性被提到了前所未有的高度。王潜多年来一直主张数据的重要性高于模型,这一观点到今年才被行业普遍接受。但对于"数据是石油"的流行比喻,他公开表示异议。
石油是大宗商品、是原材料,标准化、不需要复杂处理,开采出来就是开采出来了。机器人数据则更接近一件工业品——从怎么定义数据,到怎么采集、怎么判别、怎么处理,再到反过来用模型表现优化前面的环节,每一步都有大量工作。
按照自变量的实践,做好一个数据的复杂程度比做好一个模型更高,甚至与从电机、从原材料开始搭建一个机器人集群相当;最终能训进模型的数据,其链路长度可能不比机器人本体或模型本身低,甚至高得多。
这一判断解释了行业里一个普遍却少被明说的现象:不少公司收了很多数据,收完发现没什么用处。如果对数据的工业品属性缺乏充分认识,浪费几乎必然发生。
自变量的解法是重资产投入。2024 年初这家公司建立了全国第一个数采工厂;一直到今年初,数据都完全自己采、自己用、自己投钱。当规模扩张到一定程度,才转向极大程度依赖合作伙伴、共建产业生态——理由是整个行业要发展得好,其中每一个个体才能发展得更好。
水面之下的另一块是AI Infra。这个概念在语言模型领域已被充分理解——DeepSeek 的效率优势是行业熟知的案例——但在具身领域还普遍没被提上议事日程。
模型规模与数据量的增长会很快把行业带到语言模型训练的同等水平,而具身模型的 Infra 不比语言模型简单,甚至更难:具身训练必然涉及大规模机器人集群,不管强化学习还是 SFT、预训练,都要和硬件打交道,硬件的性质带来了通信、时钟同步、训练稳定性上的一系列特殊问题。
这方面自变量已积累了不少工作,也明确表达了向行业社区和商业合作伙伴提供这类服务的意愿。
▍开源的底气
最具代表性的动作,是 Muon 优化器分布式实现的开源。Muon 是当前深度学习中表现最好的优化器之一,但此前通信带宽比经典的 AdamW 高约 50%;自变量通过分布式优化抹掉了这部分额外开销,同时获得约 30% 的收敛速度增益。
这也是少数从具身领域反向输出给整个 AI 行业的基础设施,下一个版本的语言模型,有可能就训练自这个优化器。
敢把这样的东西拿出来共享,前提是身位够稳。自变量对行业格局的判断是:去年此时业界还在讨论美国是否在模型上领先一点;到今年,中美具身模型已基本齐头并进,或在某些方面各有高低。
身位不同,开源的功能也随之改变。语言模型时代,中国公司靠开源争夺身位;而在具身领域,中国已经处于领先水平——开源不再是竞争武器,而是给产业提速的工具:一方面培养人才,一方面让基础设施在开源基础上获得提升。
自变量拿出的清单相当彻底:VLA 模型 WALL-OSS,开源时是唯一一个不经后训练、只靠预训练就能完成零样本任务的模型;世界模型 WALL-WM,被视为未来重要的发展方向;还有部分 Infra 和数据,从模型参数、训练部署到基础设施都在其内。
至于动机,自变量归于两点:一是不为商业利益,希望产业更快一点;二是发挥市场的作用——把别的公司会藏起来的东西无偿拿出来,因为只靠自己很难做到。
以开源换生态,在语言模型领域已有先例可循。能否在具身领域复现,取决于两件事:开源模型本身的技术水位是否足够领先,以及围绕它的数据和工具链能否形成正循环。从清单的构成看,自变量押的是后者。
▍具身 ChatGPT 时刻还有多远
市场对具身智能的预期一直在两个极端之间摇摆:去年流行的疑问是"是不是一年之内就能进家庭",今年又悲观到"可能还要五到十年"。
王潜给出的参照系是语言模型的历史:具身智能正走在语言模型大约五年前走过的路上。迹象相当具体:模型能获得很好的规模化效果,few-shot、zero-shot 等涌现迹象逐渐出现;公开演示中的所有任务都是零样本完成——此前没有给过任何训练,第一次见就能做。
至于"这条技术路线是否根本达不到、还需要本质变化"的旧疑问,他的回答是方向已被证明正确,沿着走就能以非常高的确定性达到物理世界的 AGI。
更能支撑这个判断的是落地数据。自变量披露,这套方案已在真实工业产线运行,ROI 达到或超过人类水平。在此之前,具身智能在生产力场景里的价值始终没有被真正证明,应用更多集中在提供情绪价值的场景,或上一代机器人就能完成的任务。这次落地被视为一个重要的里程碑:第一次在真实工业场景里,跑通了上一代机器人完全做不了的任务。
还有一组对比数字:这个场景从数据采集、模型训练到生产部署,全链条只用了大概三个月;做同类场景的海外同行,可能用了两年半。通常三个月连工程部署都不够,这一速度被归结为基础模型的泛化能力——在"沿途下蛋"的场景里,基础模型比专用模型、专家工程和单点方案效果更好、成本更低、速度更快。
家庭 C 端场景同理:通用模型是必选项,进展很大程度上得益于整套方法论的闭环——基础模型,加上模型、数据、Infra 到硬件的彻底打通。
至于时间表,他的判断是绝对用不着等五到十年。机器人可能会在千行百业、千家万户广泛应用,甚至基本替代人类的体力劳动。最后也希望自变量的一些工作能加快这个更美好世界的来临。
✦精选活动✦
地表最酷的科创大会——S创上海2026,有新专属免费通道现已开启
9月22日—23日上海·徐汇西岸艺术中心A馆
15,000+专业观众、来自60+国家与地区的创新力量齐聚现场。大咖分享、创业路演、全球科技展览,带你进入创新正在发生的地方。
扫描海报二维码,领取媒体专属免费门票。9月,一起 Be in the Game!
✦精选内容✦
热门跟贴