过去两年,机器人登台表演一套完整动作,就被视为技术大突破。如今这套把戏越来越难打动人了——人们开始追问:这机器人到底能干什么?动作是不是提前编好的?真能帮我干活吗?

这种"祛魅"恰恰说明,具身智能行业正处在一个关键转换期:从比拼身体展演,转向比拼谁的大脑更强。甚至可以说,有没有大脑,将是具身智能公司的斩杀线。

打开网易新闻 查看精彩图片

没有大脑,具身智能这个概念会被直接证伪

现在很多炫酷的机器人,背后其实是人类工程师在遥控,动作也是预设的。在预设框架内由AI策略自主执行,已经是行业里比较先进的形态了。但问题是,在人类指令下完成预设动作,不代表机器人能理解环境,更不代表它能在陌生环境中自主完成任务。这样的机器人,只能在工厂、园区、公园等特定场景执行有限任务。

有人会说,现在的工业机器人不是已经在汽车工厂、电子工厂稳定承担焊接、搬运、装配工作了吗?这种场景根本不需要大脑。但如果是这样,具身智能跟传统机器人产业或自动化就没太大区别了。

具身智能这个概念之所以成立,核心在于:机器人到了陌生环境,能自主决策、自主识别、自主行动,把过去的经验迁移到新任务,还能从失败中学习,最终成为真正的通用机器人。没有大脑,这一切都无从谈起。

机器人的智力,还停留在不如一只边牧的水平

看了今年的机器人运动会、机器人马拉松,你可能会觉得机器人进化得太快了——能组队列、能跑飞快、还能拳打老师傅。但可以放心,人形机器人的智力水平,目前还不如一只边牧。

在2025年的机器人世界大会上,一位具身智能公司创始人直言,目前机器人的底层模型普遍采用VLA模型,是相对傻瓜式的架构。卡内基梅隆大学教授、Skild AI联合创始人Deepak Pathak也认为,机器人对物理世界缺乏真实理解。

很多机器人看起来惊艳,实际上只能照本宣科,人类指哪打哪。这恰恰说明大脑是具身智能最有价值的部分——如果这一环做不出来,这一波人形机器人就只能是泡沫。

为什么让机器人长出脑子这么难?三个瓶颈

第一个瓶颈是数据。具身数据必须靠机器人与物理世界交互产生,成本极高。谷歌曾组织16人团队,花了17个月,投入上千万美元,只采集了23万条真机轨迹。

第二个瓶颈是封闭。如此珍贵且稀缺的数据,各家公司好不容易积累起来,肯定不愿意共享。数据封闭成为具身智能的关键瓶颈。

第三个瓶颈是仿真。既然真实数据稀缺,有些企业选择仿真路线,但在虚拟世界训练出来的模型,到了真实世界就会遭遇sim-to-real的鸿沟。于是出现了世界模型这个方向,希望解决仿真问题。但世界模型目前还只是构想,没有明确的、可实现的工程突破。

修一座数据的藏经阁:真机数据派

既然数据是机器人智力的瓶颈,谁家数据多,谁就拥有了一座巨大的藏经阁,可以让自家产品在里面自我修炼。修数据藏经阁,就是企业打造大脑的基础设施。

2025年1月,智元第1000台通用具身机器人量产下线。这些机器人既是产品,也是数据采集器,逐步形成了一个专有数据集AgiBot World,包含超过100万条真机轨迹、217个任务、5大部署场景,比此前任何公开数据集都大一个数量级。有数据显示,在这套数据集上预训练的策略,平均表现比在谷歌牵头的跨本体数据集OXE上高出30%。

真机数据采集的护城河很深,但代价也大:数据得一条一条采,每次场景迁移都得重新采集,扩张曲线是线性的,无法指数级增长。这是一笔重资产,智元正在一步步积累。

另辟蹊径:合成数据派的"三年模拟"

也有人选择另一条路解决数据规模不足的问题。银河通用决定把合成数据搬进机器人的藏经阁。

合成数据真能达到真机数据的效果吗?2023年,银河通用团队的DexGraspNet,就是完全在仿真中构建的大规模灵巧手抓取数据集。到2025年,他们更进一步构建了具有十亿级仿真抓取数据的SynGrasp-1B,GraspVLA就基于这一数据集训练,抓取成功率98.3%,实现了零样本泛化。

银河通用在这条路上走了很多年。他们的发现是:具身智能所依靠的数据,99%可以借助高质量合成数据完成,只有在合成数据无法处理时,才需要采集那1%的真实数据。

举个例子,在零售场景中,让机器人按顺序抓取货架上的矿泉水,先通过百亿级别的合成仿真数据完成预训练,然后只需一个人一天的真机数据即可完成微调。合成数据的边际成本趋近于零,这种成本结构对中小型具身智能企业非常有吸引力。

打个比方:真机数据像是历年的高考真题,让机器人经历真实考试;合成数据像是名师出的《三年模拟》,可以让机器人大规模刷题。当然,高质量的模拟题也不是谁都能出的——合成数据需要很好的图形学、物理仿真、物理渲染和自动动作合成管线,并不断校准仿真与现实之间的差距,这些都需要长期积累。

架构派:不靠数据量,靠设计巧劲

在全球具身智能赛道上,Physical Intelligence是大脑派的极端样本——不造机器人本体,只专注模型本身。PI提出了一个发现:或许不需要依靠很多数据,通过架构层面的设计,再结合在线强化学习迭代,一样可以让机器人连续工作几个小时。

这就像降龙十八掌,通过一套动作的衔接与设计叠加起来,发挥出比实际内力更强大的作用。如果架构设计好了,大脑需要的数据比想象中少得多。

但设计一个好的架构并不容易。以星海图为例,研究团队来自Waymo、Momenta等自动驾驶厂商,在AI算法架构设计上独善战场。2025年开源了G0,采用双系统VLA设计,其中System 1用扩散模型学细粒度动作执行,System 2是VLM,负责高层多模态规划,这一系统曾一度是行业主流。

然而到了2026年,星海图G0.5的架构发生巨大转变:放弃双系统的分离式设计,选择将具身推理和控制统一到单个自回归序列中,单个模型在统一token流中完成推理、规划和行动。这样做的好处是让语言模型直接说出动作,推理与行动一口气完成,机器人的动作表现就能完整继承大语言模型的scaling law,有望进一步增强物理智能。

另一条路线:让语义知识流进动作生成

除了星海图的路线,行业内还有其他方向的探索。智元提出的ViLLA架构,通过引入"隐式动作标记"(latent action tokens)这个中间表示,让VLM的语义知识能流进动作生成——模型先在语义空间理解要做什么,再在潜空间翻译成怎么做,最后落到具体关节控制。人类视频、不同机器人的异构数据,全都可以喂给中间层学习。

这个方法的效果也比较好。首个基于ViLLA架构的通用具身基座大模型GO-1,在"倒水""补货"等需要指令理解与位置泛化的任务上,成功率明显优于RDT和π0模型。

目前机器人大脑的架构路线还远没有定型。不过,至少共识已经明确了:无论是现实世界的真题,还是仿真世界的模拟题,都是机器人大脑不断进化的藏经阁。唯有在大量任务、交互、失败和反馈中,机器人才能走向真正的智能化。而谁能率先把大脑做实,谁就能跨过这条斩杀线。