编辑|+0
今年的 WRC,比往年更热闹。
从展馆里密集出现的人形机器人,到各家不断刷新的模型、操作与运动能力,几乎每走几步,都能看到新的机器人形态和能力展示。具身智能的热度,直接铺满了整个展馆。
8 月 19 日,在银河通用举办的「具身智能大模型的进化之路:从技术分级到产业落地」论坛现场,一台此前没有公开亮相过的双足人形机器人先走到了台前。
这是银河通用首次发布的人形双足机器人Galbot ET1。登场后,ET1 先完成了一段节奏感十足的舞蹈,转身、摆臂、身体律动一气呵成,随后又与曾登上春晚、展示盘核桃的机器人「小盖」同台互动。
到了 2026 年,机器人会跳舞已经不稀奇。过去两年,它们学会了翻跟头、拳击、踢足球、做家务,有些动作甚至比人类还熟练。
但真正进入现实世界,难点不是「做出一个动作」,而是在物体移动、目标遮挡、任务被打断等情况下,机器人还能否及时调整,并继续完成任务。
从 VLA、世界模型到 WAM,模型范式不断变化,但最终要解决的仍是同一个问题:机器人能否在动态环境中持续、稳定地执行任务。
这也成为此次论坛,以及银河通用 C104 展台展示的一条主线。
先从刚刚登场的 ET1 说起。
新双足亮相,重点不只是两条腿
刚刚登场的 ET1,首先带出了一个问题:当机器人的身体发生变化,原有的智能能力还能保留多少?
ET1 与此前已经公开的 G1、S1,在本体形态上差别明显。但几类机器人背后有一条共同的技术主线——都围绕银河通用自研的全身全手端到端具身大模型AstraBrain展开。
所谓跨本体,就是让已经获得的智能能力尽可能迁移到不同机器人上,而不是每更换一种硬件形态都从头训练。
银河通用创始人兼 CTO、北京大学研究员王鹤在讲解技术框架时提到,人形机器人的「通用」还不只是把一颗大脑迁移到不同身体上。更完整的结构是「大脑—脑桥—小脑」:高层的大脑负责感知、认知与行动决策,小脑负责把人或大脑给出的意图转化成连续、稳定的全身运动,中间再通过「脑桥」把两者连接起来。
到了 ET1 上,首先落地的是 AstraBrain-WBC,也就是银河星脑的「通用小脑」。王鹤介绍,此前展示的 AstraBrain-WBC 0.5 已经可以向训练中没有见过的动作泛化,而 ET1 使用的是进一步迭代的 AstraBrain-WBC 1.0。它解决的主要问题,是在接收到新的运动意图后,如何将其稳定映射为机器人的全身动作。
ET1 搭载了银河通用全自研的AstraBrain-Agent,主要负责其中的「理解与决策」。这套面向人形机器人实时多模态交互和运动控制的智能体,需要让机器人持续观察周围环境、理解自然语言,并根据当下的环境和指令动态规划自己的行为和动作。
王鹤把 ET1 的能力概括成三个词:I See.I Learn.I Act。机器人能够在真实场景中调用移动、多模态交互和语言交互,并根据任务形成行动方案。
另外,这位「新同事」还展示了一项特别技能:实时学习人的新动作。
现场演示中,ET1 可以自主识别、提取人类的实时运动轨迹,再把这些轨迹转化为自己的全身动作。像手撑地等高难度街舞动作,也可以在运控模型和实时学习能力的配合下完成。
这对应着人形机器人进入开放环境后绕不开的问题:不可能事先把所有运动技能逐一写进模型,机器人能不能从看到的人类行为里继续获得新的运动能力?
如果说高层模型负责判断机器人「接下来做什么」,小脑解决的是「身体具体怎么动」。王鹤将其称为「小脑范式」:接收来自人或机器人大脑的运动意图,并转化为实时的全身动作。
在 AstraBrain-WBC 展示中,人类通过动捕设备连续输入全身运动,用于测试模型的实时跟踪、动作精度、稳定性和泛化能力。AstraBrain-WBC 0.5 已经开始向训练中未见的动作泛化。
王鹤还提到,AstraBrain-WBC 的训练使用了大规模人类动作数据。团队观察到,随着数据规模增加,关节追踪误差持续下降。也就是说,全身运动控制同样沿着基础模型的 Scaling 路径继续提升。
无论是大脑还是小脑,模型能力都依赖数据。
王鹤在演讲中介绍了银河通用的五层数据体系 AstraData(银河星数),包括互联网数据、人类动作数据、合成仿真数据、真机遥操数据和真机回流数据。
不同数据承担不同作用:互联网和人类视频提供语义与操作先验;合成仿真数据用于扩大训练规模;真机遥操数据提供真实机器人上的高精度轨迹;部署后的真机数据则继续回流,用于后续训练和迭代。
针对 ET1 的运动控制,王鹤提到,其训练数据中包括高精度动捕数据,以及从互联网人类视频中重定向得到的动作数据。
当任务从动作复现进一步进入高速、持续变化的环境,难度还会继续上升。ET1 也在学习网球这样的复杂运动技能。
与搬箱子、拿商品不同,网球几乎不给机器人留下充裕的计算时间。球的位置、速度和落点不断变化,机器人既要判断轨迹,也要协调全身动作,并控制挥拍时机。这要求感知、决策与运动控制在极短时间内连续完成。
王鹤将网球作为人形机器人「AlphaGo 时刻」的代表任务之一。其关注点不仅是运动控制,还包括实时决策,以及仿真中学习到的能力能否通过 Sim-to-Real 迁移到真实机器人上。
王鹤还在现场预告,8 月 22 日晚 7 点半,银河通用的人形机器人将在世界人形机器人运动会开幕式进行人机混双表演,并与网球界嘉宾互动,届时将进行直播。大家可以期待一下。
同一颗星脑,在不同现场干活
来到 C104 展台,模型、泛化和产业落地,很快变成了一件件具体的事。
G1 在家庭和零售场景里工作,S1 负责重载搬运,另一边还有迎宾和二次开发展示。几台机器人形态不同,面对的任务也不同。
王鹤在演讲中介绍,跨场景、跨本体和多任务能力主要对应 AstraBrain-WAM0.5。
WAM,即世界动作模型。按照王鹤的解释,VLA 训练依赖 Action Label;世界模型可以预测未来状态,但并不直接给出机器人动作。WAM 尝试将未来状态建模与动作生成结合起来。
AstraBrain WAM0.5 在隐空间中建模未来,而不是直接生成完整的未来 RGB 图像,以减少光照、纹理等与操作关系较弱的信息干扰。
这套模型已经用于不同场景、不同本体和多种任务,包括商超上下货、叠衣服和搬箱等。
先看家庭场景。
G1 要完成物品归置、洗衣晾衣、床上叠衣等连续操作。面对积木、钥匙串、玩偶、水果等不同物体,它需要根据物理属性调整抓取方式;到了衣物、床品等柔性物体面前,又要找到衣领、袖口和下摆,完成展开、对齐和折叠。
不同刚性、柔性物体的状态会随着操作不断变化,因此机器人需要持续更新感知,并据此调整抓取和后续动作。
另一项早餐制作任务,则把长程执行和抗干扰放到了同一个场景里。
G1 需要连续完成烤面包、倒饮料等操作;过程中,如果有人移动面包、拿走杯子、遮挡目标,或者改变盘子等物体的位置,机器人需要重新识别当前状态、调整后续动作,并继续完成任务。
王鹤介绍,这类能力来自 WAM 基模与真机强化学习的结合,并进一步向 10 分钟级连续早餐任务扩展,包括切水果、做三明治、烤面包和倒水等步骤。
到了零售区,变量从家庭中的动态物体,变成了更复杂的货架环境。
面对密集排布的商品,G1 要完成识别、取物、配送和交付。面对商品位置变化和遮挡,G1 需要实时识别目标并调整取物策略,而不是依赖固定货架布局。
零售也已经不只是展台里的演示。
银河通用的智慧药房解决方案已经进入多个城市的即时零售仓,「银河太空舱」也已在多个城市部署。相比一次性的 Demo,长期、重复运行的真实环境提出了更直接的要求:模型不仅要把任务做出来,还要持续稳定地工作。
工业区则换了一套要求。
S1 现场完成的是公斤级物料拆垛、搬运和码垛。到了工厂,问题不只是「能不能拿起来」,还包括能否稳定搬运重物、准确放置、长期保持效率和精度,以及物料状态变化后是否需要重新调试。
相比高度标准化的传统自动化场景,具身智能更多面对的是物料位置变化、任务切换和现场条件变化等问题。
目前,S1 已经在宁德时代产线进入 7×24 小时常态化运行。
从展台演示走到产线持续工作,跨越的正是「模型能力」与「产业能力」之间的距离。
把几个场景放在一起看,长程、多任务、柔性操作和抗干扰对应的都是实际运行中的具体要求:任务能否持续完成,环境变化后能否调整,以及是否需要人工频繁介入。
这些自主任务展示的重点,是机器人根据实时环境状态完成感知、决策和执行。
到了二次开发区,问题进一步转向这些能力能否被更多开发者使用。现场,北汽鹏龙行基于 Galbot 平台开发的 4S 店迎宾、导购等应用也进行了展示。
对银河通用来说,模型能否跨任务是一方面,开发和部署能力能否由产业伙伴继续使用,同样关系到通用能力能否规模化复制。英伟达、宁德时代等科技和产业伙伴也已经参与到这套开发生态中。
具身智能,需要一套新的「能力标尺」
从 ET1 到 C104 展台,机器人展示出的能力越来越多:跨本体迁移、实时交互、全身运动,以及在动态环境中持续完成任务。
但能力变多之后,一个更基础的问题也随之出现:我们究竟该如何判断一台机器人「智能到了什么程度」?
这也是银河通用此次 WRC 论坛「具身智能大模型的进化之路:从技术分级到产业落地」试图讨论的问题。
今年谈具身智能,VLA、世界模型、WAM 已经不是陌生词。比起再解释这些名词,相信大家都更关心下面这个问题:它们究竟把机器人的能力拓展了多少,又离真正进入产业还有多远?
银河通用的这场论坛中,讨论的重点也落在两个问题上:具身智能的技术能力接下来怎么分级、怎么继续往前走;以及这些能力又要到什么时候,才足以支撑真实的产业应用。
论坛的五场主旨演讲,从不同角度回应了这些问题。
来自机器人学、人工智能、认知机器人以及产业研究领域的学者,分别从多模态与端到端机器人学习、世界模型与机器人数据、技术成熟度与产业化、类脑与认知机器人、通用世界模型等方向展开讨论。不同演讲所采用的技术视角和研究路径并不相同,也反映出当前具身智能仍处在多种技术路线并行探索的阶段。
也正因如此,如何评价能力的进展,开始成为一个基础问题。
论坛现场发布的《全球具身智能大模型研究报告》,梳理了全球具身智能大模型的主要技术路线和模型演进,并提出具身大模型评价体系框架。这套框架从数据基建、端到端能力、通用能力和部署能力四个层面展开,并进一步提出 L1-L5 分级,用来衡量模型从单项能力到多场景、多任务、持续学习和自主闭环的发展水平。
另一项发布成果——财新数据「具身智能长期价值指数」,则进一步把观察维度延伸到产业端,从智能边界、数据基座、模型架构等维度考察企业,关注技术能力如何转化为长期产业价值。
论坛最后的圆桌讨论,再次回到「进化路径与技术挑战」:从 VLA 到世界动作模型,模型如何进一步进入物理世界?实验室中的进展距离真实场景还有多远?从技术分级到产业落地,中间还缺哪些环节?
更重要的是,它能否完成更长的任务链,应对持续变化的环境,迁移到不同机器人本体,并在这些条件下保持足够稳定的表现。
模型名称和技术范式还会持续变化,但从技术研发走向产业应用,仍需要一套相对清晰的能力评价体系,来判断技术所处的位置,以及下一步需要解决的问题。
结语
AI 行业有一个很明显的特点:很多东西还没来得及成为常识,下一轮变化已经开始了。具身智能尤其如此。
过去几年里,新的模型架构、训练方法和技术名词不断出现。端到端、Agent、VLA、世界模型……每隔一段时间,行业讨论的关键词都会变。机器人的形态也没有定论,轮式、双足、四足,甚至是否一定要做人形,都有人给出不同答案。
但从这次论坛和展台展示来看,一个相对明确的方向是:模型能力正在从单项任务走向跨任务、跨本体和动态环境中的持续执行。与此同时,如何降低场景适配和部署成本,也开始成为与模型能力同样重要的问题。
当这些能力能够在不同机器人和不同场景之间稳定复用,具身智能才可能从技术展示进一步走向规模化应用。
到那时,一个长期困扰具身智能行业的问题,也可能真正开始有答案:今天投入的大量研发,究竟什么时候,才能变成可以规模化复制、真正算得过账的生产力?
热门跟贴