编辑|张倩、杨文

2026 世界人形机器人运动会,最会「上班」的机器人赢了。

首次参赛,智元拿下 18 金 16 银 12 铜,以 46 枚奖牌总数收官。根据赛事组委会公布的榜单,智元的金牌数和奖牌总数均位列第一。

打开网易新闻 查看精彩图片

本次运动会共设 51 个赛项,分为竞技赛、灵巧手专项赛和场景赛三大板块,几乎覆盖人形机器人的主要能力维度。

其中,智元 OmniHand 在灵巧手专项 8 个赛事拿下 7 金,精灵 G2 在酒店、室内应急、图书馆等 12 个作业场景赛中收入 6 金,远征 A3 在舞蹈、武术、乒乓等竞技项目中夺得 5 金,灵犀 X2 则在田径 100 米障碍赛斩获金牌,400 米障碍赛再添银铜。

单项成绩能够体现某个动作或某类任务的能力,总榜则考验综合实力。机器人要在精细操作、场景作业、高动态运动等多个项目中持续拿分,任何明显的能力短板都会影响最终排名。智元同时登顶金牌榜和奖牌总数榜,说明其优势覆盖多个能力维度,也让这份成绩具备更强的综合参考价值。

此外,智元派出的参赛机型全部为量产版本,没有针对比赛单独打造定制本体

专用样机可以围绕特定规则调整硬件设计,量产产品还要兼顾成本、可靠性、维护效率和批量一致性,无法单纯为某个项目追求极限参数。因此,量产机在公开赛场取得的成绩,更接近产品在现实条件下可以达到的能力边界。

加之本届运动会专门设置了多个直接取自真实工作场景的赛项,量产机型在真实场景赛事中持续胜出,这场比赛更像一次公开的部署能力压力测试。

这场运动会更像是一次上岗考试

在三大板块中,场景赛与人形机器人的商业落地距离最近。

参赛机器人须在 20 至 30 分钟内按序完成多个作业环节,某个环节未达标便无法得分,也不能直接跳到下一项。任务链越长,感知误差、抓取失败和定位偏差越容易累积。

酒店赛中,智元精灵 G2 采用自主方案,要连续完成行李搬运、客房补货和房间整理。过程中,它还要穿过窄门和狭窄过道,准确识别门把手、电梯按钮等小型目标,不同酒店的物体外观和摆放位置各不相同,现场光线和人员走动,也会持续干扰感知结果。

打开网易新闻 查看精彩图片

智元用 GO 系列大模型增强视觉特征提取,并融合 RGB 与深度信息,帮助机器人判断目标的位置和姿态。系统还会加入空间约束,降低环境变化对后续决策的影响。识别、导航和操作连续衔接,机器人才能在复杂室内环境中稳定推进任务。

园林赛是纯室外自主赛道。精灵 G2 需要自主完成违禁品识别、不文明行为巡检和垃圾拾取,三项任务串联执行。光照、天气和地面干湿都会改变感知条件,复杂地形还会考验底盘通过性与运动控制。

打开网易新闻 查看精彩图片

长时间室外运行要求机械结构、传感器、电池和通信持续稳定,智元通过 Genie Agent 规划整条任务链,并针对不同时段、晴阴雨天气和干湿地面开展覆盖测试。正式比赛只有一次执行机会,最终比拼的是整套系统能否在不断变化的环境中稳定交付。

所有作业最终都要落到「手」上。OmniHand 以同一款量产产品进入 8 个专项赛决赛,拿下 7 金。积木搭建、粉末称重、镊子夹豆、开瓶撬盖等项目,分别考验精细夹取、稳定施力、工具使用和双手协同。

以粉末称重为例,机器人需要自主找到勺子和盐罐,将粉末逐步加入电子秤,最终称出 20 克,误差不能超过 0.5 克。武大智元联合队用时 27 秒完成任务。

OmniHand 有 3 个项目以全自主方式夺金,说明同一套硬件能够适配多种任务。

打开网易新闻 查看精彩图片

远征 A3 和灵犀 X2 把考验从双手扩展到全身。

远征 A3 在太极拳、国标舞等项目中,需连续完成腾空、转体、单腿支撑和低重心姿态切换,动作幅度大,节奏变化快,对全身协调控制要求极高。

打开网易新闻 查看精彩图片

乒乓球项目更进一步引入高速视觉感知与实时响应,机器人需在极短时间内判断球的速度与轨迹,随即完成移动与挥拍。

打开网易新闻 查看精彩图片

远征 A3 与丁宁、李昀锐打乒乓球

灵犀 X2 参加的 100 米障碍赛中,台阶、窄通道和起伏路面接连出现,机器人一边保持高速移动,一边识别地形并调整步态。重心一偏移,就可能导致减速、碰撞或摔倒。

打开网易新闻 查看精彩图片

有的项目甚至还要机器人匍匐前进。

打开网易新闻 查看精彩图片

这场运动会把机器人的能力变成了一项项具体工作,能够连续、稳定地做完,才更接近真实上岗,由此可见智元双榜登顶的含金量。

长脑子、全身协调,智元的奖牌是这么来的

如果把这次运动会的项目摊开来看,会发现智元拿到的这些奖牌,分布得相当散,而且项目之间差别很大,非常考验机器人的综合素质。有些全自主完成的项目还考验「泛化」能力。

就说图书馆理书。书架是主办方临时摆的,书怎么放,赛前没人告诉机器人,连现场的光照都跟训练时不一样。机器人到了书架跟前,得自己看,自己想办法。也就是说,得长脑子。这恰好是智元投入最重的地方。

打开网易新闻 查看精彩图片

智元的技术架构叫「三智一体」,也就是一个本体,承载三种智能 —— 运动智能算小脑,管走稳跑快;交互智能管人机交流,负责理解人与环境;真正管干活的是作业智能,从理解任务到动手执行,中间全归它。

三个智能里,作业智能是智元投入最狠的一块,人力和钱都给得最多,磨的时间也最长。所以智元这次拿那么多「干活」相关的奖牌丝毫不令人意外。

这套作业智能系统里有三个核心模型,学名叫GO、GE 和 RW-RL。拆开来看,它们分别负责三件事:

  • 第一件是理解。具身基座大模型 GO 负责「看懂题」:比如接到「整理客房」这种指令,它知道这意味着先找到散落的物品,再判断每样东西该归置到哪,最后排出一个合理的动手顺序。
  • 第二件是推演。世界模型 GE 相当于装在脑子里的模拟器,动作还没做,先在「脑海」里推算后果。这一把抓下去,瓶子是稳还是倒,心里先有数。
  • 第三件是手感。大规模分布式真机强化学习 RW-RL,让机器人在真实世界里反复练习,把「看着会做」练成「出手就成」。

三件事合起来,换来一个关键能力:泛化。在酒店场景学会的整理,换到图书馆不用从头再学。在精灵 G2 身上练出的技能,换个本体也能迁移过去。这也解释了为什么智元敢拿量产机直接上赛场,全凭大脑的通用性。

当然,知道要干什么之后,机器人还得真正把身体控制住,这是运动智能的事。远征 A3 打太极、跳国标舞,腾空、大角度转体、单腿支撑,非常考验重心、躯干、四肢之间的实时协调。A3 能做到毫秒级的全身姿态调整,腾空过程中随时校准躯干和四肢的角度,动态调节重心。这些动作也没法全靠真机一遍遍摔出来,所以 A3 走了 Sim2Real 的路子,先在仿真环境里大量学习,再把练出来的运动能力迁移到真机身上。

灵犀 X2 又把这个逻辑往前推了一步:从感知自己的身体,到看着环境运动。现在多数运控方案只靠关节本体感知,机器人知道自己的腿在哪,却不知道前面有什么。X2 在障碍赛里加上了视觉,靠自研的 AGILE 生成式通用小脑引擎,一边看不规则的障碍,一边实时决定怎么过,不同地形上都能自主或半自主决策。过去的运控是把一个动作练熟,现在则是一边感知环境,一边实时生成和调整运动策略。

大脑和小脑到位了,还差最后一关:手。机器人再聪明,真正干活的时候,智能都得通过手和物理世界发生接触。粉末称重、开瓶撬盖、拆箱、搭积木,难就难在它们远不是「把手移动到坐标 X」那么简单。碰没碰到,力气大了还是小了,有没有滑动,要不要临时调整,都得在抓取过程中随时感知、随时反应。OmniHand 的 DUET 架构就是干这个的:外层管位置和姿态,内层管触觉,两层配合,才撑得起这么多项目的顺利操作。

打开网易新闻 查看精彩图片

到这里,可以把这几块放在一起看了。大脑、小脑、手,单拎出来,行业里都能找到做得不错的公司。难的是连同身体在内,全都攥在同一家公司手里,还得长在一起:模型清楚这具身体能做到什么、做不到什么,本体设计也知道该给智能留多少余地,迭代的时候一起往前走。所谓协同进化,说的就是这个状态。拆开做也不是不行,但各部分之间配合起来肯定要打点折扣。

这正是「炫技」和「干活」之间的那道坎。赢一两个项目,靠单点突破就行。一口气拿那么多赛项的奖牌,只能靠一整套深度融合的完整技术栈。这也是智元这家公司让人印象深刻的地方。

机器人真正难的是没有明显短板

刷多了社交媒体上的机器人视频,很容易留下一个印象:人形机器人的竞争,比的就是谁的动作更难、更炫。

但机器人这门学问真正麻烦的地方在于,它很难靠一个单点能力走向实用。最近,UC Berkeley 教授、Physical Intelligence 联合创始人 Sergey Levine 在一次访谈里提到,机器人学和语言模型、视觉模型最大的不同,是它首先是一门「构建超复杂综合系统」的学科:从最底层的机身、能源、执行器,一路到感知、控制和高层决策,所有软硬件拼图都得完整,缺了哪一块,到了真实世界里都会露馅。

打开网易新闻 查看精彩图片

这正好提供了一种重新看这场比赛的方式。

智元的奖牌没有集中在某一种能力上。它们散在灵巧操作、全身运动、场景作业这些完全不同的项目里。

这种「散」,反而更有看头。因为它考的是一家公司能不能同时把本体、控制、感知、手、软件工程、量产可靠性等一大堆东西做到没有明显短板。

过去几年,人形机器人最容易出圈的,往往是一个惊人的动作。可等产品真走出实验室,竞争会越来越不像单项赛,而是比拼谁能「把一整套系统做完整」。

所以智元这次双榜第一,更像一张综合能力的成绩单。单项第一,努努力总有公司够得着。项目随便换、没有一块明显掉队,才是这个行业真正难拿的冠军。