8月最后一周,国家速滑馆“冰丝带”里,第二届世界人形机器人运动会正在进行。田径赛场上机器人百米冲刺、跳远,甚至电机着火,这些画面刷屏了朋友圈。但几位深度参与运动会的具身从业者被问到最关注哪场比赛时,答案出奇一致:场景赛。

场景赛没有跑道,只有临时搭建的客厅、厨房和货架,比的是家庭、餐饮、商超三项。业内有个心照不宣的共识:场景赛不是竞技表演,而是机器人真实工作能力的大考。田径项目考运动控制算法,只要算力足够,一套动作在仿真环境里跑上几万遍,总能算出最优解。场景赛考的是具身大模型,环境动态、物品柔软、随时有人打断,对模型泛化能力的要求完全不在一个量级。

打开网易新闻 查看精彩图片

允许遥操,但组委会明摆着鼓励全自主

这届比赛有一条不太被外行注意、却在圈内引发热议的规则:允许遥操。遥操在行业内外常被鄙视,但顶级大会依然允许,因为全自主的门槛实在太高。AI科技评论仔细阅读积分规则后发现,组委会其实在鼓励全自主:自主模式成绩权重是1.0,遥操模式直接打五折,仅为0.5;同分时自主队伍排名靠前。

但据AI科技评论观察,多数队伍依然选择遥操规避风险。一位具身大厂选手解释:“0.5的折扣虽然疼,但总比机器人当场死机、或者把厨房砸了要强。”真实物理世界里,让AI 100%掌管一具沉重的钢铁躯体,风险太大。

在这样的背景下,家庭、餐饮、商超三个场景的夺冠者,却是一个完全自主不遥操的团队:银河通用。三个流程最长、最容易翻车的项目,银河通用全部坚持全自主,不依赖任何人工后台干预,完全交由自研银河星脑(AstraBrain)世界动作模型独立完成决策与执行。家庭场景做到30分钟量级全场最长赛程且提前完赛,商超项目直接包揽金银铜牌。最终成绩单是夺冠率100%,包揽三大赛项金牌。

家庭考场:对抗误差级联与记忆断片

一位深度参与比赛项目的人士透露,三场比赛拆开看,恰好对应当下机器人学术界和工业界最头疼的三个底层难题。家庭考场比的是机器人对抗“误差级联”与“记忆断片”的能力。家庭场景是三个项目里任务链最长的一个,机器人要在客厅、卧室、卫生间、阳台之间来回穿梭:捡杂物、放钱包、自主开门、把脏衣服塞进洗衣机、叠衣服、最后用衣架晾起来。

第一个考点是柔性物体操作。以叠衣服为例,传统工业机器人抓杯子容易,因为杯子是刚体,有固定6个自由度,用几何运动学就能算出来。但衣服是软的,有“无限自由度”,每次抓起来褶皱都不一样。靠写死轨迹的代码彻底失效,机器人必须依赖端到端的视觉-动作模型,实时观察布料形变,实时调整双手发力。

第二个考点是长程任务中的随机干扰与记忆恢复,这也是整场比赛最惊艳的一幕。机器人正准备执行下一项任务时,现场突然响起随机语音指令:“有快递送达门外,请尽快取进屋内。”这在AI术语里叫“分布外(OOD)事件”。机器人必须立刻理解这句自然语言,暂停手头的活,走到门口把快递拿进来。最难的是:拿完快递后,它还得记得刚才干到哪一步,并回到原位继续工作。

对人类来说,洗碗时去开个门,回来接着洗是本能。但对具身智能来说,这涉及复杂的“时空接地”和长短期记忆调度。物理移动过程中,机器人视野完全改变。一旦大模型的“上下文窗口”出现物理状态断层,机器人就会像失忆一样僵在原地。这就是长程任务中最可怕的“误差级联”,前面的微小偏差或中断,会导致后续任务全线崩溃。

这场比赛整整30分钟,是本届运动会赛程最长的一个项目。对物理机器人来说,这相当于一场马拉松:时间越长,机械漂移、感知噪声、电量波动带来的不确定性越容易被放大。激烈角逐中,由AstraBrain驱动的银河通用机器人不仅顺利完成所有干扰项,还在赛后技术复核中首次复核即满分,证明这绝非偶然运气,而是底层模型实打实的泛化能力。

餐饮考场:挑战莫拉维克悖论与力控噩梦

餐饮场景的流程要求机器人听懂指令,从热食柜里用食品夹取出餐品,放进微波炉,拧动定时旋钮,加热完取出,最后接杯饮料平稳送达。这个场景是“莫拉维克悖论”的完美体现:对人类越简单的动作,对AI越难。

最典型的就是使用工具和拧微波炉旋钮。人类手指自带极其敏锐的触觉反馈,但机器人夹食物时,食品夹不固定在手上,等于要求大模型把本体的感知“延伸”到工具末端。夹轻了,餐品半路掉落;夹重了,直接把食物捏烂。拧旋钮则考验行业内极难做好的柔顺控制。不能只在三维空间里给机器人下达一个坐标指令,如果是刚性位置控制,机器人手指稍微偏离一毫米,就会把微波炉的塑料旋钮生生掰断。它必须学会像人一样,带着“弹簧般”的柔性去触碰,感受到阻尼反馈,再输出扭矩。

这一系列充满变数的操作中,多数队伍为了不搞砸,选择用遥控器接管精细动作。银河通用依然坚持全自主,最终以6分55秒的成绩零失误最快完赛。这说明AstraBrain不仅在做高层逻辑推理,也已经深度穿透到底层的力矩输出。

商超考场:抛弃过拟合,进入开放世界

商超场景是一场20分钟的限时高压测试。任务是:按外卖订单拣货,巡查货架,给空缺位置补货,并把被乱放的商品归位。在这个考场里,“背地图”毫无意义。订单动态、缺货位置随机、错放商品五花八门,甚至货架上还故意摆放了外观相似的干扰项。

传统机器人开发中,开发者往往为了某个特定场景反复写规则、调参数,这被称为“过拟合”,出了实验室的门,代码就废了。但商超赛场上,机器人面对的是一个迷你的“开放世界”。比如抓取袋装薯片,包装袋反光、形状不规则,传统视觉算法很难提取边缘特征,极易抓空。银河通用机器人凭借多模态大模型的实时感知,精准识别并丝滑抓取,甚至能自主发现哪里的商品摆错了,并将其纠正。最终,在这个对动态环境实时判断要求极高的赛道,银河通用直接包揽金银铜牌。

文章写到这里,懂行的人可能会提出一个尖锐的问题:即使全自主夺冠,这会不会依然是一套为了比赛专门训练的“特化模型”?事实上,很多机器人公司在比赛中大放异彩,但在真实商业落地时却举步维艰,就是因为赛场上的“高光表现”无法低成本地复制到千万个不同的现实场景。