"机器人是不是得在工厂里手把手教上百次,才能学会叠一条毛巾?"这可能是很多人对人形机器人的固有印象。但最近圈内放出的一个消息,正在悄悄改写这个答案:让机器人"刷视频"、去看海量的人类动作画面,它的干活准确度居然会自己往上涨,而且涨得还很有规律。

先说最直观的一幕。9月17日,人形机器人企业Figure把自己的新一代模型Helix 2.5,送进了旧金山湾区30个此前从未采集过数据的陌生家庭。这些机器人要在别人家里收拾散落在客厅的玩具、叠毛巾、铺床。关键是,它到现场之后既不重新采集数据,也不更新模型权重,更不会根据现场结果重新挑模型——说白了,就是"没见过这个家,也能上手干",业内管这叫"零样本"做家务。

打开网易新闻 查看精彩图片

但真正让行业讨论起来的,不只是这一次"秀肌肉",而是一个更底层、更耐人寻味的规律。相关方把这次背后的技术逻辑拆开来看:他们对机器人大模型做"人类动作预训练",把训练规模一举从37.5亿个token(动作编码单元)拉高到了1200亿个,这个体量大约对应了10万小时的人类动作画面。

打开网易新闻 查看精彩图片

结果呢?他们用第一视角的人类数据、还有宇树G1和自研人形机器人等好几类不同的"身体"来做测试,发现只要预训练规模越大,动作预测误差、全身姿态误差、腕部位置误差都会一路往下降,而且下降的轨迹是一条平稳的"幂律曲线"。所谓幂律,通俗讲就是"数据喂得越多,误差缩得越快、越可预期",而不是碰运气。团队还专门给这个现象起了个名字,叫"迁移缩放定律"。

打开网易新闻 查看精彩图片

行业内对这条规律的看法很谨慎也很兴奋。有观点指出,"利用互联网视频训练机器人"这件事本身并不新鲜,此前已有CoMo、HuRo等一批相近的工作在做。这次的特别之处在于,团队把"海量的人类动作视频、结构化动作恢复、越来越大规模的预训练"这几件平时往往被分开研究的事,放进了同一套规模实验里,第一次比较完整地验证了那种"刷越多、越准"的迁移规律在多类人形机器人身上都能成立。

打开网易新闻 查看精彩图片

当然,也要给人泼盆冷水。这类结果基于的是预训练规模与"目标域适配后的预测指标"之间的关系,用来衡量迁移效果的走向,它并不等同于机器人在真实环境里闭环干活的最终成功率。也就是说,"预测得更准"和"真能把活干利索并自主纠错"之间,还有一段路要走。据媒体报道,新一代模型整理客厅、叠毛巾这类整任务零样本成功率已从9%提升到56%,并开始具备全身自纠错能力——进步肉眼可见,但距离"放心交给它收拾整个家",仍有不小距离。

打开网易新闻 查看精彩图片

回头再看这条新闻,它的价值或许不在于"机器人会不会很快取代家务",而在于给行业指了一个方向:当人类动作数据能像语言数据一样被大规模利用、并按可预期的规律转化成能力时,人形机器人走向千家万户的路径,也许会比想象中更清晰一些。