家用人形机器人最后一道坎,为何不是成本而是“脑子不够灵光”?

打开网易新闻 查看精彩图片

极简科技

▍家用人形机器人卡在“进家”前的最后一道坎,不是成本,而是“脑子不够灵光”

2026年上半年,中国人形机器人出货量已经超过4万台,全球占比达到97%。减速器、伺服电机这些核心零部件的国产化率突破了75%,供应链本身不再是瓶颈。但你要是问“机器人什么时候能进我家门”,答案依然是:快则两三年,慢则五到十年。

这中间的差距,就是行业眼下最核心的病症——具身智能的泛化能力,还撑不起一个普通家庭的日常。

宇树科技创始人王兴兴在WRC主论坛上点明了这个瓶颈:在固定场景里充分训练后,机器人的任务成功率能接近100%;可一旦环境的物品、摆放发生微小改变,表现就会断崖式下滑,厘米甚至毫米级的偏差就足以让任务失败。

家庭恰恰是对泛化能力要求最高的场景——没有固定任务流程,东西随意放,随时可能出状况。机器人在展会上叠衣服、倒水能完成得很漂亮,但换一个家庭、换一天光线,就可能卡壳。

展会现场人形机器人演示抓取物品作业

▍病因不在硬件,而在“数据饥饿”

机器人“脑子不灵光”的根源,不是算法不够聪明,而是高质量的真实交互数据太少了。

行业共识是,要训练出一个具备强泛化能力的具身大模型,至少需要千万小时级的真实物理交互数据,而目前全球能用的真机数据只有十万小时这个量级,缺口是两个数量级。

这就形成了一个死循环:机器人还没大规模部署,就没有足够的数据;没有数据,模型就训练不好,那就更没法大规模部署。墨奇智能联合创始人黄青虬在WRC上把这叫做“先有鸡还是先有蛋”的问题。

这个死循环的本质,是具身智能和语言大模型在数据层面的根本差异。互联网上有海量的文本、图片数据可以喂给ChatGPT,但几乎没有人在互联网上记录“我是怎么拧开这个瓶盖的”“我是怎么叠这件衣服的”。

真实物理交互数据,需要一台台真机在真实场景里一帧一帧地采回来,采集、清洗、标注每个环节都是脏活累活。

北京智源人工智能研究院院长王仲远在WRC上的判断很直接:本体硬件能力不足,真机采集数据就少;数据稀缺,模型能力就弱;模型能力弱又进一步限制本体发挥,落地的场景就更少,数据就更缺——这是个死循环。

这就是为什么,硬件成本下探、供应链成熟,这些上游环节的进展并不能直接填平泛化能力的鸿沟。减速器、电机受益于制造业的规模效应,价格在持续下行,但泛化能力这个中间节点卡住了,再便宜的硬件也进不了家庭。

众擎机器人创始人赵同阳在WRC分论坛上给出了一个量化的标尺:当前具身模型的任务成功率大概在99%左右,也就是每百次任务会出现1次故障,但家庭场景需要的是99.99%的连续作业可靠性,“人们不会接受99%”。

从99%到99.99%,差的不是硬件,是模型在真实环境里千锤百炼出来的“常识”。

▍这个病,有救吗?分情况说

判断这个行业是阶段性调整还是结构性衰退,关键在于看“数据饥饿”这个病根能不能被缓解。

乐观的情况是,行业正在从多个方向打破数据死循环。京东计划在两年内采集超过1000万小时的人类真实场景数据和100万小时机器人本体数据。光轮智能在WRC期间发布了首个十万小时级的全模态人类行为开源数据集。

当数据飞轮开始转动——场景部署越多,数据积累越快,模型迭代越强——泛化能力就有可能迎来指数级提升。王兴兴预判的那个“具身智能ChatGPT时刻”(在80%的陌生场景中能自主完成80%的日常任务),快的话两三年就能到来。

但也有不乐观的版本。埃夫特董事长游玮在WRC上公开提出,泛化能力、推理速度、准确性三者存在“落地不可能三角”,在成本有限的情况下,实际落地可能要主动牺牲泛化性能,而该瓶颈的最终破解依赖能源与计算架构的底层突破,不是当前模型优化能解决的。

还有多位参展企业负责人指出,工程落地型人才的供给断层,这些是比泛化更前置的卡点。

已经有人绕开这个瓶颈在做小规模落地了。自变量机器人和58到家合作,用“机器人+保洁员协同”的模式做上门家政,机器人只负责有限任务,突发情况由人兜底。

未来不远机器人的家庭服务机器人已经进入超500个家庭,但它的策略是只针对单个用户的生活习惯做定制适配,不追求跨家庭的通用泛化。

维他动力的四足机器狗“大头”首销超6500台,在亲子酒店场景试点租赁,周末出租率需要提前预订——限定场景下,根本不需要全家庭环境的泛化能力。这些案例证明了同一件事:当场景被收窄、任务被限定、有人机协同兜底,泛化能力不足就不再是核心约束。

展会上展出的带置物篮的四足服务机器狗

最后还有一个最根本的变量,是用户自己。伯恩斯坦在WRC主论坛上提出了一个还没有被认真回答的问题:“我们至今没有测试过,人们是否接受一个多功能机器人在自己家里走来走去”。技术再成熟,如果用户不买账,这个行业就永远卡在“最后一道门”外面。