打开网易新闻 查看精彩图片

WAIC 2026的展台上,机器人叠衣服、冲咖啡、切菜、分拣,从工业产线到厨房灶台都在演示“干活”。

走出展台,跟那些真正在一线的人聊下来,不管是造机器人的、训模型的,还是铺产线的,听到的判断要保守得多。这个行业的实际进度,远没有展台画面看上去那么近。

面壁智能的姚远打了个比方,现在的具身智能像2018年的大模型,BERT、GPT、T5三条路线并存,谁也不知道哪条最终成立。“当前最火的不一定能笑到最后。”腾讯张正友说,最聪明的人工智能“还是一个缸中之脑,它可以编程、通过考试,但从来没有真正地活过”。大模型善于推理和知识问答,也能读懂图像和视频,但一旦进入真实世界,“很难在一个持续变化的环境里面,一边行动一边接受反馈,再及时做出调整”。具身智能还没有像Transformer那样收敛的统一框架。

不管是路线、能力还是可靠性,几位核心从业者的判断指向同一个结论,具身智能还在“前GPT时代”。

Scaling Law在物理世界遇到了什么

大模型在数字世界靠堆数据实现涌现,物理世界没有这么顺畅。

智元机器人联合创始人姚卯青在WAIC期间把障碍归纳为三道墙,数据墙、表征墙、闭环墙。数据墙指真实交互数据稀缺且昂贵;表征墙指跨任务、跨场景、跨本体的统一表征尚未形成;闭环墙指真实试错代价高、反馈慢。

面壁智能的角度不同,姚远把具身智能分成三个模块,各自成熟度不同,语言模型最成熟,多模态感知大约在70%到80%,行动(action)可能只有40%。

两种说法落到同一个结论,Scaling Law在物理世界不能简单复制。

互联网文本可以持续累积,机器人面对的物理交互数据却不会天然存在,跨场景的统一表征远比文本tokenization复杂,真实世界里试错要付出代价,而且不可回滚,反馈慢,无法像数字世界那样低成本地反复重跑。

三道墙之间是相互锁死的。数据不够,表征就训不好,表征上不去,闭环效率随之下降,闭环慢了,反过来又拖累数据积累。姚卯青点出了VLA(视觉-语言-动作)模型的一个短板:“VLA没有L(语言),无法做长程任务规划和判断。”当前最主流的端到端范式,在需要理解指令、拆解步骤、做中间判断的长程任务上,缺的就是这一块。

路线还没收敛

问题明确,但往哪走还没有答案。

目前至少有三条路线在并行,VLA(视觉-语言-动作端到端)、世界模型(预测物理状态变化来指导决策)、智元提出的WRAM(世界推理动作模型,把世界模型和语言推理能力整合进一个框架)。姚卯青认为VLA缺语言能力,无法完成长程规划。面壁智能和Physical Intelligence倾向另一条路,把VLA与世界模型融合。

张正友的判断又不一样,他主张认知系统、感知行动系统、底层反应系统分层协同。不同模块要在不同频率上运行,底层反应要100赫兹甚至更高,感知行动在10到15赫兹,大脑可以慢一些。他用人的肢体反应打比方,“绊了一脚,肢体反应假如用VLM是达不到,那个是10赫兹,100毫秒,这个时间来决策是来不及”。VLA的问题在于前面的VLM和后面的动作模块在同一个频率上运行,跟物理世界直接交互时反馈跟不上。单一模型很难解决一切。

现在像2018年大模型的BERT/GPT/T5阶段,收敛还需要两到三年。“2018年最被看好的并非GPT,最后胜出的却是GPT。”姚远说。

具身智能可能也会如此,今天展台上最吸引眼球的路线,未必是终局。

姚卯青还有一个更底层的判断。现在用的底层组件,Tokenizer、Encoder,都是从VQA(视觉问答)和对话模型借来的,并非为具身任务原生设计。他把这称为“具身原生”问题,认为要到百万小时级数据才能做真正的原生架构。行业目前还在用“改装发动机”,没有造出“原生引擎”。

这个判断如果成立,当前的路线之争可能还在浅层,真正的分歧要等数据规模上来、原生架构成为可能之后才会展开。

能演示和能干活之间,隔着工程量

展台上叠一件衣服3分钟,观众拍手叫好。但工厂要的是6秒节拍、99.8%的准确率。

博世智能科技的刘敏在WAIC论坛上给出了制造业的标准:“工厂要99.8%准确率,节拍6秒是门槛。从能用到可用,是两个指标。”这两个指标之间,要求具身智能跨过展台走向产线。

智元在南昌一家3C工厂的产线上做到了99.99%成功率,是目前公开案例里最高的数字之一。姚卯青详述了背后的工程量,首批项目需要数月做硬件软件集成、对接MES系统(制造执行系统),然后是通宵压测,每晚测试,连续一个月才上主产线。从零到一要三四个月,到产品化之后才能一两周复制一个点。

越疆科技的刘培超谈的是硬件,机器人至少20个关节起步,比汽车更复杂,行业通用要求是5万小时MTBF(平均无故障时间)。他接着说:“今天大部分机器人可能10小时的MTBF都没有。”

灵巧手的情况更严峻,姚卯青提到,灵巧手“采集数据一两周就出问题,每工作半小时要散热”。零部件“还没有到汽车16949标准”,这是汽车行业零部件供应链的质量管理标准,机器人核心零部件的可靠性工程,离工业级还远。

艾欧智能联合创始人丁哲章看到的是另一面,今年聊“落地”的需求明显变多了,“但落地案例有没有变多,要打个问号”。他说的核心问题是,“场景方对具身的预期,和本体、模型现在真正能做到的程度之间,有一个断层”。

他的思路是“渐进式落地”,机器人做一部分,人监管一部分,先接受这种“中间状态”。他把具身的发展阶段梳理成一条时间线,2022年是“PPT阶段”,2023年是“把本体做出来但放那儿不能动”,2024年“将将能动起来”,去年“进入部分场景、具备部分自主能力”。

至于今年能到什么程度,他持保留态度。

腾讯云的黄阳则认为,这类技术都有长尾效应,“会非常快速地推进到60%、70%、80%,但最后那20%要花非常非常多的时间去填。”

今年跑通,但路还长

几位具身行业的资深人士给出的时间线开始接近,但都不算近。

姚卯青判断,“2027年底到2028年初看到比较强的涌现时刻”。面壁智能的刘知远说端侧模型“还需要1到2年、2到3年”。丁哲章更谨慎,他以自动驾驶作类比,十年前从业者宣称2025年做到L5全自动驾驶,十年过去,自动驾驶达到的是“差不多可用”,好用、可用,但并非当初想象的全自主。他认为具身也会经历同样的预期修正,“先有高预期,然后预期调整,再逐渐贴近现实,这个过程可能非常漫长”。

张正友的参照系是ChatGPT。他在微软做过20多年人机交互,语音对话在特定场景里效果不错,“但是问的问题稍微变一变很不稳定,所以一直没有发展起来”,直到ChatGPT出现才“真的感觉是有进步”。具身智能也需要这样的节点,“他真的帮你做事情你可以依赖于它。假如说失败概率太大,不稳定要人照顾机器人,还不如让这个人完成这个任务效率更高”。

光轮智能联合创始人杨海波给出了更具体的时间判断,今年是“跑通”年,明年才能“算账”。他预测明年本体价格会降到今年的十分之一,稳定性提高一百倍,如果成立,硬件可靠性这道坎有可能在明年迈过去一大步。软件、数据、评测这些基础设施的缺口,不会随硬件改善自动消失。

把这些判断放在一起,大致能勾勒出一张时间表。短期内(今明两年)是特定场景的工程跑通,中期(2027到2028)可能出现能力涌现的节点,通用具身智能要从工厂走进家庭,从结构化的工业场景走到非结构化的生活场景,这条路可能比大多数人预期的要慢得多。

展台上的画面和这些判断之间显然还存在一些落差。展位都在展示机器人“干活”,真正做过产线的人清楚,从演示到能上产线,再到大规模普及,中间隔着的不止一两个技术突破,还有一整套未建成的基础设施,数据标准、评测体系都缺,零部件可靠性不够,持续学习能力也尚未成形。

姚远说"当前最火的不一定能笑到最后"。这句话置于2026年的WAIC,不只是路线之争,也是整个行业此刻所要面对的真实处境。(本文首发钛媒体APP,作者 | AGI-Signal,编辑 | 秦聪慧)