世界模型是今年具身智能领域最热的方向,但各家对它的理解并不一致。最近一次媒体沟通会上,大晓机器人展示了开悟3.1世界模型,以及基于它落地的行业解决方案。整场听下来,能明显感觉到世界模型正在从技术概念变成能商用的产品。
雷科技(ID:leitech)也参加了这场沟通会。按照大晓世界模型负责人王飞的说法,世界模型的核心逻辑是「给定当前看到了什么,以及接下来准备做什么,去推演未来可能发生什么」。过去的大语言模型和VLA预测的是next token,世界模型预测的是next state,也就是下一个世界状态。
开悟3.1把理解、生成、预测放进同一套混合Transformer架构里联合训练,最终压缩成共享隐空间,这条路线与英伟达GTC上发布的Cosmos 3方向一致。
世界模型和视频生成模型有很大的区别,视频生成服务的是内容和创意,生成模型可以凭空想象画面;世界模型生成的动态世界必须符合物理规律,盘子端起来不能悬空,物体不能凭空消失。
(图源:大晓机器人)
王飞现场举了个例子:有些失败样本画面看起来完整,但盘子悬空了,明显不符合物理规律,这种就不合格。说白了,一个服务于创意,一个要遵循物理直觉。
大晓还公布了一组对比数据。开悟3.1是8B参数模型,在英伟达Jetson Thor上跑出百毫秒级推理延迟;约3.3B的π0.5同样在百毫秒级,16B的Cosmos 3 Nano则来到千毫秒级。
也就是说,模型规模更大的情况下,大晓保持了和更小模型相当的实时性。百毫秒级推理是人形机器人能不能真正上生产线的关键,延迟太高,机器人响应慢半拍,商业化场景的节拍和成本都会受影响。
(图源:大晓机器人)
这次沟通会值得关注的有两件事,一是平行推演,开悟会在执行前生成3到5条候选轨迹和对应的未来演化视频,用评估器打分排序,再挑最优方案去执行。打开冰箱这种任务,模型可能推演出反关节的别扭姿势也能完成,但效率低、代价高,不会被选中。「脑海中推演,现实中执行」这种能力是VLA没有的,也是世界模型作为具身大脑最核心的差异,它让机器人不再是盲试,而是先判断后果再动手。
二是数据策略的变化,Dyna Robotics最近用百万小时级人类第一视角数据训练世界模型,效果提升明显。大晓的判断是三层数据结构不会变,变的是各层比例:人类第一视角数据正在快速爬坡,未来一两年可能从百万级冲到千万级,在训练中的占比会显著提高。机器人真正要学的不是特定本体的动作,而是人为什么这样和环境交互。相比真机数据的高成本和难获取,这条路径至少让数据规模化这件事变得可以期待。
技术之外,落地才是硬道理。大晓这次发布的三套方案,面向即时零售的晓满、面向酒店客衣服务的晓新、面向开放场景作业的晓途,都对应着真实商业场景。履约机器人W1力控精度小于1牛顿,底盘最小通过宽度约75厘米,能进前置仓和仓店一体门店;酒店洗衣流程拆出十几个动作,除了长程任务规划,失败后还得会反思纠错再重试;晓途主打无图导航,不依赖高精地图,一个人就能在云端管理10台机器狗。客户系统、场景点位的部署被压缩到天级,机器人进场最快次日就能上线,这种工程化速度在具身行业里并不多见。
坦率说,具身智能行业过去一年的最大争议就是表演很多、干活很难。大晓把世界模型、数据建设和行业方案放在一起讲,至少传递出一个信号:世界模型不是实验室玩具,正在变成机器人厂商愿意买单的商品。方向已经清楚了,谁能把脑海里的预演变成现实里的量产交付,谁就能先吃到这波红利。
机器人产业最重要风向标,世界机器人大会(WRC)2026重磅来袭,还有世界人形机器人运动会紧随其后。
宇树、智元、启元、魔法原子、银河通用、云深处、灵心巧手等300余家TOP展商联袂呈现,定义全球机器人产业未来!
所有关于机器人的核心问题,WRC都将给出答案。
雷科技WRC 2026报道团已抵达WRC现场。
热门跟贴