允中 发自 凹非寺量子位 | 公众号 QbitAI

一笔收购,揭示了世界模型开始从“生成空间”走向“模拟行动后果”

李飞飞把世界模型的下一站,押在了机器人身上。

7月21日,World Labs宣布收购机器人仿真公司SceniX。

仅一周后,双方便公布了Real-to-Sim-to-Real,也就是R2S2R的最新成果。

这套系统做的事情,听起来并不复杂:把一个真实机器人任务搬进仿真,在仿真放大的任务场景中训练和评测策略,再把策略部署回真实机器人。

打开网易新闻 查看精彩图片

但World Labs想证明的不只是“仿真里能跑”。

更关键的是,策略在仿真中的相对表现,能否预测它回到真机后的表现;仿真中发现的失败区域,能否提前暴露真实部署可能遇到的问题。

World Labs将其定义为一个可以反复运行的机器人训练与评测引擎:一个真实任务进入系统后,可以被扩展成大量可控制、可复用的训练世界。

这件事真正值得关注的地方,也不只是李飞飞开始进入机器人行业了。

企业可以用采访和发布会表达愿景,但收购意味着资本、人才和组织资源的真实配置。

World Labs真金白银买下SceniX,背后代表的是一个更明确的判断:

世界模型的下一站,不只是生成一个看起来逼真的世界,而是要让机器人能够在虚拟世界中行动、试错和学习

打开网易新闻 查看精彩图片

当世界模型进入机器人领域,核心问题变了

过去两年,世界模型最直观的进展,是生成越来越完整、逼真和空间一致的三维环境。

输入文字、图片或视频,模型可以创造一个能够自由浏览、继续编辑的空间。

房间从不同角度看过去,结构不会突然变化;用户向前走几步,桌椅也不会凭空消失。

但机器人面对的是另一道题

一个纸箱即使在画面中足够逼真,如果箱盖不会弯曲,就无法用于训练装箱。

一根线缆即使拥有准确的纹理和阴影,如果它不会随着受力滑动、弯折和缠绕,机器人在仿真中学会的动作,也很难回到现实。

所以,当世界模型进入机器人领域,核心问题就从:

世界看起来是什么样?

变成了:

机器人采取一个动作后,世界会发生什么?

这也是SceniX之于World Labs的意义。

SceniX补上的是真实任务重建、物理属性恢复、复杂交互模拟,以及机器人策略训练和评测能力。

世界模型因此开始从生成观察的Renderer,走向预测状态变化的Simulator。

World Labs也把模拟器视为连接世界生成与智能行动的关键中间层。

打开网易新闻 查看精彩图片

顺着这次收购继续往下看,会发现R2S2R很难由一个世界模型、一套物理引擎或者一个仿真平台独立完成。

它要求真实数据、世界重建、生成扩展、物理模拟、模型训练、能力评测和真机反馈被放进同一个闭环。

而这套由真实世界进入虚拟世界、再回到真实世界的技术路径,恰好与无问智科以“世界模型X数据工厂X世界模拟器”三位一体架构实现“采集世界—生成世界—模拟世界”路径完整打通Real2Sim2Real的技术布局不谋而合

无问智科要用世界模型,构建物理AI时代的数据基础设施

过去很长一段时间,机器人行业谈数据,首先想到的是“缺多少”。

训练场、真机遥操、第一人称采集和仿真合成等不同路线,解决的都是数据从哪里来的问题。

但无问智科看到的另一个问题是:即使采到了更多数据,模型也未必稳定变强

同样规模的数据,因为输入模态、任务动作、场景覆盖、交互质量和失败样本不同,对模型的价值可能完全不同。

因此,真正困难的不是生产一批数据,而是持续回答三个问题:

  • 模型究竟缺什么数据?
  • 如何给整个行业规模化生产这些数据?
  • 如何让这些数据真正改善模型能力?

在无问智科的定义里,物理AI数据基础设施并不是一座更大的数据仓库。

它是一个把数据、场景、工具和测评结合在一起的、持续运转的循环系统:

模型在训练、测评和真机运行中暴露问题;系统根据这些问题重新定义数据需求;再通过真实采集、世界生成和仿真补充数据,进入下一轮训练与验证。

打开网易新闻 查看精彩图片

在定义了什么是物理AI的数据基础设施之后,无问智科构建了“采集—生成—模拟”的独特世界模型技术路线:

从真实世界获得物理先验知识,在生成世界中放大数据分布,再在模拟世界中完成训练、评测和反馈

三个世界,一个闭环,藏着机器人进化的钥匙

如果说World Labs收购SceniX,让R2S2R从一条技术路线走到了产业聚光灯下,那么无问智科此前提出的“采集世界—生成世界—模拟世界”,则是试图把这条路线进一步落实为一套完整闭环的数据基础设施。

三个“世界”,是一套形成完整闭环的世界模型技术路线。

真实世界为虚拟世界提供真实锚点,生成式模型将有限数据扩展成更大的分布,物理规律模拟再让虚拟世界“动起来”。

数据由此不再是一次性交付的产品,而成为模型持续迭代的起点。

采集世界:让真实世界成为可被理解和计算的资产

R2S2R的起点,依然是真实世界。

但无问智科所理解的“采集世界”,不是把机器人集中到训练场里,反复执行一批预先设计好的动作,而是通过大规模无感野采,让采集设备进入工厂、商业空间、家庭等真实环境,记录自然作业过程中真实发生的物理交互

打开网易新闻 查看精彩图片

这种方式保留下来的,不只是一条标准化动作轨迹。

真实环境中的物体差异、空间变化、操作习惯、任务中断、异常状态和失败过程,也会一并进入数据系统。

对于机器人而言,这些不够整齐、甚至略显“杂乱”的真实交互,恰恰构成了现实世界的复杂度。

但新的问题也随之出现

真实场景中持续回传的海量数据,不会天然变成可以训练模型的高质量数据集。

从Raw Data到Model-Ready Data,还隔着一长串的数据处理管线。

在大量长时序记录中,可能混杂着无效动作、重复片段、遮挡、传感器误差和信息缺失。

如果依赖人工处理,采集规模越大,后端处理成本也会越高。

因此,无问智科将世界理解模型引入数据生产链路,对回传数据进行自动化清洗、筛选、时空对齐、标注、数据集构建和跨格式、跨本体转换

系统需要理解物理交互中发生了什么、任务处于哪个阶段、人与什么物体发生了交互、人与物体如何运动,以及最终为什么成功或失败,再将连续的真实作业数据转换成可以用于训练、重建和评测的结构化资产。

打开网易新闻 查看精彩图片

在这套体系里,采集硬件也不再是一款孤立的设备。

无问智科以算法模型反向定义了Capture系列硬件:

不同任务需要采集哪些模态、达到怎样的时空精度、如何完成多传感器同步,以及数据怎样进入后端处理链路,共同决定设备的传感器组合与产品形态

由此形成覆盖不同采集范式、不同数据模态和不同真实场景的Capture产品体系。

无问智科要解决的,不只是“怎样采到更多数据”,而是如何让真实物理交互能够以更自然的方式发生,再以更自动化的方式转化为模型可用的数据。

这些来自真实世界的交互数据,一方面经过治理,成为了可用于训练机器人大脑的数据资产,另一方面也会进入无问智科的世界模型训练体系,成为后续世界重建、生成扩展和虚实校准的现实锚点,通过源源不断真实世界的交互数据,构成了无问智科世界模型持续迭代的数据飞轮。

生成世界:把有限的真实数据扩展成无限泛化的世界

仅仅将真实世界采集下来,还不足以支撑通用机器人的训练。

现实世界里的物体、布局、材质和任务组合近乎无限。

即便能够持续扩大真实采集,也很难低成本覆盖模型可能遇到的所有状态,尤其是低频异常、危险工况和难以重复制造的失败边界。

“生成世界”要解决的,正是有限数据分布如何被规模化放大的问题。

在无问智科的技术路径中,通过Scan2Sim和Gen2Sim两大技术,既保证了生成的精度,又实现了生成的广度。

首先通过Scan2Sim技术,将真实物体、场景和任务重建为可交互、可编辑的高精度物理孪生资产。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

视频地址:https://mp.weixin.qq.com/s/ch8DztkIDf_DEjlgoozogA

这里的重建,并不只是复刻物体外观。

一扇门除了纹理和几何结构,还需要具备铰链、运动范围和碰撞关系;一个抽屉需要恢复滑轨和可操作区域;柔性物体则需要具备与真实材料相符的形变与交互属性。

只有当现实场景被转化为能够直接参与机器人任务的SimReady世界,真实经验才真正具备进一步扩展的基础。

在此之上,Gen2Sim再围绕物体和场景的几何、外观、结构、类别、布局、材质、光照、物理属性,生成更多可控变化。

一个现实中只出现过有限次数的工业搬运任务,可以被扩展为不同货物类型、不同摆放位置、不同遮挡关系和异常工况下的一组任务分布。

机器人不必等待每一种情况在现实中自然发生,就可以提前在虚拟世界中经历这些变化。

这种扩展也不只是简单地“多生成一些场景”。

围绕真实场景进行受控变化,可以形成与现实分布接近的“物理表亲”;进一步面向未知环境和长尾状态进行扩展,则可以构造更远分布的“物理远亲”。

打开网易新闻 查看精彩图片

视频地址:https://mp.weixin.qq.com/s/ch8DztkIDf_DEjlgoozogA

更重要的是,生成什么,不完全由工程师事先决定。

当评测发现模型总是在某类材质、某种空间关系或者某个任务阶段失败,系统便可以针对这些能力缺口,反向生成新的物体、环境和任务组合。

由此,生成世界不再只是生产3D资产,而是把一次真实经验扩展成可以持续训练模型的任务世界。

真实数据提供种子和约束,生成模型负责放大规模与覆盖范围

两者共同解决机器人数据生产中“真实性”和“丰富度”难以兼得的问题。

模拟世界:在虚拟世界产生真实的物理变化

场景被重建和生成之后,还必须真正“动起来”。

机器人采取一个动作后,物体怎样运动,接触如何发生,线缆如何弯曲,柔性材料如何形变,液体如何流动,都决定了仿真中的策略能否最终迁移到现实。

这也是“模拟世界”与普通三维内容生成的根本区别。

无问智科开创了由显式DPE可微分物理求解器+PINN物理信息神经网络,结合隐式因果动力学模型构建的双空间世界模拟器“无穹”,让虚拟世界能够对物理交互实现更广范围、更高精度的模拟。

打开网易新闻 查看精彩图片

真实交互数据在其中仍然发挥关键作用。

系统可以对比同一物理变化在现实和仿真中的状态,持续修正虚拟世界中的几何、参数、拓扑、状态和边界物理量。换言之,模拟世界并不是一次搭建完成后便固定不变,而是会随着采集到的真实世界数据进行不断校准。

打开网易新闻 查看精彩图片

但模拟的目标不只是让物理效果看起来更真实。

当虚拟世界具备足够可信的交互能力后,它将成为机器人的训练场和考场。决策器可以通过在世界模拟器生成的海量丰富场景和任务中进行数百万次的强化学习训练和评测

机器人最终回到真实场景后,任务中产生的新数据、失败案例和分布外状态,又会重新进入系统。

这些结果可以修正物理参数,更新场景资产,改变下一轮生成方向,也可以形成新的评测任务。

至此,“采集世界—生成世界—模拟世界”才真正形成闭环

采集世界提供真实锚点,生成世界放大数据分布,模拟世界完成物理推演;模型在现实中暴露的新问题,再重新定义下一轮需要采集和生成的数据。

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

无问智科要建设的,是能够不断提升模型能力的物理AI基础设施。

下一场竞争,是谁能造出更多“有用的世界”

World Labs收购SceniX,让R2S2R站到了世界模型行业的聚光灯下。

但这次收购真正揭示的,是物理AI数据基础设施的定义正在收敛。

未来衡量Data Infra的标准,不再只是采集了多少小时数据、拥有多少3D资产,或者生成的画面有多逼真。

更重要的问题会是:

  • 一个真实任务能拓展出多少有效的训练世界?
  • 数据的堆叠是否真的提升了模型的能力?
  • 模型的失败又能否快速变成下一轮迭代的数据输入?

World Labs从3D生成模型出发,开始补齐物理仿真、机器人训练与真实反馈能力。

无问智科则从真实场景数据出发,把世界重建、生成扩展、物理模拟和训练评测打通形成闭环

两者隔着一个太平洋,但正在回答同一个问题:

如何把现实世界转化成物理AI可以反复学习和训练使用的计算资源

李飞飞用一次收购,把这个问题推到了台前。

而无问智科此前提出的“采集世界—生成世界—模拟世界”,也因此获得了一个更清晰的产业坐标。

过去,数据公司交付的是一批数据。

下一阶段,物理AI数据基础设施要交付的,是让模型持续进化的能力。

World Labs与无问智科对此判断不谋而合,双方正在太平洋的两岸同步加速布局。

*本文系量子位获授权刊载,观点仅为原作者所有。