文 | 机器最前线
2026年,世界模型逐渐从学术概念走向产业落地。
World Labs收购了机器人仿真公司SceniX,英伟达的Cosmos绑定算力主攻仿真,谷歌的Genie系列持续迭代。国内Manifold AI发布自研世界模型WorldScape登顶多个榜单,摩尔线程开源全栈仿真平台MT Lambda完成Sim2Real真机验证。
各大玩家都在加速布局,但路线分歧也越来越明显,这些号称能“理解世界”的模型,到底是在生成好看的画面,还是在搭建可用的空间?
World Labs在九月发布了全球首个多模态世界模型Atlas,恰好提供了一个可供剖析的样本。它的设计思路和取舍,或许能帮我们看清这条赛道的真实走向。
几何重建,让训练场从专业级走向消费级
Atlas发布后,很多人会联想到Sora。两者都建立在生成式模型架构之上,输出内容也都以视觉画面呈现,从表面看确实有相似之处。但两者除了都涉及“生成”之外,几乎没有共同点。
Sora做的事情是视频生成。给它一段文字,它生成一段看起来合理的画面。它关心的是像素之间的连贯性、运动的平滑度、视觉上的逼真感。最终交付的产物是一个视频文件。
Atlas做的事情与它不同。当你给它几张照片,它能直接按照照片画面重建出一个相同的3D场景。这些照片被锚定在三维空间的具体坐标上,模型据此还原几何结构。它主要的关心在于空间坐标对不对、几何结构准不准、程序能不能直接读取。
最终交付的也不是画面,而是可供计算机直接解析的几何数据,例如点云、3D高斯泼溅,也就是一堆带坐标的空间点、一组带形状和颜色的椭圆体,两者都不是给人看的图片,而是机器能直接读取和计算的“0和1”,程序可以直接使用、机器人仿真器也可以直接导入运行。
换句话说,Sora交付的是“画面”,Atlas交付的是“世界”,一个机器人可以直接进去“干活”的数字空间。从照片到三维空间,Atlas靠的不是像素拼接,而是一套对空间关系的重新理解。这个改变,正在重新定义机器人感知世界的底层逻辑。
1.空间上下文重塑视觉输入规则
传统视觉输入处理的是二维像素阵列,一张图就是一张图,没有深度,没有尺度,没有遮挡关系。Atlas的空间上下文则让每一帧图像都自带三维坐标,输入从“拍到了什么”变成了“从哪拍的、和周围什么关系”。
这个变化直接触及世界模型的底层结构。
一个世界模型通常分为三个模块:视觉模块负责把摄像头、麦克风这类原始信号翻译成模型能理解的内部格式;记忆模块负责学习环境的变化规律,根据当前状态推算下一步会怎样;控制模块则基于这些推算来决定具体怎么动。
Atlas做的事情,就是把视觉模型和记忆模型这两个环节往前推了一大步。
推动这一步的关键机制,是Atlas对空间上下文的理解方式。过去大语言模型用文字上下文来预测下一个词,把输入的文字编码成上下文,再基于上下文生成后续内容。Atlas的思路一脉相承,但是它用的不是文字,而是带着三维坐标的照片。每一张输入Atlas的照片都被固定在一个三维空间位置上,模型能够识别这张图是从哪个方向拍的,和其他照片之间是什么关系。
(图源:World Labs)
这个机制的效果,可以用一个简单场景来说明。想象你在一个房间里拍了五张照片,朝东一张、朝北一张、朝西一张。传统模型看到的是五张独立的平面图。但Atlas可以分析出这五张图来自同一个房间的不同角度,并把它们拼成了一张完整的三维房间地图。这不是在拼接画面,而是在还原空间。
2.空间重建降低3D场景构建门槛
3D场景构建的核心门槛,在于几何结构的还原精度。而Atlas仅需最少2张,最多25张普通照片,它就能输出一个完整的3D场景,这个3D场景可被仿真器直接导入,作为视觉环境的基础。
官方做过一个逐步构建的演示:一开始只给一张办公桌的局部特写,Atlas生成了一张室内全景图,画面中办公桌和电脑是准确的,但旁边的椅子和墙面全是模型“脑补”出来的。再加入第二张房间整体视角的照片,这一次办公桌和椅子都对了,但画面右侧的显示器区域仍然是空的。直到加入第三张侧面双屏工作台的照片,整个办公场景才完整对齐。
(图源:World Labs)
输入越多,需要“脑补”的部分就越少。官方透露Atlas通常只需要两到三张图就能实现可用的重建,也能处理超过一百张输入图做精细建模。另一个案例是斯坦福大学主方庭,仅靠几张从地面拍摄的手机照片,Atlas就生成了从校园高空俯瞰的连续飞行画面。
这意味着,过去想要搭建一个给机器人训练用的3D场地,需要扛着专业设备围绕目标转几十圈,拍摄数百张照片,再花几天时间手工建模。现在一部手机,一段视频,几分钟就能完成。这个效率的提升,把3D场景生成从专业测绘的范畴,拉近了普通工程师日常工作的范畴。
3.时空模拟打通真实到仿真链路
当有了3D世界后,如何灵活地观察它,成为下一个需要解决的问题。
Atlas的相机可控生成能力允许用户输入1到6张参考图,再设计一条相机运动轨迹,模型沿着轨迹生成最高1440p、最长1分钟的视频。其本质是让用户不再“猜”下一帧长什么样,而是让用户用坐标告诉模型“从哪个角度看”,模型按坐标渲染对应的画面。
为了验证这项能力的实际效果,World Labs做了第三方盲测。测试中,Atlas以相机位姿作为原生输入来控制运镜,其他对比模型通过文本提示描述运镜方式。Atlas对MiniMax H3的胜率是75%,对阿里HappyHorse 1.1是86%,对字节Seedance 2.5是94%。胜率随着运镜复杂度增加而进一步拉大,说明当相机控制精度成为瓶颈时,Atlas的原生几何理解能力带来了优势。
(图源:World Labs)
从观察世界到让世界动起来,是Atlas的另一个延伸能力。这项能力被称为时空模拟。通过三五台普通手机同步录一段视频,Atlas就能实现时间冻结、多视角回看的效果,即能把时间暂停在某一帧,允许从任意角度回看同一个瞬间。过去这种效果往往需要几十台同步摄像机才能做到,而现在几台手机配合Atlas就能完成,大大降低了多视角捕捉的门槛。
不过对整个机器人行业来说,更重要的是Atlas时空模拟带来的仿真价值。
World Labs曾用手机拍摄了两个大型环境,各取24帧重建出3D场景,然后模拟不同机器人沿不同路径行走,Atlas能实时生成机器人传感器应该看到的RGB画面和深度数据。而且一个真实场景可以生成上千种变体,改变路线、挪动障碍物、调整光照,全都不需要重新搭建场地。
(图源:World Labs)
这意味着,数据采集的主体从真实机器人变成了虚拟机器人。物理世界的行走只需要一次,剩下的都在数字世界里完成。成本从“每次都要跑一趟”变成了“跑一趟,用无数次”。
但成本只是其中一面,生成的虚拟数据还需要跟真实世界对齐。
在传统流程里,环境重建和传感器渲染是两套系统,误差在接缝处累积。而Atlas把这两步统一在同一个模型里,消除环节之间的误差传递,让机器人能在虚拟环境中获得与真实世界高度一致的感知数据,训练效果更可靠。
整体来看,空间重建解决了“世界长什么样”,相机控制解决了“从哪个角度看”,时空模拟解决了“时间如何流动”。这三项能力都附着同一个链条,先有几何结构,再有视角控制,最后推演时间的演化。
在这个链条里,视觉模型不再是把图像压缩成抽象的潜在向量,而是直接输出3D点云;记忆模型不再是在抽象空间里做预测,而是在三维空间里模拟时空变化;建训练场从专业级变成了消费级,镜头控制从文字描述变成了坐标说话;数据采集从物理空间转向了虚拟空间;世界模型架构里的前两个环节,被Atlas一次性推到了新的高度。
但这还不是终点。
物理属性,模拟器真正的硬仗
Atlas目前解决的是几何层面的问题。世界长什么样子、物体在哪儿、空间关系如何,这些它能从照片里推算出来。
可它还不能解决物理层面的问题。这个世界里的东西怎么动、多重、摩擦多大、会不会变形。照片里看不出来,Atlas还算不出来。
而要理解这个差距有多大,或许可以从Atlas在仿真链路中的实际定位入手。
Atlas在Real-to-Sim工作流中,为模拟机器人生成的传感器数据仅包含RGB图像和深度图,不输出碰撞检测信息、刚体动力学参数或接触力计算结果。物理演算需要对接外部物理引擎,比如MuJoCo、PhysX等,Atlas自身架构中没有内置刚体动力学方程、接触力求解器,也没有对摩擦系数或材料刚度的参数化表征。
不仅如此,Atlas的损失函数是基于图像帧的预测误差,优化的也是画面保真度,而非物理演算的准确性。
这意味着Atlas在架构层面拥有先天限制。它在仿真链路中的角色始终是“视觉渲染器”,只负责把场景“画”出来,而非“算”出物体如何相互作用。
这种限制可以从Atlas在稀疏输入场景中的行为逻辑中看出来。它做的是视觉层面的“填空”,从已有像素推断未见区域的几何结构,这是在补画面。但物理仿真要求的是“填力”,知道这个位置的东西受到推力会怎么动、受到重力会怎么变形。
像素记录的是外观,不记录力,Atlas能补画面,但补不出力的响应。视觉推断能找到“这个位置该有什么”,但找不到“这个物体受力后会怎样”。
World Labs并非没有意识到这个距离,为了补上物理仿真这块短板,2026年7月,他们收购了机器人仿真公司SceniX。这家公司的技术方向正是用物理信息增强数字资产,让虚拟物体具备接近真实世界的物理属性。
收购完成后,SceniX的团队和技术并入World Labs,双方计划结合World Labs在空间建模与三维重建方面的积累,以及SceniX在机器人学习与物理仿真领域的技术栈,为Atlas从几何重建向物理模拟延伸铺路。
同月,双方公布了Real-to-Sim-to-Real工作流,展示了一套完整的闭环:先录制一段真实世界的操作视频,将其转化为带物理属性的仿真环境,在这个环境里训练和优化策略,再把策略部署回真实机器人。
演示中,RB-Y1机械臂成功完成了线缆操作任务,YAM机械臂完成了可变形物体操控,所有策略都在仿真中训练、零真实数据、直接迁移到多种真实机器人平台,自主运行一小时无人工干预。这套流程证明了物理仿真到真实迁移的可行性,也为Atlas下一步的进化指明了方向。
Atlas做的事情核心是“从照片到几何场景”。SceniX做的是“从视频到物理仿真”。两者如果能够融合,即用Atlas重建几何结构,用SceniX注入物理参数,就有可能打通从真实世界到物理仿真环境的完整管道。
World Labs在Atlas发布的官方博客中也提到了这一点:Atlas的时空模拟能力“为机器人领域开启真实到模拟的工作流程”,不过目前这个工作流还处于早期阶段。
对于具身智能行业来说,Atlas的方向是清晰的。数据采集的瓶颈正在从“采集更多照片”转向“让这些照片承载物理信息”。
不过,几何可以靠算法推算,从照片里反推空间结构。但每一根线缆的阻尼、每一块布料的编织方式、每一个关节的摩擦特性,都只能通过真实的物理交互来标定。
Atlas迈过了几何这道坎,但物理这道坎还在前面等着。当它真正能把空间结构和物理规则统一起来的时候,它才算走完了从感知到理解的全链路。
那时,或许也是具身智能行业真正迎来转折点的时刻。
热门跟贴