9月2日,李飞飞创立的World Labs正式发布新一代世界模型Atlas。官方将其定义为“全球首个多模态世界模型”,slogan直接亮出核心能力:建模世界,移动相机,模拟空间和时间。
Atlas不是一个只能生成互动视频的模型。它能以像素级相机控制生成图像和视频帧,并完成3D重建,同时理解空间与时间。李飞飞本人将其置顶,称“Atlas为从视觉特效到机器人的众多应用场景打开了大门”。英伟达机器人主管Jim Fan也来捧场,评价这是机器人领域“Real-to-Sim的一大步”。
具体能力拆成四块。相机控制生成:仅需一张图片,即可生成具有像素级相机控制的图片和视频,最高输出1分钟、1440p。空间重建:基于一张到数十张输入图像,既可生成新视角帧,也能输出显式3D表示,效果超过当前专业3D重建模型。时空模拟:输入视频即可转换观察视角,支持机器人Real-to-Sim工作流。图像生成:根据文本生成图片和360°全景图。
技术底座是一套多模态自回归扩散Transformer。文本、图像、视频、相机位姿、3D深度图等输入都被锚定在三维空间中形成空间上下文,Atlas再据此生成多模态输出。官方博客强调,这套架构融合了大语言模型和视频模型的思想:既能利用KV Cache、缓存感知路由等LLM推理优化,也保留了扩散模型的采样蒸馏和引导算法。
定量评估显示,在相机控制生成任务中,Atlas优于SOTA视频模型,且相机轨迹越复杂优势越大。盲测对比中,Atlas面对MiniMax H3胜率75%,面对Gemini Omni Flash胜率81%,面对FLUX 3胜率93%,面对Seedance 2.5胜率94%。稀疏视角3D重建方面,Atlas在DTU、ETH3D、ScanNet等数据集上取得25.3的误差分数,优于Pi3X的28.7和Depth Anything 3的39.3。
喂给它几张照片,它就能生成逼真的RGB和深度数据,机器人可以在更多不同的模拟空间中训练和测试。按官方说法,从真实照片到3D空间,再到机器人传感器视图和可变化的模拟环境,这条路径已经打通。Atlas未来将成为World Labs旗下Marble等产品的底层模型。
热门跟贴