一张静态照片,能否变成可以自由探索的三维世界?World Labs 最新发布的多模态世界模型 Atlas,正在尝试回答这个问题。

这个从零训练的模型,核心能力在于对空间的理解与生成。它不仅能生成具备像素级相机控制能力的图像和视频帧,还能从单张输入图像直接重建出大型场景。通过重帧视频模拟时空变化,Atlas 可以从一张或多张图像原生输出 3D 空间,甚至将多张带位姿的图像合成为一个一致的三维世界。

打开网易新闻 查看精彩图片

从单图到三维空间

这项技术的想象空间不小。作者称其为迄今最好的相机条件世界模型,潜在应用方向覆盖了从视觉特效(VFX)到机器人等多个领域。对于内容创作者而言,这意味着更低的场景构建门槛;对于机器人研究来说,则可能提供更丰富的环境理解能力。

不过,模型的实际表现和落地路径,仍有待更多测试与验证。