2026年9月1日,李飞飞联合创立的World Labs发布了新一代世界模型Atlas。

它可以同时处理文字、图片、视频和3D信息,从几张照片中重建空间,生成新的观察视角,并输出点云、3D Gaussian Splats等显式三维结果。官方展示中,它还被用于搭建机器人训练所需的仿真环境。

这听起来像又一次模型升级,但真正值得注意的,并不是画面变得多逼真。

过去几年,AI主要学习如何描述世界;现在,它开始尝试建立一个可以进入、编辑和行动的世界。

一、AI正在离开对话框

大语言模型理解世界的主要方式是文字。

我们向它提问,它根据语言中的统计关系给出回答。即便是视频生成模型,最终呈现的通常也是一连串二维画面:镜头向前推进,看起来像进入了一间房;可镜头转身再回来,桌椅、门窗和光线未必还是原来的样子。

因为模型生成的可能只是一段“像世界的视频”,背后未必存在一个持续保存的空间。

Atlas与Marble试图解决的,正是这种空间一致性问题。

Marble已经能够根据文字、图片、视频或粗略的3D布局,创建可以漫游、编辑、扩展和导出的三维世界。Atlas则进一步把不同形式的信息放进同一个空间语境中,既生成画面,也推测镜头没有拍到的区域。World Labs:Atlas、World Labs:Marble

画面不再只是一次性结果,而开始变成一个可以反复使用的空间。

二、内容生产开始从“做镜头”转向“造世界”

这会首先改变游戏、影视、建筑和空间设计。

传统数字内容生产需要建模师搭结构、贴图师做材质、灯光师布置光线,创作者必须先把想象拆成许多专业工序,才能得到一个可用场景。

世界模型正在压缩前期试验的门槛。一张草图、一段视频,可能迅速变成可以走进去观察的空间;修改房间布局后,不同镜头也能随之更新。

这并不意味着专业建模师会立刻消失。模型生成的空间仍可能存在几何误差、细节幻觉和工程适配问题,精确建模、安全验证以及最终交付,依然需要专业人员。

但人的位置会发生变化:过去大量时间花在制作单个资产,未来更多精力可能用于决定世界的规则、结构和体验。

创作者交付的单位,正在从一张图、一个镜头,变成一套能够持续展开的世界。

三、机器人终于有了可以反复犯错的练习场

空间智能更深的影响,可能出现在机器人领域。

语言模型可以阅读互联网上的大量文本,但机器人需要的数据不同。它要学会抓取杯子、绕开障碍、整理电线,就必须理解距离、遮挡、碰撞和物体状态。

这些经验很难只靠视频获得。让机器人在现实中不断试错,又意味着昂贵的设备损耗、人工复位和安全风险。

2026年7月,World Labs公布了与SceniX团队推进的R2S2R系统:先把真实任务重建成仿真环境,再改变物体位置、灯光、视角和物理条件,让机器人策略在其中训练和测试。官方实验显示,部分策略可以完全通过仿真训练后迁移到真实机器人,仿真测试也能帮助预测不同策略在硬件上的相对表现。World Labs:R2S2R

如果这种能力能够稳定扩展,世界模型提供的就不只是内容素材,而是机器获得经验的基础设施。

四、生成世界,仍不等于理解现实

但这里必须留下一条边界。

Atlas目前仍处于面向部分合作伙伴的早期访问阶段。它能补全镜头看不到的区域,意味着模型具备强大的空间推测能力;可“合理补全”并不等于还原事实。

一间房子背后可能有模型想象出的走廊,一个物体看起来可以移动,也不代表它的重量、摩擦力和受力方式都符合现实。

对于游戏和影视,这种想象可能是优势;到了机器人、医疗、工业制造等场景,同样的想象却可能成为风险。

未来真正困难的工作,不只是让AI生成更多世界,而是判断这些世界在哪些范围内可信、哪些规则必须由外部物理引擎和真实数据校验。

空间智能的价值,不在于制造一个更逼真的梦,而在于建立一套能够被检查、被修正、被机器使用的现实模型。

空间智能正式开启

李飞飞曾把空间智能称为语言之后的AI前沿:它连接想象、感知与行动,让机器有机会理解并介入三维世界。李飞飞:From Words to Worlds

过去,我们把AI装进对话框,让它回答关于世界的问题。

现在,对话框的边缘正在松动。AI开始建造房间、街道、工厂和训练场,也开始学习如何在其中移动。

这并不意味着机器已经理解现实。它只是第一次拥有了一张可以反复修改、推演和犯错的空间草图

而从会说,到会看,再到能够行动,中间隔着的,正是这张草图与真实世界之间的距离。