被低估的 Atlas:它不止是新模型,更是 AI 时代的分界点

每一次AI的代际跃迁,从来都不是参数规模的简单堆砌,而是认知维度的跃迁。从ChatGPT引爆大语言模型浪潮,让机器读懂人类文字;到Sora带火视频生成,让机器创作视觉画面,AI的进化已然超乎人类的想象。然而,无论怎么进化,AI始终在二维信息的边界内打转。

9月1日,李飞飞的研究团队正式发布下一代世界模型Atlas。看似只是又一款生成式AI产品的迭代,实则悄悄把AI拉入了全新的维度——三维空间。

回望人工智能数十年发展史,这或许正是第三代AI正式开启的标志性节点:AI终于开始从“处理符号”,走向“理解世界”。

打开网易新闻 查看精彩图片

一、AI 1.0时代:语言认知革命,让机器读懂人类符号

以 ChatGPT为代表的大语言模型爆发,拉开AI 1.0时代的序幕。这一时代的核心标志,是机器第一次真正掌握了人类的文字符号系统,具备了通用的语言理解与生成能力。

在此之前,自然语言处理大多是针对特定任务的专用模型,彼此割裂。而大语言模型通过海量文本预训练,建立起人类知识的符号化映射,让机器可以用自然语言完成推理、创作、编程、信息检索等数十种任务,第一次实现了“通用能力”的突破。它重构了信息检索、内容创作、办公自动化等整个数字产业,把人机交互从命令行时代推进到了自然语言时代。

但语言智能天然有它的局限。李飞飞曾指出:语言是一种对世界的压缩表达方式,本身存在信息损失。纯粹的语言在自然界中并不存在,我们环顾四周,只有真实的物理空间与物体。

困在文字符号里的AI,就像“黑暗中的文字工匠”——它言辞流利、学识渊博,却对真实物理世界的空间结构、物理规则、实体交互缺乏基本认知。它能写出上万字的建筑论文,却数不清一张照片里有几把椅子。AI 1.0时代,机器读懂了人类的语言,却没有读懂我们生活的世界。

打开网易新闻 查看精彩图片

二、AI 2.0时代:视觉生成爆发,从“看懂”画面到“生成”画面

二、AI 2.0时代:视觉生成爆发,从“看懂”画面到“生成”画面

随着多模态技术的成熟,AI快速进入2.0时代。这一时代的核心标志,是文生图、文生视频模型的快速普及,Midjourney、Sora、可灵AI等产品相继涌现,AI的视觉生成能力快速走向成熟。

相比于1.0时代只能“识别”图像,2.0时代的AI已经可以“创作”图像与视频。通过扩散模型与 Transformer架构的结合,AI的像素级创作能力已经达到甚至超越了人类普通创作者的水平。文字与视觉的打通,也让多模态交互成为可能,这场视觉革命重塑了设计、影视、广告、营销等整个内容生产链路,大幅降低了视觉内容的创作门槛与成本。

打开网易新闻 查看精彩图片

但AI 2.0依然没有跳出二维的边界。本质上,视频生成模型依然是在做“帧的拼接”——根据前文的像素预测下一帧的像素,底层逻辑和大语言模型的“文字接龙”没有本质区别。它没有空间认知,没有物理常识,更不懂物体之间的空间关系。

这也是为什么视频生成总会出现各种“灵异现象”:镜头推进物体就变形、视角旋转结构就崩塌、人物动作稍复杂就穿模。它能生成足够好看的画面,却完全不懂画面里的世界。AI 2.0时代,机器学会了“画世界”,却依然没有“看懂世界”。

打开网易新闻 查看精彩图片

三、AI 3.0时代:空间智能觉醒,AI开始理解并构建物理世界

三、AI 3.0时代:空间智能觉醒,AI开始理解并构建物理世界

Atlas的发布,正式宣告AI进入3.0时代——空间智能时代。这一时代的核心标志,是“世界模型”的诞生,空间认知取代文本生成、画面生成,成为AI新的核心能力。

相比于前两个时代,AI 3.0带来了三层本质突破:

第一,任务范式升级。

从“预测下一个文字Token”“预测下一帧画面”,升级为“预测下一个新视角”。AI的任务不再是生成连续的符号或像素,而是在统一的三维空间里,根据相机的位置与姿态渲染对应的视觉内容。镜头不再是生成的结果,而是生成的原生输入。

第二,表征体系升级。

Atlas将文本、图像、视频、3D深度、物理信息统一编码进同一套空间表征,不再是多个模型分别处理再拼接。所有模态共享同一个三维空间上下文,画面、深度、物理规则都来自同一个底层世界模型,从根源上保证了空间一致性与物理合理性。

第三,认知能力升级。

AI第一次具备了初级的空间想象力、物理常识与时序推演能力。它可以补全画面盲区,可以重建完整三维场景,可以模拟物体的运动与交互,生成的不再是孤立的画面,而是可交互、符合物理规则的三维时空。

这种能力升级,也带来了应用场景的根本跃迁。前两个时代的AI主要服务于虚拟内容生产,而空间智能时代的AI,开始成为实体产业的底层基础设施,服务对象延伸至机器人、自动驾驶、工业制造等所有与物理空间打交道的领域。

李飞飞曾用生物进化视角解释这一趋势:空间认知是比语言更基础、更底层的智能能力。而Atlas的意义,就是让AI第一次朝着这个更底层的智能方向,迈出了坚实的一步。

打开网易新闻 查看精彩图片

结语:

从文字到图像,再到空间,AI的每一次代际跃迁,本质上都是在向人类认知的底层能力靠近。从读懂符号,到生成画面,再到理解空间,AI正在一步步走出数字的虚拟世界,走向真实的物理世界。

当然,作为3.0时代的初代产品,Atlas必然存在性能不成熟、落地不充分、场景覆盖有限等问题。它还不够完美,也远没有到达终点。但它最重要的价值,是划定了下一代AI的赛道方向——空间智能。

当AI开始真正看懂物理世界的空间与规则,我们今天熟悉的产业形态,我们与世界交互的方式,都将在这场空间智能的浪潮里,被重新定义。