AI 生成的世界为何“中看不中用”
AI 生成的大多数世界“中看不中用”,根本原因是 AI 少了一本“底账”:一份记住世界里有什么、每次行动改变了什么、并且能被检查和回滚的状态记录。
李飞飞押注的空间智能,被视为世界模型的主流路线之一。这条路线的基本构想是,让 AI 从识别二维画面,走向理解、推理和生成可进入、可操作、可持续编辑的三维世界。但真正的考验在于:一个“站得住”的世界,是怎样构建出来的?
要回答这个问题,不妨先回到一个更基础的追问:当 AI 的交付形态从“画面”变成“三维世界”,互动方式从“观看”变成“进入和操作”,到底意味着什么?它意味着 AI 交付的内容开始拥有时间属性:对象需要在多轮操作中保持身份,规则要承受真实行动,局部修改也要与已经成立的关系相容;系统还得从每一次行动的后果中,修正自己对世界的理解。
李飞飞将这组能力概括为 Renderer、Simulator 与 Planner——通俗地说,一个负责把世界“画出来”,一个负责记住“世界现在是什么样、行动之后会变成什么样”,一个负责决定“下一步做什么”;三者之间的连接,尤其是模拟与规划共享的状态层——也就是那本“底账”,直接决定了一个生成世界能否继续运行。
状态层为何难以持续运转
然而,维持这一状态层持续运转并非易事。空间世界的开放性和交互组合的无限性,意味着任何预置规则都无法穷尽所有可能情形。系统必须在实际运行中不断遭遇未知、记录冲突并修正假设。说白了,就是让系统从每一次操作中自动学习。
当这种“自我纠错”从零散的补丁升级为一整套固定流程时,行业称之为递归自我改进(Recursive Self-Improvement, RSI):系统将“状态—目标—行动—新状态—验证—反馈”保存为完整轨迹;在真实交互中识别能力缺口;自动生成新任务和困难样本;再经独立评测、版本门控与回滚,驱动下一轮迭代。
反过来看,空间世界也恰好为这一闭环提供了理想的试验场。它有明确的对象、可执行的动作和可外部核验的结果,使“从可观看世界,到可计算状态,再到持续行动与学习的自主空间智能”不再停留于技术想象,而成为一条可逐步验证的工程路径。
生成式 AI 能造出怎样的世界?
生成式 AI 的输出正在获得空间属性:人可以进入、操作,并在其中继续创作。三维世界把感知、推理、代码、物理和交互压进同一项任务,也因此成为前沿模型少见的综合试验场。
Kimi K3 的官方演示里,一段自然语言最终变成浏览器中的程序化开放世界:骑乘、森林、村庄、山地、水体和天气处于同一运行画面中。它展示了模型将三维推理、代码生成、工具调用和视觉反馈串成一条完整工作流的能力。
GPT‑5.6 与 Codex 构建的 MiniTown 则更进一步。房屋和道路之外,分区、居民日程、车辆与昼夜循环也被组织在同一状态里。一幅城市画面由此获得了时间、规则和行为,背后则是资产组织、规则编写、引擎执行和反复检查。
所谓“一句话生成”,实际压缩了一条很长的生产链:拆解意图、检索资产、求解空间关系、执行脚本、检查渲染结果,再修复空场景、穿模、对象缺失与状态丢失。时间轴把演示和系统区分开来——桌子移动后仍要保有身份,门的开合需要更新通行区域,局部换材质也应限定影响范围。世界开始接受行动,状态维护随即进入智能系统的核心。
一个可运行世界如何被构建
一个可运行空间至少包含三类状态:语义状态说明对象是什么、承担什么功能;几何状态保存尺寸、位置、边界与拓扑;运行状态记录门是否打开、角色在执行什么任务、路径是否仍然有效。三者必须绑定在同一对象生命周期中。
系统还要区分“编辑世界”和“在世界中行动”:删除一面墙是在改规则,推开一扇门则是在规则内运行,两者需要不同的权限、依赖和回滚方式。
这使世界生成越来越像软件编译与持续集成。自然语言先被翻译成目标与约束,空间模型提出结构,资产系统补齐对象,求解器处理边界、碰撞和关系,引擎执行并渲染,验证器再决定新状态能否提交。每次修改都应继承上一个稳定版本,并把重算限制在受影响区域。
整条链可以压缩为“表示—转移—验证”:描述当前世界,计算行动带来的变化,再检查新状态是否满足几何、物理和任务目标。通用模型理解意图,专用空间模型求解位置与约束,状态层让模型、资产、求解器和引擎围绕同一个世界协作。评估也随之从首轮画面扩展到有效质量、首次有效时间与单位有效结果成本。工程链能否压低返工,同时维持既有状态,决定了世界生成能走出演示多远。
三条技术路线的能力边界
目前,构建可运行三维世界的技术路径主要沿着三条路线展开:以视觉生成驱动的感知式世界生成、以对象身份、规则为核心的符号化/程序化世界生成,以及正在形成的融合架构。
三者起点不同、优势各异,但正朝同一方向收敛。视觉表征开始吸收对象身份和可操作状态,程序化系统则补入视觉经验、连续空间与开放环境泛化。融合架构试图用统一的中间表示承接两者,关键检验发生在行动之后:观察与状态能否同步更新。
真正的瓶颈:世界造出来了,但等不起、也改不动
感知式路线把大量世界信息压在画面或潜在表征里,错误往往藏在镜头之外;符号化路线把对象和程序显式写出,错误则常藏在代码和工具状态之后。它们的表象不同,根因相近:生成结果承担了过多世界状态,却缺少一份独立、可验证、可增量更新的底账。
今天的产品门槛集中在两个问题上:多久能拿到第一个可继续工作的场景;局部修改之后,它能否保持原有身份和关系。影响范围不清、约束无法自动复核,系统便会退回整场重算、多轮截图和人工审阅。
用户实际等待的是第一个通过几何、功能和任务检查的结果。单轮生成即使很快,只要接受率偏低,时间仍会被资产检索、渲染、碰撞检测、视觉审阅和反复修复吞掉。SceneOrchestra 在同一 A6000 环境复测时,LayoutGPT、Holodeck、SceneOrchestra 和 SceneWeaver 的平均运行时间从 2.3 分钟延伸到 91 分钟;World Labs 文档把 Draft、完整 World 和高质量 Mesh 分别放在约 2 分钟、10 分钟和更长时间的量级上。
这意味着,生成速度本身不是瓶颈,有效结果的产出速度才是。系统若不能在第一次返回后快速收敛到可提交状态,用户就会陷入“等一个能用的世界”而不是“看一个能看的世界”。
状态底账如何改变生成范式
把状态层从生成结果中独立出来,是空间智能走向可工程化的关键一步。状态层不再只是模型的输出缓存,而是一份可查询、可校验、可回滚的世界记录。它让每一次行动都有据可查,让每一次修改都能被限定在影响范围内,让系统在失败时不必推倒重来。
这种转变也改变了评估方式。过去看一张图是否好看,现在看一个世界是否“经得起折腾”:对象能否在多次操作后保持身份,规则能否在真实行动中保持一致,局部修改能否不破坏已经成立的关系。有效质量、首次有效时间和单位有效结果成本,成为比单轮生成速度更重要的指标。
当状态层成为系统的核心,递归自我改进才有了落点。系统可以从每一次真实交互中保存完整轨迹,识别能力缺口,自动生成新任务和困难样本,再经独立评测、版本门控与回滚,驱动下一轮迭代。空间世界因此不只是生成式 AI 的展示场,更是一个可以持续学习、持续修正的试验环境。
从可观看世界到可计算状态
李飞飞提出的 Renderer、Simulator 与 Planner,本质上是在描述一种新的交付形态:AI 不再只交付画面,而是交付一个可以被进入、被操作、被编辑的世界。这个世界的核心不是渲染质量,而是状态一致性。
当对象需要在多轮操作中保持身份,规则需要承受真实行动,局部修改需要与既有关系相容,系统就必须拥有一份独立于画面的底账。这份底账记录世界里有什么、每次行动改变了什么、哪些状态可以被检查、哪些修改可以被回滚。没有它,生成的世界就只能停留在演示层面,无法进入真实工作流。
空间智能的工程路径因此变得清晰:从可观看世界,到可计算状态,再到持续行动与学习的自主空间智能。每一步都需要状态层的支撑,每一步也都让状态层变得更加重要。生成式 AI 的下一阶段,或许不是画得更像,而是记得更牢、改得动、经得起折腾。
热门跟贴