生成一个世界,不等于理解一个世界。

今天的 AI 已经可以生成逼真的视频,也可以用代码搭建复杂的 3D 场景。但无论是像素还是场景,都只是世界的 “表象”。真正的物理智能,需要进一步回答:这个世界由什么构成、处于什么状态、又遵循什么规律?

换句话说,AI 的下一步,不只是预测世界会 “看起来怎样”,而是恢复为什么世界会这样运行 —— 从描述现象,走向发现机制。

近日,MirroS 提出 Code-as-World:让 AI 将观测到的现实主动重建为可执行、可验证、可推理的代码世界,并以此作为理解物理世界的表征。在这套框架下,对象、状态、物理参数与演化规律被显式写入代码,一个关于世界的解释由此不再只是语言描述或隐式特征,而成为一个可以查询、执行、干预和验证的世界假设

如果说从观测直接预测未来,回答的是:接下来会看到什么?

那么 Code-as-World 进一步追问:什么样的世界,能够产生这些观测,并在干预之后继续演化?

Code-as-World 将物理组成、动态演化与视觉外观显式写入可执行代码,并让智能体围绕观测不断提出、运行、检验和修正世界假设。这些经过验证的可执行世界可以转化为可规模化的物理监督,推动视觉语言模型学习物理推理。

  • 项目主页:https://mirros-lab.github.io/code-as-world
  • 论文:https://mirros.ai/report/code-as-world.pdf
  • 代码:https://github.com/mirros-lab/code-as-world
  • 全文 Blog : https://mirros.ai/blog/representing-physical-world

打开网易新闻 查看精彩图片

01|生成得像,不等于理解得对

人类理解物理世界,并不是记住每一次具体观测。

面对不同大小的球、不同角度的斜坡和不同材质的地面,人类仍然会使用物体、质量、速度、重力、摩擦等概念进行思考。真正能够迁移的知识,存在于这些紧凑的抽象之中,而不是某一段视频的全部像素。

这也意味着,复现观测,并不等于形成了对世界的理解。只要生成出的未来在视觉上足够合理,像素预测本身并不要求模型显式回答:世界中存在什么、状态如何变化,又是什么机制支配着这些变化。

问题因此进一步落到:什么样的表征,才能真正支撑对物理世界的理解与推理?

现有的几类世界表征,各自保留了世界的一部分信息。

像素保留丰富细节,却把原因隐藏在结果之中;3D 重建恢复几何、深度和视角,却不自动解释物体为何下落、碰撞或停止;自然语言能够紧凑地表达实体、动作和关系,却难以精确承载连续轨迹、接触关系与物理参数。

Code-as-World 希望找到一个新的结合点:

像语言一样具有语义,像 3D 一样具有结构,又像视频一样能够表达连续演化。

打开网易新闻 查看精彩图片

代码恰好提供了这样一种形式。对象、状态、参数与规则可以被显式写出;世界不仅能够被描述,还能够被执行、干预和检验。Code-as-World 因而不追求每一个像素的完全复制,而是优先保持世界组成、约束与演化机制的一致。

真正重要的,不再只是把世界复现得更像,而是找到一种能够显式承载世界结构与机制的表征。

02|不是更真实的像素,而是一可执行世界

如果要用代码来抽象一个物理世界,究竟需要写下什么?

Code-as-World 将一个世界拆解为三个相互关联的方面:

  • Composition:世界中有什么,描述物体、几何结构与质量、摩擦、重力等基本物理属性。
  • Evolution:世界如何变化,描述物体的状态、运动、交互与关键事件,以及世界随时间的演化过程。
  • Appearance:世界如何被观测,描述相机、背景、材质、光照等视觉呈现条件。

三者结合起来,Code-as-World 表达的就不再是一张场景图,也不只是一段轨迹,而是一个可以真正运行起来的世界。

不同组件还可以被独立查看和修改:改变一个物体的速度、质量、运动方向或相机位置,其他结构仍然可以保持不变,世界随后重新执行。这也让 “世界编辑” 从像素层面的重新生成,变成了对底层机制的直接干预。

代码在这里不是最终答案。

它更像一个能够被运行和证伪的世界假设

03|让 Agent 在模拟与验证中发现世界

从一段视频或文字中恢复底层物理世界,本质上是一个复杂的逆问题。

因此,Code-as-World 没有把世界表征视为一次性的代码生成任务,而是将其构造为一个agentic discovery loop:让 Agent 在不断提出假设、模拟与验证的过程中,逐步逼近能够解释观测的世界。

这一过程借鉴了科学发现中的溯因推理:从不完整、带噪声的证据出发,不断寻找能够最好解释观测、同时保持简洁的机制假设。

首先,不同形式的输入会被转换为相应的证据。

对于文本,系统提取实体、空间关系、物理事件和预期结果;对于真实视频,则进一步提取深度、实例分割、物体轨迹与三维几何,共同约束可执行世界表征。

随后,Agent 进入五个连续阶段:

  • Propose|提出世界假设:根据当前证据和反馈,生成或修改世界表征。
  • Instantiate|实例化:将抽象世界假设编译为可执行程序。
  • Execute|执行:运行模拟,得到完整的世界状态轨迹。
  • Render|渲染:把状态轨迹转换成可观测视频
  • Verify|验证:把模拟结果与输入证据逐项比较,将差异整理成反馈。

于是,世界表征不再依赖 “一次猜中”,而成为一个持续循环:

提出 → 实例化 → 执行 → 渲染 → 验证 → 修正。

打开网易新闻 查看精彩图片

每一轮执行都让世界假设产生可观测的后果;每一处差异都在告诉 Agent,究竟是世界组成、动力学过程,还是相机与外观设置出现了问题,把上一轮暴露的问题,转化为下一轮有方向的修改。

它不是重复抽样,而是在利用错误。

04|世界一旦可执行,物理监督就能规模化

让世界变得可执行,价值并不止于更可控的模拟和生成。

它还解决了物理智能训练中一个长期存在的问题:

真实视频很多,但隐藏在视频背后的物理标签极少。

互联网中存在海量运动、碰撞与交互视频,但它们通常不会告诉模型:物体的真实尺寸是多少,某一时刻速度是多少,运动过程中的加速度如何变化,更不会提供完整的三维状态轨迹和接触事件。

可执行世界则天然拥有这些信息:

  • 一段可观察的视频;
  • 一条精确的模拟状态轨迹;
  • 物体尺寸、相机参数与时间戳;
  • 位移、速度、加速度等世界尺度标签。

Code-as-World 从原始视觉观测出发,恢复其背后的结构化世界,使原本隐藏在像素中的状态与动力学变成可直接使用的训练监督。

基于这些可执行世界,MirroS 训练了 Code-as-World-VL 系列模型。

在李飞飞提出的首个 VLM 物理推理量化评估基准 QuantiPhy 上:

Code-as-World-VL-9B 模型超过 Gemini-3.1 Flash 的 54.8;
Code-as-World-VL-27B Reasoning 模型进一步提升至 58.6。

视频链接:https://mp.weixin.qq.com/s/a5hm9dP2W2RTzXW75v2n0A
打开网易新闻 查看精彩图片
视频链接:https://mp.weixin.qq.com/s/a5hm9dP2W2RTzXW75v2n0A

这意味着,可执行世界不仅是一种外部模拟工具,也可以成为一种新的训练数据形态:

把无法直接标注的物理机制,转化为能够规模化学习的监督。

05|代码只是第一步,结构化语言才是更大的命题

Code-as-World 的技术实现以代码为核心。

但在更大的愿景中,MirroS 提出的并不只是 “用代码代替像素”,而是一类更广义的世界表征:

结构化语言,Structured Language。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

代码与自然语言,是其中两种有力而互补的形式。

代码是一种精确、可执行的形式语言。它能够把变量、状态、约束和规则显式写出,并支持严格计算、模拟执行和证据验证。当一个物理过程能够被明确建模时,代码可以沿着机制精确地推演世界如何变化。

自然语言则提供更广泛的语义与因果抽象。它承载着人类长期积累下来的实体、事件、关系、因果直觉与科学知识,也能够对难以被代码精确模拟的复杂现象,进行定性和更长时间尺度上的推理与预测。

二者因此覆盖了不同但互补的抽象层级:

代码让世界可以被精确执行,自然语言让世界可以被广泛理解与推演。

由更重要的是,它们都与人类已有的知识体系相连。物理智能不必只从感知数据中重新发现一切,而可以继承人类已经形成的概念、规律与推理方式,并在新的物理经验中不断扩展它们。

06|统一的世界表征,重塑物理智能

Code-as-World 的意义,也并不是孤立服务于一项任务的技术。

它试图为物理推理、视频生成和具身交互建立同一个世界底座。

  • Physical Reasoning|在世界中查询与推演

推理不再只是从画面直接输出答案,而是先恢复实体、状态、关系与动力学,在结构化世界中计算,并对结论进行验证。

  • Video Generation|先演化世界,再渲染像素

视频生成不再需要完全依赖跨帧的隐式记忆。模型可以先推进一个持续存在的世界状态,再把它渲染为像素,从而更稳定地保持物体身份、几何关系和历史信息。

  • Embodied Interaction|先推演未来,再采取行动

具身智能也不必只对当前刺激作出即时反应。Agent 可以先构建内部世界,模拟多种可能结果,再选择行动;同一套抽象还可以连接真实观测、模拟环境和现实交互,使物理知识更容易跨环境迁移。

打开网易新闻 查看精彩图片

换句话说,推理、生成与行动,不再是三个彼此独立的模块。

它们可以被看作围绕同一个世界表征展开的不同操作:

查询世界、演化世界、渲染世界,以及干预世界。

结语|Physical RSI,从可积累的物理经验开始

Code-as-World 更深层的意义,也正在于此:它为Physical RSI提供了一种可操作、可积累的经验载体。真实世界中的发现可以被编码、复现、验证和修正,并持续回流,驱动 World Model 与 Agent 协同进化。

当每一次理解世界,都能成为下一次进化的起点,Physical RSI 才真正成立。

语言模型的 Scaling 已经全面展开,而物理智能的 Scaling 才刚刚开始。真正需要被扩展的,不只是更多像素与轨迹,而是可积累、可执行、可修正的结构化物理经验