打开网易新闻 查看精彩图片

从物理视频生成到运动迁移,再到可控世界建模。

如果说自然语言帮助 AI 读取人类记录的知识,那么 PhiZero 所探索的 “物理语言”,则试图让 AI 读懂真实世界中的运动、交互与变化。

打开网易新闻 查看精彩图片

视频链接:https://mp.weixin.qq.com/s/fZy3ZNtwlS9xyxosD7V4PQ

打开网易新闻 查看精彩图片

  • 论文名称:PhiZero: A World Model Built Around Physical Language
  • 项目网站:https://Phi-Zero.github.io/
  • 研究团队:Shuyao Shang、Yuqi Wang、Ruopeng Gao、Xu Chen、Tieniu Tan、Lue Fan、Zhaoxiang Zhang
  • 所属机构:中国科学院自动化研究所(NLPR, CASIA)

语言让经验得以保存,也让知识能够跨越时间与个体持续传播。人类借助语言描述日常生活、总结科学规律、书写历史与程序;大语言模型则通过学习这些内容,逐步掌握概念表达、知识组织,以及面向数字信息的理解与推理。

当 AI 开始进入现实环境,仅靠自然语言是否足以支撑它认识世界?进一步说,除了描述事物的文字,机器能不能学习一套直接表征物理世界细粒度变化的符号系统?

PhiZero 从这个问题出发,希望为世界的状态演化建立一种可学习、可预测的新表示。

从结果开始:PhiZero 展示了哪些能力?

1. 生成具有连贯物理过程的视频

无论是海水冲击岩石、液体灌入容器,还是物体坠入热油、金属罐发生爆炸,PhiZero 都可以对后续过程进行建模。它追求的不仅是每一帧足够逼真,也要求动作产生的影响能够延续,整段事件在时间上保持完整。

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

场景虽然跨越海浪、流体、燃烧与爆炸,模型面对的核心任务却相同:预测当前状态将如何继续发展。

2. Motion Transfer:让同一种变化发生在不同载体上

物理语言中,重点是变化本身,而非执行变化的具体对象。基于这一特点,一段运动所对应的状态转移可以离开原始视频,被赋予新的外观、身体结构或视觉风格。

Human Body → G1 Humanoid

对于真人运动,PhiZero 可以先抽取其中的状态变化,再让 Unitree G1 人形机器人呈现相应过程。这项迁移不以成对的人类 — 机器人训练视频为前提。

打开网易新闻 查看精彩图片

图中包含四组跨身体形态的迁移结果;各组由左侧真人输入与右侧 G1 输出组成。

Human Hand → Sharpa Dexterous Hand

相似的迁移也能发生在手部操作上:人手与物体接触、完成抓握及转动手腕的过程,可以在 Sharpa 灵巧手上重新呈现。

打开网易新闻 查看精彩图片

Simulation → Reality

这种机制同样能够连接仿真域与真实域。模型保留仿真片段所包含的动作和交互,再以真实场景的初始外观为基础,生成对应的后续视频。

打开网易新闻 查看精彩图片

每行展示同一个交互过程:仿真输入位于左侧,真实视觉域中的重建结果位于右侧。

3. 从单张图像出发,连续探索可交互世界

PhiZero 能够接收持续输入、随时更新的控制信号。每当移动方向或观察视角发生改变,模型都会据此向前生成世界,同时努力维持环境布局、关键地标及空间关系的一致。

打开网易新闻 查看精彩图片

四段演示分别从异星地表、月下湖景、滨海村庄和落日原野展开。

4. 由驾驶动作决定未来画面

面对相同的道路起始帧,不同控制轨迹应当导向不同结果。PhiZero 会结合转向的方向与幅度生成相应未来;在下方四个案例中,多条备选控制信号及其生成视频被并列展示。

打开网易新闻 查看精彩图片

5. 预测机器人动作带来的视觉后果

在机器人任务中,抓取、舀取和双臂配合等动作轨迹可以先被编码为物理语言,再被还原为细致的交互视频。

打开网易新闻 查看精彩图片

视频看起来真实,为什么还不够?

近年来,视频世界模型的生成能力不断提升。输入一幅图像或一条文本指令,模型已经可以合成视觉效果出色的未来片段。但是,画面具有真实感,并不能保证其中发生的事情符合物理规律。

网球碰到玩具鸭之后,后者应当怎样移动?物体坠入滚烫的油中,会引发什么样的液体响应?金属容器爆炸时,火光、碎片和投影又该如何随时间共同改变?要回答这些问题,模型需要超越表面的像素质量,理解状态之间的转移、动作造成的影响,以及事件向后展开的因果关系

传统方法往往直接在维度极高的像素空间里生成未来,物理世界的状态转移也因此被包裹在巨大的视觉预测网络之中。这样的模型擅长合成下一段画面,却缺少一个专门用于表达 “世界接下来怎样变化” 的中间层。PhiZero 正是针对这一缺口提出。

“物理语言” 究竟是什么?

通过在大规模真实视频上进行自监督学习,PhiZero 获得了一组容量紧凑的离散表示,并将其称为物理语言(Physical Language)。这套表示不会重复记录颜色、纹理等静态视觉细节,也无意覆盖画面里的全部像素;它专门编码另一类信息:

对象怎样移动、彼此如何作用,以及整个场景从一个时刻过渡到下一个时刻的方式。

以倾倒液体为例,容器的形状与材质已经包含在首帧中;倾斜、流出、扩散等动态过程,则交由物理语言承载。如此一来,描述外观的信息与描述演化的信息被明确分工。

这种分工使状态变化具备复用的可能。即便更换场景、材质或对象形态,原有的运动和交互规律仍可被保存,并进一步参与组合与迁移。

打开网易新闻 查看精彩图片

画面中的对象与环境已经改变,贯穿事件的状态转移仍然保持一致。

PhiZero 的方法:推演在前,渲染在后

以物理语言为中间层,PhiZero 构建了Reason-then-Render(先推理、后渲染)的世界模型框架。

打开网易新闻 查看精彩图片

这套框架由两个主要阶段构成:

阶段一:将视频转写为物理语言。Physical Language Tokenizer 识别连续世界状态之间的差异,并把这些差异编码成离散符号序列。场景和对象的静态外观由第一帧提供,视觉细节则可以借助预训练扩散解码器恢复,因此,数量有限的符号能够集中记录真正发生的动态变化。

阶段二:在物理语言中预测后续事件。Physical Language Reasoner 接收当前图像与动作意图,按照自回归方式生成未来的符号序列;扩散解码器随后读取这些符号,将推理出的演化过程转换为视频。

因此,模型对未来的生成可以理解为一条三段式链路:

识别此刻的世界 → 推算后续的状态变化 → 绘制变化对应的视觉结果

物理语言对视频动态进行了高度压缩。一段 4 秒长、8 FPS、分辨率为 512×896 的视频,在首帧之后仅需256 个离散符号表示其状态演化;相比之下,标准视频 VAE 会使用 44,800 个连续视觉 token。重建实验表明,即使符号数量大幅减少,模型依然获得领先质量。这说明被压缩表示优先保留了与世界演化相关的信息,而不是反复存储静态外观。

物理语言从哪里来?

与人类语言一样,物理语言也需要从大量经验中形成。

打开网易新闻 查看精彩图片

训练数据经历了逐层筛选。研究团队先对约5 万小时真实世界视频进行去重、画质过滤和镜头级筛选,从中保留约1 万小时未标注内容,用于训练 Physical Language Tokenizer。接下来,真实视频与仿真视频共同构成约500 万个时长 4 秒的片段,帮助模型覆盖更多状态转移。最终,约100 万个运动充分、物理事件明确的样本被进一步选出,用来提升 Physical Language Reasoner 对世界演化的预测能力。

整个学习过程不需要人为规定某个符号必须表示 “碰撞”“重力” 或 “流体”。通过不断压缩视频、还原画面并预测未来,模型自行发现哪些变化值得记录,又该如何将它们组织成连续事件;物理语言由此从数据中逐渐形成。

用实验检验:它是否真的更理解物理世界?

打开网易新闻 查看精彩图片

这里给出四组 Physics-IQ 实例,橙色框对应 PhiZero 生成的视频。

研究团队分别从物理视频生成与物理事件理解两个方向对 PhiZero 进行了评估。

在生成侧,PhiZero 在Physics-IQ Verified、PhyGround、WorldModelBench三项基准中取得领先成绩,相关指标覆盖结果是否一致、过程是否遵循物理规律,以及整体世界建模水平。相较于直接在像素空间生成视频的模型,它更准确地表现出碰撞引起的移动、重力造成的形变、连续触发的反应,以及随对象位置改变的阴影。

在理解侧,PhiZero 在IntPhys2、LikePhys、YoCausal三项测试中也达到领先或具有竞争力的表现。模型可以把两段视频映射到物理语言空间并比较其合理程度,进而找出不符合直觉物理或因果逻辑的事件。

由此可见,物理语言不仅是一种服务于生成的高效编码,也提供了评判现实中哪些事件更有可能发生的表示基础。

为 AI 打开一条通往物理世界的新通道

自然语言之所以强大,并不只是因为它能给事物命名,还因为知识可以借助语言被抽象、重组、推导和传递。PhiZero 希望把类似的能力带到对物理变化的表达之中。PhiZero 则把连续的世界演化压缩成可传递、可推断的符号,使视频生成、物理理解、动作控制与运动迁移能够围绕同一个表示体系建立联系。

面向未来,规模更大的训练数据、更强的模型以及跨度更长的预测,有望继续拓展物理语言的表达范围。它还可能支持多模态模型理解时空关系、帮助具身智能体制定计划,并推动技能在不同机器人形态之间迁移。

文字让 AI 接触到了人类书写的数字知识;PhiZero 所做的尝试,则是让机器进一步读取运动与交互中蕴含的世界规律。

让 AI 不只看见世界,也学会物理世界自己的语言。