打开网易新闻 查看精彩图片

不动模型,只动证据:世界模型由此成为通向真实世界的入口。


编辑丨岑峰

▎论文与作者信息

  • 论文标题:World in World: Explore the World with World Models

  • 作者:Chenxi Song(宋晨曦)、Yanming Yang(杨颜名)、Chi Zhang(张驰)

  • 论文: https://arxiv.org/abs/2609.11548

  • 项目主页:https://chenxi-song.github.io/worldinworld

  • GitHub:https://github.com/Westlake-AGI-Lab/WorldinWorld

  • 第一作者宋晨曦是西湖大学 AGI 实验室博士后研究员,研究方向为世界模型、可控视频生成。通讯作者张驰为西湖大学助理教授、AGI 实验室负责人。

过去一年,视频生成的重心正在从"生成一段视频"转向"运行一个世界"。自回归视频世界模型不再一次性输出固定长度的片段,而是一段接一段地预测下一时刻的画面,用户可以在生成过程中随时移动相机、转动视角,模型像游戏引擎一样实时响应。9 月初,李飞飞的 World Labs 发布新一代世界模型 Atlas,再一次把"世界模型"推到聚光灯下:从一张图出发,生成一个可以任意运镜的世界,成了这个方向的标志性画面。

热闹之中,有一个问题很少被讨论:这些世界从哪里来?今天的世界模型,起点大多是文字、图片,或者模型自己的想象。而现实世界最常见的记录形式——视频——反而还没有被真正"走进去"过。一个自然的追问是:能不能让世界模型走进一段真实存在的视频,去探索那段视频里正在发生的世界?

西湖大学 AGI 实验室的研究团队给出的答案是World in World(WiW)。它不改动世界模型的任何参数,也不训练任何新模块,而是把源视频、几何、历史生成结果等控制信息统一转化成模型本来就会读的"视觉证据",通过模型自带的自注意力读进去。凭这一个接口,同一个冻结的世界模型就能在一段视频的世界里自由运镜、做 360° 环绕和子弹时间、改画面、迁移动作,还能记住来路、与另一个模型实例共享所见。

打开网易新闻 查看精彩图片

图 1 World in World:探索视频中的世界。左为源视频记录的事件,右为同一事件在新视角下的生成结果——360° 向内环绕、360° 向外环视与自由探索。

首 屏 16 宫格墙

主演示片

01

为什么"走进一段视频"这么难

从一张照片生成一个可以走动的三维场景,已经有不少成熟做法。视频难在多了时间这一维:它不是一个静止的空间,而是一个正在发生的事件。

模型必须同时做到四件事:生成画面与源视频中事件的进展保持同步;源视频里看得见的内容出现在新视角的正确位置;相机转过去后新露出的表面被合理补全;相机转回来时,早先生成过的内容还记得住。同步、对位、补全、记忆,缺一件效果就露馅。

现有方法通常为每项需求单独设计模块、单独训练:相机控制训一套条件编码,源视频重运镜训一套编码器,长时记忆再训一套记忆模块。每多一种控制,就多一条专用通路、多一轮训练。当预训练世界模型越来越强,这种"每种控制都要改造一次模型"的做法,代价越来越高,改造之后能不能保住模型原有的能力,也没有保证。

02

核心思路:不改模型,

把控制变成模型会读的"视觉证据"

WiW 的出发点是一个观察:因果视频世界模型在自回归生成时,本来就要通过自注意力读取初始帧和最近生成的画面,每个状态都带着相机与时间编码。也就是说,模型早就有一条读取"视觉状态"的通用入口,只是过去只用来读自己的输出。模型读自己的过去,和读外部的世界,可以走同一条通道。

WiW 把外部控制信息全部变成同一种东西:无论是源视频帧、投影到目标视角的画面、渲染出来的人体几何,还是已被滚动缓存淘汰的历史状态,一律标注上相机位姿、事件时间与有效区域,以干净状态送进冻结的骨干网络提取 K/V,再让当前的去噪 token 通过原生自注意力读到它们。扩展世界模型的控制能力,由此从"改造模型"变成了"构建并编排视觉证据"。这和大语言模型的经验是相通的:对一个足够强的预训练模型,很多能力不是训出来的,而是"给它看对东西"之后自己长出来的。

打开网易新闻 查看精彩图片

图 2 WiW 方法总览。源视频、目标视角投影、3D 人体几何、点轨迹等被统一构建为 K/V 形式的视觉证据,由冻结的世界模型通过原生自注意力读取;历史记忆、编辑内容、其他模型的 K/V 都可以作为可选证据接入同一接口。

具体来说,WiW 围绕"同步、对位、补全、记忆"四项需求构建了四类互补证据:带时间标签的源视频画面负责让事件同步推进;基于深度把源画面投影到目标视角,负责空间对位;用 3D 数字人渲染出相机转过去后新露出的人体表面,负责补全;一个覆盖整段生成的历史库,负责在相机转回旧区域时把当时生成的内容找回来。每一类证据只负责自己最可靠的那部分信息,合在一起覆盖全部四项需求。

在"怎么读"上,论文提出了两个轻量机制。对应引导注意力路由(CGAR)用源视频中追踪到的点对应关系告诉模型"该看哪里",在几何给不出匹配的地方则不干预;证据级注意力 CFG(EWA)在单个注意力层的响应上,为每种证据独立调节引导强度、只放大证据带来的互补信息,并且复用同一次前向的结果,不增加任何额外的网络计算。一个管"看哪里",一个管"信多少",都发生在模型原有的注意力层里。

03

一个冻结模型,解锁十余种玩法

所有控制都走同一条通路,只需换一换证据的构成方式与相机、时间标签,同一个冻结的世界模型就能做完全不同的事。下面这些功能不是逐个开发出来的特性,而是同一个接口下不同的"取景方式"。

自由运镜与 360° 探索。给定一段普通视频,用户可以像玩第一人称游戏一样,用键盘在视频里的世界中移动、环顾,也可以围着主体绕一整圈,或站在场景中向外环视。事件进程始终与源视频同步,镜头没拍到的部分由模型的生成先验补全。一段视频由此不再是一个固定的观看位置,而是一个可以被重新观察的场景。

打开网易新闻 查看精彩图片

自由运镜·拳击

打开网易新闻 查看精彩图片

自由运镜·机器人

打开网易新闻 查看精彩图片

360° 向内环绕·双人舞

打开网易新闻 查看精彩图片

360° 向 外环视 ·独舞

子弹时间。《黑客帝国》式的子弹时间过去需要几十台相机同步拍摄;在 WiW 里,只需要一段视频。做法上,它只是把证据的事件时间固定在某一帧、让相机继续运动。时间在这里成了一个可以被固定的标签。

打开网易新闻 查看精彩图片

子弹时间·牛奶飞溅

打开网易新闻 查看精彩图片

子弹时间·小丑

视频编辑。把编辑后的画面作为证据接入,模型会在保持原有运动与镜头的前提下,把修改一致地传播到整段视频。编辑不再是逐帧的活,而是改一处、传全篇。

打开网易新闻 查看精彩图片

视频编辑

跨模型通信。既然模型读的是 K/V 形式的证据,另一个模型实例的 K/V 同样可以传过来。论文展示的例子里,一个固定机位的实例被告知场景中发生了变化,另一个自由运镜的实例读取它的缓存后,在自己的视角里也"看见"了这一变化;不共享时则看不到。两个实例之间没有文本或图像的中转,交流的就是注意力缓存本身。这为多个世界模型共享同一个世界打开了一个口子。

打开网易新闻 查看精彩图片

图 3 跨模型通信:模型 A 与模型 B 是同一冻结模型的两个实例。B 生成的 K/V 作为记忆传给 A 后,A 在自由运镜下也能看到 B 所知晓的场景变化(右列);不共享记忆时则看不到(中列)。

打开网易新闻 查看精彩图片

跨模型通信三联对比

人体动作迁移。把另一段视频中的人体动作换成 3D 人体几何证据,画面里的人就会照着做,同时相机仍可任意运动。动作、人物、机位三者各有来源,彼此解耦。

打开网易新闻 查看精彩图片

人体动作迁移 + 重运镜

长视频与更多。同一接口还能撑起几十秒不间断的连续生成,早先生成的内容可以随时被检索回来,这是长时间生成不走样的基础。此外还支持视频去抖、多机位式的视角切换,以及边按键边生成的实时交互,这里不再一一展示。

长椅场景 40 秒连续生成,2× 加速播放(20 秒)

这些取景方式还可以叠加。项目主页上的多支"冻结 360°"案例,就是把时间停住和 360° 环绕同时做出来的结果。因为它们不是功能列表上的独立条目,而是同一个接口上的不同参数组合。

04

实验:和主流方法放在一起看

研究团队在公开发布的 LingBot-World 2.0 上实现了 WiW,全部参数冻结,并在 DAVIS 与 OpenVid-1M 两个数据集上,把它和当前最主流的一些视频重运镜与 4D 世界模型方法放在一起,比较相机可控的视频重运镜。在同样的源视频与目标相机路径下,这个没有动过参数的模型在主体与场景一致性、视角控制和新露出区域的补全上都表现稳定(图 4)。

打开网易新闻 查看精彩图片

图 4 不同相 机运动下 的定性对比。所有方法接收相同的源视频与目标相机路径;从左到右依次为逆时针环绕、右转、下俯、右移、前进,WiW 为最下一行。

05

为什么是现在

这件事在两年前很难做成。它依赖两个条件:一是开放权重的视频世界模型已经足够强,能在真实场景里补全看不见的部分,并且保持前后一致;二是自回归、带相机与时间编码的架构成为主流,给"递证据"留下了天然的入口。WiW 是在这两个条件上顺势而为,它没有造一个更大的模型,而是让已有的模型多了一种用法。

这也意味着它会随着底座一起变好。底座模型的画质、一致性、长度每提升一档,走进视频里的探索也就跟着提升一档,而接口本身不需要重新设计。

06

结语:

世界模型的可控性,是一个"证据"问题

World in World 这个名字有两层含义:一段视频记录的世界,被装进了世界模型生成的世界之中;世界模型探索的对象,也从纯粹的想象扩展到了真实记录的事件。

更深一层的启发在于方法论。过去,扩展世界模型的控制能力意味着改造模型;WiW 表明,对一个足够强的预训练世界模型而言,控制可以被重新表述为视觉证据的构建、选择与调控。这条"不动模型、只动证据"的路成本低,也能跟着底座一起升级。

往前看,能被走进去的不只是电影片段和体育录像。一场直播、一次手术示教、一段机器人采集的操作数据,都是正在发生的世界的记录;当它们可以被重新观察、被多个模型共同理解,世界模型就不只是一个生成器,而是一个通向真实世界的入口。

为了方便大家抱团交流、互通会议消息,我们专门建了IROS2026参会交流群!进群你会解锁这些「福利」

  • 会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航:场馆分布、报告厅怎么走,群里随时问;

    议题共读:热门 session、Keynote 探讨,错过也能追;

    Poster 汇编:现场海报精华整理,一键收藏不遗漏;

    约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

进群传送门:扫码进群或添加微信Luyoyo_2026,备注:ECCV + 单位/学校+姓名+方向。

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。