AI 生成图片、生成视频已经越来越常见。

真正困难的,不再是 "生成一段内容",而是让 AI 理解真实世界。

例如:

  • 给 AI 一张图片,它能不能推断出照片背后没有拍到的场景?
  • 给 AI 一段视频,它能不能按照指定机位,自然生成新的拍摄视角?

这些问题,正是世界模型希望解决的核心能力。近年来,世界模型也逐渐成为视觉 AI 领域的重要研究方向。

打开网易新闻 查看精彩图片

WorldScore 榜单

最近,兔展智能联合北京大学、鹏城实验室研发的 UniWorld-View 登顶李飞飞团队 WorldScore 世界模型榜单(训练数据来自北大系初创企业元空智能),并完成国产昇腾算力适配与代码、权重开源。

官方地址:

https://github.com/PKU-YuanGroup/UniWorld-View

UniWorld-View 尝试回答的,并不是 "如何让 AI 生成一张更漂亮的图片",而是另一个更难的问题:

AI 如何理解没有被拍摄到的世界。

AI 如何 "看到" 没有拍到的世界?

很多人第一次看到 UniWorld-View,会觉得:它像是一个可以 "任意换机位" 的视频生成模型。

事实上,它完成的远不只是视角切换。

你随手拍一段视频,或者只提供一张图片,UniWorld-View 就能够按照指定的相机轨迹,生成新的视角画面。

推、拉、摇、移,甚至绕着场景完成 360° 环绕,都能够保持较好的空间一致性。

更重要的是,无论是单图 3D 生成,还是视频 4D 生成,UniWorld-View 采用的是同一套模型、同一套代码完成不同任务,实现了真正意义上的 "Uni(统一)World-View"。

1、单图新视角合成

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

2、动态视频新视角合成

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

从一张图片或一段视频,到理解没有拍到的空间

先说为什么这件事难。

所谓新视角合成(Novel View Synthesis),本质上,是让 AI 根据有限的视角,推断没有拍摄到的空间,并生成对应的新画面。

难点在于 “大基线(large-baseline)” 上。

说得简单一点,就是:

只给 AI 看一张正脸,让它推断侧脸,甚至后脑勺应该是什么样子。

对于人来说,这或许并不难。

但对于 AI 而言,它不仅要生成新的内容,还需要保证空间结构、遮挡关系和物体位置保持一致,这也是世界模型研究的重要挑战之一。世界模型的目标正是让 AI 不仅生成内容,还能够学习和预测真实世界中的空间关系与环境变化。

过去,无论是 NeRF、3DGS 等重建路线,还是近年来大量生成式路线,都在尝试解决这个问题。

前者依赖大量、多角度的数据完成三维重建,问题也很明显,可随手拍的单目视频,视角覆盖约等于没有,喂给它们,轻则空洞伪影满天飞,重则直接摆烂;后者虽然敢画,但大多数方法只是把相机位姿当个 “口头指令”(一个抽象的条件向量)塞进扩散模型 —— 没有显式 3D 建模,走两步就飘,转大角度直接失控。

于是,近年来不少研究工作开始先用几何模型把画面撑成 3D 点云,再把目标视角的点云渲染图喂给视频扩散模型当条件,几何归几何,生成归生成,相机控制一下子准了。ViewCrafter、英伟达 GEN3C,走的都是这条路。

但在研发过程中,团队发现,这条技术路线仍然存在一个容易被忽视的问题。

点云渲染为什么容易 "穿帮"?

问题,就出在点云渲染。

点云是一堆孤立的点:既不知道谁跟谁相连,也不知道哪面朝外。

当相机视角变化较小时,这些问题也许并不明显,生成模型还能糊弄过去。

但一旦进入大角度的新视角生成,错误就会迅速放大,渲染图的穿帮主要体现在两个方面。

第一,是前景与背景容易发生撕裂。

深度边界处没有连接信息,视角一变,前景纹理就像口香糖一样被扯到背景上,或者背景像素直接糊到前景脸上。

第二,是背面漏光。

由于点云没有 “面” 的概念,不会自动遮挡。相机绕到物体背后,正面的点会直接透过来,相当于隔着后脑勺,看到了一张脸。

尤其是上了大基线,条件图里全是错误几何信号,扩散模型直接被带偏:结构扭曲、伪影乱飞。

针对这些问题,UniWorld-View 提出遮挡感知点云渲染(Occlusion-aware Point Cloud Rendering)。

第一步,是双重投影(Double-Reprojection),专治撕裂

打开网易新闻 查看精彩图片

遮挡感知点云渲染:解决前景背景撕裂

把源画面投影到目标视角,再原路投影回来。

来回一倒腾,凡是 “回不来” 的像素,就是会被遮挡的区域。

把这些区域沿相机轨迹逐帧累积成遮挡 mask,渲染时直接挖掉 —— 该是洞的地方就老老实实留洞,交给生成模型去补,而不是留一堆错误纹理误导它。

第二步:法向过滤,专治背面漏光。

法线过滤点云渲染:解决背面漏光
打开网易新闻 查看精彩图片
法线过滤点云渲染:解决背面漏光

给每个点估计法向量,和视线方向算个夹角:背对相机的点,直接踢出渲染。

两招下来,条件图里的错误信号清零,剩下的全是可靠几何 + 明确的待补区域。

双分支架构,一个管构图,一个管上色

几何理顺了之后,还有另一个问题。

点云渲染图能够提供准确的空间结构,但纹理细节仍然存在缺失;而原始视频保留了丰富的外观信息,却无法直接对应目标视角。

换句话说,怎么让生成结果既贴合目标视角,又和原视频长得一模一样?

UniWorld-View 的答案是 “双流条件注入”:

几何流”:点云渲染图 + mask,编码后加到潜变量上,负责把生成内容死死钉在 3D 结构上;

外观流”:源视频走新设计的 “Ref-DiT 模块”—— 新视角特征当 Query,源视频特征当 Key/Value 做 cross-attention,让模型自己去原视频里 "翻素材",哪儿缺补哪儿,连点云伪影造成的糊纹理都能顺手修掉。

一个管构图,一个管上色,二者共同作用,使模型在大角度视角变化下,依然能够保持较好的空间一致性与视觉质量。

模型框架图
打开网易新闻 查看精彩图片
模型框架图

4D 重建

既然能任意换机位,那多换几个机位,“单目视频不就变成多视角视频了”?

多视角视频一到手,4D 重建(动态 3DGS)就从不可能任务变成了常规操作。

常规生成式方法的相机是 “边走边拍”,空间变换和时间推进耦合在一起,视角在 4D 空间里分布极不均匀。

为进一步保证空间一致性,UniWorld-View 直接把两者解耦,分两步走:

先拍定妆照”:把时间冻结在第一帧,绕场生成一圈静态环绕视图,当整个场景的外观锚点;

再开机拍动态”:在固定机位上生成同步多视角视频,每个机位的第一帧用 “定妆照” 对齐,前景的自遮挡靠迭代生成逐步补全。

最终,生成的多视角视频可以进一步用于 4DGS 优化,实现从单目随手拍到可自由视角漫游的 4D 场景的完整流程。

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

随着生成式 AI 不断发展,视觉模型已经逐步完成了从 "生成图片" 到 "生成视频" 的演进。

而世界模型关注的,则是进一步理解空间、预测变化,并学习真实世界运行规律。近年来,越来越多研究认为,世界模型有望成为下一阶段通向具身智能、机器人等方向的重要基础能力之一。

Open-Sora Plan,到UniWorld,再到UniWorld-View兔展智能过去几年一直围绕视觉 AI 底层能力持续迭代。相比单纯提升生成效果,团队更关注统一理解、生成与空间认知能力,这也成为此次 UniWorld-View 探索世界模型的重要基础。

此次兔展智能 UniWorld-View 登顶 WorldScore 榜单,并完成国产昇腾算力适配与代码、权重开源,不仅展示了兔展智能团队在新视角生成方向上的探索成果,也为世界模型相关研究提供了一条新的技术路径。

作为由北京大学校友与北京大学视觉领域青年领军人才联合创立的高科技企业,兔展智能团队将持续围绕视觉空间人工智能开展研究。近期,公司也正将相关能力进一步产品化,推动视觉 AI 从模型走向实际应用。