视频生成模型又卷出新花样了。这次不是生成一段视频等几分钟渲染,而是像直播一样,边生成边更新画面。

Visko 今天发布了 Orbis 1.0,官方称之为他们的第一个"Live Model"(实时模型)。核心能力一句话概括:实时生成一个场景,并且在新提示词进来时,持续更新画面,不需要重启整个生成流程。每次更新都会自然叠加到正在生成的场景中,像直播一样流畅。

打开网易新闻 查看精彩图片

这跟传统视频生成模型有本质区别。以前你输入一段提示词,模型吭哧吭哧生成几秒到几十秒的视频,不满意?改提示词,重新生成,等。Orbis 的做法是:场景一直在生成中,你随时丢新指令进去,画面直接跟着变,不用从头再来。

测试数据:74个测试用例,每个1-3分钟,每个包含6次提示词变更。技术报告显示,Orbis 在感知质量、运动质量和提示词对齐度上,领先于其他实时系统,包括 LongLive、Self-Forcing 和 SANA-Video。

这组数字说明什么?说明它不是为了炫技做的演示,而是真的在"持续生成"这个方向上做了系统性的工程优化。

输入输出规格

输入方面,Orbis 支持三种起点:

  • 文本提示词
  • 图片
  • 现有视频

输出方面,支持 4K 分辨率、24 FPS。这个规格放在实时生成这个前提下,算得上硬核了——毕竟很多非实时的模型,生成4K视频也要等不少时间。

更关键的是跨会话的一致性。测试中,Orbis 能在不同会话之间保持主体、场景和风格稳定。这意味着你上午生成一个角色,下午继续生成,它还是那个角色,不会变成另一个人。这对做长视频、做连续剧情的创作者来说,是刚需功能。

"持久记忆"和"物理接地"

官方介绍里有两个词值得注意:persistent memory(持久记忆)和 physics-grounded generation(物理接地生成)。

持久记忆解决的是上面说的跨会话一致性问题。物理接地则是说,生成的内容要符合物理规律——物体不会凭空消失,运动轨迹不会违反直觉。这两个特性叠加,加上"无界长度"(unbounded length)的生成能力,官方给的使用场景是"创建活的世界并实时流式传输"。

翻译一下:你可以用它做实时直播的虚拟场景,也可以做游戏里的动态背景,甚至做电影预演(previs)——场景不是预先渲染好的,而是实时生成的,随时可以改。

API 已开放

Orbis 1.0 现在已经在 visko.ai/models#orbis 上线,可以试用。API 通过 reactorworld 提供。这意味着开发者可以直接把实时视频生成能力接进自己的应用里,不用自己训练模型。

从产品定位来看,Visko 瞄准的不是"生成一段视频"这个旧需求,而是"持续生成一个世界"这个新需求。前者是单次请求-响应,后者是长连接-持续流。这个转变,跟当年从"下载文件"到"在线流媒体"的转变有点像。

跟其他实时系统的对比

技术报告里提到的对比对象——LongLive、Self-Forcing、SANA-Video——都是学术界和工业界在实时视频生成方向上的代表系统。Orbis 能在这些系统里领先,说明它的架构不是简单堆算力,而是在生成机制上做了创新。

不过,报告只提到了"领先",具体领先多少、在哪些细分维度上有优势,原文没有展开。对于想深入了解的人来说,可能需要去看完整的技术报告。

吐槽两句

说实话,"实时生成+持续更新"这个方向,之前不是没人提过,但大多数产品停留在演示阶段——生成几秒钟的短视频,然后告诉你"这是实时的"。Orbis 这次至少把规格拉到了4K/24FPS,还做了74个测试用例的系统性评估,看起来是认真在做产品,不是发个论文就完事。

但也要泼盆冷水:"无界长度"和"持久记忆"这两个词,在视频生成领域已经被用滥了。很多模型号称无限长,实际生成到一定长度就开始崩坏——主体变形、场景漂移、风格突变。Orbis 的测试用例最长只有3分钟,这个长度能不能撑住"无界"的承诺,还得看实际使用中的表现。