世界模型,真的不一样了。

文/秋秋

老实说,我过去对世界模型有过刻板印象,总觉得它是一门偏「糊弄」的技术。

高情商地说,它的画面走意识流;低情商地说,提示词一输进去,像是在搅一锅东西。当时还有同事吐槽说,所有世界模型都烂得平等……至少在那会儿的体验里,很多东西看起来不怎么靠谱。

直到最近看到PixVerse R2的演示Demo,我才反应过来,世界模型已经不一样了。

演示视频里,我印象最深的是一段送信任务,用户一边按方向键跑路,一边打字说要一条密道。结果AI不仅生成了,还顺手给密道配了个开门UI,我当时都愣了一下,反复回看:这真不是魂游的逃课路线?

打开网易新闻 查看精彩图片

推出R2的爱诗科技,在上个月刚拿到了由阿里巴巴领投,共计29.8亿元的C轮融资。之前我们也分享过,项目背后还有前腾讯天美发行制作人、前叠纸CTO负责孵化。

没想到拿完融资才一个月,PixVerse又做了这么大的迭代。从R1跑通可交互视频,到现在R2真正可玩、可用,甚至在导演的监制下,R2能做到惊艳的「互动影游」体验。

导演小笼包的中世纪魔法题材作品《Zero Mark》预告

趁着R2公布几段演示Demo和技术报告的节点,我们或许也该重新认识一下世界模型:它进化到哪一步了?又会给游戏行业带来什么新影响?

01

世界模型进化到哪一步了?

话不多说,我们先看一下R2的演示Demo。Demo大致分三个方向:世界探索、故事剧情、角色交互。

其中,世界探索方向的Demo,展现了「低成本做游戏」的可能。

首先R2给了一个响应更丝滑的「游戏框架」。相比R1只能靠提示词改变世界,R2额外加了镜头控制、方向移动、跳跃这些更具游戏味的操作,且生成的延迟更低。比如修仙题材的Demo中,角色往前走,路随之往前延伸,云雾缭绕中场景渐隐生成,好像路本来在那里。

打开网易新闻 查看精彩图片

其次是能在框架中做玩法了。比如Demo里有两个连续的桥段。一个是角色转弯看到墙上藏着的门,推开直接进了密道;另一个是输入「衣服变成巡逻的样子混入其中」,角色一秒换装入戏。

打开网易新闻 查看精彩图片

这个潜行伪装桥段如果放在正经游戏里,设计师估计得键盘敲冒烟了,去做服装、动作、交互,改角色敌对状态……搞出一整套系统,才能保证玩家有不错的体验——但在Demo里,只是两句话的事。

故事剧情方向的Demo,则选择了另一条「游戏」路线:互动影游。

Demo有明确的打Boss主线,路上会遇到各种状况,AI会主动抛选项给你:是莽还是逃?该用什么武器?你可以像玩互动影游那样只做选择题,也可以自己输入提示词开新分支。这条路的未来发展方向,可能是一部画面衔接自洽、分支管够的实时互动影游。

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

角色交互方向的Demo就更加特殊了,因为它做的是真实自然的人物。

在直播带货Demo里,用户可以随时文字打断提问和猫粮有关的问题,主播说完当前这句会自然接话;

闺蜜交流的Demo里,你发语音让角色挎个包,她的动作神态也跟真人没什么两样。要知道,R2走的是视频生成路线,每一帧画面都是AI算出来的,不靠建模或预设动作,所以能做到真假难辨的地步,是一件可怕的事情。

视频还做出了手持拍摄的轻微晃动感

据了解,Demo选择真人出镜的题材,是因为这个方向最具挑战,如果换成3D、2D动漫风格会更轻松。可以预见,它拥有陪伴类游戏、虚拟偶像、文旅、电商等诸多落地方向。

看到这儿,可能大家还是有点迷糊:这样的Demo表现意味着什么?这样的技术很强吗?世界模型的进步到底在哪了?

关于强在哪里,可以打个比方。大家觉得画面很惊艳的视频模型,像是把水冻成冰再雕成冰雕,造型上限可以很高,但一雕成就定死了;世界模型则是让水一直流着,还要随时把它塑成你要的形状。

所以世界模型的技术实力和挑战在于不同的维度,光看Demo确实很难理解,得配着R2的技术报告一起食用。

简单来说,R2对管线做了大刀阔斧的修改,把管线从层层传递、层层折损,改为一个多模态模型力大砖飞直接输出,再将它直接蒸馏成实时版本——五层接力,变成了两步直达。

打开网易新闻 查看精彩图片

图 1|旧式多阶段Pipeline与 PixVerse R2 Scaling World Modeling对⽐:R2将能⼒扩展与实时蒸馏收敛为Omni Causal AR和实时加速层两个核⼼训练过程,并在同⼀框架中统⼀多任务、多信号与⻓视频建模。

基于新管线和框架,R2主要优化了三部分。

一是体验更沉浸丝滑。

R2升级了多模态输入,支持语音、文字、音频/图片参考、方向/镜头控制等方式,而且可以同时输入——送信Demo里你能边跑边打字,用的就是这个技术。

打开网易新闻 查看精彩图片

图 2|PixVerse R2 Omni Causal AR:模型可以在运⾏过程中持续接收不同类型的控制信号;在每⼀个交互时刻,当前⽣效的信号与对应粒度的动态⾳视频Chunk对⻬,并驱动下⼀段视频与⾳频⽣成。

在此基础上,R2还会用Dynamic Chunk给指令分级。上下左右移动的操作需要毫秒级反馈和生成,复杂提示词则需要一段完整的演出。提前把这些东西分好,AI就不用在反应和演出之间纠结。因此R2的生成延迟比R1大幅降低。

二是画面更不容易崩。

R2的记忆系统分为三层:Sink Memory储存规则、风格、场景、角色这些长期锚点,决定世界长什么样子,类似编剧;Rolling History处理和优化动作、镜头等衔接,类似分镜师;Object KV Cache储存AI对这个世界的理解,类似场记。这三者协同,能在一定预算内,降低角色漂移、场景突变、跨段闪烁和动作断裂等画面崩坏的概率。

打开网易新闻 查看精彩图片

图 3|Hybrid Teacher / Diffusion Forcing的统⼀Causal Attention Mask与 Relative Temporal RoPE。上⽅展⽰两种历史构造的因果可⻅性,下⽅通过编号⾏展开代表性Query的Q/K Block、 Relative Slot与RoPE ID映射,说明真实Block ID持续推进,⽽窗⼝内时间坐标始终保持有界。

有意思的是,他们还会给AI饭里掺沙子。

道理很简单,你光给AI喂好的,那真实情况下给它稍微吃得差了点,反应就会特别大,画面说崩就崩;光喂差的,输出质量又上不去。所以把两种内容按配比同时喂给AI,它才有「耐受性」,出了小错能自己稳住和修正。

据他们的评测,这套逻辑对亮度色彩漂移、静止场景里的错误运动、角色状态偏移尤其有效。其中亮度漂移指标从约0.2降至0.13,降幅35.8%;29个长序列样例中有20个获得改善。

你可能也发现了,亮度、状态、静止时乱动这些问题,刚好是数字人最怕的崩点。R2 Demo里那些真假难辨的角色,背后多半有这套记忆系统的发力。

打开网易新闻 查看精彩图片

第三,也是最务实的——省钱。

R2采用了Block-sparse Attention技术,让AI只把注意力花在关键的地方,思路很像游戏渲染里的「看不见的不画」。简单来说,这一项把AI的注意力计算量砍掉了90%以上,但画面质量、动作连续性、长时稳定性没有明显退化。

打开网易新闻 查看精彩图片

另外还有Pyramid Ultra-few-step Distillation技术,先用低分辨率打底,确定场景、运动和镜头,再用高分辨率精修纹理细节,类似游戏研发中的「白模-贴图」环节,让AI生成的延迟更低、重复计算更少;DDMD的正则对抗,保证在极少的生成步数下,指令响应依然精准、画面依然精细,给「两步直达」的管线兜住了质量下限。

打开网易新闻 查看精彩图片

R2不仅在模型内部省钱,还在产品层面做到了开箱即用。据了解,R2 的最新版本已经把AI知识库、语音都集成进了模型内部,真正做到音画同步输出,厂商只需要接一个API,就能用到完整的模型能力,不用额外付费或外挂能力。

当然,目前R2只公开了几段几十秒的演示Demo和技术报告,他们自己也在报告里承认,R2的生成质量距离前沿的离线视频模型还有差距,模型仍处于预训练研究阶段。

也就是说,虽然他们摸索出了一条比较明确的路线和框架,但上限在哪,还需要持续验证。

02

游戏行业开了个口子

虽说挑战还有不少,但到了这个阶段,世界模型能讨论和想象的空间已经大多了,对游戏行业的影响也更清晰了。

其中最先可能发生的影响,是一些游戏品类可能会有新变化。

比如互动影游类产品。自从《完蛋!我被美女包围了!》爆火,这个品类焕发了第二春,但最大的挑战一直是成本。不管真人实拍还是AI生成视频,都要先做出数十上百小时的内容,游戏还没见着玩家,钱就先花出去了。

而世界模型实时生成内容,相当于后置了很多成本,回收风险更低。至于大家担心的生成质量,我认为类比AI短剧的发展趋势,后续会有一批人能接受这种明知是AI,但还是想图一爽的内容,R2也许能正好卡在这个需求上。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

比如近期爆火的互动影游小游戏《别崩人设啊》

可点击查看大图

有意思的是,今天PixVerse官方还公布了三段基于R2世界模型的互动影游Demo,除了上面导演小笼包的作品《Zero Mark》外,还有导演JadeWu的科幻恐怖题材作品《畸变回声》;

以及导演也毛的科幻太空探索作品《Battle of the Moon》,在有导演的精细监制下,R2的生成质量显然高出了很多。

再比如情感陪伴类游戏。前面说过,R2生成的角色一致性高、交互自然,比起3D/2D建模加动作库的传统路线,在成本、流畅度、交互体验上都有优势。未来的二次元、女性向产品,或许真能用上这个技术。目前爱诗内部孵化的两款项目已经在尝试应用,还有一批潜在合作伙伴正在接触。

打开网易新闻 查看精彩图片

爱诗孵化的乙游项目的PV画面

稍远一点的影响,是游戏研发。

世界模型的流程是从文字直接跨到可交互的「游戏」。这意味着开发者脑子里的东西能更快落地。比如策划直接用文字预览游戏Demo,让玩法创意、画面机制用更具体的方式呈现。甚至更进一步,游戏研发这件事,能不能靠世界模型实现边做边测?

再往远处说,创造和体验的边界可能会被进一步模糊。

比如玩家的娱乐方式,变成了随时随地创造出世界;或者未来游戏对抗的形态从规则变成想象力,你能掏出飞机大炮,我能修仙斗法……

再比如UGC会不会成为一个更普遍的现象?毕竟《我的世界》将编程语言变成方块,就撑起了这么大的创作生态,那直接用自然语言造世界,潜力会不会更大?

打开网易新闻 查看精彩图片

R1目前可以输入几个字,等待30秒后,生成一个可持续运行5分钟的世界,创作门槛极低

当然,上面这些内容更多只是未来畅想。而且我猜聊到这里,有的朋友又要问那个问题了:世界模型会跟游戏行业竞争吗?

我对此倾向于乐观。

首先,世界模型更像全新的娱乐形态,仍处于萌芽期。画面和玩法在很长时间内都赶不上主流游戏。有从业者表示,他们的世界模型产品跟《荒野大镖客2》比,可能连万分之一都做不到。

打开网易新闻 查看精彩图片

其次,两者的体验存在一定错位。大家玩游戏,更多玩的是创作者的独特表达,美术、玩法、叙事等都是收束的;而目前来玩世界模型的人,有不少玩的是随机体验、控制欲、想象力,反而模型生成得越离谱越好。玩家上号玩精品游戏,闲下来再随手造个世界,两件事并不冲突。

打开网易新闻 查看精彩图片

R1世界模型,输入核爆炸、飙车、吃饭(动图有剪辑)

最后,两者有互补的趋势。游戏行业一直在追求GaaS化和无限游戏,需要源源不断的内容留住玩家,而世界模型等AI技术,是能持续提供内容的主流手段;反过来,世界模型需要海量数据和规则去收束训练,游戏又是采集数据、验证成果最好的场所之一。

其实回头看,「游戏」这个词的边界一直在变化。从线下娱乐到游戏机、单机、端游、手游……每一次技术突破,都让游戏的形态扩容一次。

而这一次,站在边界上的是世界模型——它未必会长成我们所熟悉的游戏的样子,但它构建的世界、带来的体验,很可能会在下一轮扩容中扮演重要角色。

目前PixVerse R2已经开启了体验申请,感兴趣的朋友可以点击「阅读原文」参与报名。

打开网易新闻 查看精彩图片


(星标可第一时间收到推送和完整封面)