来源:市场资讯

(来源:科技行者)

打开网易新闻 查看精彩图片

这项由阿拉雅实验室(Alaya Lab)联合加州大学默塞德分校共同完成的研究,以技术报告形式发布于2026年7月21日,论文编号为arXiv:2607.18703v1,有兴趣深入了解的读者可通过该编号在arXiv平台查询完整论文。

电子游戏的画面是怎么生成的?绝大多数人从未思考过这个问题。当你操控游戏角色穿越一片森林,屏幕上的每一棵树、每一道光影、每一滴水珠,都是游戏引擎在极短时间内精密计算出来的。传统的游戏画面生成方式,像是一套严格按照物理规律运行的精密仪器——它告诉你,光从哪个角度照来、树叶的材质是什么、地面有多粗糙,然后按照这些数据老老实实渲染出画面。这套方法可靠、一致,但也因此受限:它能生成的画面风格是固定的,你没法一键把一个晴天的竹林瞬间变成赛博朋克霓虹夜景。

阿拉雅实验室的研究团队想做一件很有野心的事:让AI来承担游戏画面的最终渲染工作。游戏引擎依然负责计算物理规律——哪里有墙、角色走到哪了、光从哪来——但画面的最终"外观",交给一个经过大量训练的生成式AI模型来完成。这样一来,只需要改变输入给AI的文字提示,玩家就能把同一段游戏场景变成雪山、火山、深海或赤外线风格,而不需要改动任何游戏底层逻辑。

这个想法并不是凭空而来的。研究团队此前已经开发了一个名为AlayaRenderer(阿拉雅渲染器)的系统,它能够接收游戏引擎导出的"结构化世界状态数据",并将其转换为真实感极强的彩色画面。但这套系统有一个致命缺陷:它太慢了。每秒钟只能生成0.56帧画面,而正常游戏体验至少需要30帧。换句话说,原版AlayaRenderer的速度只有实际需求的大约五十四分之一。

这就是AlayaRenderer-Flash(阿拉雅渲染器·闪速版)诞生的原因。研究团队在这份技术报告中详细描述了他们如何将这套系统从龟速推进到实时可玩的30帧每秒,中间经历了哪些技术上的取舍与创新。整个过程就像把一台精密但笨重的手工相机改造成一台能连拍的运动相机——不改变它拍摄的"眼睛",而是彻底重新设计它的快门、胶卷和冲洗流程。

一、游戏引擎的"草稿纸":G缓冲区是什么

要理解这项研究,需要先弄清楚一个关键概念:G缓冲区(G-buffer)。

现代3D游戏在正式生成画面之前,会先把场景中的所有物理信息整理成一套"草稿数据":这个表面是金属的还是塑料的,它有多粗糙,从哪个角度看它有多深,法线方向朝哪——所谓法线,就是物体表面朝向的方向,决定了光如何反射。这些草稿数据统称为G缓冲区,通常包含五个通道:反照率(albedo,表面本身的颜色)、深度(depth,物体距离摄像机多远)、法线(normal,表面朝向)、粗糙度(roughness,表面光滑程度)和金属度(metallic,材质是否像金属一样反光)。

G缓冲区的存在,让游戏引擎可以把"场景几何计算"和"最终着色渲染"分成两步走,这是一种叫做"延迟渲染"的经典技术。传统做法是,引擎自己完成第二步着色,生成最终画面。而AlayaRenderer系列的核心思路,就是把第二步替换成AI——G缓冲区告诉AI"世界长什么样",AI负责决定"画面看起来是什么风格"。

由于G缓冲区完整保留了场景的几何结构和物理属性,AI生成的画面在结构上必然与游戏世界保持一致,不会凭空添加不存在的建筑,也不会让角色凭空消失。这就保证了在AI可以自由发挥画面风格的同时,游戏玩法逻辑完全不受影响。

研究团队将AlayaRenderer建立在一个叫做Wan 2.1的视频扩散模型基础上。这类模型的工作原理,可以用冲洗照片来理解:你先把底片(含有噪声的随机数据)放入暗房,经过多次显影步骤,逐渐还原出清晰的照片。每次"显影"就是模型运行一次去噪计算。原版AlayaRenderer需要经过50次这样的去噪步骤,才能生成一组画面。这也是它速度慢的根本原因。

二、三把"加速刀":让渲染从蜗牛变成猎豹

研究团队在AlayaRenderer-Flash中使用了三项核心改进,每一项都像是给这台慢吞吞的"显影机"加装了一个不同的加速装置。

第一把刀:改变生成方式,从"批量冲印"变成"流水线冲印"。原版AlayaRenderer一次处理21帧数据,而且必须看完整个片段才能开始生成——这叫"双向固定窗口"生成。打个比方,这就像一家照相馆规定必须等你拍完整个婚礼,收集好所有底片,才开始冲洗第一张。对于一个不知道何时结束的实时游戏流来说,这套机制根本无法运作。

AlayaRenderer-Flash改为"自回归流式生成"——把视频切成小块(每块4帧),每生成完一块就立刻输出,同时把已生成的历史帧保存下来,作为生成下一块的参考。这就像流水线工厂:冲印好第一批照片之后,立刻把它们放到传送带上,同时开始冲印第二批,而不是等所有照片都冲好才发货。

为了保持整段视频的视觉一致性,研究团队还设计了一套三层历史压缩机制:离当前帧最近的历史帧以完整精度保存,稍远的历史帧被压缩成中等精度表示,更远的则压缩得更粗糙。此外,第一帧生成的结果会作为"全局外观锚点"一直保留,让AI在生成任何时刻的画面时,都能参考整段视频的初始风格,避免画面风格在长时间游戏中慢慢漂移。

为了确保文字提示在整个游戏过程中持续生效,每一层注意力机制都配备了专属的"文字接收槽",把风格提示的信息永久嵌入模型的运算流程中,而不仅仅依赖标准的交叉注意力机制。

第二把刀:把50步去噪压缩成4步。这是加速效果最显著的改动,但也最难做到不损失质量。直接把50步缩成4步,就像把一道需要烤90分钟的蛋糕强行压缩到7分钟——外面糊了里面还是生的。

研究团队为此设计了一套三阶段"蒸馏"流程,像是逐渐调快学生学习节奏的培训计划。第一阶段叫做"引导蒸馏":原本AI在去噪时需要同时考虑"有提示"和"无提示"两条路径(分类器无关引导,CFG),这意味着每步去噪要跑两次计算。引导蒸馏把这两条路径合并成一条,训练一个学生模型,让它一次计算就能模拟出老师模型两次计算的结果,同时保留完整的50步去噪步数。第二阶段叫做"渐进步数缩减":学生模型依次经历32步、16步、8步、最终4步的训练,每次适应更大的去噪跨度,避免突然跳到4步时训练崩溃。第三阶段叫做"平均流蒸馏(MFD)加自回归训练":在这个阶段,学生模型不再接收真实视频的历史帧,而是完全依赖自己之前生成的帧——这与实际游戏中的使用方式完全一致,消除了训练时和使用时的差距。

研究团队在第三阶段尝试过另一种叫"DMD"的对抗训练方式,但发现它容易产生色彩异常,因此改用更稳定的平均流蒸馏方法。另外,过于激进的步数压缩会让画面丢失细节纹理,为了补救这一点,研究团队在模型中附加了轻量级的GAN(对抗生成网络)模块,专门负责恢复局部纹理细节,同时给这个模块分配较小的权重,确保它不会干扰主要训练目标。

第三把刀:把两端的"编解码器"换成轻量级版本。即使把去噪步数压缩到4步,编码(把G缓冲区数据转换成AI能处理的潜在表示)和解码(把AI输出的潜在表示还原成实际像素画面)两个环节依然耗时巨大。具体而言,原版系统需要对五个G缓冲通道分别运行一次完整的Wan VAE编码器,一共五次;解码则依赖同样笨重的Wan VAE解码器。

研究团队把这两个环节都替换成了轻量级蒸馏版本。轻量级解码器采用了一个叫TAEHV的架构,在Wan 2.1的预训练权重基础上,针对游戏内容进行了专门的域内蒸馏训练,让它学会用冻结的原版Wan解码器的输出作为目标,同时使用像素重建损失和感知损失来优化质量。轻量级G缓冲编码器更进一步:不再分五次分别编码五个通道,而是用一个共享的微型编码器,一次前向传播就完成所有五个通道的编码,然后与整个渲染器进行联合微调。

这三把刀加在一起,把原版AlayaRenderer的0.56帧每秒,经过每一步逐渐推进到了最终的31.54帧每秒。

三、一步一步来:每项改进贡献了多少速度提升

研究团队在论文中详细记录了每个改进阶段的效果,这让我们能够清楚地看到速度提升的来源。

第一阶段,仅加入自回归流式生成(保留50步去噪),速度从0.56帧每秒提升到1.53帧每秒。与此同时,场景结构保留度(用CLIP图像相似度衡量)从0.836提升到0.846,窗口间过渡的平滑度也有所改善。但时序稳定性(相邻帧之间的一致性)有所下降,这是自回归模式固有的挑战——每帧都依赖上一帧,误差容易积累。

第二阶段,加入4步蒸馏(保留轻量级前的编解码器),速度跃升到6.30帧每秒,而各项画质指标基本持平甚至略有改善,时序稳定性反而从0.197改善到0.158(数值越低越好),说明4步蒸馏在减少步数的同时,也减少了帧间的细微差异积累。

第三阶段,加入轻量级编解码器,速度从6.30帧每秒大幅跃升至31.54帧每秒,显存占用也从22.6GB降低到16.2GB。画质指标进一步维持或轻微改善,研究团队认为这是因为轻量级编解码器在游戏域数据上经过了专门蒸馏训练,对游戏内容有更好的适配。

换句话说,三把刀的速度贡献大致是:自回归改造贡献了约3倍加速,4步蒸馏贡献了约4倍加速,轻量级编解码器贡献了约5倍加速,三者叠加实现了总体约56倍的速度提升。

四、与其他同类方法的横向比较

研究团队将AlayaRenderer-Flash与两个同类型的外部方法进行了对比,所有方法都在同一个数据集(《黑神话:悟空》游戏画面,包含1352个训练片段和131个测试片段,分辨率1280×720,帧率30FPS)上重新训练和评测。

第二个对比方法是FrameDiffuser,它引入了自回归时序建模,场景一致性改善到0.844,FVD降至650.6,但它不支持任何文字提示控制——画面风格无法通过提示词改变。更关键的是,它的时序稳定性非常差(tLPIPS高达0.440),在长时间游玩中会出现明显的画面飘移:颜色、光照、甚至几何形状会逐渐发生变化。它的速度只有0.31帧每秒,比原版AlayaRenderer还慢。

此外,研究团队还将DiffusionRenderer纳入了讨论,但由于它采用双向生成而非自回归流式生成,无法在相同协议下进行公平的流式对比。在给予它"每25帧为一个独立窗口"的有利条件下,DiffusionRenderer的场景一致性达到0.870,FVD降至335.5,优于AlayaRenderer-Flash,但速度仅有1.10帧每秒,同样无法实时运行。

AlayaRenderer-Flash在场景一致性(0.847)、FVD(384.1)、时序稳定性(0.155)和文字提示控制能力(MCLIP 0.043)上取得了均衡的最佳成绩,是唯一一个同时满足实时速度、支持提示词切换、自回归流式生成和少步推理四个条件的方法。

五、在真实游戏中跑起来:SuperTuxKart的实测

纸面上的数据终究需要在真实环境中验证。研究团队选择了一款叫SuperTuxKart的开源卡丁车赛车游戏作为测试平台,这款游戏完全开源,便于集成外部渲染管线。

团队首先在SuperTuxKart的游戏画面上采集了一套专属数据集,包含同步的RGB帧和五个G缓冲通道,然后对AlayaRenderer-Flash进行了针对这款游戏的微调训练。随后,他们把微调好的模型嵌入到SuperTuxKart的实时运行流程中,形成了一个闭环系统:玩家通过手柄或键盘控制赛车,游戏引擎照常计算物理和逻辑,并持续导出G缓冲区数据;AlayaRenderer-Flash接收这些数据,结合玩家输入的文字提示,实时生成风格化的画面,立即显示给玩家。

整套流程运行在单张NVIDIA H200显卡上,AlayaRenderer-Flash本身(含G缓冲编码、4步扩散生成、RGB解码)跑在31.54帧每秒;加上游戏引擎侧的G缓冲回读、数据传输和画面同步,完整交互系统稳定维持在30帧每秒的目标帧率,达到了完全可玩的水准。玩家可以在游戏进行中随时切换风格提示——从普通白天变成雪夜、从写实风格变成赛博朋克——而游戏本身的物理模拟、碰撞检测、路线逻辑完全不受任何影响。

六、提示词切换:在一场游戏里穿越八个世界

提示词实时切换是AlayaRenderer-Flash的一个特别值得关注的能力。研究团队专门设计了一组长达637帧的测试序列,在单次流式生成过程中每隔五个数据块切换一次提示词,总共循环经历八种不同的视觉风格:赛博朋克、火山、沙尘暴、极地、蒸汽波、神圣金色、深海、红外线。

结果显示,每次提示词切换后,画面风格的转变既明确又平滑,没有出现明显的画面撕裂、残影或边界异常。场景中的几何结构(地形、角色、相机运动轨迹)在整个637帧的生成过程中保持完全一致,说明自回归历史压缩机制和全局外观锚点机制共同发挥了作用,既让风格随提示词变化,又防止了场景结构随时间漂移。

说到底,这项研究解决的核心问题,其实是一个很朴素的矛盾:AI生成画面的质量够好,但速度不够用。研究团队通过三项互补的系统改造——让生成方式从批量变成流水线、让去噪步数从50步压缩到4步、让两端的编解码器从臃肿变成轻巧——把一个只能离线慢慢跑的渲染器,改造成了能跟上真实游戏节奏的实时系统。

归根结底,这件事的意义在于证明了一条新路的可行性:游戏引擎不需要被AI完全替代,两者完全可以协作——引擎管物理和逻辑,AI管画面和风格。玩家因此获得了一种以前不存在的体验自由:游戏规则不变,但视觉世界可以随心而变。

当然,这套系统目前还有明显的局限。它需要为每款游戏单独采集数据并微调,显存需求仍然较高(16.2GB对消费级显卡而言并不轻松),画质在与离线双向渲染方法(如DiffusionRenderer)相比时仍有差距。研究团队并没有回避这些问题,而是将本报告定位为"向实时生成式世界模型迈进的一步"。

有一个问题值得读者思考:如果AI能够接管游戏画面的生成,那么"游戏画面设计师"这个职业会走向何方?或者反过来说,如果风格切换变得像打字一样简单,游戏体验的边界会不会因此被彻底重新定义?这或许是比技术本身更有趣的问题。对技术细节感兴趣的读者,可以通过arXiv编号2607.18703查阅完整的技术报告。

Q&A

Q1:AlayaRenderer-Flash需要什么样的硬件才能跑起来?

A:根据论文中的实测数据,AlayaRenderer-Flash运行在单张NVIDIA H200 GPU上,显存占用约16.2GB,在这一配置下实现了31.54帧每秒的渲染速度。H200属于当前高端专业级显卡,消费级显卡能否达到同等性能,论文中并未说明。

Q2:AlayaRenderer-Flash生成的游戏画面和原版游戏画面相比质量差多少?

A:AlayaRenderer-Flash和原始游戏画面在语义内容上保持一致(CLIP图像相似度0.847),但它的目标并非像素级复现原始画面,而是在保留场景结构的基础上生成风格化的新画面。与离线双向方法DiffusionRenderer相比,AlayaRenderer-Flash的CLIP相似度(0.847对0.870)和FVD(384.1对335.5)略低,但后者无法实时运行。

Q3:AlayaRenderer-Flash支持哪些游戏?

A:目前AlayaRenderer-Flash在《黑神话:悟空》和开源游戏SuperTuxKart上进行了验证。适配新游戏需要采集该游戏的专属G缓冲区和RGB数据集并进行针对性微调,不能直接通用于任意游戏,这是当前系统的主要限制之一。