作者|周雅

如果你留意游戏赛道,会发现一个现状:移动游戏的画质和体验,一直在向桌面级和主机级看齐。

眼下,承载移动游戏的电竞终端也越来越“桌面化”,动辄165Hz高刷、硬件级光追、主机级画质、电影感。像《原神》《鸣潮》《绝区零》这类作品,最初就是按主机大作的画质标准开发的,只是最后要塞到移动端,并非易事。

就在7月28号,Arm与Unity中国达成一项战略合作,试图用AI来解决这个困境。双方的合作说起来并不复杂:把Arm神经技术(Arm Neural Technology)原生集成进团结引擎,让中国开发者能在自己习惯的工作流里,直接调用一套AI驱动的图形加速能力。

但这并非一场简单的商业合作,我们在随后采访中了解到,这背后是AI对游戏产业革新的必经之路。

“当下不少正在研发的游戏内容,如果没有神经技术的辅助,将很难在性能和能效之间达到理想平衡。”Arm 边缘AI智能终端计算副总裁 James McNiven在采访中坦言。

Unity中国首席执行官张俊波在采访里则给出另一个观察:游戏行业,大家习惯把负责创意策划的人称为“文科生”,把负责实现的程序员称为“理科生”,两者的比例大致在1:10甚至更高。

实际情况是,游戏开发一直是这两类人的博弈过程,美术总想做到极致,程序员则会说“计算能力就这么多,我们只能做到这个程度”。“要把一个好的创意,变成大量可用的资产,需要非常强的工程能力。”张俊波点出问题本质。

现在,这个1:10的结构,正在被AI从两头夹击。

移动游戏传统的“美术堆料+开发伤肝”模式,正在被AI重新分配算力和人力。

打开网易新闻 查看精彩图片

图从左至右:Arm 边缘AI智能终端计算副总裁 James McNiven、Unity中国首席执行官张俊波

GPU里为什么要塞一颗“AI副脑”

在桌面GPU上,过去依赖三样东西继续往前走:更先进的制程、更低的功耗、更多的电力预算。而在移动GPU上,功耗、散热、电池的极限被困在移动设备那几平方空间里,这些约束不会因为画质的高要求,就跟着放宽。

Arm的方案是,让神经网络承担一部分传统上归 GPU 的工作。

在11个月前的SIGGRAPH 2025上,Arm对外发布了一项Arm神经技术,当时号称“业界首创”,并宣布将专用神经加速器引入2026年推出的Arm GPU。

需要明确的是,Arm神经技术不是把AI作为一个独立的加速模块外挂在SoC上,也不是拿NPU去代跑一部分图形工作。它做的事更底层,在GPU的着色器核心(Shader Core)内部,塞进一个专用的神经加速器。神经加速器是一类专门运行神经网络计算的硬件。

James在采访中向科技行者表示,“硬件配置层面,Arm下一代GPU的每个着色器核心可以搭配一个神经加速器,实际部署数量按硬件配置调整。”这个表述很关键:它意味着神经加速器和GPU共享内存系统,可以和着色器核心紧密协同工作。

诚然,既然SoC里已经有NPU,为什么不直接让NPU干这个活?

James的回答是“能效”。把神经加速器内置到 GPU 内部,相比作为独立模块部署能够带来更高的能效,因为它可以与 GPU 共享内存系统,并与着色器核心和执行引擎紧密协同工作。图形工作的特点是数据吞吐量极大、对延迟极敏感,任何跨模块的数据搬运都要付出功耗和时延代价。神经加速器和GPU“住”在一起,才能把这些代价压到最低。

顺着这个思路看下去,你会发现 Arm 的选择,不是一次孤立的工程决定。

图灵奖得主 David Patterson 曾在多个场合判断,通用处理器的黄金年代已经结束,未来是“特定领域架构”(Domain-Specific Architecture, DSA)的时代,针对具体工作负载定制硬件,才能继续获得性能和能效的提升。这个判断在最近几年逐步被验证:Google的TPU、苹果M系列芯片里的神经引擎、几乎所有智能手机SoC里独立的NPU,都在往同一个方向走。

Arm 神经技术是这个方向在移动GPU里的一次具体落地。它不是给CPU或NPU再加一点通用算力,也不是靠更先进的制程堆晶体管,而是为神经网络推理这一类特定工作,在GPU里辟出一块专用硬件。

Patterson 讲的"特定领域架构时代",落在移动GPU上,就是Arm这次做的这颗嵌进着色器核心的神经加速器。

Arm神经技术架构的首个应用,是Arm神经超级采样(Arm Neural Super Sampling,NSS)。它的工作方式和桌面的 DLSS、FSR大体思路一致:以较低分辨率渲染(比如540p),再由神经网络补齐细节,输出接近原生质量的1080p画面。Arm给出的数据是,每帧只需4毫秒,最多可减少50%的GPU工作负载。

省下来的这一半算力,可以被开发者拿去做别的事:降低游戏整体功耗,或者提高帧率,或者增加画面效果。

NSS之后,Arm还预告了另外两个应用:神经帧率提升(Neural Frame Rate Upscaling,NFRU),用AI实现帧率翻番而不加倍渲染负载;以及神经超级采样与降噪(Neural Super Sampling and Denoising,NSSD),在移动设备上实现实时路径追踪,每个像素只需发射更少光线。

三件套凑齐之后,Arm神经技术的技术图景就完整了:NSS补分辨率、NFRU补帧率、NSSD补光线,三件事都靠AI“推演”完成,而GPU传统的着色器核心继续负责真实渲染的那部分。

一套底层技术,怎么才能真的让开发者用上

技术做出来,只是第一步。任何一次底层图形技术的升级,都可能碰到的问题是:开发者不会用、不知道怎么用、或者用了之后适配成本大到不敢用。

张俊波在采访中直指现实处境:“开发者通常只发布一个安卓安装包,不会针对某一款芯片单独开发一个安装包。”

这句话点破了移动图形技术推进过程中的难点。桌面端可以针对不同显卡出不同的驱动、不同的补丁包,玩家自己去装;但手机端的分发链路里,一个App就是一个安装包,跑在千差万别的机型上。任何一项底层特性,如果不能被引擎自动屏蔽掉设备之间的差异,都很难被开发者放心地用起来。

移动图形有一段近史,可以作为参照。

2016年,Khronos Group推出Vulkan,一套跨平台图形API,接棒OpenGL。Vulkan被寄予厚望,理论上一次开发就能跑遍所有平台。但真正让Vulkan在移动端跑起来的,不是Khronos Group自己。Google从Android 7.0开始把Vulkan集成到系统里,Unity和 Unreal引擎随后原生支持,开发者不用直接调用 Vulkan API,也能用上它带来的性能收益。

规格文档、参考实现、开放接口,这些底层工作本身,不能直接被开发者使用。它需要引擎和系统层接手,把底层能力翻译成开发者项目里能直接勾选的选项。

Arm神经技术开放的Vulkan机器学习扩展(VK_ARM_tensors、 VK_ARM_data_graph),走的是同一条老路。Vulkan是游戏调用GPU图形能力的一套通用接口,上两个扩展,让开发者能够使用张量资源,并把推理管线直接构建到渲染图中,让神经网络计算能够作为图形渲染的一部分被顺畅调用。Arm是Khronos Group成员,这两个扩展也是提供给整个行业的,其他GPU厂商同样可以用。James还特别强调:“这不是Arm独享的方案,其他GPU厂商同样可以使用这些扩展。”

Unity中国完全可以做到,让Arm神经技术能被一个安装包接住。按张俊波的介绍,团结引擎会把 NSS、NFRU和NSSD这三项Arm神经技术设计成“可选能力”,是否开启,会在运行时根据设备硬件能力自动判断,开发者不需要提前知道某款芯片是否支持相关功能。跑在支持神经加速器的旗舰机上,引擎自动开启;跑在不支持的老机型上,走传统渲染路径。开发者继续只出一个安装包。

对于已经在市场上的设备,Arm还提供了基于传统着色器的Arm精锐超级分辨率技术 (Arm Accuracy Super Resolution, Arm ASR)。它同样可以把较低分辨率的画面放大,但不要求手机配备新的神经加速器。James判断,着色器超分、神经超分和其他硬件加速方案会长期并存。

游戏引擎成为开发者的共同工作台

Arm省下来的算力要被真正用起来,引擎自己也得先够强。

游戏引擎的基本逻辑是,根据当前状态,计算出下一帧该呈现什么。手机屏幕每秒要刷新60次、120次、165次,每一次都是一次完整的画面运算。

张俊波在采访中用两句话讲清楚了这件事的困难。一个是关于画面本身:“计算开销取决于需要处理的像素数量”。另一个是关于帧率:“由于计算能力有限,无法逐帧精确计算”。

而在这两个难点上,AI都能帮上忙。

第一个方向是分辨率。可以只渲染480p较低分辨率的画面,再通过超分技术把它提升到1K、2K甚至4K;只要渲染很少的像素、再用神经网络补齐细节,就能以更低的计算成本,获得接近原生分辨率的效果。

第二个方向是帧率,思路在于“插帧”:可以只计算其中一部分帧,比如30帧,其余的帧由AI补齐生成,从而在有限算力下,实现更流畅的画面体验。

Arm这次公开的神经技术,正是围绕这两个方向做的架构层动作。NSS对应超分辨率,以540p渲染,用神经网络补到1080p,每帧耗时约4毫秒。NFRU对应插帧,根据已经渲染的画面生成中间帧。NSSD兼顾超分辨率和降噪,用AI补齐光线追踪场景中缺失的光线信息。

张俊波在采访里坦率指出:“一些游戏公司也可以选择直接调用Arm的底层API,自行实现这些技术的接入,但这样成本会非常高。与其让每家公司都重复做同样的事情,不如由引擎统一把这件事做好。”

为了进一步赋能游戏开发者,团结引擎自身也在不断迭代。此次,Unity中国正式推出团结Codely。

打开网易新闻 查看精彩图片

团结Codely是一款面向游戏开发的AI智能体。开发者可以从团结引擎编辑器、IDE、命令行和网页进入Codely,这几个入口读取的是同一个项目。写完代码之后,Codely可以启动引擎测试、查看控制台报错和游戏截图;如果任务涉及性能,它还可以打开性能分析器,检查资源、绘制调用和着色器。

写代码只是其中一部分。开发者还可以让Codely配置天空、云层和光照,或者把界面设计工具Figma中的设计稿转换为引擎里能够运行的界面。模型写出的代码会直接进入项目,随后接受编译、运行和画面检查。发现问题以后,它可以继续修改。

一个人的注意力有限。开发者的时间用在报错、迁移和跨工具切换上多一分,用在游戏本身的设计和判断上就少一分。Codely承担的是那些反复执行、反复检查的工程工作,让开发者把注意力还给内容判断本身。

Codely在Unity中国内部开发并测试了近两年,自今年5月18日开始邀请外部开发者测试,从邀测到7月28日大约十周时间,Codely每日消耗的Token增长了约十倍,达到Unity中国自有算力的上限。这个平台每天可以提供约80亿Token,其中约95%用于智谱GLM 5.2等大模型。越来越多的开发者开始把完整任务交给Codely,而不只让它生成一小段代码。

打开网易新闻 查看精彩图片

在这次团结引擎2.0发布会现场,我们看到了两个直观演示。

团结Codely产品经理先打开一个只支持安卓的早期Unity项目,让Codely把它迁移到Open Harmony,此时,平台接口、工程配置、构建链路和报错修复被放进同一项任务,智能体可以连续操作项目,直到工程能够在新平台运行。另一个演示是获得FIFA官方授权的中国版游戏《绿茵竞技》,把Codely用在前后端开发、引擎操作、服务端、资产生成和测试中,这样的工作很难靠补写几行代码完成,模型要知道项目里已经有什么,还要调用工具检查自己的工作。

打开网易新闻 查看精彩图片

要让Codely写出的代码可靠地进入项目,团结引擎2.0还做了一些底层的准备。采用新的.NET运行时CoreCLR和微软项目构建系统MSBuild。CoreCLR关系到C#脚本的执行和编译,MSBuild让项目可以接入编辑器之外的编译和自动化流程。模型加快了代码的生产,引擎则把它们变成能够运行、检查和发布的游戏工程。

此外,团结引擎2.0还做了一系列升级。首先,新版引擎引入了虚拟几何体,用于管理高精度模型,引擎可以根据画面需求和设备性能调度几何数据。Unity中国在特定演示场景中,让iPhone 13同屏渲染6亿三角面。其次,移动端动态全局光照会随着光源和物体变化,实时计算环境中的间接光照。并行渲染改善了CPU准备绘图任务与GPU执行任务之间的协作。最后,新版引擎还计划把面向高画质游戏的高清渲染管线HDRP带到移动设备,平台支持将扩展到PlayStation、Switch和Xbox三大主机。

在内容生产一侧,Unity中国与清华大学计划联合训练面向Unity和团结引擎技术栈的游戏垂类模型。所谓垂类模型,是专门学习游戏代码、引擎操作和项目数据的AI模型,合作还包括私有化部署、引擎代码和评测数据。比如Hyper3D,提供3D模型与空间环境生成,并准备通过导入工具把生成资产送进团结引擎。经验较少的开发者则可以先使用团结Creator,在浏览器里完成轻量开发,再把项目转入完整编辑器。

游戏做完以后,发行团队通常要制作大量广告素材,测试哪些画面和玩法更能吸引玩家。现场,Unity中国游戏发行业务负责人王巍介绍,过去可能需要数万元和较长工期的试玩广告素材,现在可以借助AI视频与AI试玩广告工具,把制作成本降到更低,并把时间压缩到分钟级。素材做得更快,小团队就能测试更多创意版本,也能更早看到市场反馈。

按照Unity中国公布的时间表,Codely已经开始外部邀测。团结引擎2.0将在2026年第四季度启动邀请测试,2027年第一季度进入Beta公开测试,第二季度正式发布。Arm神经图形完成原生集成后,也将进入量产手机和不同类型的游戏。

这些升级和Arm神经技术是同一件事的两端。芯片层省下的算力,引擎层要能承接住;引擎层新增的画面复杂度,芯片层要跟得上。按公开消息,双方后续计划把合作扩展至汽车智能座舱及工业边缘等场景。

不是替代方案,而是叠加方案

Arm 神经技术从去年8月首发到今年7月和Unity中国签约,中间隔了近一年。

这段时间里,Arm 还做了不少准备工作:开放了专为手游打造的「神经图形开发套件」,涵盖集成和定制AI视觉效果所需的各项资源,包括虚幻引擎插件、基于PC的Vulkan模拟、面向Vulkan的Arm机器学习扩展、以及在GitHub和Hugging Face提供的开放模型,方便开发者集成。首发合作伙伴名单里,已经出现了Epic Games、网易游戏、腾讯游戏、Sumo Digital。

不过,Arm这次并没有把话说满。James在采访里特别强调:“我们实现了神经加速器集成,但这不是传统路线的‘替代’方案。开发者依然需要进行传统渲染,获得更高分辨率、更高帧率、更好画质,开发者也依然需要在性能、画质和功耗之间做出权衡,这本身就是游戏开发的重要工作之一。我们的目标是让开发变得更简单。”

也就是说,未来一段时间,GPU 里会同时存在两条计算路径:传统的着色器核心继续负责“算得准”的部分,专用神经加速器负责“推得快”的部分。这个申明对 Arm 来说很重要,也对产业合作来说很重要。

同样的克制也出现在张俊波这一侧。他在采访里被问及“引擎会不会为不同硬件生成差异化的安装包”时回答,团结引擎2.0会支持更细粒度的硬件配置档,也就是profile,“从技术角度来看,这是一种更加科学、更加精细的方案。”但他也承认,“目前在行业内还没有形成成熟的配套方案,这部分还需要与渠道方进一步协同推进。”技术上完全可以实现,但要真的在整个安卓分发体系里跑起来,还有工程和商业层面的配合要做。

这些克制的表述放到一起,反而让这场合作的可信度更高。双方都没有承诺这是一次能立即兑现的技术革命,而是在共同推进一个需要时间的架构变革。

按照官方节奏,Arm 神经技术将从 2026 年开始进入下一代 Arm GPU,搭载它的第一批设备预计在 2026 年底上市。之后,才会真正进入普通玩家的移动设备中。团结引擎对三项技术的原生集成,需要在真实的开发者项目里被使用、被反馈、被迭代。手游之外的车机、工业边缘场景,需要更长的验证周期。

属于游戏的世界模型

至此,Arm用不到一年便完成了一场节奏极快的产业链拼合,从技术发布,到SDK开放,到与中国本土引擎绑定,一层一层把底层能力向开发者移交。

James在采访中强调:“一些公司可能会选择直接在API层面访问这些能力,另一些则会通过游戏引擎来调用。Arm希望补齐整个技术栈的最后一环,让开发者能够更加便捷地使用从API、算法到神经加速器和GPU的完整能力。”

张俊波在采访里,抛了一个未来判断。

他说,未来可能会出现针对游戏本身训练的“世界模型”,把游戏逻辑训练成一种基础模型,最终通过这个世界模型来直接还原、生成玩家在游戏中看到的画面和内容。这类“世界模型”会给游戏带来更多可能性:NPC行为、对话、乃至动画表现,都可以在端侧根据玩家的实时行为动态生成。

这条路走到最远处会是什么样?张俊波顺手抛了一个略带调侃的推论:“像我这种手残玩家,很多操作类游戏根本打不过别人。但如果未来我可以雇佣一个 AI 智能体替我去对战,说不定以后决定世界冠军的,不再是玩家本人的操作水平,而是所调用的AI算力有多强。”

“未来,只要有好的创意、有足够的预算去调用算力,很小的团队也可能做出高质量的游戏;过去难以负担庞大开发团队的创作者们,如今也有能力通过AI打造出制作精良、富有创意的作品。”张俊波强调。