今天去了趟上海的Arm Everywhere China,Arm发布了新一代AI原生计算平台,说实话这种芯片计算平台的发布特别硬核,实在是考验我的吸收理解能力,我尽量写通俗一些,让大家都能看懂。
一年前,Arm Unlocked上海站的主角是Lumex CSS,这是Arm第一代面向手机的计算子系统,把CPU、GPU、系统互联和软件做成一个完整平台交给芯片厂,不再是一个个单独的IP核。
今天,Arm发布了第二代移动终端计算子系统(CSS for Mobile 2),也就是去年Lumex的第二代。
只看参数表的话,这是一次标准意义上的年度升级,CPU单线程提升15%,GPU基准性能最高提升24%。
不过,一整天的活动听下来,我越来越确定一件事,GPU才是Arm今年真正想讲的故事。
从IP到Lumex再到CSS for Mobile 2,Arm向前迈进一步
Lumex今年改成了CSS for Mobile 2,有人可能会疑惑为什么换名字,我们特地问了Arm这个问题,其实是有意为之,改名就是为了简化命名体系,CSS for Mobile表意清晰,一看就知道是针对移动领域的平台,与之相比,此前COMPUTEX上还发布了CSS for PC,这样大家一眼就能看清每个平台针对哪个品类。
名字变了背后,是Arm在交付方式上向前迈了一步,前文有提到,以前Arm交付的是单个IP核,芯片厂商自己拿回去组合,从Lumex开始,甚至从Arm CSS for Client开始,Arm在IP授权的基础上,又多了一种选择,即把CPU、GPU、系统互连、物理实现、软件工具链预先整合好,做成一个完整平台交给芯片厂商。
要特别说明的是,这不是捆绑销售,合作伙伴既可以整套采用CSS平台,也可以单独选用其中某个组件,还可以和自研或第三方IP结合,根据产品定位、性能目标和市场需求灵活搭配。
大家可以理解为CSS提供的是一个经过系统级优化的参考方案,用不用、用多少,主动权在客户手里。
CSS for Mobile 2的三大件分别是C2 CPU集群、Mali G2-Ultra NX GPU和SI L2系统互连,而这三大件的设计,都围绕同一个原点:智能体。
Arm认为,手机上的AI正在从问答助手变成能自主完成任务的智能体,而智能体的工作流可以拆成四步:
第一步是感知,听懂用户在说什么、理解意图;
第二步是记忆,调取日历、照片、偏好等上下文信息;
第三步是推理,根据已知信息规划下一步该做什么、生成结构化指令;
第四步是行动,调用对应的App或服务把事情办完。
当然,全程还有一个编排层在调度,决定每一步该跑在哪个计算资源上,CPU就是这个体系的编排调度中心,C2 CPU集群集成了双SME2引擎,就是专门用来跑轻量级AI任务的。
按Arm官方的说法,轻量模型通常指20亿至30亿参数规模,比如Gemma-2B、腾讯混元HY-1.8B-2Bit,这个规模的模型放在CPU上跑,延迟比NPU还低,而且跨平台兼容性好。
具体参数方面,最新AI模型性能最高提升1.7倍,语音转文本延迟降低40%,单线程性能提升15%。这些提升贯穿智能体工作流的各个环节,比如更快的语音处理缩短交互起始延迟,更快的记忆检索让智能体迅速调取上下文,更快的推理速度让决策更及时等。
值得一提的是,目前vivo X300系列、OPPO Find X9系列、三星S26系列,包括iPhone等几乎所有旗舰手机,都已经采用了SME2技术,这意味着Arm在CPU端的AI能力已经实现了大规模落地。
手机GPU撞墙之后
说完CPU,来说说今年的重头戏:GPU。
当前手机游戏的画面越来越复杂,高分辨率、高帧率、大世界、光线追踪,每一项都在增加GPU的工作量。而手机的功耗预算就那么多,散热空间也有限,GPU的性能增长追不上游戏复杂度的增长,这是所有手机GPU厂商都要面对的一堵墙。
Arm的解法是Mali G2-Ultra NX,这个名字里的“NX”,就是Neural Accelerators(神经网络加速器)的意思。
从这就可以看出,Arm做了一个和很多厂商不同的选择,没有把AI加速器做成独立的NPU放在GPU旁边,而是直接集成进了着色器核心内部。
这个设计的好处是数据不用在GPU和NPU之间来回搬运,神经图形任务和渲染任务可以并行跑,共享GPU的内存系统和缓存,延迟更低、效率更高。而且这部分加速器面积极小,带电源门控,不用的时候直接关掉不耗电。
其实就像两个人一起拼乐高,如果一个在客厅、一个在卧室,零件要来回传递,效率很低;如果两个人坐在同一张桌子前,共享一个零件盒,随时能看到对方拼到哪了,配合起来就快得多。
基于NX加速器,Arm带来了三项神经图形技术:
神经超级采样(NSS):GPU 先渲染低分辨率画面,再用神经网络重建到高分辨率,最高提升2倍 FPS,外部内存流量降低50%。
神经帧率提升(NFRU):在两帧之间生成AI中间帧,支撑120 FPS持续游戏,DRAM流量降低33%。
神经超级采样与降噪(NSSD):把超分和降噪结合,专门用于复杂光追场景,在低采样率的光追画面上同时提升分辨率和去除噪点。
说到这里难免有人会问:这和NVIDIA的DLSS有什么区别?
Arm也很坦诚,直言不讳表示底层要实现的场景确实高度相似,超分、帧生成、降噪,但手机必须在功耗和散热约束下重新设计整套东西,所以Arm的模型更小更省电,而且是开放的,手机厂商验证之后可以按自己的产品需求修改和定制,目前Arm正与腾讯游戏合作探索神经动态全局光照等下一代技术。
说白了,移动端再怎么堆料,在绝对画质方面肯定比不过桌面显卡,但我认为Arm的方向是对的,在手机个位数性能释放的功耗预算里,用AI来补画面,确实是一条“曲线救国”路。
抛开AI,传统图形渲染依旧有硬实力
说了这么多AI,不如实际跑跑看效果。
在Arm Everywhere China上,Arm展现了和Sumo Digital基于虚幻引擎5.5联合打造了一款叫《光影新生》demo,支持MegaLights,场景内最多1400盏动态光源,光照与阴影全部为光线追踪实时计算,没有预烘焙,实际效果非常惊艳。
作为参考,它原来只有15 FPS,但在Mali G2-Ultra NX平台上跑到了持续60 FPS,相当于帧率最高4倍的提升,同时DRAM流量还最多降低了70%。
如果以为G2-Ultra NX只靠AI,那就小看它了,这一代GPU在传统渲染上也有实打实的提升,主要有两项关键升级。
其中一个是全新的执行引擎,这是Mali七代产品以来最大的指令集架构升级,每个线程束的寄存器数量比上一代多了一倍,支持动态寄存器分配。
在面对UE5 Nanite和Lumen这类越来越复杂的着色器程序,寄存器翻倍能有效减少溢出到内存的情况,让大着色器更高效地运行。
另一个是第三代光线追踪单元,采用了更紧凑的光线-三角形数据结构,光追基准测试的DRAM流量降低13%。同时硬件支持不透明度微贴图(OMM),能高效处理植被、织物这类透明几何体,演示中帧率提升30%,光追负载降低70%。
硬件能力到位了,开发者能不能方便地用上才是关键,Arm在这方面也做了不少铺垫。
针对开发者生态,Arm推出了神经图形开发套件(Arm Neural Graphics Development Kit),目前NSS和NFRU模型已经在Hugging Face和GitHub上开放。
国内大厂的合作进展也很快,腾讯Magic Dawn、Unity中国团结引擎已集成;网易《燕云十六声》今年将推出NSS版本,腾讯《暗区突围:无限》、叠纸的《无限暖暖》也在集成中。另外据小米官方信息,玄戒O3也采用了G2-Ultra NX。
还是那句话,AI不是万能的,神经图形更像是一个工具,用在什么场景、用到什么程度,最终还是开发者说了算。
写在最后
一整天活动下来,有两点观察想和大家分享。
第一、神经图形在移动端确实到了可用的节点,模型、插件、demo都有了,还有明确的接入周期和国内厂商的适配名单,这些都是技术从概念走向落地的信号。当然最终效果还要看量产机型和实际游戏,但至少路径我觉得是清晰的,不再是PPT上的画饼。
第二是关于CSS平台模式的一点思考,Arm把CPU、GPU、互连、软件整合得越来越深,那各家终端的差异化从哪里来?
针对这个问题,Arm也对雷科技表示,平台解决的是基础能力的下限, 保证每一家采用CSS 的芯片都能达到不错的性能、能效和兼容性,而差异化交给合作伙伴在平台上做,核心数量、频率、工艺节点、自研IP的混接,都由厂商自己决定。
相当于Arm的平台化不是要把厂商变成贴牌工厂,而是把重复造轮子的工作交给自己,让厂商把精力放在真正能体现差异的地方。
以上就是我在Arm Everywhere China的所见所闻,至于Arm这种模式能不能走通,等量产机型出来就会有答案了。
热门跟贴