个人AI到底需要一套怎样的计算底座?当手机开始理解用户意图、调用工具并连续完成任务,计算平台要支撑的已不只是一次模型推理,而是完整的个人AI体验。
在今天的Arm Everywhere China 2026大会上,Arm发布了最新的CSS for Mobile 2。AI在全新的手机计算子系统中扮演了两个不同角色:CPU通过增强AI计算能力,帮助更多应用用上AI;Mali GPU首次原生集成神经网络加速器,用AI推动游戏性能和体验跨越式提升。
CPU加速端侧AI普及,SME2成旗舰标配
个人AI带来的计算负载,比运行一次模型复杂得多。以预订结婚纪念日晚餐为例,智能体需要完成语音转文字,搜索用户喜欢的餐厅、日历和相册,再生成指令、访问网页并执行操作。如果餐厅订满,整套流程还要重新运行。
CPU既要运行部分轻量级模型,也要承担工具调用和任务编排,每个环节的延迟都会影响最终体验。Arm C2 Ultra针对这类负载增强了单线程性能、执行引擎和数据访问能力。根据Arm给出的数据,其单线程性能和网页浏览性能均提升15%,应用启动和多线程性能分别提升12%。
单线程性能的提升,会直接影响智能体交互、工具调用和并行任务的响应速度。在C2 CPU集群中,C2 Ultra负责需要快速响应的突发负载,C2 Pro则以更高能效承担持续任务。Arm的合作伙伴可以按照产品定位调整两类核心的数量,而不是用一种核心覆盖所有场景。
更明显的AI性能提升来自SME2。在特定AI模型中,增强SME2支持的C2 CPU集群,执行性能可以达到上一代的1.7倍。Arm边缘AI智能终端计算副总裁James McNiven表示:“目前几乎所有旗舰智能手机,无论是安卓还是iOS手机,均已采用SME2技术。”
不过,端侧AI不仅受计算能力限制,也经常受制于内存带宽。以大语言模型为例,处理整段输入的预填充阶段包含大量矩阵运算,更接近计算密集型任务;逐字生成答案时,处理器需要频繁读取模型权重,又更容易受到内存带宽限制。SME2提高矩阵计算效率,低位宽与缓存设计则减少需要搬运的数据,几项改进分别对应模型运行的不同阶段。
面对计算密集型负载,量化是一个解决方法,从INT8、INT4进一步走向INT2。位宽降低后,计算量和数据量随之减少,但也可能损失精度。Arm边缘AI CPU产品管理总监Daniel Lu对雷峰网表示:“量化感知训练能够缓解模型从INT8降到INT4、INT4降到INT2带来的精度损失,业界也在持续缩小精度损耗。”
相比追求更高的主频或峰值算力,Arm更关注降低延迟。Daniel Lu表示:“如果一味追求峰值性能,反而可能影响延迟。持续运行的高计算密集型算法更适合GPU或NPU,CPU则应聚焦低延迟应用,以及能够控制在本地算力预算内的小语言模型。搭载SME引擎的CPU集群等效算力约为5至6TOPS。”
内存受限时,再高的计算性能也可能消耗在等待数据上。Daniel Lu介绍,C2 CPU集群同时配备私有L2缓存与大容量共享L3缓存,能够减少访问系统级缓存乃至DRAM的频次,从而降低延迟以及数据移动产生的功耗。从低位宽矩阵计算到缓存拓扑,C2 CPU集群针对的是端侧AI落地后的实际瓶颈。
Mali GPU首次集成AI加速器,手游性能跨越式提升
如果说CPU的进化是让更多应用能够使用AI,Mali G2-Ultra NX则让AI直接参与图形计算,改变GPU输出画面的方式。实时光线追踪、复杂几何细节和动态全局光照正在进入手机,散热、电池容量和内存带宽却很难同步跃升。依靠GPU逐像素渲染,开发者不得不在画质、帧率和功耗之间反复取舍。
Mali G2-Ultra NX首次在Mali GPU中原生集成神经网络加速器,让手游开发者不再需要反复取舍。全新GPU采用神经超级采样(NSS)技术,先以较低分辨率渲染,再由神经网络重建高分辨率画面;神经超级采样与降噪(NSSD)同时处理光追噪声;神经帧率提升(NFRU)则利用前后两个真实渲染帧重建中间帧。
这不是让大语言模型“凭空生成”画面。Mali G2-Ultra NX采用卷积神经网络,以GPU渲染的真实画面、运动向量和深度信息为输入完成重建。开发者也可以用自己的游戏内容训练模型,让输出保持原有的美术风格。
在《光影新生》的三帧演示中,第一帧和第三帧只有四分之一像素采用传统方式渲染,中间帧完全由AI重建。综合计算,八分之七的像素由AI完成重建。
AI插帧也会带来新的延迟问题。以30FPS为例,每个真实帧的时间预算约为33毫秒,系统既要完成真实帧渲染,也要在合适的时序插入重建帧。如果调度不当,帧率数字提高了,操作响应仍可能变慢。因此,NFRU不仅依赖GPU中的NX单元,也需要Android帧节奏机制和游戏引擎共同配合,保证生成帧进入显示链路时不破坏交互延迟。
这使Mali G2-Ultra NX的帧率与能效最高达到上一代的4倍,DRAM流量最高降低70%。如果不使用神经图形技术,Arm给出的综合游戏基准性能平均提升20%,同频游戏实测性能最高提升14%。两组数字的差距,正体现了AI为GPU打开的增量空间。
传统图形能力也在升级。Mali G2-Ultra NX引入新的执行引擎和第三代光追单元,以更紧凑的三角形数据表达减少重复数据,在现有光追基准测试中可将DRAM带宽需求降低约13%。
“AI增强图形将逐渐成为行业标配。”James McNiven指出,Arm会同时加强AI功能和传统图形渲染技术。神经网络加速器并非取代渲染单元,简单画面的传统渲染成本仍然更低。
NPU留给伙伴,Arm押注软硬件一体生态
CPU加速AI普及,AI加速GPU进化。但在这套面向个人AI的平台中,Arm为什么没有同时纳入自家的NPU?James McNiven解释:“在移动设备领域,Arm一贯的思路是将NPU层面的技术创新更多交由合作伙伴主导。”
把NPU的差异化创新留给伙伴后,Arm将重点放在CPU、GPU以及支撑硬件能力的软件生态上。从KleidiAI到神经图形模型、SDK和游戏引擎合作,Arm正在缩短处理器能力与开发者应用之间的距离。软硬件一体的系统和生态,正是Arm在AI时代能够继续成为领导者的关键。
热门跟贴