Arm在Tech Day上发布CSS for Mobile 2平台。整场发布看下来,让人印象最深的不是某个具体的性能数字,而是一个明确的信号:Arm要完成一次AI时代的计算逻辑重构。

先看看外面发生了什么。

当前的智能手机行业已经不再只是卷性能,AI已经成为智能手机发展最明确的方向。前段时间的世界人工智能大会上,荣耀Robot Phone、阶跃星辰STEPX Neo、努比亚NaviX Ultra三款智能体手机同台亮相。这些智能体手机虽然形态不同,但方向高度一致:手机正在从安装AI功能的智能设备,走向以AI智能体为核心的新终端。

AI智能体时代,芯片的评价标准变了

未来智能手机不只是替你回答问题,而是要帮你办事。

数据也能说明问题。据行业预测,2026年将是端侧AI从概念验证迈向规模化落地的转折之年,到2030年全球活跃AI智能体将达数十亿规模。

手机对AI的需求,尤其是对以智能体AI为核心的新应用形态,对芯片的要求跟传统智能手机已经有了很大不同。

传统手机芯片应对的是"用户点击→应用响应"的一次性、可预期的瞬时算力需求,而智能体AI带来的是一套"感知→记忆→推理→执行"的持续闭环工作流——智能体在后台不间断运行,任务链式展开,频繁读写本地个人信息,对延迟极度敏感,且工作负载呈现突发性、内存密集的特点。

打开网易新闻 查看精彩图片

这意味着芯片的评价标准从"峰值算力有多高"变成了"多环节协同下延迟有多低、内存带宽效率有多高"。

而这恰恰是Arm这次发布的核心切入点。

过去几年,行业对端侧AI的讨论几乎被NPU的TOPS数字绑架。但Arm在这次Tech Day上给出了一个完全不同的判断。

Arm边缘AI CPU产品管理总监Daniel Lu在媒体问答中说得非常直白:"我们看待计算密集型场景时,更关注的并不是峰值吞吐量,而是延迟优化。CPU的设计目标主要是满足低延迟应用的需求。如果一味追求峰值性能,反而可能会影响延迟表现。"

CPU要做智能体的“调度引擎”

CPU需要干什么?

Arm的答案是:做智能体的"调度引擎"。

Arm边缘AI智能终端计算副总裁James McNiven在技术趋势专场给出了轻量级模型的具体定义——20亿至30亿参数规模,比如Gemma-2B、腾讯混元的HY-1.8B-2Bit。这些模型恰好构成了智能体功能的基本模块:语音转文字、记忆检索、意图理解、工具调用。

而Arm带来的C2-Ultra CPU的核心能力,就是让这些模块跑得足够快。

打开网易新闻 查看精彩图片

这其中的关键技术支撑,正是Arm在C2集群中部署的第二代可伸缩矩阵扩展——SME2。AI模型本质上就是大量的矩阵乘法运算,传统CPU处理这类任务的效率远低于NPU或GPU。SME2通过专用的矩阵乘加指令,让CPU在处理AI推理时实现了数量级的效率提升。C2集群支持在多个核心上配置SME2单元,合作伙伴可以根据自身需求灵活选择配置数量,实现从单核到多核的AI性能扩展。这一技术目前已应用于几乎所有旗舰智能手机——无论安卓还是iOS——这不是实验室里的概念,而是正在大规模商用的现实。

根据官方数据:相比上一代C1-Ultra,C2-Ultra在语音转文字模型上快40%,在记忆检索和搜索任务上快41%。在最新AI模型上整体性能提升最高1.7倍。这些数字不是实验室里跑出来的峰值,而是真实智能体工作流中的实际场景。C2-Ultra通过更优的分支预测、更大的执行窗口、更少的后端停滞,把整个链条的响应时间压了下来。

这种性能的提升不靠暴力堆叠算力,而是对体验的深度优化。

CPU是这样,GPU也不例外。

Arm这次发布的Mali G2-Ultra NX被定义为"首款AI原生Mali GPU",核心变化是把神经网络加速器(NX)直接塞进了着色器核心。

这意味着GPU不再只是"算得更快",而是"用AI来算"。

打开网易新闻 查看精彩图片

Arm边缘AI高级产品经理Deyan Lazarov在GPU专场举了一个让人印象深刻的例子:在《光影新生》这款原生游戏中,通过NSS(神经超级采样)和NFRU(神经帧率提升)技术,"7/8的像素由AI生成,只有1/8由传统方式渲染"。

传统GPU要渲染每一个像素、每一帧画面,势必带来功耗的持续攀升。而Arm的Mali G2-Ultra NX做法是:只渲染关键信息,剩下的交给AI。

打开网易新闻 查看精彩图片

效果很直观。根据官方介绍,游戏从15 FPS提升到60 FPS。在功耗和散热约束完全不变的手机里,流畅度翻了两番。

James McNiven在回答"AI生成的像素越来越多,GPU设计思路会不会变"时,给出了一个很坦率的判断:"我们相信AI增强图形将逐渐成为行业标配。不过,这并不意味着传统图形渲染会被取代。未来我们一方面会持续增强AI相关功能,另一方面也会不断推进传统图形渲染技术的演进。"

硬件做得再好,开发者用不上等于零。这一点Arm比谁都清楚。

Arm在软件生态上的投入,在这次发布中体现得相当充分。KleidiAI软件库已经集成了超过100家第三方应用、12个AI框架,提供了超过200个优化微内核。开发者不需要懂底层汇编,调用KleidiAI就能让SME2的性能跑起来。

新推出的Arm AI Portal则更进一步——它是一个模型发现与优化平台,开发者可以在这里找到已经针对Arm硬件优化好的模型,包括阿里Qwen、Google Gemma等。Arm表示,这是"让超过2200万开发者及其编码智能体发现、优化和部署AI模型"的平台。

这套打法的逻辑很清晰:降低门槛,让"在Arm上跑AI"变成默认选项,而非可选项。

在GPU侧,Arm走的也是开放路线。NSS、NFRU的模型是开放的,手机厂商可以自行验证和定制。游戏引擎插件做到了"基本上像打开一个开关一样简单"。腾讯游戏、网易、Unity中国都在合作名单里。

Arm在下一盘更大的棋

Arm不是在卖硬件,是在打造一个完善的底层生态。

Arm这次发布的核心信息,用一句话概括:AI不再是"附加功能",而是新的"操作系统层"。当AI任务从"单次推理"变为"感知-记忆-推理-执行的持续闭环",对延迟、内存带宽和任务调度的要求跟以往完全不同。

打开网易新闻 查看精彩图片

Arm的选择是提前从底层完成对这类需求的布局。

事实上,很多人曾担心NPU的崛起会削弱CPU的重要性——毕竟,如果AI计算更多跑在NPU上,CPU的角色似乎会变得边缘化。但Arm给出了一个相反的答案:智能体时代的到来,恰恰让CPU的价值不降反升。因为决定智能体体验优劣的关键,从来不是单次推理有多快,而是从感知到执行的整个链条能否高效衔接——这需要一个强大的"总调度师"。而Arm手中握着的,正是CPU和GPU这两张"通用算力"王牌。

更何况,Arm的护城河远不止于硬件。从KleidiAI到AI Portal,从SME2的生态适配到NX单元的开发者工具链,Arm正在用软件生态把开发者深度绑定——当调用一个API就能在Arm上跑出最佳性能时,开发者会习惯性地选择Arm,而不会在意底层究竟是哪条指令在起作用。

这就是Arm最核心的价值所在:它不仅在定义计算的标准,更让整个生态习惯了被它定义。Arm不是在为AI时代做准备,它正在重新书写AI时代边缘计算的底层规则。

(编辑:SWC)