打开网易新闻 查看精彩图片

近日,高通宣布对其新一代顶级移动平台的AI计算架构进行系统性重构,全新Qualcomm Hexagon NPU成为核心引擎。除了导入专为Transformer工作负载打造的Element Accelerator之外,NPU共享存储器容量大幅增加50%,成为本次架构升级中最具标志性的变化。在生成式AI向代理式AI(Agentic AI)加速演进的关键节点,这一调整折射出移动端AI计算底座正在经历的范式转移。

对于整个手机芯片产业而言,这并非一次常规的硬件迭代,而是面向"多模型、多代理、持续运作"场景的计算范式再定义。

一、从"一个问题对应一个模型"到"持续运作的多代理系统"

一、从"一个问题对应一个模型"到"持续运作的多代理系统"

理解高通此次架构调整,需要先厘清一个产业逻辑的转变:手机端AI正从生成式AI(Generative AI)迈入代理式AI(Agentic AI)阶段。

高通技术团队在阐述新一代架构时指出,过去生成式AI的工作模式,本质上是"单一大型模型处理所有任务"。用户提问,模型回答,交互即终止。但代理式AI的运行逻辑完全不同——AI需要持续感知情境、调用工具、规划任务、修正结果,并在不同模型之间动态调度。

这意味着,手机端AI对底层算力的需求,已经从"更高的峰值推理性能"转向"持续运作能力、多模态处理能力、低延迟响应能力,以及多模型协同调度能力"的综合较量。

打开网易新闻 查看精彩图片

具体到技术维度,代理式AI对计算架构提出了三重新挑战:

其一,长上下文处理。AI代理需要"记住"更长的对话历史、工具调用记录和中间状态,意味着模型状态与激活值的存储器占用急剧膨胀。

其二,多模型并存。手机端可能同时运行语言模型、视觉模型、规划模型等多个专用模型,它们之间需要快速切换和协同。

其三,并行任务调度。AI代理往往需要"一边思考、一边调用工具、一边生成回答",这对计算资源的并行调度提出了远超传统推理场景的要求。

正因如此,高通选择将NPU存储器子系统容量提升50%,作为应对代理式AI挑战的核心抓手。

二、50%存储器扩容:表面是容量,深层是"存储器墙"的破局

二、50%存储器扩容:表面是容量,深层是"存储器墙"的破局

在高通的官方表述中,NPU共享存储器扩容50%是本次架构升级的关键指标之一。但若仅将其视为"容量增大",则低估了这一调整的产业意义。

更深层的逻辑在于:手机端AI正在遭遇"存储器墙"瓶颈。

AI推理过程中,模型的权重参数、激活值、KV缓存(Key-Value缓存,用于存储注意力机制的中间状态)以及各种中间张量,需要在计算单元与存储器之间高频交换。当NPU片上存储器不足时,系统不得不频繁访问外部DDR存储器,每一次访问都意味着带宽消耗、延迟增加和功耗上升。

打开网易新闻 查看精彩图片

高通技术团队明确指出:通过扩大共享存储器容量,更多模型状态、激活值及中间张量能够保留在芯片本地端,减少频繁访问DDR存储器的需求,进而缓解存储器带宽瓶颈并降低功耗。

这一思路与近期AI芯片产业的技术演进方向高度吻合。从苹果M系列芯片的统一内存架构(UMA),到英伟达GPU的HBM配置,再到各类AI加速器对片上SRAM的极致追求,整个行业都在通过"把数据留在离计算更近的地方"来突破"存储器墙"。

在手机端,这一挑战尤为突出。受限于功耗、面积和成本,手机SoC无法像服务器GPU那样堆叠大容量HBM,必须在片上存储与外部DDR之间寻找最优解。高通选择将NPU共享存储器扩容50%,本质上是在移动端复刻"大内存计算"的思路——以更多的硅面积换取更少的外部访存,这是面向代理式AI场景的必要权衡。

三、Element Accelerator与MoE:架构升级的两条暗线

三、Element Accelerator与MoE:架构升级的两条暗线

除了存储器扩容之外,高通还在Hexagon NPU中导入了两个关键组件:全新的Element Accelerator,以及对混合专家模型(Mixture-of-Experts,MoE)的系统性支持。

Element Accelerator的产业含义

Element Accelerator专为Transformer工作负载设计。结合向量、矩阵及标量扩充功能,其目标明确指向大型模型推理及AI代理决策、路由与协同调度效率。

这一设计的产业意义在于:通用NPU的算力堆叠已不再是差异化竞争的主战场。面向特定工作负载的专用加速单元,正在成为新一代AI芯片的"必选项"。无论是苹果Neural Engine的张量加速器,还是联发科APU中的特定算子优化,都在沿袭这一路径。

MoE模型支持的战略价值

高通同时将混合专家模型视为未来手机端大型AI模型的重要架构方向。其技术逻辑清晰:一个拥有300亿参数的MoE模型,可保留数百亿个参数,但每次生成token时,仅需激活约30亿个经路由选择的参数。

相较传统Dense模型每次推理都需要动用大部分参数,MoE通过动态选择不同专家模型,可在保持模型能力的前提下大幅降低计算量与存储器带宽需求。这意味着,原本只能在云端运行的超大规模模型,有望在手机端落地。

打开网易新闻 查看精彩图片

更为关键的是,高通还配套导入了从闪存至系统存储器的专家模型管理及缓存机制,可依照实际需求加载不同模型。配合更大的NPU共享存储器,模型切换效率将显著提升——这意味着手机端AI有望实现"模型常驻、按需调用、动态切换"的运行模式。

四、精度与协同:低精度运算与CPU-NPU分工

四、精度与协同:低精度运算与CPU-NPU分工

在AI模型精度方面,新一代Hexagon NPU支持INT2、INT4、INT8、FP8及FP16等多种格式,为开发者提供了从极致压缩到高质量推理的完整工具链。

其中,针对INT4模型,新平台可带来最高50%的预填充(Prefill)性能提升,同时改善解码吞吐量、推测解码(Speculative Decoding)及整体每秒token数。预填充阶段是处理长篇输入资料的关键瓶颈,这一指标的提升对代理式AI场景意义重大——AI代理往往需要处理大量上下文信息(文档、网页、对话历史),预填充速度直接决定了响应启动的延迟。

在CPU与NPU的协同层面,高通提出了清晰的分工逻辑:Hexagon NPU主要负责Transformer及AI推理运算,CPU则负责多步骤工作流程中的路由、协同调度及资料管理,确保资料能即时提供给NPU使用。

这一架构设计呼应了产业界的共识:AI代理的运行不是单纯的矩阵运算,而是"推理+调度+管理"的复合流程。NPU负责"重活",CPU负责"协调",两者的高效配合比单一算力堆叠更为重要。

五、行业影响:移动AI芯片竞争进入"架构深水区"

五、行业影响:移动AI芯片竞争进入"架构深水区"

高通此次架构调整,对全球移动AI芯片竞争格局的影响是多维度的。

首先,竞争焦点从TOPS转向"系统级AI能力"。

过去几年,移动芯片厂商的比拼集中在AI算力TOPS(每秒万亿次运算)的数字上。但随着代理式AI成为下一阶段竞争焦点,单纯的峰值算力已无法定义产品优劣。存储器层级、模型调度能力、多精度支持、CPU-NPU协同效率等系统级指标,开始成为新的竞争维度。高通此次升级,本质上是从"卖算力"转向"卖AI系统能力"的战略转型。

其次,对中国手机芯片厂商形成新的竞争压力。

在2026中国联通合作伙伴大会上,高通展示了智能体AI创新,并提出携手产业加速"AI原生6G"演进。这意味着高通正在将代理式AI与下一代通信标准绑定推进。对于联发科、紫光展锐等中国手机芯片厂商而言,如何在NPU架构、存储器子系统、MoE支持等深水区领域追赶,将是未来2-3年的关键课题。

打开网易新闻 查看精彩图片

值得关注的是,中国AI芯片企业已经在多个细分赛道展开布局。端侧大模型推理、MoE架构适配、低精度量化等方向,国内均有团队在推进。但要在手机SoC这一对功耗、面积、成本极度敏感的战场实现全面追赶,挑战依然巨大。

第三,对手机AI生态产生连锁反应。

新一代Hexagon NPU对长上下文、多模型协作、并行AI代理的支持,将直接降低端侧AI应用的开发门槛。开发者可以构建更复杂的AI代理应用,而不必过度顾虑硬件瓶颈。这有望加速AI代理类应用在手机端的落地,进而形成"硬件升级—应用爆发—用户粘性"的正向循环。

六、趋势展望:代理式AI重塑移动计算底座

六、趋势展望:代理式AI重塑移动计算底座

站在产业演进的视角审视,高通此次架构调整并非孤立事件,而是移动计算范式迁移的缩影。

趋势一:从"推理芯片"到"代理计算平台"。

手机AI芯片的角色正在发生根本性转变——从单纯执行模型推理的加速器,进化为承载多模型、多代理、持续运作的智能计算平台。这一转变对芯片架构的要求远超传统升级,未来围绕代理式AI的系统级创新,将成为移动芯片厂商的核心竞争力。

趋势二:存储器架构成为AI芯片分水岭。

随着模型规模与上下文长度的持续膨胀,存储器层级设计正在成为AI芯片的关键差异化点。从片上SRAM、NPU共享存储,到系统缓存、DDR带宽管理,再到闪存与存储器的协同,每一层都蕴含着大量的优化空间。围绕存储器子系统的创新,将成为下一阶段AI芯片竞争的主战场之一。

趋势三:端云协同走向新平衡。

高通强调新一代Hexagon NPU的目标,是让更多代理式AI功能直接在设备端完成,在降低延迟及功耗的同时兼顾资料隐私。这与端云协同的大趋势形成呼应——端侧AI能力的提升,并非取代云端,而是将更多实时性、隐私敏感、低延迟的任务留在设备端,将重型训练与跨设备协同留给云端。

对于中国通信产业而言,高通的架构调整既是压力也是启示。在AI与通信深度融合的"AI原生6G"演进路径中,端侧AI算力、代理式AI架构、存储器子系统等核心技术,正成为新的战略制高点。中国芯片企业需要在这些"深水区"领域持续投入,才能在全球移动AI竞争中占据有利位置。

高通此次重构手机AI芯片架构,表面看是NPU存储器扩容50%与Element Accelerator的引入,实质上是对移动计算底座的一次系统性再造。当AI代理成为手机的标准能力,芯片厂商的较量才刚刚进入深水区。