2026年8月14日,Qwen正式开放Qwen3.8-27B模型权重。作为Qwen新一代高效能模型,Qwen3.8-27B拥有27B稠密参数量,采用混合线性注意力架构并原生支持视觉语言理解,对GDN线性注意力计算及长序列处理效率提出了更高要求。

打开网易新闻 查看精彩图片

Qwen3.8-27B开源后,昇腾Atlas 800 A3、Atlas 850E超节点通过vLLM-Ascend开源推理引擎快速实现了推理支持。围绕该模型的结构特点,昇腾采用GDN线性注意力融合算子、W8A8量化等关键路径进行针对性优化,充分释放Qwen3.8-27B在昇腾上的推理性能。

Qwen3.8-27B——新一代高效能多模态稠密模型

Qwen3.8-27B——新一代高效能多模态稠密模型

Qwen3.8-27B采用稠密(Dense)架构,全部参数参与每次Token计算,在保障模型能力密度的同时,具备良好的部署友好性。

在Attention层,Qwen3.8-27B采用Gated DeltaNet(GDN)与标准Attention相结合的混合线性注意力架构,64层中48层为GDN、16层为Full Attention,每4层按"3×GDN + 1×Attention"交替排列,兼顾长序列处理效率与上下文建模能力。

同时,Qwen3.8-27B原生集成视觉编码器,支持图像与视频理解,视觉Token与文本Token统一进入语言模型处理,对多模态融合推理路径提出了更高要求。

基于昇腾实现Qwen3.8-27B的推理部署

基于昇腾实现Qwen3.8-27B的推理部署

昇腾持续深耕大模型推理关键技术,从GDN融合算子优化,到W8A8量化、MTP与ACL Graph,昇腾不断完善面向前沿模型架构的高性能推理能力,通过vLLM-Ascend开源推理引擎实现Qwen3.8-27B在昇腾AI基础软硬件上的高效部署。

线性注意力优化:GDN融合算子

线性注意力优化:GDN融合算子

Qwen3.8-27B的64层中,将48层非线性Attention演变成了Linear Attention,打破了长序列下O(n²)的复杂度,其采取的Linear Attention算法是业界最领先的Gated Delta Net(GDN),它融合了Mamba与Delta Net算法,可以兼顾全局衰减的同时,建立单键值替换的逻辑。

针对GDN的计算特点,vLLM-Ascend在Prefill阶段采用GDN融合算子,以Chunk方式高效处理长序列,并融合关键计算过程,减少中间数据搬运和算子调度开销。

W8A8量化:提升推理计算效率

W8A8量化:提升推理计算效率

相较于超大规模MoE模型以量化降低显存压力,27B稠密模型的量化核心目标在于提升推理性能。vLLM-Ascend支持Qwen3.8-27B的W8A8量化部署,将权重与激活值从BF16量化至8-bit,降低访存带宽开销与计算量,充分发挥昇腾NPU的INT8/MXFP8算力,在兼顾模型精度的同时,提升Prefill与Decode阶段的执行效率。

MTP投机推理:加速Decode生成

MTP投机推理:加速Decode生成

Decode阶段逐Token计算,效率是瓶颈。vLLM-Ascend利用Qwen3.8的MTP能力,通过MTP模块预测后续Token、主模型并行校验,使单次执行产出更多有效Token,减少主模型调用次数,提升吞吐、降低时延。

ACL Graph:降低Decode调度开销

ACL Graph:降低Decode调度开销

Decode阶段小Batch高频执行,Host调度等固定开销占比高。vLLM-Ascend支持将Decode计算捕获为设备侧执行图(ACLGraph),消除重复调度开销。ACL Graph可与MTP协同,Draft模型与主模型均走Graph路径,实现算法加速与系统优化的双重收益。

注:本文转自华为计算,版权归作者所有

打开网易新闻 查看精彩图片