近日华为在上海举行了2025年华为全联接大会,推出了全球首个NPO光引擎Hi-ONE,用于超节点系统内。同时带来了基于“灵衢+Hi-ONE”打造的昇腾960超节点,采用领先的正交架构和全液冷设计,加速前沿模型的训练与推理创新。

据Wccftech报道,在这次活动上,华为还更新了Ascend芯片和SuperPod路线图,带来了更多有关Ascend 960DT/PR、Ascend 970和Ascend 980的信息。华为将推进其AI基础设施路线图,以满足行业日益增长的需求。

打开网易新闻 查看精彩图片

Ascend 960DT将采用新的SIMD/SIMT架构,支持FP32、HF32、FP16、BF16、FP8、MXFP8、HiF8、MXFP4和HiF4等多种数据格式。其中“H”格式同时考虑精度和动态范围,能够用一种格式替换两种标准浮点数据格式。该芯片最多可提供2 PFLOPs的FP8算力和4 PFLOPs的FP4算力,配备288GB的HBM,带宽达9.6 TB/s,是Ascend 950系列的2.4倍,互连带宽将达到2.2 TB/s。

到了2027年第三季度,华为将推出Ascend 960PR,具备更快的推理能力,FP4算力提升至8 PFLOPs,搭配192GB的HBM,带宽2.4 TB/s,互连带宽将保持在2.2 TB/s。2028年将迎来Ascend 970,将是另一项重大架构升级,可提供3.6 PFLOPs的FP8算力和14 PFLOPs的FP4算力,配备288GB的HBM,不过带宽将提升至14.4 TB/s,另外互连带宽也将翻倍,达到4.4 TB/s。

到了2029年,华为计划提供Ascend 980,可提供7.2 PFLOPs的FP8算力和28 PFLOPs的FP4算力,配备384GB的HBM,带宽将提升至38.4 TB/s,另外互连带宽也将达到8 TB/s。不过华为表示,这只是初步规格,上市时可能会有调整。

这次华为还正式推出了OceanStor M900 AI记忆存储,面向超大规模数据中心AI推理场景,为超节点提供PB级大容量、TB级高性能的全共享记忆空间,推动AI基础设施从以计算为中心,迈向计算、网络与存储深度协同的新阶段,进一步释放超节点算力潜能。

打开网易新闻 查看精彩图片

新产品利用灵衢网络构建了“一跳直通”的PB级全局KV Cache多级缓存方案,充分释放超节点的算力潜能,加速超大规模数据中心AI推理,其具备三大核心能力:

  • 打破容量边界,让大规模AI拥有更充足的记忆 - 实现KV Cache的全局池化共享和分级存储,将超节点的KV Cache从显存与内存扩展至SSD,单集群可提供64PB容量,单NPU可用KV Cache容量从GB级提升至TB级,让更多上下文得以保存、共享和复用,大幅提升KV Cache缓存命中率。

  • 跃升推理性能,让算力释放更充分 - 业界首创的CPU、网络、盘控三芯合一架构,提供原生KV语义,实现超节点的NPU一跳直通到SSD,避免协议转换和CPU转发,访问时延由ms级降至60μs,缩短90%。单集群可提供40TB/s聚合访问带宽,相比业界方案提升1.5倍。

  • 降低Token成本,让AI规模化应用更经济 - 采用业界首创的KV-Aware自适应存储技术,根据KV Cache数据价值预测生命周期,对多模介质上的数据排布进行智能调度,实现最高24 DWPD,使得SSD介质寿命提升16倍,支撑三年稳定运行。通过减少介质更换和运维投入,降低大规模AI推理基础设施的长期成本,加速人工智能规模化普及。

华硕表示,随着面向未来,随着AI加速进入各行业核心生产系统,AI基础设施将由单纯追求算力规模,进一步迈向算力、网络与存力的系统协同,AI记忆存储将成为持续提升超大规模推理KV Cache容量与访问效率的必然选择。