深圳光博会,华为亮出重磅黑科技 ——7.2Tbps NPO 近封装光引擎! 这是业界首款内置光源的 7.2T 硅光引擎,36 通道,单通道 200G,总带宽 7.2T。功耗比传统光模块直接砍掉三分之二,延迟下降 90%。

很多朋友听过昇腾 950AI 芯片,知道它算力很强,但很少有人明白:单颗芯片再强,上万颗芯片拼在一起做超算,瓶颈往往不在算力本身,而在芯片之间的数据传输。 这次深圳光博会展出的华为 7.2Tbps NPO 光引擎,就是专门解决这个难题的核心硬件。

先做个通俗类比。 昇腾 950 就像一个个顶尖短跑运动员,单独一个人跑步速度很快。但 AI 大模型训练不是单人赛跑,是上万名运动员组队接力运算。运动员之间传递接力棒的速度,直接决定整个队伍的总成绩。 传统光模块就是普通网线,带宽有限、耗电高、信号跑的慢。一旦上万块昇腾 950 放在同一个智算集群里,互相交换海量数据时,“接力棒” 传递跟不上,大量 GPU 就得空等,强大算力白白浪费。这个传输瓶颈,就是高速互联。

NPO 全称近封装光学,我们不用记复杂名词,简单理解:把高速光信号收发装置,紧贴着昇腾 950 交换芯片摆放。 它介于两种技术之间:一边是我们现在大量在用、可以插拔更换的普通光模块;另一边是业界讨论火热,但维修难度极大的 CPO 共封装光学。

这款 7.2T NPO,单台引擎带宽 7.2Tbps,由 36 条 200G 通道组成,激光器直接集成在引擎内部。

  • 功耗相比传统插拔光模块大幅下降,延迟降低 90%。信号从一块昇腾芯片传到另一块,等待时间几乎被压缩到极致;
  • 它是独立器件,坏了可以单独更换。不像 CPO 方案,光器件和芯片封装死在一起,一旦损坏,整块基板直接报废,运维成本极高。

它和昇腾 950 集群是什么关系? 昇腾 950 本身负责做 AI 计算,而 NPO 光引擎,是昇腾 SuperPOD 智算集群内部的互联通道。 一个完整的昇腾 950 超算集群,包含大量昇腾 950 算力卡、交换机、供电散热系统,NPO 就是交换机和昇腾 950 算力卡之间的高速连接桥梁

训练大模型时,每一块昇腾 950 计算完一批数据,需要立刻把结果传给其他芯片协同计算。模型参数、梯度数据来回交互,数据量极其庞大。 过去用传统光模块,带宽不够、功耗太高,集群规模很难拉到上万卡级别。有了 7.2T NPO 这种超高带宽、低延迟、低功耗的互联硬件,才能支撑大规模昇腾 950 集群高效协同,让上万颗昇腾 950 一起稳定跑大模型训练。

商业化节奏上,3.2T 版本 NPO 会率先落地配套昇腾集群,7.2T 版本会在后续新一代 SuperPOD 中逐步上线。 不止硬件,华为还联合国内产业链推出 OPEN NPO 多源协议,搭建国产 NPO 标准。简单说就是统一接口规范,国内各家厂商的器件可以互相兼容,整条光电产业链一起配套昇腾算力集群,不再受制于海外互联标准。

总结一句话: 昇腾 950 是 AI 算力的 “发动机”,而 7.2T NPO 光引擎,就是连接无数台发动机之间的超级高速管路。没有这套高速互联,再多昇腾 950 芯片,也很难发挥出全部集群算力。