华为在WAIC上第一次把Atlas 950 SuperPoD服务器摆到台前。这台机器今年3月在MWC上首次官宣,时隔五个多月才在国内展会露面,现场围观的人比隔壁展台多了两圈。

先看核心数字:一台Atlas 950 SuperPoD塞进了1024颗NPU,由16个Atlas 950机柜组成,每个机柜装64颗昇腾950 NPU。整机算力达到1 EFLOPS FP8,这个量级在国产算力集群里属于第一梯队。

打开网易新闻 查看精彩图片

内存配置才是真正的看点

这台机器标配98TB的HiZQ内存,这是华为自研的HBM3E同级方案。如果觉得不够,还能再加158TB的第二级DRAM,把可用内存总量堆到256TB。对于大模型训练来说,内存带宽和容量直接决定能塞多大的模型、跑多长的上下文。

华为把Atlas 950 SuperPoD分成了两个版本,对应大模型推理的两个阶段:

  • Atlas 950DT:主打解码和训练,用HiZQ内存,也就是华为的HBM级别方案,带宽更高。
  • Atlas 950PR:主打预填充,用HiBL内存,本质上是封装内的LPDDR,带宽相对低一些。

这两个版本的划分逻辑很清晰。预填充阶段对带宽要求没那么极端,用LPDDR方案能省成本;解码和训练阶段吃带宽,必须上HBM级别。华为把同一套硬件平台拆成两种配置,让客户按需选型。

为什么这个时间点值得关注

昇腾950系列NPU是华为当前算力底座的核心,Atlas 950 SuperPoD则是把单卡算力整合成集群交付的形态。1024颗NPU的整机柜方案,意味着客户不用自己攒服务器、调网络、配存储,拿到的是一套开箱即用的算力池。

从MWC官宣到WAIC首展,华为的节奏不算快,但每一步都在把昇腾生态从“能买到卡”推向“能买到集群”。256TB可用内存这个数字,放到整个AI服务器市场里,也是能让采购方多看两眼的参数。