IT时代网8月7日消息,全球排名第一的国产超算“灵晟”完成了纯CPU架构下的MoE模型分布式推理部署。仅用16个计算节点,就能流畅运行DeepSeek-V3/R1-671B满血模型;在并发数batch_size=2048时,输出吞吐量与80张主流GPU组成的集群相当。

这件事的分量在于,纯国产CPU架构第一次在大模型推理领域与GPU集群正面掰手腕,“跑大模型必须用GPU”的惯性认知被撬动了。

灵晟走的路线与堆GPU或专用加速卡的常规方案不同。研发团队在自研的LX2 CPU中直接集成了矩阵加速单元,支持多精度计算,让每颗CPU既能处理超算科学计算,也能承担AI推理任务。这种片上融合的设计,省掉了CPU与加速卡之间搬运数据的开销。

不过算力只是第一关。大模型推理真正的瓶颈在内存带宽——模型参数需要在计算单元和内存之间反复搬运。LX2 CPU为此集成了首颗国产高带宽内存,总带宽达到4TB/s,相比传统CPU内存带宽提升10倍。搭配自研的“灵启”高速网络,支持微秒级时延与10万节点组网,计算、带宽、通信三道坎被一起搬开。

实测数据显示,经优化后MoE推理时延从1440微秒降至980微秒。团队还引入了DeepSeek的多token预测加速技术,输出速率进一步提升。

这意味着灵晟超算不再只服务于传统科学计算,已经正式纳入国产AI大模型的生产服务体系。今年6月23日,灵晟超算在德国汉堡ISC2026大会上正式登顶全球超算TOP500榜单,这是时隔九年中国超算再次排名全球第一。

打开网易新闻 查看精彩图片

注:本文中包含AI辅助创作的内容。