智猩猩AI整理
编辑:林夕
刚刚,DeepSeek正式开源面向昇腾算力平台的一批基础设施组件。
本次开源内容覆盖计算、通信和算子编程等多个底层环节,从高性能算子到分布式通信,进一步补齐昇腾平台上的大模型基础设施。
其中,DeepGEMM Ascend和DeepEP Ascend分别对应计算和通信两部分,也是这次开源中与MoE模型底层运行密切相关的两个组件。
DeepSeek此前围绕大规模MoE模型打造的底层计算与通信组件,正在进一步适配昇腾NPU平台。
DeepGEMM主要解决的是“算”。
GEMM,即General Matrix-Matrix Multiplication(通用矩阵-矩阵乘法),是Transformer和MoE模型中的核心计算操作之一。
DeepSeek开源的DeepGEMM,重点针对FP8等低精度计算进行优化,覆盖Dense GEMM以及MoE场景下的Grouped GEMM等计算。
对于MoE模型来说,大量Expert内部的计算最终都会落到矩阵乘法上,因此底层GEMM Kernel的效率,会直接影响模型整体的计算性能。
而DeepEP解决的是“传”。
MoE模型会通过Router把不同Token分配给不同Expert。
如果这些Expert分布在不同设备上,就需要进行Token Dispatch和Combine,也就是把Token发送到对应Expert,再把计算结果汇总回来。
这背后会产生大量All-to-All通信。
DeepEP正是针对这一环节设计的高性能通信库,核心面向MoE的Expert Parallelism。
通过优化节点内外通信、Token Dispatch和Combine等环节,降低通信开销。
可以把两者简单理解成:DeepGEMM负责把计算做快,DeepEP负责把通信做快。
而这两个库现在都开始向昇腾平台延伸。
这次开源的范围其实比DeepGEMM和DeepEP更广。
DeepSeek同时开放了TileLang昇腾版本,以及TileKernels、FlashMLA、DeepSelect等基础组件,覆盖高级算子编程、计算与访存、注意力以及数据筛选等多个底层环节。
其中,TileLang尤其值得关注。
在DeepSeek-V4的系统设计中,团队针对细粒度Expert Parallelism进行了优化,并在NVIDIA GPU和Huawei Ascend NPU平台上进行了验证。
公开信息显示,昇腾平台已经进入DeepSeek-V4专家并行等底层能力的验证和优化范围。
这次联合实践还进一步推进了昇腾950上的128卡超节点方案,并围绕计算和通信进行了优化。
在这一方案中,DeepEP的通信性能也进行了实测。公开数据显示,Dispatch达到375 GB/s,Combine达到347 GB/s,接近硬件上限。
除了底层组件本身,相关优化也已经延伸到DeepSeek-V4.1-Flash的训练和推理部署。
在EP32、Offline推理模式下,DeepSeek-V4.1-Flash的测试数据显示,当TPOT为5ms时,每卡输出吞吐达到2469 tokens/s;当TPOT为10ms时,每卡输出吞吐达到5102 tokens/s。
从这次开源的组件来看,DeepSeek正在把模型训练和推理过程中积累的底层能力进一步拆开并开放出来。
DeepGEMM对应计算侧,DeepEP对应通信侧,TileLang则进一步连接算子开发。
如今,这些底层组件进一步进入昇腾平台,也意味着DeepSeek正在将此前在大规模MoE模型中积累的计算、通信和算子开发能力,扩展到昇腾NPU平台。
从模型到Kernel,再到通信和并行系统,大模型基础设施正在继续向更底层延伸。
关注+星标,获取AI前沿进展与开源一线动态
热门跟贴