打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

图片由 AI 生成

近日,华为 CANN 社区公开《基于昇腾 950 超节点的万亿 MoE 模型预训练系统参考实践》。

其中在介绍 DeepSeek 预训练支持时明确提到,基于 PyTorch 原生训练框架和昇腾 950 超节点,结合 DeepSeek-V4-Flash 训练验证,分析 550B、1.6T 模型的切分策略,以及向 10T 规模外推时的部署权衡。

打开网易新闻 查看精彩图片

这也是目前公开的 DeepSeek 相关训练技术材料中,模型规模明确触及 10 万亿参数量级的一次披露。

这套方案主要针对超大规模 MoE 模型训练。

CANN 在昇腾 950 超节点内部和节点之间设计 FSDP、EP、CP 等并行部署策略,同时针对模型规模扩大后出现的显存、通信和计算效率问题进行优化。

除模型规模扩展外,方案还覆盖超长序列、多模态、高可用训练等场景,并针对训练过程中的参数、梯度、优化器状态和激活值进行内存优化。

CANN 同时引入 FlexMuon 分布式优化器以及大容量记忆表分布式训练等方案。

全文:

打开网易新闻 查看精彩图片

云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片