一个5050亿参数的庞然大物,每次推理却只激活大约180亿参数——华为7月31日正式开源的openPangu-2.0-Pro,让人忍不住想追问:这到底是一种务实的克制,还是算力受限下的无奈选择?

这份开源包不止放出模型权重和基础推理代码,连技术报告也一并公开。按照华为常务董事、终端BG董事长余承东此前在HDC 2026上的时间表,openPangu 2.0的7大组件正逐一落地,Pro版本是其中最关键的一块拼图。一个月前92B参数的Flash模型已经上线,现在代号Pro的505B模型也终于露出真身。

打开网易新闻 查看精彩图片

从公开的技术细节看,openPangu-2.0-Pro走的是混合专家(MoE)路线:总参数量约505B,但每个token实际调用的专家参数仅约18B,这使得模型在支撑512k超长上下文的同时,仍能压制单次推理的计算开销。训练数据总量达到约34T tokens,后训练阶段则走了“快慢合一微调+多专项强化学习+在线蒸馏”的组合拳,试图把不同能力收敛到一个统一模型里。

架构升级的点也很集中。注意力部分依然沿用高效的MLA,但首次把DSA和SWA按1:2的层配比做成分层混合结构:SWA层负责局部窗口建模,DSA层用稀疏注意力做全局聚合,目标是在不丢精度的前提下把长序列推理的显存和访存压力打下来。此外,原生的残差连接被替换成4支流mHC拓扑,自投机模块上了3头MTP,一次就能多预测出3个token,训练侧则跳到了收敛更快的Muon优化器。

到这里,技术拼图看起来很完整,可焦点还是回到了那个扎眼的数字:505B比市面上不少已开源的大模型都要大,但每token只激活大约18B,又小得让人多想。余承东的解释很直接——华为自己留的算力有限,“算力大量支持了国内的其他企业需求,自己留的数量还是非常有限的”;再加上AI算力成本极高,团队更聚焦“时延和吞吐率的提升”。换句话说,比起堆参数博纸面数字,华为赌的是用可控的激活量跑出更好的工程表现。

这种选择带来的分歧是明摆着的。一方觉得,505B的总量是实打实的,MoE架构下的18B激活照样能撬动很强的能力上限,开源后还能帮昇腾生态把训练推理的最佳实践跑通。另一方却没那么乐观:激活参数只有总规模的零头,是否意味着推理侧天生的天花板就会偏低?在越来越多企业开始卷百万上下文、卷大激活量的当下,这种“克制”会不会在市场侧被解读成能力不够?

问题是,大模型竞赛从来不是单一维度的数字比拼。华为这次把模型放在昇腾NPU上全链路训练,并同步开源预训练代码、后训练代码和训练算子,本身就是想把“昇腾能跑什么”这件事做透。如果openPangu-2.0-Pro真能在吞吐率和长上下文效率上做出可见的优势,那“省出来的算力”反而可能成为一条独特的产品思路。

目前模型已在GitCode上完整发布,接下来要看开发者生态能不能接住这波开源。毕竟,再好的技术报告,最后也要落到谁愿意用它、它能跑出什么样的场景上。

开源地址:https://ai.gitcode.com/ascend-tribe/openPangu-2.0-Pro