智东西作者 程茜编辑 李水青
打开网易新闻 查看精彩图片
智东西作者 程茜编辑 李水青

智东西7月31日消息,今日,华为开源基于昇腾NPU训练的盘古MoE模型openPangu-2.0-Pro。

该模型是openPangu-2.0系列的最新开源模型,总参数规模5050亿,激活参数规模180亿,支持512K上下文长度,训练数据总量约34T tokens。另一轻量化模型openPangu-2.0-Flash已于6月12日开源,参数92亿,其中6亿为激活参数。

今年6月12月,在华为开发者大会现场,华为常务董事、产品投资评审委员会主任、终端BG董事长余承东发布openPangu-2.0-Flash、预告openPangu-2.0-Pro,并喊话要把盘古大模型做到世界第一。此次openPangu-2.0-Pro的开源,便是余承东放狠话后的首次重磅发布

打开网易新闻 查看精彩图片

技术报告仅披露openPangu-2.0两款模型的数据,未附上第三方模型对照结果。技术报告提到,openPangu-2.0系列模型在通用能力、逻辑推理、智能体相关主流评测基准中均具备出众的对标实力。

openPangu-2.0-Pro在模型架构上实现全面升级:

Attention架构:沿用高效MLA,并采用DSA+SWA独立分层混合架构,层配比为1:2;SWA层负责局部窗口建模,DSA层负责稀疏全局聚合,在保持精度的同时显著降低长序列推理的计算、显存与访存开销。

拓扑架构:将传统残差连接升级为4支流mHC架构,提升表征多样性与泛化能力。

自投机模块:采用3头MTP架构,一次额外预测3个token,提升模型的推理速度。

Muon优化器:训练中采用Muon优化器,获得更快收敛速度。

该研究还发现一套正向协同反馈机制:底层性能强劲的基础推理能力能够直接支撑复杂智能体行为运行,而智能体的持续运行又会反向迭代优化模型的多阶任务规划能力与长轨迹上下文处理水平。

openPangu-2.0-Pro模型的模型权重、基础推理代码及技术报告已正式开源上线。

开源地址:

Hugging Face:https://huggingface.co/openpangu/openPangu-2.0-Pro

AtomGit:https://gitcode.com/ascend-tribe

技术报告:https://huggingface.co/openpangu/openPangu-2.0-Pro/blob/main/openPangu-2.0%20Tech%20Report.pdf

一、专为长上下文智能体任务打造,复杂软件工程任务与顶尖模型存在差距

智能体应用要求模型可以执行长程任务、精准调用外部工具、在长时间运行时保持认知一致性。

但模型在部署时会暴露出不少问题,如现有通用框架会带来不必要的推理资源损耗,拉长上下文长度会拖累模型表现;另外传统对齐手段稳定性不足,运行长周期任务时常出现时间逻辑、层级结构方面的推理问题。

基于此,openPangu-2.0系列模型融合自研硬件内核、整机系统架构、训推一体化智能体强化学习算法,搭配专属推理加速方案,搭建了一套完备的软硬件协同设计体系,是专门针对长上下文智能体任务打造。

该系列模型包含此次新开源的openPangu-2.0-Pro;6月12日开源的轻量化模型openPangu-2.0-Flash,参数92亿,其中6亿为激活参数。

在发布openPangu-2.0-Flash时,余承东提到,从算法架构到训练推理,此次盘古模型重点针对昇腾算力进行了优化,并且更深度地开源。昇腾原生训练的训练效率提升了30%,并且这是业界首个采用DSA+SWA独立分层混合架构的模型。余承东特别提到,这也是首个开源预训练代码、后训练代码、训推算子的模型。

Hugging Face的数据显示,本地离线模型openPangu-2.0-Flash GGUF上月下载量达到39935次

打开网易新闻 查看精彩图片

华为还推出一种专为资源有限环境优化设计的30亿参数模型,2亿为激活参数。

研究人员基于多个公开基准测试评估了openPangu-2.0模型的性能。

技术报告中未公开openPangu-2.0与第三方模型的对比结果,其提到,在通用能力测试、推理任务、智能体等测试中,openPangu-2.0的表现出色,但在处理复杂现实世界软件工程任务时,仍与顶尖模型存在明显差距。

通用能力方面,openPangu-2.0-Flash和openPangu-2.0-Pro在多种通用测试中都表现优异,包括上下文学习、指令遵循以及多轮理解能力等方面。在世界知识及事实可靠性测试中,openPangu-2.0-Pro的表现远远超过openPangu-2.0-Flash。

打开网易新闻 查看精彩图片

华为内部实验中,研究人员发现,为模型建立扎实的基础知识及推理能力有助于学习更复杂的智能体行为和编程技能。反过来,在复杂的智能体环境中进行训练能够明显提升模型基本能力,包括指令遵循、长轨迹上下文处理、多步推理以及程序规划等。

此外在训练过程中及训练结束后,持续提供高质量、多样化的长轨迹智能体数据以及互动环境是非常有优势的,这成为未来模型升级的核心策略之一。

二、核心是采用分层混合注意力机制,预训练语料34T tokens

openPangu-2.0系列模型的核心架构是采用分层混合注意力机制完成上下文计算解耦:将滑动窗口注意力机制(SWA)用于稠密局部上下文的处理,将深度稀疏注意力机制用于全局稀疏信息检索。

同时为实现推理加速,模型额外搭载了一个三头多Token预测(MTP)模块,还将流形约束超连接(mHC)与Muon优化器相结合,能够在固定数据投入量的前提下提升模型收敛速度。

打开网易新闻 查看精彩图片

▲openPangu-2.0模型架构

研究人员针对MoE负载均衡、mHC结构稳定性、MTP训练策略以及Muon参数分组分别设计专属优化方案,以此保障端到端训练全过程的稳定性。

训练基础设施方面,当模型拓展至512K上下文窗口,同时叠加mHC、Muon、MTP等多重复杂基础架构单元,会带来更高通信开销与显存占用瓶颈。

基于此,研发人员搭建了一套系统化协同优化框架:融合无冗余混合上下文并行(CP)、面向MTP的轻量化点对点数据传输、适配Muon优化器的分布式计算通信重叠机制以及混合重计算策略;依托Ascend C专用编程语言定制融合内核,对mHC、参数化注意力汇点(PAS)、模块化注意力(ModAttn)模块进行深度加速。

打开网易新闻 查看精彩图片

▲Muon通信与计算重叠情况

为释放CloudMatrix 384超节点集群的整体算力,其落地了一套精简且感知网络拓扑的硬件亲和调度策略,将高带宽数据流约束在超节点内部交互,最大限度减少跨节点数据传输开销,破除集群运行瓶颈,实现硬件资源利用率最大化。

预训练阶段,openPangu-2.0预训练语料库包含约34T tokens,为了优化学习过程,预训练过程被划分为三个阶段,每个阶段都采用特定的数据配方和选择策略来逐步提升模型的能力:

第一阶段是通用领域(25T tokens),重点在于建立扎实的通用知识和广泛的语言能力基础。

第二阶段是推理能力培养(8T tokens),提升深度推理能力、逻辑思维能力以及高级编程技能。

第三阶段是退火处理(1.4T tokens),优化模型行为和智能体的能力,研究人员特意保留了较长的文档和复杂的轨迹数据,以便在这一阶段最大限度提升模型的自主任务处理能力。

其预训练语料库汇集了网页、书籍、PDF文件、多语言文本、代码库等数据。

后训练阶段分为三级流水线:监督微调(SFT)、并行强化学习专家训练、多专家在线策略蒸馏(OPD)。

打开网易新闻 查看精彩图片

▲监督式微调

完成统一监督微调后,系统并行训练多组强化学习专家模型;各组专家依托独立数据集与专属奖励函数,分别针对逻辑推理、通用问答、智能体交互、代码生成四大领域优化策略,消除强化学习过程中的跨领域任务干扰。

最后借助在线策略蒸馏完成各路专家能力的融合聚合。

推理加速方面,华为自研了昇腾原生推理框架,实现硬件执行逻辑与模型运行时动态行为耦合。

该架构自研多款融合算子,包含面向推理场景优化的mHC算子、专用集合通信原语,同时配套Felix上下文并行、单核多流执行等并行策略。

打开网易新闻 查看精彩图片

▲Felix流水并行(CP)方案完整前向计算流程

为提升推理吞吐,该框架搭配了定制量化方案与算子感知式保精度量化机制;并且集成混合KV缓存管理、无损并行分词(LoPT),基于模块化注意力(ModAttn)原生适配自动前缀缓存(APC)与MTP技术。

在128K上下文长度下,这套框架在昇腾NPU硬件的长上下文推理性能为:openPangu-2.0-Flash版本最低TPOT时延可达5.63ms,在TPOT为15ms的工况下单卡NPU生成吞吐1846 token/s;openPangu-2.0-Pro版本最低TPOT时延9.55ms,TPOT 20ms条件下单卡吞吐1326 token/s。

打开网易新闻 查看精彩图片

结语:华为要借openPangu,打造端侧智能体生态

基于Ascend平台的硬件与软件协同设计方法,openPangu-2.0模型解决了大模型训练、长上下文对齐以及推理效率方面的关键瓶颈。

此外,华为在技术报告中提到,他们的目标不仅仅停留在静态基准测试的性能上,而是更注重实际系统的实用性。openPangu在战略上处于有利地位,有望成为智能设备、汽车等领域智能体应用的核心竞争力。

华为也在积极扩展基于边缘计算的能力,利用麒麟处理器架构来突破设备智能化的极限。为了实现这一变革,其将以昇腾硬件生态系统为基础,进一步扩展基于沙盒的仿真流程,以在复杂且开放性的场景中生成大量高保真度的执行数据集。

未来几个月,研究人员将不断迭代该模型,目标是在编程和复杂智能体任务方面,系统地提升openPangu的核心能力。