7月31日,华为正式开源基于昇腾NPU训练的盘古MoE模型openPangu-2.0-Pro。该模型总参数规模达5050亿,激活参数180亿,支持512K上下文长度,训练数据总量约34T tokens。这是华为常务董事、终端BG董事长余承东在6月华为开发者大会上预告后的首次重磅发布,也是其喊话“把盘古大模型做到世界第一”后的首个开源动作。

openPangu-2.0系列包含两款模型:此次开源的Pro版本,以及6月12日已开源的轻量化模型openPangu-2.0-Flash(参数92亿,激活参数6亿)。余承东在发布Flash时曾表示,盘古模型从算法架构到训练推理均针对昇腾算力优化,昇腾原生训练效率提升30%,并强调这是业界首个采用DSA+SWA独立分层混合架构的模型,也是首个开源预训练代码、后训练代码及训推算子的模型。

openPangu-2.0-Pro在架构上进行了全面升级。注意力机制沿用高效MLA,并采用DSA+SWA独立分层混合架构(层配比1:2),SWA层负责局部窗口建模,DSA层负责稀疏全局聚合,在保持精度的同时降低长序列推理的计算与显存开销。拓扑架构升级为4支流mHC结构,提升表征多样性与泛化能力。自投机模块采用3头MTP架构,一次额外预测3个token以加速推理。训练中采用Muon优化器,获得更快收敛速度。

该模型专为长上下文智能体任务打造,融合自研硬件内核、整机系统架构及训推一体化智能体强化学习算法。华为研究人员发现一种正向协同反馈机制:底层基础推理能力可支撑复杂智能体行为,而智能体持续运行又反向优化模型的多阶任务规划与长轨迹上下文处理。技术报告称,openPangu-2.0系列在通用能力、逻辑推理、智能体相关主流评测基准中表现出众,但未公开与第三方模型的对比结果,并承认在处理复杂现实世界软件工程任务时,仍与顶尖模型存在明显差距。

预训练语料库约34T tokens,分三阶段训练:通用领域(25T tokens)、推理能力培养(8T tokens)、退火处理(1.4T tokens)。后训练采用三级流水线:监督微调、并行强化学习专家训练、多专家在线策略蒸馏。推理加速方面,华为自研昇腾原生推理框架,在128K上下文下,Flash版本最低TPOT时延5.63ms,Pro版本9.55ms;TPOT 20ms条件下Pro单卡吞吐1326 token/s

华为还推出了一款专为资源有限环境设计的30亿参数模型(激活参数2亿)。Hugging Face数据显示,openPangu-2.0-Flash GGUF上月下载量达39935次

此次开源不仅是华为在AI模型层的重要布局,更凸显其以昇腾硬件生态为核心、软硬协同的战略。华为计划将openPangu打造为智能设备、汽车等领域智能体应用的核心竞争力,并扩展基于麒麟处理器的边缘计算能力。未来几个月,研究人员将持续迭代模型,重点提升编程和复杂智能体任务能力。