7月31日,華為正式開源基於昇騰NPU訓練的盤古MoE模型openPangu-2.0-Pro。該模型總引數規模達5050億,啟用引數180億,支援512K上下文長度,訓練資料總量約34T tokens。這是華為常務董事、終端BG董事長餘承東在6月華為開發者大會上預告後的首次重磅釋出,也是其喊話“把盤古大模型做到世界第一”後的首個開源動作。
openPangu-2.0系列包含兩款模型:此次開源的Pro版本,以及6月12日已開源的輕量化模型openPangu-2.0-Flash(引數92億,啟用引數6億)。餘承東在釋出Flash時曾表示,盤古模型從演算法架構到訓練推理均針對昇騰算力最佳化,昇騰原生訓練效率提升30%,並強調這是業界首個採用DSA+SWA獨立分層混合架構的模型,也是首個開源預訓練程式碼、後訓練程式碼及訓推運算元的模型。
openPangu-2.0-Pro在架構上進行了全面升級。注意力機制沿用高效MLA,並採用DSA+SWA獨立分層混合架構(層配比1:2),SWA層負責區域性視窗建模,DSA層負責稀疏全域性聚合,在保持精度的同時降低長序列推理的計算與視訊記憶體開銷。拓撲架構升級為4支流mHC結構,提升表徵多樣性與泛化能力。自投機模組採用3頭MTP架構,一次額外預測3個token以加速推理。訓練中採用Muon最佳化器,獲得更快收斂速度。
該模型專為長上下文智慧體任務打造,融合自研硬體核心、整機系統架構及訓推一體化智慧體強化學習演算法。華為研究人員發現一種正向協同反饋機制:底層基礎推理能力可支撐複雜智慧體行為,而智慧體持續執行又反向最佳化模型的多階任務規劃與長軌跡上下文處理。技術報告稱,openPangu-2.0系列在通用能力、邏輯推理、智慧體相關主流評測基準中表現出眾,但未公開與第三方模型的對比結果,並承認在處理複雜現實世界軟體工程任務時,仍與頂尖模型存在明顯差距。
預訓練語料庫約34T tokens,分三階段訓練:通用領域(25T tokens)、推理能力培養(8T tokens)、退火處理(1.4T tokens)。後訓練採用三級流水線:監督微調、並行強化學習專家訓練、多專家線上策略蒸餾。推理加速方面,華為自研昇騰原生推理框架,在128K上下文下,Flash版本最低TPOT時延5.63ms,Pro版本9.55ms;TPOT 20ms條件下Pro單卡吞吐1326 token/s。
華為還推出了一款專為資源有限環境設計的30億引數模型(啟用引數2億)。Hugging Face資料顯示,openPangu-2.0-Flash GGUF上月下載量達39935次。
此次開源不僅是華為在AI模型層的重要佈局,更凸顯其以昇騰硬體生態為核心、軟硬協同的戰略。華為計劃將openPangu打造為智慧裝置、汽車等領域智慧體應用的核心競爭力,並擴充套件基於麒麟處理器的邊緣計算能力。未來幾個月,研究人員將持續迭代模型,重點提升程式設計和複雜智慧體任務能力。