在9月17日至19日舉行的華為2026年全聯接大會上,華為圍繞靈衢互聯架構及超節點叢集,集中釋出了昇騰960晶片昇騰960超節點OceanStor M900 AI記憶儲存等一系列AI基礎設施新品。貫穿所有釋出的關鍵詞是“靈衢”。華為常務董事、ICT BG CEO楊超斌在題為“靈衢互聯,架構創新,構建Agentic AI算力底座”的演講中,對這一架構給出了完整闡釋。

靈衢(UnifiedBus)是華為算力底座的統一互聯匯流排協議,目標是把CPU、NPU、DPU、DDR、SSD等多種計算與儲存單元統一互聯,並貫穿單機、超節點和超大規模叢集。華為公佈的資料顯示,基於靈衢的單叢集可支援100萬顆AI處理器,10萬卡叢集的模型浮點算力利用率(MFU)從20%提升至35%

華為把架構創新的關鍵點釘在“通訊”上,與AI Agent時代的計算需求變化直接相關。模型引數規模已從萬億級走向10萬億級,上下文長度從幾K級來到幾M級,人與Agent的互動頻次也遠高於模型。作為底層計算系統,需要同步支援超大模型推理、高頻次呼叫、多種工具使用與多層級資訊傳遞儲存。

華為將挑戰歸納為三方面。第一,通訊量隨叢集規模近似平方級增長,典型MoE模型在10萬卡叢集上的MFU不到20%,如何打破MFU隨叢集規模快速下降的趨勢成為首要難關。第二,AI業務負載多樣化,Prefill與Decode呈現不同計算與訪存特徵,需要異構算力協同與記憶體資源池化。第三,上下文持續變長帶來儲存壓力,HBM、DDR、SSD分層分級的多級快取成為必然選擇,而現有PCIe加RoCE網路難以滿足時延與頻寬需求。

靈衢的核心是用一套協議貫穿從晶片到叢集的整個系統,把複雜協議歸一,統一記憶體語義,消除協議轉換開銷。楊超斌將其競爭力概括為四個維度。一是協議歸一、統一記憶體語義,將CPU、NPU、DPU、記憶體、儲存、網絡卡等核心元件統一基於靈衢協議互聯,實現十幾種協議歸一,互聯頻寬從百GB級提升到TB級,RTT通訊時延從7微秒壓縮至2微秒,降低約70%。二是多樣算力、異構協同,計算與儲存單元通過靈衢直接對等互聯,形成去中心化的平等訪問方式。三是分級儲存、全域性池化,將多種混合介質納入統一資源體系。四是光電互聯、靈活組網,通過光路保護、高速光互聯以及176埠、280Tb高速互聯的靈衢交換裝置,把單個超節點規模從1024卡擴充套件到4096卡

在Scale-Up方向,櫃內靈衢交換刀片支援172T超大頻寬,可實現72個昇騰處理器和18個鯤鵬處理器互聯。華為通過光互聯減少櫃內電纜,一個4096超節點內單櫃可節省196公里銅纜。跨櫃後,靈衢交換裝置擁有176個埠,每個埠達到1.6T,單機實現280T全光互聯。再向Scale-Out擴充套件,UBG靈衢網路交換機擁有1024超大Radix扇出能力,可支援百萬卡超節點叢集。

基於靈衢,華為構建了由鯤鵬950超節點、昇騰960超節點、OceanStor M900記憶儲存、星河UBG交換機組成的Agentic AI超節點叢集。其中,基於靈衢與NPO光引擎Hi-ONE,單個昇騰960超節點可實現4096卡規模,最大可提供8 EFLOPS FP8算力,實現高達1PB的HBM容量,系統無故障執行時間提升1倍,系統可用度可達99.8%。昇騰960風冷超節點和液冷超節點分別將於2027年Q2和Q3上市

算力與儲存方面,鯤鵬950超節點計算刀片提供384個CPU核和6TB記憶體,單櫃可提供12288個CPU核、支援192TB記憶體,基於靈衢可實現超過150萬核統一排程以及24000TB記憶體全域性池化。昇騰960超節點計算刀片支援8顆昇騰960 NPU,提供32 PFLOPS FP4算力、4.5TB統一記憶體以及17.9TB/s靈衢互聯頻寬。OceanStor M900通過全新儲存控制器和ASU模組實現網路、CPU、盤控晶片“三芯合一”,單ASU模組擁有64TB容量密度,單節點訪問頻寬達到480GB/s。

在中小場景,華為基於靈衢推出從1卡到8卡的系列化一體機產品和鯤鵬昇騰模組。Atlas 650E可通過雙機靈衢直連,讓16個NPU進行Full-Mesh組網,無需交換機,兩台機器可以像一台一樣執行,支援萬億引數模型,並通過EP16並行切分讓推理吞吐提升40%以上,時延低至10毫秒。

生態方面,楊超斌回顧,去年8月5日華為CANN全面開源開放,目前CANN社群月活開發者已達5200多人,50多家行業頭部客戶、夥伴及高校科研團隊與昇騰合作,打造了26個行業專屬運算元庫。華為還與DeepSeek Harness、OpenCode、openJiuwen等開源框架協同,打造Agent外掛化元件並全量開源,並與90多家主流開源社群展開合作。

從產業視角看,過去幾年行業多在既有PCIe加RoCE體系上做最佳化,但Agent負載把通訊、記憶體、儲存的短板同時放大,繼續在舊協議上疊補丁的收益遞減。華為選擇從協議層重構互聯,把計算與通訊做垂直整合,試圖為10萬億級大模型時代提供一套系統級算力底座。這一路線能否在生態與規模化落地上兌現,仍有待觀察,但它已把AI基礎設施的競爭推向體系化能力較量。