2026 年 9 月 21 日於上海舉行的華為全聯接大會(HUAWEI CONNECT 2026)上,華為董事、ICT BG CEO 楊超斌發表算力架構創新主題演講,首次披露 UnifiedBus 互聯架構的更多細節,併發布基於該架構的一系列算力產品。他同時介紹了華為與開源社群協作、幫助客戶與開發者進行應用創新的進展。

楊超斌指出,傳統算力架構存在一個結構性難題:叢集規模越大,資源利用率反而越低。在一個 10 萬 NPU 的叢集中,模型實際利用到的算力可能只有 20%,大量算力在資料通訊過程中閒置。而一個 10 萬億引數的模型在訓練時需要海量中間資料,遠超單顆加速器記憶體的承載能力。叢集內部件之間的互聯與通訊,已成為算力系統的關鍵效能瓶頸。

華為給出的解法就是 UnifiedBus。該架構面向智慧體應用興起帶來的算力需求增長而設計,目標是讓叢集與超節點之間協同工作。據楊超斌介紹,UnifiedBus 算力系統具備四項關鍵特性。

其一是統一的協議與記憶體語義。UnifiedBus 把十餘種互聯協議整合到一套協議之下,將互聯頻寬從 100 GB/s 級提升到 TB/s 級,往返時延(RTT)從 7 微秒降到 2 微秒,並在超節點內實現統一的全域性記憶體定址。

其二是異構算力協同。UnifiedBus 直接互聯 CPU、NPU、記憶體與固態硬碟(SSD),使它們之間可以點對點、去中心化訪問,並支援 CPU 與 NPU 的靈活混配;同時針對 Transformer 提供分層硬體加速,實現 Attention-FFN 解耦(AFD)。

其三是分層儲存與全域性池化。UnifiedBus 通過混合介質資源池化來快取啟用值,把 DDR 記憶體作為 NPU 的補充記憶體,從而降低搜尋、推薦與廣告業務的時延,並使千維、千億級資料條目的向量檢索效能翻倍。這一設計還降低了對 10 萬億引數模型訓練時單 NPU 所需 HBM 容量的要求,並提升叢集的模型算力利用率(MFU)。

其四是光電互聯與靈活組網。UnifiedBus 充當全域性超高頻寬、超低時延的“資料高速公路”,讓算力可以彈性擴充套件。

在產品層面,華為釋出了覆蓋機櫃內、機櫃間與跨叢集三類場景的 UnifiedBus 互聯產品,支援從單個機櫃到 百萬 NPU 叢集的彈性擴充套件。機櫃內的 UnifiedBus LinkBlade 採用無纜化設計消除線路損耗,使一個 4,096 NPU 超節點內的銅纜用量減少約 196 公里。機櫃間的 UnifiedBus LinkDevice 支援 176 個埠、單埠 1.6 Tbit/s 頻寬,提供 280 Tbit/s 全光互聯,華為稱其為業界頻寬最高、埠數最多的高速匯流排協議互聯裝置,RTT 時延低至 2 微秒。跨叢集的 UnifiedBus UBG 交換機則提供高達 1,024 的交換容量,可支撐百萬 NPU 級 SuperCluster,並向支援數十萬億引數模型演進。

楊超斌還發布了基於 UnifiedBus 的智慧體 AI 超節點叢集,由 TaiShan 950Atlas 960 超節點、OceanStor M900 記憶體儲存以及星河 UBG 交換機組成,可實現多樣化算力協同與分層資源池化。

除超節點之外,華為把 UnifiedBus 技術延伸到算力裝置形態:推出新的 UnifiedBus 系列裝置(支援 1 至 8 顆 NPU)以及鯤鵬與昇騰模組,讓中小企業也能在本地執行萬億引數模型。

生態方面,楊超斌表示昇騰正與 DeepSeek HarnessOpenCodeopenJiuwen 等開源框架合作,開發完全開源的智慧管理、推理加速與安全框架智慧體外掛。他表示,華為致力於在系統層面創新,構建算力基礎產品組合,並堅持開源與開放系統,繼續與客戶、夥伴和開發者合作,為世界提供算力新選擇。

從產業視角看,這條訊息的核心不在單顆晶片的算力指標,而在“系統級”組網能力:當模型引數走向十萬億級、叢集走向百萬卡級,互聯頻寬與時延、記憶體層級與儲存池化往往比單點算力更能決定叢集的實際可用算力。UnifiedBus 把協議、記憶體語義與光互聯收攏到一套架構,並配合面向中小企業的低 NPU 數量裝置與開源智慧體外掛,形成從超大規模叢集到本地推理的完整梯度。對關注國產算力產業鏈的讀者而言,後續值得跟蹤的是這套架構在客戶側的落地規模、開源外掛的成熟度,以及光互聯與儲存配套環節能否同步放量。