在華為全聯接大會2026期間,華為正式上市了昇騰950超節點,包含Atlas 950 SuperPoD液冷超節點和Atlas 850E風冷超節點兩款產品,成為業界最大規模的商用超節點。此前該產品已在WAIC上真機亮相,此次上市標誌著超節點從技術驗證邁入規模化商用階段。
超節點為何成為行業共識
智慧體(Agentic AI)浪潮下,AI推理需求呈指數級爆發。據華為方面預計,到2030年全球每月Token消耗數將超過120千萬億,暴漲24倍。與此同時,頂級MoE模型引數量已來到十萬億級,訓練壓力同步增長。傳統伺服器難以同時滿足更大規模模型的高效訓練與推理端更長上下文、更低時延、更低成本的需求,超節點逐漸成為AI基礎設施領域公認的更優解決路徑——通過將大量AI加速器緊密耦合為更高密度的計算單元,解決大模型訓推中的儲存牆和通訊牆。
然而,全球晶片巨頭、雲廠商、伺服器大廠雖爭先發布超節點產品,真正商業化落地的卻很少。華為昇騰計算產品線總裁張迪煊在演講中表示,大模型每一波迭代都帶來新的AI需求,昇騰超節點用大頻寬、低時延和記憶體統一編址的確定架構來應對AI變化的不確定性。
Atlas 950 SuperPoD:1024卡像一台計算機
Atlas 950 SuperPoD液冷超節點由1024顆高效能NPU、1300多個靈衢互聯套片、4000多個光模組和19萬根CableTray組成,讓千張卡像一台超級計算機一樣協同工作。
技術突破集中在晶片和互聯兩個層面。晶片微架構方面,過去需要開發者手動管理的資料搬運、格式轉換、通訊同步、快取策略均下沉到硬體,提升了運算元開發易用性和效率。互聯層面,靈衢高速互聯技術實現1024卡統一記憶體編址,跨卡遠端記憶體訪問如同操作本地記憶體,晶片互聯頻寬相比上代提升2.1倍。
工程化落地方面,昇騰自研TPSU電源模組提供儲能能力以支撐訓練推理業務的供電波峰訴求。散熱上,單個昇騰950 NPU模組功耗達950W,通過高密鏟齒加冰川鎧甲冷板技術及多水路串聯設計,單塊冷板可帶走2000W熱量。正交架構設計實現櫃內零線纜全電互聯,單櫃減少6000多根線纜,一個1024超節點可省下50千米銅線。櫃間光互聯採用業界唯一的光模組液冷技術,一個超節點4000多個光模組節省的電力消耗相當於數千戶家庭的年用電量。
實際訓推場景中,Atlas 950訓練效率提升1.5-1.7倍,基於器件、網路、系統三重可靠設計實現萬卡超節點叢集月級穩定訓練;推理側效能提升2-3倍、時延低於10ms,實現萬億模型訓推一體化。昇騰也是國內唯一商用支援mxFP8低精訓練和全流程支援mxFP4推理的廠商。
Atlas 850E:風冷機房無需改造直接部署
Atlas 850E風冷超節點聚焦企業級通用風冷機房的升級改造。大量企業級風冷機房面臨液冷基建改造週期長、成本高的門檻,而Atlas 850E基於自研相變散熱技術,無需液冷改造,標準風冷機櫃可直接上架部署,支援從32卡到768卡。
該產品原生覆蓋FP8、mxFP8、HiF8、INT8、mxFP4全量低精格式,可穩定實現10ms級時延推理。通過異構PD分離方案動態調整PD配比、疊加大規模專家並行最佳化,在萬億引數MoE模型推理上實現5-10ms極致低時延,單卡吞吐比業界風冷叢集提升2.5倍。
軟體生態:從好用到易用
昇騰超節點的系統軟體包括靈衢匯流排管理、靈衢系統服務及超節點管理等元件。靈衢系統高階服務支援跨物理節點統一記憶體編址,程式設計模式與單系統語義一致。基於記憶體語義和拓撲編排,1024卡超節點域內集合通訊效能提升1.6倍;實測大EP跨卡通訊1K小包場景,耗時從70微秒降到8.6微秒,效能提升8倍。
生態方面,昇騰已完成CANN和Mind系列的全面開源開放,CANN社群月活開發者突破5200多名,位列中國開源專案活躍度排名第一。
產業影響與觀察
從行業視角看,昇騰950超節點的規模化商用落地,為超節點這一形態提供了從技術到工程化的可參照樣本。其液冷與風冷雙形態覆蓋了從大型資料中心到中小企業機房的不同場景,降低了超節點技術的部署門檻。目前昇騰超節點已應用於網際網路、運營商、金融、教育、醫療、交通、製造等行業,螞蟻阿福基於其實現模型訓練“離線持續最佳化、線上即時糾偏”,德賽西威基於其構建高效能算力底座。
值得關注的是,超節點競爭的本質正從單一硬體引數轉向“硬體架構+系統工程+軟體生態”的綜合能力比拼。對AI產業鏈而言,超節點的規模化落地將帶動光模組、液冷散熱、電源管理等配套環節的需求,同時也對傳統伺服器廠商的競爭格局形成壓力。在十萬億級大模型時代,算力基礎設施的部署效率與成本,正成為決定AI應用能否規模化落地的關鍵變數之一。