2025年4月底,華為開始交付 CloudMatrix 384。384顆昇騰910C,擺滿16個機櫃:12個裝計算,4個裝網路,櫃內櫃間全用光纖連,光模組用掉6,912個。[6] 對面的輝達 GB200 NVL72,一個機櫃,72顆 GPU。[8]
比整機算力,華為反而高出約七成;比耗電,華為這邊接近四倍。[6]
一年半後的2026年9月,華為全聯接大會上,沒人再拿單卡說事。台上報出的是另一組數:十萬卡叢集的模型算力利用率,從20%提到35%。[2]
結論先行
華為把和輝達的比較,從單卡峰值挪到了「卡數×單卡算力×利用率」。按華為披露,靈衢互聯讓十萬卡叢集的利用率從20%升到35%,同樣的卡多幹七成五的活。但單卡差距還在:追平同代輝達的有效算力,仍要近九倍的卡,電費、機櫃和光器件跟著卡數一起漲。
換一把尺子:比的是真正在幹活的算力
一張卡的紙面峰值,像發動機的最大馬力。上了賽道,能跑出多少,看的是別的東西。
大模型訓練時,成千上萬張卡要不停交換中間結果。等資料的那幾微秒裡,算力閒著。MFU(模型浮點算力利用率),就是訓練中真正花在模型計算上的運算量,佔全部卡理論峰值的比例。於是有了一個比峰值更誠實的公式:
有效算力=卡數×單卡峰值×MFU
華為常務董事、ICT BG CEO 楊超斌在大會上給出的現狀是:十萬卡叢集的實際利用率只有約20%。[2][3] 十張卡里,八張的算力在等。華為副董事長、輪值董事長汪濤補了一個原因:用8卡伺服器拼成的十萬卡叢集,訓練時光是卡與卡之間通訊就佔去四成以上的時間。[2] 作為參照,Meta 用1.6萬張 H100 訓練 Llama 3 405B 時,BF16 口徑的 MFU 是38%到43%。[10] 規模越大,等待越多,十萬卡掉到兩成並不奇怪。
華為選這把尺子,是因為另一把量不贏。昇騰910B、910C 都由中芯國際7nm 工藝代工,910C 是把兩顆910B 拼在一起。[11] DeepSeek 研究人員估算,910C 的推理效能約為 H100 的60%。[11] 拿 CloudMatrix 384 攤到單卡:300 PFLOPS 除以384顆,每顆約0.78 PFLOPS(BF16 稠密);NVL72 是180 PFLOPS 除以72顆,每顆2.5 PFLOPS,單卡差三倍多。[6][8] 整機能反超,靠的是卡數多出五倍多(384對72)。
單卡追不上,就把卡連得更好。眾擎易舉,前提是大家同時使勁,而不是輪流等。
靈衢改了什麼:讓四千張卡像一台機器
超節點,是用高速匯流排把上千張卡連成一個整體,彼此能像讀自己的記憶體那樣直接讀寫對方;這個直連的範圍叫互聯域。互聯域越大,需要繞到外部網路的通訊就越少。
華為這次的主角叫靈衢(UnifiedBus,簡稱 UB)。按華為披露,它把十幾種互聯協議歸成一套,互聯頻寬從百GB/s級提到TB/s級,往返時延(一條訊息發出去再收到回覆的時間)從7微秒降到2微秒,單個超節點從1024卡擴到4096卡。[2][4]
4096卡的超節點,銅線裝不下了。華為第一次在超節點裡用上 NPO(近封裝光學):把光電轉換模組挪到離晶片只有幾釐米的板上,訊號出晶片約五釐米後就變成光,其餘路程走光纖。華為稱這帶來接近40%的成本下降,機櫃內無纜化設計讓4096卡超節點少用約196公里銅纜。[2] 配套的 Hi-ONE 光引擎單引擎容量7.2T,華為稱是業界首個量產的 NPO 光互聯產品。
三代超節點擺在一起,看得出華為的節奏:
| 代際 | 代表系統 | 單個超節點規模 | 互聯 | 上市節點 |
|---|---|---|---|---|
| 昇騰910C | CloudMatrix 384 | 384卡,16個機櫃 | UB 1.0,可插拔光模組全光互聯 | 2025年4月底開始交付 |
| 昇騰950 | Atlas 950 超節點 | 1024卡真機,1 EFLOPS FP8;SuperPoD 滿配8192卡 | UB 2.0 | 950PR 已上市;超節點開始交付;950DT 今年底或明年規模供貨 |
| 昇騰960 | 昇騰960超節點 | 4096卡,8 EFLOPS FP8 | UB 2.1+NPO | 960DT 晶片2027年一季度;960PR 2027年三季度;超節點預計2027年三季度 |
兩處口徑需要分開看。一是「超節點」與「SuperPoD」:昇騰960超節點單個互聯域是4096卡;而華為路線圖裡的 Atlas 960 SuperPoD 最多15,488卡、分佈在220個機櫃,是更大一檔的系統,華為沒有說明兩者如何對應。二是時間:提前三個季度到2027年一季度的是960DT 晶片,超節點整機仍在2027年三季度前後,智東西報道風冷版二季度、液冷版三季度。
對賬:35%補回了多少
FP8 是用8位二進位制數表示一個數,位數越少算得越快、精度越粗;FP4、FP8、BF16 的算力不能混著比,下表統一用 FP8。設想各建一個十萬卡叢集:
| 方案(各10萬卡) | 單卡 FP8 峰值 | MFU | 有效算力 |
|---|---|---|---|
| 昇騰960DT,利用率按舊水平 | 2 PFLOPS | 20% | 40 EFLOPS |
| 昇騰960DT,按華為披露的靈衢水平 | 2 PFLOPS | 35% | 70 EFLOPS |
| 輝達 Vera Rubin,利用率假設相同 | 17.5 PFLOPS | 35%(假設) | 612.5 EFLOPS |
| 輝達十萬卡規模的實測 MFU | — | 未披露 | — |
說明:960DT 的2 PFLOPS 取自華為路線圖,華為稱其效能是950系列的兩倍;Rubin 的17.5 PFLOPS 取自輝達 Vera Rubin NVL72 規格頁的單卡 FP8 訓練算力(整櫃1,260 PFLOPS,72顆)。[9] 華為沒有註明其 FP8 數字是否含稀疏加速。1 EFLOPS=1000 PFLOPS。
賬當場算得平:
- 補回了多少。 從40到70 EFLOPS,多出30 EFLOPS。按舊的20%利用率,這相當於再買七萬五千張卡(75,000×2×20%=30,000 PFLOPS)。不添一張卡,多出七成五的產出,這是靈衢實打實的分量。
- 還差多少。 同樣按35%,一張 Rubin 的有效產出抵8.75張960DT。利用率停在20%時,這個數是15.3張。互聯把「十五換一」壓到了「九換一」,但壓不到「一換一」。
MFU 這個數本身,也得帶著幾條註腳讀:
- 20%到35%是華為自己披露的,不是第三方實測。
- 20%是楊超斌對「十萬卡叢集」現狀的泛指,是誰的叢集、跑什麼模型、在什麼精度下測,均未公佈。[2]
- 同一場大會上,汪濤給過另一個口徑:據華為實驗室模擬,由4K 規模超節點組成的十萬卡叢集,比8卡伺服器組成的叢集,MFU 提升到原來的2.75倍。[2] 20%到35%是1.75倍,兩個說法指向的不是同一條基線。
- 35%仍略低於 Meta 在1.6萬卡上做到的38%到43%,但兩者規模差六倍多,模型與精度也不同,只能當量級參照。[10]
代價記在哪幾筆賬上
卡多,是這條路的起點,也是每一筆成本的乘數。
- 電費與每瓦效能。 最後一個有第三方數字的是 CloudMatrix 384:整機約560千瓦,NVL72 約145千瓦;算力高1.7倍,耗電高約3.9倍,每瓦效能低約2.3倍。[6][7] 950、960 兩代的整機功耗與每瓦效能,華為都沒有公佈。互聯提高的是卡的忙碌程度,不改變一張卡每做一次運算耗多少電。
- 機櫃與佔地。 Atlas 960 SuperPoD 按15,488卡、220櫃算,每櫃約70卡,和 NVL72 每櫃72顆幾乎一樣密;FP8 算力攤到每櫃約141 PFLOPS,Vera Rubin NVL72 一櫃1,260 PFLOPS,差約9倍。[9] 華為在樓宇上想辦法:它釋出的3D 資料中心把供冷、IT 裝置、供電分層疊放,IT 供電容量從76兆瓦提到168兆瓦,樓裡裝的正是昇騰950系列。
- 光器件。 CloudMatrix 384 一套就用6,912個800G 光模組。[6] NPO 讓光互聯成本降了近四成,省下196公里銅纜,但卡越多,要連的光路越多。降下來的是單價,數量跟著卡數走。
- 軟體生態。 十萬卡能不能真跑到35%,一半靠硬體,一半靠通訊庫、運算元、排程這類軟體。華為稱昇騰已跨過生態拐點:CANN(昇騰的底層軟體棧,對標輝達 CUDA)社群月活開發者超5200人,超40個模型在昇騰上完成預訓練;[2] 華為此前宣佈在2025年底前開源 CANN 介面。同一把尺子下,CUDA 這邊的對應數字沒有可比的公開口徑。
- 採購。 受 HBM(疊在晶片旁的高頻寬記憶體)供應趨緊影響,昇騰950DT 報價據稱超過25萬元人民幣,較此前上漲約20%到50%。DeepSeek 在烏蘭察布的資料中心計劃部署至少16萬顆950DT,虎嗅按單卡25萬元估算,僅晶片名義投資就超400億元。
為什麼這條路仍然走得通
這些賬是真的,這條路也是真的。
昇騰超節點已部署超過1000套,客戶超過370家。基於靈衢的昇騰950智算叢集雲服務定於9月30日在國內商用。汪濤把華為的 AI 戰略概括為以算力為核心、堅持硬體變現、打造「超節點加叢集」的底座;監事會主席郭平在內部座談中說得更直白:華為在計算領域的目標是成為輝達,核心不在自研大模型,而在讓客戶的大模型高效跑在昇騰上。
往深處看,這是一道約束條件下的最優解。先進製程和裝置受限,單卡短期追不上;電力相對充裕,SemiAnalysis 當初評估 CloudMatrix 時就把「中國電力充裕」列為它成立的前提。[6] 能用電和機櫃換來的,就不必卡死在光刻機上。同一周,據報道阿里平頭哥也稱真武 V900 算力為 M890 的三倍、單叢集可擴至50萬卡;華為則表示有意把叢集擴到50萬顆甚至更多 NPU。國產算力的主賽道,正在從「一顆晶片多快」轉到「一片叢集連得多好」。
電錶還在轉
靈衢做成的事,是讓四千張卡像一台機器那樣說話,把差距從晶片挪到了系統。系統能攤薄的是等待,攤不薄的是每一次運算本身的電。
2027年一季度,960DT 上市;三季度前後,4096卡的超節點跟上。那時最值得等的數字,也許不是下一個 MFU,而是華為一直沒報的那一項:一個 EFLOPS 要燒多少千瓦。華為已經在資料中心的另一頭佈局,推出源網荷儲 AIDC 方案,想讓算力設施既適應電網、也能支撐電網。卡連好了,下一段要連的,是電網。