2025年4月底,华为开始交付 CloudMatrix 384。384颗昇腾910C,摆满16个机柜:12个装计算,4个装网络,柜内柜间全用光纤连,光模块用掉6,912个。[6] 对面的英伟达 GB200 NVL72,一个机柜,72颗 GPU[8]

比整机算力,华为反而高出约七成;比耗电,华为这边接近四倍。[6]

一年半后的2026年9月,华为全联接大会上,没人再拿单卡说事。台上报出的是另一组数:十万卡集群的模型算力利用率,从20%提到35%。[2]

结论先行

华为把和英伟达的比较,从单卡峰值挪到了「卡数×单卡算力×利用率」。按华为披露,灵衢互联让十万卡集群的利用率从20%升到35%,同样的卡多干七成五的活。但单卡差距还在:追平同代英伟达的有效算力,仍要近九倍的卡,电费、机柜和光器件跟着卡数一起涨。

换一把尺子:比的是真正在干活的算力

一张卡的纸面峰值,像发动机的最大马力。上了赛道,能跑出多少,看的是别的东西。

大模型训练时,成千上万张卡要不停交换中间结果。等数据的那几微秒里,算力闲着。MFU(模型浮点算力利用率),就是训练中真正花在模型计算上的运算量,占全部卡理论峰值的比例。于是有了一个比峰值更诚实的公式:

有效算力=卡数×单卡峰值×MFU

华为常务董事、ICT BG CEO 杨超斌在大会上给出的现状是:十万卡集群的实际利用率只有约20%。[2][3] 十张卡里,八张的算力在等。华为副董事长、轮值董事长汪涛补了一个原因:用8卡服务器拼成的十万卡集群,训练时光是卡与卡之间通信就占去四成以上的时间。[2] 作为参照,Meta 用1.6万张 H100 训练 Llama 3 405B 时,BF16 口径的 MFU 是38%到43%。[10] 规模越大,等待越多,十万卡掉到两成并不奇怪。

华为选这把尺子,是因为另一把量不赢。昇腾910B、910C 都由中芯国际7nm 工艺代工,910C 是把两颗910B 拼在一起。[11] DeepSeek 研究人员估算,910C 的推理性能约为 H100 的60%。[11] 拿 CloudMatrix 384 摊到单卡:300 PFLOPS 除以384颗,每颗约0.78 PFLOPS(BF16 稠密);NVL72 是180 PFLOPS 除以72颗,每颗2.5 PFLOPS,单卡差三倍多。[6][8] 整机能反超,靠的是卡数多出五倍多(384对72)。

单卡追不上,就把卡连得更好。众擎易举,前提是大家同时使劲,而不是轮流等。

灵衢改了什么:让四千张卡像一台机器

超节点,是用高速总线把上千张卡连成一个整体,彼此能像读自己的内存那样直接读写对方;这个直连的范围叫互联域。互联域越大,需要绕到外部网络的通信就越少。

华为这次的主角叫灵衢(UnifiedBus,简称 UB)。按华为披露,它把十几种互联协议归成一套,互联带宽从百GB/s级提到TB/s级,往返时延(一条消息发出去再收到回复的时间)从7微秒降到2微秒,单个超节点从1024卡扩到4096卡。[2][4]

4096卡的超节点,铜线装不下了。华为第一次在超节点里用上 NPO(近封装光学):把光电转换模块挪到离芯片只有几厘米的板上,信号出芯片约五厘米后就变成光,其余路程走光纤。华为称这带来接近40%的成本下降,机柜内无缆化设计让4096卡超节点少用约196公里铜缆。[2] 配套的 Hi-ONE 光引擎单引擎容量7.2T,华为称是业界首个量产的 NPO 光互联产品。

三代超节点摆在一起,看得出华为的节奏:

代际代表系统单个超节点规模互联上市节点
昇腾910CCloudMatrix 384384卡,16个机柜UB 1.0,可插拔光模块全光互联2025年4月底开始交付
昇腾950Atlas 950 超节点1024卡真机,1 EFLOPS FP8;SuperPoD 满配8192卡UB 2.0950PR 已上市;超节点开始交付;950DT 今年底或明年规模供货
昇腾960昇腾960超节点4096卡,8 EFLOPS FP8UB 2.1+NPO960DT 芯片2027年一季度;960PR 2027年三季度;超节点预计2027年三季度

两处口径需要分开看。一是「超节点」与「SuperPoD」:昇腾960超节点单个互联域是4096卡;而华为路线图里的 Atlas 960 SuperPoD 最多15,488卡、分布在220个机柜,是更大一档的系统,华为没有说明两者如何对应。二是时间:提前三个季度到2027年一季度的是960DT 芯片,超节点整机仍在2027年三季度前后,智东西报道风冷版二季度、液冷版三季度。

对账:35%补回了多少

FP8 是用8位二进制数表示一个数,位数越少算得越快、精度越粗;FP4、FP8、BF16 的算力不能混着比,下表统一用 FP8。设想各建一个十万卡集群:

方案(各10万卡)单卡 FP8 峰值MFU有效算力
昇腾960DT,利用率按旧水平2 PFLOPS20%40 EFLOPS
昇腾960DT,按华为披露的灵衢水平2 PFLOPS35%70 EFLOPS
英伟达 Vera Rubin,利用率假设相同17.5 PFLOPS35%(假设)612.5 EFLOPS
英伟达十万卡规模的实测 MFU未披露

说明:960DT 的2 PFLOPS 取自华为路线图,华为称其性能是950系列的两倍;Rubin 的17.5 PFLOPS 取自英伟达 Vera Rubin NVL72 规格页的单卡 FP8 训练算力(整柜1,260 PFLOPS,72颗)。[9] 华为没有注明其 FP8 数字是否含稀疏加速。1 EFLOPS=1000 PFLOPS。

账当场算得平:

  • 补回了多少。 从40到70 EFLOPS,多出30 EFLOPS。按旧的20%利用率,这相当于再买七万五千张卡(75,000×2×20%=30,000 PFLOPS)。不添一张卡,多出七成五的产出,这是灵衢实打实的分量。
  • 还差多少。 同样按35%,一张 Rubin 的有效产出抵8.75张960DT。利用率停在20%时,这个数是15.3张。互联把「十五换一」压到了「九换一」,但压不到「一换一」。

MFU 这个数本身,也得带着几条注脚读:

  1. 20%到35%是华为自己披露的,不是第三方实测。
  2. 20%是杨超斌对「十万卡集群」现状的泛指,是谁的集群、跑什么模型、在什么精度下测,均未公布。[2]
  3. 同一场大会上,汪涛给过另一个口径:据华为实验室仿真,由4K 规模超节点组成的十万卡集群,比8卡服务器组成的集群,MFU 提升到原来的2.75倍。[2] 20%到35%是1.75倍,两个说法指向的不是同一条基线。
  4. 35%仍略低于 Meta 在1.6万卡上做到的38%到43%,但两者规模差六倍多,模型与精度也不同,只能当量级参照。[10]

代价记在哪几笔账上

卡多,是这条路的起点,也是每一笔成本的乘数。

  1. 电费与每瓦性能。 最后一个有第三方数字的是 CloudMatrix 384:整机约560千瓦,NVL72 约145千瓦;算力高1.7倍,耗电高约3.9倍,每瓦性能低约2.3倍。[6][7] 950、960 两代的整机功耗与每瓦性能,华为都没有公布。互联提高的是卡的忙碌程度,不改变一张卡每做一次运算耗多少电。
  2. 机柜与占地。 Atlas 960 SuperPoD 按15,488卡、220柜算,每柜约70卡,和 NVL72 每柜72颗几乎一样密;FP8 算力摊到每柜约141 PFLOPS,Vera Rubin NVL72 一柜1,260 PFLOPS,差约9倍。[9] 华为在楼宇上想办法:它发布的3D 数据中心把供冷、IT 设备、供电分层叠放,IT 供电容量从76兆瓦提到168兆瓦,楼里装的正是昇腾950系列。
  3. 光器件。 CloudMatrix 384 一套就用6,912个800G 光模块。[6] NPO 让光互联成本降了近四成,省下196公里铜缆,但卡越多,要连的光路越多。降下来的是单价,数量跟着卡数走。
  4. 软件生态。 十万卡能不能真跑到35%,一半靠硬件,一半靠通信库、算子、调度这类软件。华为称昇腾已跨过生态拐点:CANN(昇腾的底层软件栈,对标英伟达 CUDA)社区月活开发者超5200人,超40个模型在昇腾上完成预训练;[2] 华为此前宣布在2025年底前开源 CANN 接口。同一把尺子下,CUDA 这边的对应数字没有可比的公开口径。
  5. 采购。HBM(叠在芯片旁的高带宽内存)供应趋紧影响,昇腾950DT 报价据称超过25万元人民币,较此前上涨约20%到50%。DeepSeek 在乌兰察布的数据中心计划部署至少16万颗950DT,虎嗅按单卡25万元估算,仅芯片名义投资就超400亿元。

为什么这条路仍然走得通

这些账是真的,这条路也是真的。

昇腾超节点已部署超过1000套,客户超过370家。基于灵衢的昇腾950智算集群云服务定于9月30日在国内商用。汪涛把华为的 AI 战略概括为以算力为核心、坚持硬件变现、打造「超节点加集群」的底座;监事会主席郭平在内部座谈中说得更直白:华为在计算领域的目标是成为英伟达,核心不在自研大模型,而在让客户的大模型高效跑在昇腾上。

往深处看,这是一道约束条件下的最优解。先进制程和设备受限,单卡短期追不上;电力相对充裕,SemiAnalysis 当初评估 CloudMatrix 时就把「中国电力充裕」列为它成立的前提。[6] 能用电和机柜换来的,就不必卡死在光刻机上。同一周,据报道阿里平头哥也称真武 V900 算力为 M890 的三倍、单集群可扩至50万卡;华为则表示有意把集群扩到50万颗甚至更多 NPU。国产算力的主赛道,正在从「一颗芯片多快」转到「一片集群连得多好」。

电表还在转

灵衢做成的事,是让四千张卡像一台机器那样说话,把差距从芯片挪到了系统。系统能摊薄的是等待,摊不薄的是每一次运算本身的电。

2027年一季度,960DT 上市;三季度前后,4096卡的超节点跟上。那时最值得等的数字,也许不是下一个 MFU,而是华为一直没报的那一项:一个 EFLOPS 要烧多少千瓦。华为已经在数据中心的另一头布局,推出源网荷储 AIDC 方案,想让算力设施既适应电网、也能支撑电网。卡连好了,下一段要连的,是电网。