華為本週在華為全聯接大會期間宣佈,其下一代Ascend 900系列AI加速器將只在中國市場提供,不會推向國際。公司輪值董事長徐直軍表示,華為目前的產能連滿足中國國內需求都不夠,因此沒有計劃全面拓展國際市場;他同時提到,華為會向少數需求特別旺盛的國家供應有限數量的產品,但沒有進一步說明細節。

這一表態的背景是,華為正面臨國內AI算力需求快速膨脹與自身供給能力受限之間的突出矛盾。據路透社報道,徐直軍在大會間隙作出上述表態。華為此次還公佈了最新的AI加速器路線圖,展示了Ascend 960、970、980等下一代NPU在訓練和推理效能上相對現有Ascend 910C及Ascend 950系列的提升。

按照路線圖,Ascend 960DTAscend 960PR計劃在2027年將FP8訓練效能提升至2 PFLOPS,FP4推理效能分別達到4 PFLOPS8 PFLOPS。其後續產品Ascend 970和Ascend 980預計在未來幾年將FP4效能分別提升至14 PFLOPS28 PFLOPS

不過,與輝達的加速器相比,華為即將推出的NPU在原始算力上仍有明顯差距。華為計劃2027年推出的Ascend 960DT,訓練FP8效能預計為2 PFLOPS,而輝達2023年第四季度釋出的H200已達4 PFLOPS。Ascend 960PR的FP4訓練效能預計為8 PFLOPS,遠低於輝達B30015至20 NVFP4 PFLOPS。即便是瞄準2029年的Ascend 980,預計也只能達到7.2 FP8 PFLOPS28 FP4 PFLOPS,而輝達的R200今年就有望實現17.5 FP8 PFLOPS35/50 FP4 PFLOPS

這種單晶片效能上的巨大差距,意味著華為在相當程度上仍要依靠系統級的大規模擴充套件來與輝達競爭,而非晶片對晶片的效能比拼。華為的Atlas SuperPoD和SuperCluster最多可整合15,488顆Ascend 960 NPU,可提供最高30 FP8 EFLOPS120 FP4 EFLOPS的效能,遠超輝達NVL72叢集72顆GPU的擴充套件規模。但大規模系統級擴充套件也帶來巨大的功耗,使其在能夠獲得AMD或輝達硬體的市場上競爭力明顯下降,單位功耗效能預計遠低於輝達架構,因此這類硬體在中國以外市場的需求最多也只能是有限的。

華為的處境存在一種矛盾:一方面,近封裝光學(NPO)等整合努力釋放了較老製程節點的產能,可用於AI平台的其他元件;另一方面,中芯國際在7奈米和6奈米級節點上無法順利擴產,限制了華為供應AI硬體的能力,這也是其難以滿足需求的原因。

從商業邏輯看,華為當前不大力推進全球AI硬體擴張有其合理性。更可行的方向或許是向各類學術和研究客戶提供其硬體的雲訪問服務,以推廣其CANN軟體棧。