华为本周在华为全联接大会期间宣布,其下一代Ascend 900系列AI加速器将只在中国市场提供,不会推向国际。公司轮值董事长徐直军表示,华为目前的产能连满足中国国内需求都不够,因此没有计划全面拓展国际市场;他同时提到,华为会向少数需求特别旺盛的国家供应有限数量的产品,但没有进一步说明细节。

这一表态的背景是,华为正面临国内AI算力需求快速膨胀与自身供给能力受限之间的突出矛盾。据路透社报道,徐直军在大会间隙作出上述表态。华为此次还公布了最新的AI加速器路线图,展示了Ascend 960、970、980等下一代NPU在训练和推理性能上相对现有Ascend 910C及Ascend 950系列的提升。

按照路线图,Ascend 960DTAscend 960PR计划在2027年将FP8训练性能提升至2 PFLOPS,FP4推理性能分别达到4 PFLOPS8 PFLOPS。其后续产品Ascend 970和Ascend 980预计在未来几年将FP4性能分别提升至14 PFLOPS28 PFLOPS

不过,与英伟达的加速器相比,华为即将推出的NPU在原始算力上仍有明显差距。华为计划2027年推出的Ascend 960DT,训练FP8性能预计为2 PFLOPS,而英伟达2023年第四季度发布的H200已达4 PFLOPS。Ascend 960PR的FP4训练性能预计为8 PFLOPS,远低于英伟达B30015至20 NVFP4 PFLOPS。即便是瞄准2029年的Ascend 980,预计也只能达到7.2 FP8 PFLOPS28 FP4 PFLOPS,而英伟达的R200今年就有望实现17.5 FP8 PFLOPS35/50 FP4 PFLOPS

这种单芯片性能上的巨大差距,意味着华为在相当程度上仍要依靠系统级的大规模扩展来与英伟达竞争,而非芯片对芯片的性能比拼。华为的Atlas SuperPoD和SuperCluster最多可集成15,488颗Ascend 960 NPU,可提供最高30 FP8 EFLOPS120 FP4 EFLOPS的性能,远超英伟达NVL72集群72颗GPU的扩展规模。但大规模系统级扩展也带来巨大的功耗,使其在能够获得AMD或英伟达硬件的市场上竞争力明显下降,单位功耗性能预计远低于英伟达架构,因此这类硬件在中国以外市场的需求最多也只能是有限的。

华为的处境存在一种矛盾:一方面,近封装光学(NPO)等集成努力释放了较老制程节点的产能,可用于AI平台的其他组件;另一方面,中芯国际在7纳米和6纳米级节点上无法顺利扩产,限制了华为供应AI硬件的能力,这也是其难以满足需求的原因。

从商业逻辑看,华为当前不大力推进全球AI硬件扩张有其合理性。更可行的方向或许是向各类学术和研究客户提供其硬件的云访问服务,以推广其CANN软件栈。