在上海举行的华为全联接大会上,华为发布了面向AI时代的Peerium计算架构以及作为其关键互联技术的UnifiedBus灵衢总线。会后,华为轮值董事长徐直军与海思首席科学家廖恒接受媒体采访,就昇腾市场份额、950DT训练进展、芯片产能瓶颈、光互联路线及与英伟达的技术差异等话题作出回应。

徐直军明确表示,在中国市场统计英伟达的市占率很难,但「从我们能够统计到的数据看,昇腾应该已经超过了英伟达」。这一表态意味着华为首次公开宣称其AI芯片在中国市场的份额已反超英伟达。不过他也承认,昇腾目前满足国内市场需求「还远远不足」,因此没有全面拓展海外市场的计划,仅有少数国家有少量测试和供给。

关于产品节奏,徐直军透露,昇腾950率先推出的是PR版,主要面向推理,上市量不算大;基于950DT的超节点则主要用于训练,目前仍在测试中,规模供货预计在今年年底或明年初。从现阶段测试结果看,他预计从明年开始将有大量模型训练构筑在950DT超节点上。他强调,制约昇腾进一步放量的主要问题「已经不是市场需求,而是供货能力」,「现在能产多少就供多少」。

在技术路线上,徐直军认为华为单芯片仍受国内工艺水平限制,但在多芯片互联和系统架构上已形成自己的路线。他提到,Atlas 950超节点采用Peerium架构,目前25.6万卡规模的集群已在部署和测试中。廖恒补充说,25.6万或约20万这个数字并非随意设定:当前模型参数规模已达5万亿级别,未来两年中国预计出现约6至7个前沿AI实验室,目标训练参数规模在10万亿到40万亿之间的基础模型;同时考虑到单个数据中心园区的电力输送设计,20万是一个相对保守的数字。

互联技术是此次发布的核心。徐直军解释,英伟达分别用NVLink和InfiniBand应对Scale-up与Scale-out,但最新NVL72柜内带宽达1.8 TB/s,一出柜就降到0.2 TB/s,柜间低带宽无法支撑百万处理器组成一台计算机。华为的灵衢基于统一协议,柜间带宽最高可达800 GB/s。廖恒补充,英伟达方案在协议切换时至少涉及微秒级转换时间,而UB将数据包从scale-up传到scale-out网络可能只需约150纳秒,可节省一个数量级。

光互联方面,徐直军介绍华为刚发布基于NPO的Hi-ONE模组,支持7.2T高带宽,光引擎距主芯片仅约5厘米,仅这部分需铜线电连接,基本可称全光超节点。他预计未来两到三年内很难有其他厂商做出该方案。廖恒表示,全光互联最大障碍是对可靠性的担忧,华为选择内置光源方案是工程上的务实折中。徐直军还提到,NPO相比CPO可带来成本接近40%的下降,且光引擎出问题不会导致整个AI芯片报废,在OIF上NPO已得到40家产业链厂商支持。

产能瓶颈方面,徐直军认为中国的瓶颈与全球基本一致,全球产业界都没有为AI如此浪涌式的发展做好准备。他预计全球供需平衡差不多在2029年能得到解决,中国可能还要慢一点。

谈及生态,廖恒承认两年前昇腾软件层面存在巨大障碍,CUDA具有压倒性优势,但过去18个月发生巨大变化:模型数学复杂度提升、模型变得细粒度,算法开发者必须转向超大规模内核编程风格,新编译器语言正逐步平衡CUDA壁垒,前沿实验室已不再像两年前那样重视CUDA。他认为英伟达与昇腾之间的差距已大幅缩小。

关于芯片自主化,徐直军表示,中国有14亿人口又是工业化大国,不能一直受制于人,「尽管水平差一点、先进性差一点,但解决有无问题」,推动芯片全面自主化、推动半导体产业整个链条的全面自主化「肯定是一条必由之路」,相信总有一天会变为现实。