在9月17日至19日举行的华为2026年全联接大会上,华为围绕灵衢互联架构及超节点集群,集中发布了昇腾960芯片昇腾960超节点OceanStor M900 AI记忆存储等一系列AI基础设施新品。贯穿所有发布的关键词是“灵衢”。华为常务董事、ICT BG CEO杨超斌在题为“灵衢互联,架构创新,构建Agentic AI算力底座”的演讲中,对这一架构给出了完整阐释。

灵衢(UnifiedBus)是华为算力底座的统一互联总线协议,目标是把CPU、NPU、DPU、DDR、SSD等多种计算与存储单元统一互联,并贯穿单机、超节点和超大规模集群。华为公布的数据显示,基于灵衢的单集群可支持100万颗AI处理器,10万卡集群的模型浮点算力利用率(MFU)从20%提升至35%

华为把架构创新的关键点钉在“通信”上,与AI Agent时代的计算需求变化直接相关。模型参数规模已从万亿级走向10万亿级,上下文长度从几K级来到几M级,人与Agent的交互频次也远高于模型。作为底层计算系统,需要同步支持超大模型推理、高频次调用、多种工具使用与多层级信息传递存储。

华为将挑战归纳为三方面。第一,通信量随集群规模近似平方级增长,典型MoE模型在10万卡集群上的MFU不到20%,如何打破MFU随集群规模快速下降的趋势成为首要难关。第二,AI业务负载多样化,Prefill与Decode呈现不同计算与访存特征,需要异构算力协同与内存资源池化。第三,上下文持续变长带来存储压力,HBM、DDR、SSD分层分级的多级缓存成为必然选择,而现有PCIe加RoCE网络难以满足时延与带宽需求。

灵衢的核心是用一套协议贯穿从芯片到集群的整个系统,把复杂协议归一,统一内存语义,消除协议转换开销。杨超斌将其竞争力概括为四个维度。一是协议归一、统一内存语义,将CPU、NPU、DPU、内存、存储、网卡等核心组件统一基于灵衢协议互联,实现十几种协议归一,互联带宽从百GB级提升到TB级,RTT通信时延从7微秒压缩至2微秒,降低约70%。二是多样算力、异构协同,计算与存储单元通过灵衢直接对等互联,形成去中心化的平等访问方式。三是分级存储、全局池化,将多种混合介质纳入统一资源体系。四是光电互联、灵活组网,通过光路保护、高速光互联以及176端口、280Tb高速互联的灵衢交换设备,把单个超节点规模从1024卡扩展到4096卡

在Scale-Up方向,柜内灵衢交换刀片支持172T超大带宽,可实现72个昇腾处理器和18个鲲鹏处理器互联。华为通过光互联减少柜内电缆,一个4096超节点内单柜可节省196公里铜缆。跨柜后,灵衢交换设备拥有176个端口,每个端口达到1.6T,单机实现280T全光互联。再向Scale-Out扩展,UBG灵衢网络交换机拥有1024超大Radix扇出能力,可支持百万卡超节点集群。

基于灵衢,华为构建了由鲲鹏950超节点、昇腾960超节点、OceanStor M900记忆存储、星河UBG交换机组成的Agentic AI超节点集群。其中,基于灵衢与NPO光引擎Hi-ONE,单个昇腾960超节点可实现4096卡规模,最大可提供8 EFLOPS FP8算力,实现高达1PB的HBM容量,系统无故障运行时间提升1倍,系统可用度可达99.8%。昇腾960风冷超节点和液冷超节点分别将于2027年Q2和Q3上市

算力与存储方面,鲲鹏950超节点计算刀片提供384个CPU核和6TB内存,单柜可提供12288个CPU核、支持192TB内存,基于灵衢可实现超过150万核统一调度以及24000TB内存全局池化。昇腾960超节点计算刀片支持8颗昇腾960 NPU,提供32 PFLOPS FP4算力、4.5TB统一内存以及17.9TB/s灵衢互联带宽。OceanStor M900通过全新存储控制器和ASU模组实现网络、CPU、盘控芯片“三芯合一”,单ASU模组拥有64TB容量密度,单节点访问带宽达到480GB/s。

在中小场景,华为基于灵衢推出从1卡到8卡的系列化一体机产品和鲲鹏昇腾模组。Atlas 650E可通过双机灵衢直连,让16个NPU进行Full-Mesh组网,无需交换机,两台机器可以像一台一样运行,支持万亿参数模型,并通过EP16并行切分让推理吞吐提升40%以上,时延低至10毫秒。

生态方面,杨超斌回顾,去年8月5日华为CANN全面开源开放,目前CANN社区月活开发者已达5200多人,50多家行业头部客户、伙伴及高校科研团队与昇腾合作,打造了26个行业专属算子库。华为还与DeepSeek Harness、OpenCode、openJiuwen等开源框架协同,打造Agent插件化组件并全量开源,并与90多家主流开源社区展开合作。

从产业视角看,过去几年行业多在既有PCIe加RoCE体系上做优化,但Agent负载把通信、内存、存储的短板同时放大,继续在旧协议上叠补丁的收益递减。华为选择从协议层重构互联,把计算与通信做垂直整合,试图为10万亿级大模型时代提供一套系统级算力底座。这一路线能否在生态与规模化落地上兑现,仍有待观察,但它已把AI基础设施的竞争推向体系化能力较量。