2026 年 9 月 21 日于上海举行的华为全联接大会(HUAWEI CONNECT 2026)上,华为董事、ICT BG CEO 杨超斌发表算力架构创新主题演讲,首次披露 UnifiedBus 互联架构的更多细节,并发布基于该架构的一系列算力产品。他同时介绍了华为与开源社区协作、帮助客户与开发者进行应用创新的进展。

杨超斌指出,传统算力架构存在一个结构性难题:集群规模越大,资源利用率反而越低。在一个 10 万 NPU 的集群中,模型实际利用到的算力可能只有 20%,大量算力在数据通信过程中闲置。而一个 10 万亿参数的模型在训练时需要海量中间数据,远超单颗加速器内存的承载能力。集群内部件之间的互联与通信,已成为算力系统的关键性能瓶颈。

华为给出的解法就是 UnifiedBus。该架构面向智能体应用兴起带来的算力需求增长而设计,目标是让集群与超节点之间协同工作。据杨超斌介绍,UnifiedBus 算力系统具备四项关键特性。

其一是统一的协议与内存语义。UnifiedBus 把十余种互联协议整合到一套协议之下,将互联带宽从 100 GB/s 级提升到 TB/s 级,往返时延(RTT)从 7 微秒降到 2 微秒,并在超节点内实现统一的全局内存寻址。

其二是异构算力协同。UnifiedBus 直接互联 CPU、NPU、内存与固态硬盘(SSD),使它们之间可以点对点、去中心化访问,并支持 CPU 与 NPU 的灵活混配;同时针对 Transformer 提供分层硬件加速,实现 Attention-FFN 解耦(AFD)。

其三是分层存储与全局池化。UnifiedBus 通过混合介质资源池化来缓存激活值,把 DDR 内存作为 NPU 的补充内存,从而降低搜索、推荐与广告业务的时延,并使千维、千亿级数据条目的向量检索性能翻倍。这一设计还降低了对 10 万亿参数模型训练时单 NPU 所需 HBM 容量的要求,并提升集群的模型算力利用率(MFU)。

其四是光电互联与灵活组网。UnifiedBus 充当全局超高带宽、超低时延的“数据高速公路”,让算力可以弹性扩展。

在产品层面,华为发布了覆盖机柜内、机柜间与跨集群三类场景的 UnifiedBus 互联产品,支持从单个机柜到 百万 NPU 集群的弹性扩展。机柜内的 UnifiedBus LinkBlade 采用无缆化设计消除线路损耗,使一个 4,096 NPU 超节点内的铜缆用量减少约 196 公里。机柜间的 UnifiedBus LinkDevice 支持 176 个端口、单端口 1.6 Tbit/s 带宽,提供 280 Tbit/s 全光互联,华为称其为业界带宽最高、端口数最多的高速总线协议互联设备,RTT 时延低至 2 微秒。跨集群的 UnifiedBus UBG 交换机则提供高达 1,024 的交换容量,可支撑百万 NPU 级 SuperCluster,并向支持数十万亿参数模型演进。

杨超斌还发布了基于 UnifiedBus 的智能体 AI 超节点集群,由 TaiShan 950Atlas 960 超节点、OceanStor M900 内存存储以及星河 UBG 交换机组成,可实现多样化算力协同与分层资源池化。

除超节点之外,华为把 UnifiedBus 技术延伸到算力设备形态:推出新的 UnifiedBus 系列设备(支持 1 至 8 颗 NPU)以及鲲鹏与昇腾模组,让中小企业也能在本地运行万亿参数模型。

生态方面,杨超斌表示昇腾正与 DeepSeek HarnessOpenCodeopenJiuwen 等开源框架合作,开发完全开源的智能管理、推理加速与安全框架智能体插件。他表示,华为致力于在系统层面创新,构建算力基础产品组合,并坚持开源与开放系统,继续与客户、伙伴和开发者合作,为世界提供算力新选择。

从产业视角看,这条消息的核心不在单颗芯片的算力指标,而在“系统级”组网能力:当模型参数走向十万亿级、集群走向百万卡级,互联带宽与时延、内存层级与存储池化往往比单点算力更能决定集群的实际可用算力。UnifiedBus 把协议、内存语义与光互联收拢到一套架构,并配合面向中小企业的低 NPU 数量设备与开源智能体插件,形成从超大规模集群到本地推理的完整梯度。对关注国产算力产业链的读者而言,后续值得跟踪的是这套架构在客户侧的落地规模、开源插件的成熟度,以及光互联与存储配套环节能否同步放量。