在华为全联接大会2026期间,华为正式上市了昇腾950超节点,包含Atlas 950 SuperPoD液冷超节点和Atlas 850E风冷超节点两款产品,成为业界最大规模的商用超节点。此前该产品已在WAIC上真机亮相,此次上市标志着超节点从技术验证迈入规模化商用阶段。

超节点为何成为行业共识

智能体(Agentic AI)浪潮下,AI推理需求呈指数级爆发。据华为方面预计,到2030年全球每月Token消耗数将超过120千万亿,暴涨24倍。与此同时,顶级MoE模型参数量已来到十万亿级,训练压力同步增长。传统服务器难以同时满足更大规模模型的高效训练与推理端更长上下文、更低时延、更低成本的需求,超节点逐渐成为AI基础设施领域公认的更优解决路径——通过将大量AI加速器紧密耦合为更高密度的计算单元,解决大模型训推中的存储墙和通信墙。

然而,全球芯片巨头、云厂商、服务器大厂虽争先发布超节点产品,真正商业化落地的却很少。华为昇腾计算产品线总裁张迪煊在演讲中表示,大模型每一波迭代都带来新的AI需求,昇腾超节点用大带宽、低时延和内存统一编址的确定架构来应对AI变化的不确定性。

Atlas 950 SuperPoD:1024卡像一台计算机

Atlas 950 SuperPoD液冷超节点由1024颗高性能NPU、1300多个灵衢互联套片、4000多个光模块和19万根CableTray组成,让千张卡像一台超级计算机一样协同工作。

技术突破集中在芯片和互联两个层面。芯片微架构方面,过去需要开发者手动管理的数据搬运、格式转换、通信同步、缓存策略均下沉到硬件,提升了算子开发易用性和效率。互联层面,灵衢高速互联技术实现1024卡统一内存编址,跨卡远程内存访问如同操作本地内存,芯片互联带宽相比上代提升2.1倍。

工程化落地方面,昇腾自研TPSU电源模块提供储能能力以支撑训练推理业务的供电波峰诉求。散热上,单个昇腾950 NPU模组功耗达950W,通过高密铲齿加冰川铠甲冷板技术及多水路串联设计,单块冷板可带走2000W热量。正交架构设计实现柜内零线缆全电互联,单柜减少6000多根线缆,一个1024超节点可省下50千米铜线。柜间光互联采用业界唯一的光模块液冷技术,一个超节点4000多个光模块节省的电力消耗相当于数千户家庭的年用电量。

实际训推场景中,Atlas 950训练效率提升1.5-1.7倍,基于器件、网络、系统三重可靠设计实现万卡超节点集群月级稳定训练;推理侧性能提升2-3倍、时延低于10ms,实现万亿模型训推一体化。昇腾也是国内唯一商用支持mxFP8低精训练和全流程支持mxFP4推理的厂商。

Atlas 850E:风冷机房无需改造直接部署

Atlas 850E风冷超节点聚焦企业级通用风冷机房的升级改造。大量企业级风冷机房面临液冷基建改造周期长、成本高的门槛,而Atlas 850E基于自研相变散热技术,无需液冷改造,标准风冷机柜可直接上架部署,支持从32卡到768卡。

该产品原生覆盖FP8、mxFP8、HiF8、INT8、mxFP4全量低精格式,可稳定实现10ms级时延推理。通过异构PD分离方案动态调整PD配比、叠加大规模专家并行优化,在万亿参数MoE模型推理上实现5-10ms极致低时延,单卡吞吐比业界风冷集群提升2.5倍。

软件生态:从好用到易用

昇腾超节点的系统软件包括灵衢总线管理、灵衢系统服务及超节点管理等组件。灵衢系统高阶服务支持跨物理节点统一内存编址,编程模式与单系统语义一致。基于内存语义和拓扑编排,1024卡超节点域内集合通信性能提升1.6倍;实测大EP跨卡通信1K小包场景,耗时从70微秒降到8.6微秒,性能提升8倍。

生态方面,昇腾已完成CANN和Mind系列的全面开源开放,CANN社区月活开发者突破5200多名,位列中国开源项目活跃度排名第一。

产业影响与观察

从行业视角看,昇腾950超节点的规模化商用落地,为超节点这一形态提供了从技术到工程化的可参照样本。其液冷与风冷双形态覆盖了从大型数据中心到中小企业机房的不同场景,降低了超节点技术的部署门槛。目前昇腾超节点已应用于互联网、运营商、金融、教育、医疗、交通、制造等行业,蚂蚁阿福基于其实现模型训练“离线持续优化、在线实时纠偏”,德赛西威基于其构建高性能算力底座。

值得关注的是,超节点竞争的本质正从单一硬件参数转向“硬件架构+系统工程+软件生态”的综合能力比拼。对AI产业链而言,超节点的规模化落地将带动光模块、液冷散热、电源管理等配套环节的需求,同时也对传统服务器厂商的竞争格局形成压力。在十万亿级大模型时代,算力基础设施的部署效率与成本,正成为决定AI应用能否规模化落地的关键变量之一。