在AICC 2026大会上,浪潮信息正式发布两款算力产品:面向前沿模型训练的元脑SD200 Ultra超节点AI服务器,以及面向大规模推理的元脑HC2000多元算力机组。前者以128芯本土AI芯片紧耦合,实现单机运行总参数量2.8万亿Kimi K3,Token生成时延首次突破5.85毫秒;后者在典型Agent任务场景中,同等SLO约束下相比单一算力构建的推理系统,实现同等投资10倍Token产能提升

同场,IDC给出了一组需求侧数字:2026年全球活跃Agent约7940万个,到2030年将达22.16亿个;同期Token消耗量从2026年的0.026Peta增长到2030年的152667Peta。Agent数量增长约28倍,Token消耗却增长数百万倍。这一剪刀差,构成了浪潮信息此次产品布局的背景。

浪潮信息把算力需求拆成两个方向。其一是“向上”的能力型智算:Agent时代一次用户意图背后可能是几十次、几百次甚至更多次推理,多个Agent连续协同数小时甚至数天,叠加前沿模型参数规模持续放大。以Kimi K3为例,其权重文件约1.56TB,普通AI服务器的GPU显存连权重都装不下,官方推荐至少64卡甚至更大规模才能运行。简单堆叠服务器已难以奏效,超节点的意义在于把更多芯片和内存纳入统一高效协同的计算域。

SD200 Ultra基于3D HyperMesh架构,提供8TB带宽64TB内存,采用对称直连与算子优化减少数据搬移;原生内存语义通信把跨芯片通信时延降至0.69微秒。软件侧,浪潮信息构建超级算子库,将KDA、Gated MLA、MoE中的基础算子融合为计算加通信的大算子,算子数量降为原先的1/11,以减少Kernel Launch次数与HBM访问开销。该产品还支持10万亿参数规模的前沿模型,为模型规模与上下文长度扩展留出空间。

其二是“向广”的容量型智算。推理并非单一计算模式,Prefill与Decode的计算特征不同,Attention与MoE对计算和访存的要求也不同,多模态、MTP等架构还会带来更多负载类型。单纯增加服务器可能因资源浪费、失衡与任务排队,导致部分算力闲置、另一部分持续紧张。HC2000的思路是按负载组织资源:基于DirectCom 2.0极速架构,以原生液冷高密整机柜为载体,核心软件栈MCIS持续测量不同算力资源的能力与负载,动态分配并实时调整配置。硬件上采用全液冷设计与高通流供电,单柜供电能力达300千瓦以上,最大承载256张AI卡,算力密度实现4倍跃升。

值得注意的是,浪潮信息首席AI战略官刘军把这一思路概括为“贯穿式创新”,涵盖芯片、服务器系统到模型的纵向贯穿,单机到系统的横向贯穿,以及技术到生态的贯穿。他提到,Prefill可搭配供应与成本更优的LPDDR颗粒,Decode可选择大容量HBM的AI芯片,FFN计算环节可选用3D DRAM堆叠芯片,从而放弃用同一种通用巨无霸芯片包打天下的策略。刘军还表示,智能的价值不仅取决于最高点有多高,更取决于有多少人能够获得它。

从产业视角看,这一布局回应了今年两个典型案例所暴露的困境。Kimi K3指向“向上”的部署门槛从单机走向集群;DeepSeek在2026年上半年将V4-Pro的API价格下调75%并称长期有效,8月又预告整体提价,理由直指“算力不足”,指向“向广”的性价比算力容量瓶颈。浪潮信息试图用SD200 Ultra突破智能上限、用HC2000推动规模化供给,并以系统协同连接两者。对AI产业链而言,这意味着竞争焦点正从单点芯片性能,转向芯片组合、软件栈调度与系统级协同能力,国产算力如何在同一业务内实现多元芯片分工,将成为后续观察重点。