在AICC 2026大會上,浪潮資訊正式釋出兩款算力產品:面向前沿模型訓練的元腦SD200 Ultra超節點AI伺服器,以及面向大規模推理的元腦HC2000多元算力機組。前者以128芯本土AI晶片緊耦合,實現單機執行總引數量2.8萬億的Kimi K3,Token生成時延首次突破5.85毫秒;後者在典型Agent任務場景中,同等SLO約束下相比單一算力構建的推理系統,實現同等投資10倍Token產能提升。
同場,IDC給出了一組需求側數字:2026年全球活躍Agent約7940萬個,到2030年將達22.16億個;同期Token消耗量從2026年的0.026Peta增長到2030年的152667Peta。Agent數量增長約28倍,Token消耗卻增長數百萬倍。這一剪刀差,構成了浪潮資訊此次產品佈局的背景。
浪潮資訊把算力需求拆成兩個方向。其一是“向上”的能力型智算:Agent時代一次使用者意圖背後可能是幾十次、幾百次甚至更多次推理,多個Agent連續協同數小時甚至數天,疊加前沿模型引數規模持續放大。以Kimi K3為例,其權重檔案約1.56TB,普通AI伺服器的GPU視訊記憶體連權重都裝不下,官方推薦至少64卡甚至更大規模才能執行。簡單堆疊伺服器已難以奏效,超節點的意義在於把更多晶片和記憶體納入統一高效協同的計算域。
SD200 Ultra基於3D HyperMesh架構,提供8TB頻寬和64TB記憶體,採用對稱直連與運算元最佳化減少資料搬移;原生記憶體語義通訊把跨晶片通訊時延降至0.69微秒。軟體側,浪潮資訊構建超級運算元庫,將KDA、Gated MLA、MoE中的基礎運算元融合為計算加通訊的大運算元,運算元數量降為原先的1/11,以減少Kernel Launch次數與HBM訪問開銷。該產品還支援10萬億引數規模的前沿模型,為模型規模與上下文長度擴充套件留出空間。
其二是“向廣”的容量型智算。推理並非單一計算模式,Prefill與Decode的計算特徵不同,Attention與MoE對計算和訪存的要求也不同,多模態、MTP等架構還會帶來更多負載型別。單純增加伺服器可能因資源浪費、失衡與任務排隊,導致部分算力閒置、另一部分持續緊張。HC2000的思路是按負載組織資源:基於DirectCom 2.0極速架構,以原生液冷高密整機櫃為載體,核心軟體棧MCIS持續測量不同算力資源的能力與負載,動態分配並即時調整配置。硬體上採用全液冷設計與高通流供電,單櫃供電能力達300千瓦以上,最大承載256張AI卡,算力密度實現4倍躍升。
值得注意的是,浪潮資訊首席AI戰略官劉軍把這一思路概括為“貫穿式創新”,涵蓋晶片、伺服器系統到模型的縱向貫穿,單機到系統的橫向貫穿,以及技術到生態的貫穿。他提到,Prefill可搭配供應與成本更優的LPDDR顆粒,Decode可選擇大容量HBM的AI晶片,FFN計算環節可選用3D DRAM堆疊晶片,從而放棄用同一種通用巨無霸晶片包打天下的策略。劉軍還表示,智慧的價值不僅取決於最高點有多高,更取決於有多少人能夠獲得它。
從產業視角看,這一佈局回應了今年兩個典型案例所暴露的困境。Kimi K3指向“向上”的部署門檻從單機走向叢集;DeepSeek在2026年上半年將V4-Pro的API價格下調75%並稱長期有效,8月又預告整體提價,理由直指“算力不足”,指向“向廣”的價效比算力容量瓶頸。浪潮資訊試圖用SD200 Ultra突破智慧上限、用HC2000推動規模化供給,並以系統協同連線兩者。對AI產業鏈而言,這意味著競爭焦點正從單點晶片效能,轉向晶片組合、軟體棧排程與系統級協同能力,國產算力如何在同一業務內實現多元晶片分工,將成為後續觀察重點。