2.8萬億引數的大模型如何跑快,成為海內外團隊幾乎同時攻關的焦點。全球最大引數量的開源模型Kimi K3擁有2.8萬億總引數、104B啟用引數,普通AI伺服器難以承載,Kimi官方推薦64卡甚至更大規模的伺服器才能裝下。有業內人士稱,未經最佳化的超節點跑Kimi K3,初始效能可能僅在10 tokens/s左右。
9月21日,浪潮資訊在AICC 2026釋出元腦SD200 Ultra超節點AI伺服器,通過緊耦合128顆本土AI晶片,單機承載2.8萬億引數Kimi K3,Token生成時延首次降至5.85毫秒。兩天後的9月23日,海外TPU推理最佳化團隊Inferact開源tpu-megakernels,用16顆谷歌TPU v7晶片把整個K3裝進一個kernel(核心),配合DSpark投機解碼,低併發Decode(解碼)吞吐達到709 tokens/s。一個用本土晶片做商業化超節點,一個用谷歌TPU做開源推理專案,指向同一技術思路:打破運算元邊界,把大模型推理的計算過程融合到極致。
萬億引數模型推理慢,瓶頸往往不在算力本身,而在資料搬運和記憶體頻寬。據半導體行研機構SemiAnalysis分析,K3一次前向計算的HBM頻寬需求約1.5TB,896個專家需要分佈到多張晶片上,每次前向還會觸發超過120次All-to-All通訊。即便晶片算力強大,資料傳輸跟不上,大量計算能力也會閒置。在解碼階段,每生成一個Token都要持續讀取大量權重,傳統推理框架如vLLM、TensorRT-LLM往往需要啟動大量Kernel,每個Kernel完成自己的載入、計算和寫回,計算之間出現大量細小的“空泡”,累積成實際速度與理論峰值之間的鴻溝。
Inferact的思路是整個模型就是“一個kernel”。其megakernel方案使用Google Pallas,把K3的92個MoE層放進一個Pallas呼叫,在一個Kernel內部完成整個解碼過程。當前層計算時,下一層權重可通過非同步DMA提前從HBM搬運到片上VMEM。這套打法成立的關鍵是TPU v7的架構特性:每個TensorCore自帶64 MiB VMEM,資料進入VMEM後生命週期可由程式顯式控制,Kernel作者可以主動安排哪些權重提前搬運、哪些啟用繼續駐留、哪些資料使用後立即釋放。
浪潮資訊沒有把整個模型壓成一個Kernel,而是把眾多基礎運算元融合成超級運算元,用系統級緊耦合架構榨取整體效率。針對K3推理特點,團隊把KDA、Gated MLA、MoE中眾多基礎運算元融合為計算與通訊協同執行的大運算元,運算元數量降低10倍,模型推理效能提升3倍以上。具體做法分兩步:一是把小運算元“焊成”大運算元,按片上儲存容量劃分資料塊,讓前一步結果直接留在暫存器或片上快取供後一步使用,減少kernel launch次數,避免中間結果反覆寫入和讀取HBM;二是把通訊和計算融合,按Tile組織流水線,通過非同步搬運和多緩衝機制,讓下一塊資料預取、當前資料計算和上一塊結果寫回同時進行,跨晶片通訊也按Tile推進,把通訊延遲藏進計算過程。
超級運算元能減少資料搬運與等待,但其設計和最佳化本身是複雜工程。浪潮資訊在元腦SD200 Ultra適配Kimi K3的過程中引入“超級運算元智慧體”,讓Kimi K3參與自身的推理最佳化。浪潮資訊首席AI戰略官劉軍在採訪中打了個比方:過去大模型推理由數百個運算元串聯執行,如同綠皮火車途經數百個小站,反覆啟停裝卸資料;而超級運算元就像一站直達的高鐵,省去中間停靠開銷。劉軍談道,以往行業清楚這套模式的短板,但人工運算元最佳化排程工作量巨大,如今Agent帶來解法。浪潮資訊採用“用K3最佳化K3”的思路,由AI智慧體自動生成超級運算元,再經模型校驗迭代,效能較此前再度提升50%,形成迴圈加速。模型已不只是被最佳化的物件,也開始成為最佳化基礎設施的工具。
需求側同樣在爆發。據Gartner 2026年3月報告,一個Agent工作流每任務消耗的Token量是標準聊天機器人的5到30倍;高盛預測,到2030年全球Token消耗量將較2026年增長24倍,達到每月約120000萬億Token。算力供給面臨兩個典型困境:一是Kimi K3代表的“向上”,模型越來越大、長上下文與多Agent協同越來越多,單機越來越難承載;二是DeepSeek代表的“向廣”,低成本模型呼叫量迅速擴張,若算力供給跟不上,低價Token難以持續。浪潮資訊的回答是Capability AI Compute(能力型智算)加Capacity AI Compute(容量型智算)兩條線齊頭並進:向上,SD200 Ultra用5.85ms/token、單使用者170 tokens/s讓前沿模型跑得起;向廣,HC2000多元算力機組用DirectCom 2.0極速架構,Prefill、Decode、FFN按負載匹配多元晶片,同等投資Token產能提升10倍。
中國玩家的護城河在哪裡?單看晶片,與NVIDIA仍有差距,單卡算力、生態、工具鏈都有明顯短板。但到了超節點層面,靠系統級創新可以追平甚至超越單卡更強但系統鬆散的方案。以SD200 Ultra為例,其用3D Hyper Mesh架構緊耦合128顆本土AI晶片,提供8TB統一編址視訊記憶體和64TB記憶體,通訊時延低至0.69微秒;通過對稱記憶體技術,首次在基於本土AI晶片的超節點上實現GPU視訊記憶體直連,AllReduce通訊時間降低3.5倍。劉軍談道,超節點最基本的特徵是視訊記憶體要統一定址,這一點做到了,才能把這麼大的模型放進去,否則只能叫節點叢集,仍需把模型拆分成若干段。
晶片是一張牌,系統工程是另一張牌。當晶片之間形成更緊密連線、記憶體形成統一空間、通訊藏進計算過程、運算元又可由AI持續最佳化,單晶片效能之外的系統紅利就開始釋放。Inferact用16顆TPU證明一個kernel可以裝下2.8萬億引數;浪潮資訊用128顆本土晶片證明系統級緊耦合加超級運算元,可以讓本土算力跑進第一梯隊。兩條路線,一個方向:大模型推理的效率革命才剛剛開始。對中國AI產業而言,在晶片工藝受限的約束下,系統級創新是確定性較高的追趕路徑。