2.8万亿参数的大模型如何跑快,成为海内外团队几乎同时攻关的焦点。全球最大参数量的开源模型Kimi K3拥有2.8万亿总参数、104B激活参数,普通AI服务器难以承载,Kimi官方推荐64卡甚至更大规模的服务器才能装下。有业内人士称,未经优化的超节点跑Kimi K3,初始性能可能仅在10 tokens/s左右。
9月21日,浪潮信息在AICC 2026发布元脑SD200 Ultra超节点AI服务器,通过紧耦合128颗本土AI芯片,单机承载2.8万亿参数Kimi K3,Token生成时延首次降至5.85毫秒。两天后的9月23日,海外TPU推理优化团队Inferact开源tpu-megakernels,用16颗谷歌TPU v7芯片把整个K3装进一个kernel(内核),配合DSpark投机解码,低并发Decode(解码)吞吐达到709 tokens/s。一个用本土芯片做商业化超节点,一个用谷歌TPU做开源推理项目,指向同一技术思路:打破算子边界,把大模型推理的计算过程融合到极致。
万亿参数模型推理慢,瓶颈往往不在算力本身,而在数据搬运和内存带宽。据半导体行研机构SemiAnalysis分析,K3一次前向计算的HBM带宽需求约1.5TB,896个专家需要分布到多张芯片上,每次前向还会触发超过120次All-to-All通信。即便芯片算力强大,数据传输跟不上,大量计算能力也会闲置。在解码阶段,每生成一个Token都要持续读取大量权重,传统推理框架如vLLM、TensorRT-LLM往往需要启动大量Kernel,每个Kernel完成自己的加载、计算和写回,计算之间出现大量细小的“空泡”,累积成实际速度与理论峰值之间的鸿沟。
Inferact的思路是整个模型就是“一个kernel”。其megakernel方案使用Google Pallas,把K3的92个MoE层放进一个Pallas调用,在一个Kernel内部完成整个解码过程。当前层计算时,下一层权重可通过异步DMA提前从HBM搬运到片上VMEM。这套打法成立的关键是TPU v7的架构特性:每个TensorCore自带64 MiB VMEM,数据进入VMEM后生命周期可由程序显式控制,Kernel作者可以主动安排哪些权重提前搬运、哪些激活继续驻留、哪些数据使用后立即释放。
浪潮信息没有把整个模型压成一个Kernel,而是把众多基础算子融合成超级算子,用系统级紧耦合架构榨取整体效率。针对K3推理特点,团队把KDA、Gated MLA、MoE中众多基础算子融合为计算与通信协同执行的大算子,算子数量降低10倍,模型推理性能提升3倍以上。具体做法分两步:一是把小算子“焊成”大算子,按片上存储容量划分数据块,让前一步结果直接留在寄存器或片上缓存供后一步使用,减少kernel launch次数,避免中间结果反复写入和读取HBM;二是把通信和计算融合,按Tile组织流水线,通过异步搬运和多缓冲机制,让下一块数据预取、当前数据计算和上一块结果写回同时进行,跨芯片通信也按Tile推进,把通信延迟藏进计算过程。
超级算子能减少数据搬运与等待,但其设计和优化本身是复杂工程。浪潮信息在元脑SD200 Ultra适配Kimi K3的过程中引入“超级算子智能体”,让Kimi K3参与自身的推理优化。浪潮信息首席AI战略官刘军在采访中打了个比方:过去大模型推理由数百个算子串联执行,如同绿皮火车途经数百个小站,反复启停装卸数据;而超级算子就像一站直达的高铁,省去中间停靠开销。刘军谈道,以往行业清楚这套模式的短板,但人工算子优化调度工作量巨大,如今Agent带来解法。浪潮信息采用“用K3优化K3”的思路,由AI智能体自动生成超级算子,再经模型校验迭代,性能较此前再度提升50%,形成循环加速。模型已不只是被优化的对象,也开始成为优化基础设施的工具。
需求侧同样在爆发。据Gartner 2026年3月报告,一个Agent工作流每任务消耗的Token量是标准聊天机器人的5到30倍;高盛预测,到2030年全球Token消耗量将较2026年增长24倍,达到每月约120000万亿Token。算力供给面临两个典型困境:一是Kimi K3代表的“向上”,模型越来越大、长上下文与多Agent协同越来越多,单机越来越难承载;二是DeepSeek代表的“向广”,低成本模型调用量迅速扩张,若算力供给跟不上,低价Token难以持续。浪潮信息的回答是Capability AI Compute(能力型智算)加Capacity AI Compute(容量型智算)两条线齐头并进:向上,SD200 Ultra用5.85ms/token、单用户170 tokens/s让前沿模型跑得起;向广,HC2000多元算力机组用DirectCom 2.0极速架构,Prefill、Decode、FFN按负载匹配多元芯片,同等投资Token产能提升10倍。
中国玩家的护城河在哪里?单看芯片,与NVIDIA仍有差距,单卡算力、生态、工具链都有明显短板。但到了超节点层面,靠系统级创新可以追平甚至超越单卡更强但系统松散的方案。以SD200 Ultra为例,其用3D Hyper Mesh架构紧耦合128颗本土AI芯片,提供8TB统一编址显存和64TB内存,通信时延低至0.69微秒;通过对称内存技术,首次在基于本土AI芯片的超节点上实现GPU显存直连,AllReduce通信时间降低3.5倍。刘军谈道,超节点最基本的特征是显存要统一寻址,这一点做到了,才能把这么大的模型放进去,否则只能叫节点集群,仍需把模型拆分成若干段。
芯片是一张牌,系统工程是另一张牌。当芯片之间形成更紧密连接、内存形成统一空间、通信藏进计算过程、算子又可由AI持续优化,单芯片性能之外的系统红利就开始释放。Inferact用16颗TPU证明一个kernel可以装下2.8万亿参数;浪潮信息用128颗本土芯片证明系统级紧耦合加超级算子,可以让本土算力跑进第一梯队。两条路线,一个方向:大模型推理的效率革命才刚刚开始。对中国AI产业而言,在芯片工艺受限的约束下,系统级创新是确定性较高的追赶路径。