研究机构SemiAnalysis于9月22日发布一份深度技术报告,系统拆解大模型推理服务的底层架构。报告的核心判断是:AI推理并非运行在单一服务器上的整体程序,而是由多个专用工作节点池构成的循环系统,可细分为预填充(Prefill)中间填充(Midfill)解码注意力(Decode Attention)解码专家(Decode Experts)四个工作阶段,构成一座分工明确的"Token工厂"。

报告首先从混合专家(MoE)架构切入。过去业界习惯用参数量衡量模型规模,但MoE改变了比较逻辑——每次处理一个词元时,模型不会让全部参数参与计算,而是由"路由器"为每个词元定位少数几个最合适的专家模块。这带来连锁反应:哪些数据必须住在离计算最近的地方发生根本变化,内存、带宽、存储的价值权重被重新排列,调度复杂度也从线性增长变为指数级跃迁。

在推理流程上,用户或代理发出请求后,调度层(如英伟达DynamoMooncake)将其放入队列,分配给输入填充工作节点,把用户输入连同历史对话状态转化为新上下文,再交由解码工作节点反复读取已积累状态、逐步生成回答词元。在智能体场景下,这一流程还会与工具调用、外部搜索交织,形成每小时可达数千次的对话轮次。

每轮对话产生的"记忆"以KV状态形式存储,被设计成不可变的数据块,一旦生成便不再修改、只不断追加,契合AI对话因果推进的特性。存储采用层级设计:最高频调用的实时数据住在GPUHBM(高带宽内存里,次高频的中间态数据转移到CPU的DRAM中转,低频历史数据则推入SSD或网络存储池。报告引用SemiAnalysis AgentX数据集的真实追踪数据指出,智能体对话中上下文增长极快,也会因压缩行为大幅波动,领先AI公司被观察到反复压缩上下文以维持在百万词元限制之内。成本结构上,报告明确指出HBM比DDR内存贵出数倍且供应受限,频繁复用的通用数据块应保留在共享CPU内存或近端缓存,而非占用昂贵的HBM。

报告最核心的贡献之一,是强调四个阶段对硬件的需求天差地别。预填充处理用户首次请求的一整批新词元,大量词元共享权重加载,矩阵运算效率高、算术强度高,通常受计算能力约束而非内存带宽。中间填充在智能体工作流中日益重要,它在已有长缓存前缀上追加少量新词元——前缀可能已达数十万词元,新输入仅数百至数千词元,兼具解码阶段的大规模KV状态读取与预填充阶段的权重复用特性,算术强度可达单词元解码的数百倍。解码注意力每次前向传播仅处理一个或少数几个词元,随上下文增长,注意力读取的数据量甚至可超过模型权重本身,是长上下文场景下最重的内存操作之一。解码专家则是MoE特有环节,路由器根据当前词元激活值从庞大专家库中选取少数专家执行计算,专家权重不携带查询历史,因而可在更广泛的GPU范围内分布部署。

由此报告得出一个对硬件采购具有反直觉意义的结论:在许多推理场景下,带宽比容量更能创造收益。数据在被处理时创造收益,在内存中闲置时只产生成本。一块内存吞吐极高的加速器,即便容量较小,其生成词元的速率也可能超过低带宽高容量配置。在达到"够用"的容量门槛之前,每增加一份内存都能显著提升收益;越过门槛后曲线逐渐走平,继续堆容量的边际效益越来越低。报告给出一个2027年的实用设计基准:以每词元约70KB的KV状态、200万词元的聚合活跃上下文计算,单个流水线阶段的KV状态需求约140GB,加入双缓冲后接近280GB;再叠加模型权重、激活值、路由表和运行余量,单阶段约需400至500GB的本地快速内存。

调度层面,报告特别警告一种在大规模推理集群中容易出现的系统性风险——延迟反馈震荡。预填充和中间填充可预测,但解码是随机的,没人知道模型何时输出终止符号。若解码变慢,后续预填充请求就会积压,系统可能过度补偿、突然放入大量新任务,形成新一轮拥堵。报告提出的解法包括:在各阶段之间设置就绪缓冲区、平滑化入场控制、分层控制时间尺度(微秒级硬件调度、毫秒级词元流控制、秒级缓冲管理、分钟级工作节点重配置)。报告认为,高交互性与高利用率并不天然矛盾,关键在于调度器要有足够视野和反应速度。

架构路线上,报告呈现了分离式与聚合式两种哲学的辩论。分离式主张为预填充和解码分别配置最适合的硬件,任务来了由调度器决定送往哪台机器、完成后搬走KV缓存;聚合式主张一次对话尽量在同一台机器完成,省去跨机搬运动辄数十GB KV缓存的网络开销,但要求单机同时擅长高强度计算与高带宽内存访问,而这两种能力在硬件设计上往往存在取舍。报告认为,这场辩论的结论取决于能否造出同时具备极高计算密度和极高内存带宽的"全能明星芯片",否则分离式仍是现有硬件条件下更务实的选择。

报告最后通过SemiAnalysis推理模拟器,对Kimi K3模型在B200B300GB200系统上采用16至64块GPU的不同配置进行了性能投影,覆盖交互延迟、吞吐量、能耗与内存占用四个维度,并注明这些均为模拟预测而非实测基准。解码阶段,GB200在延迟-吞吐权衡曲线的大部分区间表现领先;中间填充阶段,GB200凭借NVL72架构将扩展带宽延伸至整个机架,在低首词元延迟区间领先,B300在吞吐量导向端追平差距。内存占用方面,大多数前沿配置的每GPU HBM峰值驻留量维持在80GB以下,支持了报告的核心论点:相较于最大化每块加速器的HBM容量,带宽管理与存储编排往往具有更高的经济价值。能耗方面,解码阶段因每个查询需约1000次模型前向传播而成为最大能耗来源,中间填充阶段反而能耗最低。