在 Hot Chips 2026 大会上,英伟达硬件副总裁 Igor Arsovski 展示了其 Groq 3 LPX 机架的架构,并公布了该硬件的首个第三方推理基准。Arsovski 曾是 Groq 的首席架构师,如今在英伟达负责硬件业务。他展示的基准测试由 Artificial Analysis 完成,结果显示,在 Gemma 4 31B 推理任务(上下文长度 100K)上,LPX 机架的输出速度达到每秒 3431 token,约为其他最快公共端点的四倍(后者为每秒 870 token)。Arsovski 表示,该机架已投入生产,基于英伟达在 2025 年 12 月以 200 亿美元收购 Groq 交易中获得的 LP30 芯片。这笔交易也使得被其取代的 Rubin CPX 从英伟达的路线图中消失。
LP30 芯片采用纯 SRAM 设计,不带 HBM,每个芯片集成了约 500MB 的片上 SRAM。一个完整的 LPX 机架包含 256 颗芯片,提供 128GB 内存、40 PB/s 的聚合带宽和 315 PFLOPS 的 FP8 算力,芯片间延迟为 350 纳秒。该机架采用 Vera Rubin 兼容的 MGX 液冷设计,可扩展至超过 1000 个 LPU。将模型权重驻留在 SRAM 中而非从 HBM 流式加载,消除了单 token 解码中占主导地位的内存访问延迟。该设计还去掉了缓存、分支预测和乱序执行,采用完全确定性的流水线,由编译器以时钟周期粒度进行调度。
在基准测试中,Artificial Analysis 通过 Google Cloud 上的一个私有预发布 Gemma 4 31B 端点运行了对比,采用并发为 1 的 50 次顺序客户端请求的中位数,而对比的公共提供商则运行共享的生产无服务器端点。单请求模式能产生硬件可达到的最高每用户 token 速率,与其他端点的多租户条件不直接可比。英伟达在台上演示的更高数字(每秒 10996 token)被 Arsovski 标记为“自我报告”,他表示目标是“第三方验证的独立基准,你们可以信任”。Gemma 4 31B 是一个稠密模型,足够小,可以放入单个 LPX 机架,但万亿参数规模的混合专家模型(内存容量成为主要约束)的情况并未涉及。
英伟达将 LPX 机架定位为解码协处理器,与 Vera Rubin NVL72 配合使用,Rubin GPU 处理计算密集的预填充阶段并构建 KV 缓存,而 LPU 生成输出 token。英伟达展示了三种分工方式:分离式预填充和解码;注意力-FFN 分离(注意力及其缓存保留在 GPU HBM 上,LPU 运行前馈层);以及外部草稿投机解码(LPU 上的小模型提出 token,GPU 并行验证)。一个 FPGA 桥接同步 LPU 域和异步主机 I/O 及 GPU 交接,英伟达的 Dynamo 运行时和 CUDA 的 LPU 扩展负责编排。英伟达称,在 2 万亿参数、400K token 缓存上下文的负载下,这些模式相比单独使用 Rubin 可带来约 3 到 5 倍的性能提升,但这些数据均为英伟达自测。
确定性执行还带来功耗和散热优势:编译器可逐周期预测功耗,英伟达据此提前从机架稳压器预取电流,将电压跌落降低 60% 以上,过冲降低 70% 以上。同一调度机制还能均衡热量,而非限制到最热瓦片,Arsovski 称在固定热限制下可额外获得约 10% 到 11% 的性能。跨机架时,英伟达通过所谓的“准同步网络”将芯片同步到单一虚拟时钟,每颗芯片既充当处理器又充当路由器,因此无需自适应路由或拥塞感知,芯片间时钟漂移在链路层补偿。
在问答环节,当被问及工作负载中途芯片故障的影响范围时,Arsovski 表示用户“会体验到与业界任何其他硬件完全相同的体验”,只需“检查点或重新配置硬件”。
同一场 Hot Chips 会议上,Cerebras 也展示了其 CS4 晶圆级系统。首席系统架构师 Jean-Philippe Fricker 称,CS4 的运行速度比 GPU 快 30 倍,token 速率是 CS3 的两倍,token 容量是其 10 倍。每个 CS4 机架包含三个晶圆级引擎,采用名为 Nexus 的新模块化平台,围绕可插拔计算“背包”构建,将电源、计算和 I/O 分离,Fricker 称其内存带宽为 43…(原文截断)。