英伟达近日发布了 Groq 3 LPX,这是一款专为 Vera Rubin 平台设计的交互式 AI 推理加速器。据英伟达开发者博客介绍,该加速器在第三方基准测试中表现亮眼:在 Artificial Analysis 100K 上下文基准上,运行 Gemma 4 31B 模型时实现了 每秒 3431 输出 token 的世界级交互速度,且未损失精度或模型质量。这一成绩标志着在长上下文场景下实现高交互性推理的重要进展。
长上下文与高交互性为何重要?智能体(agentic)会话通常涉及多轮推理,每轮结束后,智能体的输出会被追加到不断增长的上下文中,供后续所有轮次使用。随着会话进行,上下文可能膨胀至数十万 token,尤其是在会话超过数百轮时。这意味着,在任务后期,智能体必须反复处理此前学到的所有信息。如果上下文受限,智能体的能力将大打折扣。因此,最强大的智能体不仅需要速度,还必须在会话增长时保持长上下文。
在推理系统中,张量并行(TP)等技术可带来数量级的加速,但前提是系统能高效管理协调开销。高交互性推理要求极小的批处理大小,此时固定的协调成本可能超过 TP 节省的时间。TP 涉及将计算拆分到多个芯片并行执行,然后合并结果。在极小批处理下,有效的 TP 需要紧密协调,许多小张量必须在计算单元间传输,且每个张量的到达和离开都需精确同步。通信和结果合并的时间很容易与分布式计算节省的时间相当甚至更长。
Groq 3 LPX 通过编译器调度的负载规划解决了这一挑战。其芯片间(C2C)机架内网络和计算与通信的重叠设计,将首比特延迟降至最低,从而在极小批处理下也能实现有效的张量并行。这种确定性调度使得系统能够高效处理长上下文 KV 缓存,支持多智能体推理。
基准测试进一步证实,Groq 3 LPX 在通用智能体任务和编码任务上均能持续提供高吞吐量,例如在 SPEED-Bench 上达到 每秒 4767 输出 token 的中位数。此外,该加速器支持与 Vera Rubin NVL72 的多种协同执行配置,包括预填充-解码分离、注意力-FFN 分离以及推测性外部草稿解码,可扩展至 2 万亿参数 的模型。
英伟达表示,Groq 3 LPX 扩展了 Vera Rubin 平台在高交互性服务层级的能力,使其能够更好地支持 AI 工厂中的用户体验。这一技术突破对于需要长上下文、高交互性的智能体应用具有重要意义,可能推动相关产业链的发展。不过,实际部署效果仍需进一步验证。