NVIDIA 于 8 月 24 日发布博文,宣称其下一代 AI 加速器平台 Vera Rubin NVL72 与现有 Blackwell GB300 NVL72 在智能体 AI 推理的每瓦性能上树立了新标准。根据 SemiAnalysis 推出的 AgentX 基准测试,Vera Rubin NVL72 在每兆瓦 AI 工厂吞吐量上较 GB300 NVL72 最高提升 30 倍,而 GB300 NVL72 在大型混合专家(MoE)模型上较上一代 H200 NVL8 每兆瓦吞吐量最高提升 80 倍。
智能体 AI 的兴起正在改变推理负载的特征。OpenRouter 的《State of AI》报告显示,在 100 万亿 token 的真实使用中,平均每次请求的提示 token 数增长了约四倍,单个智能体请求消耗的 token 量是普通聊天的 15 倍。这种从单轮交互到多步骤工作流的转变,要求硬件和软件栈能够处理长上下文预填充、KV 缓存复用、工具调用间隙以及动态并发。
AgentX 是 SemiAnalysis 开源基准套件 InferenceX 中的智能体编码基准,它通过回放预录的 Claude Code 会话(包含推理与工具调用)来评估加速器在真实智能体流量下的表现。与传统的固定序列长度测试不同,AgentX 保留了会话的上下文、输入输出序列长度以及推理时间和工具调用延迟,从而真实再现 KV 缓存容量压力。该基准报告每兆瓦 token 吞吐量,并结合端到端归一化交互性、标准交互性、端到端延迟和首 token 时间四个用户体验指标。
NVIDIA 表示,这些能效提升源于系统级优化,包括 MoE 服务运行时(SGLang、TensorRT-LLM、vLLM)、基于 DeepGEMM 的内核、混合精度格式(MXFP4、MXFP8)、NVIDIA Dynamo 会话感知服务栈,以及连接 72 个 GPU 的高带宽 NVLink 扩展结构,实现了机架级协同推理。
值得注意的是,AgentX 基准由第三方 SemiAnalysis 开发,NVIDIA 的博文引用了其预览结果。对于 AI 工厂运营商而言,每瓦性能直接关系到电力成本与资本开支,因此这一指标对算力采购决策至关重要。Vera Rubin 作为 NVIDIA 下一代平台,其能效优势若得到验证,可能进一步巩固 NVIDIA 在 AI 推理市场的领导地位,并对竞争对手形成压力。不过,实际部署效果仍需等待产品上市后的独立验证。