NVIDIA 於 8 月 24 日釋出博文,宣稱其下一代 AI 加速器平台 Vera Rubin NVL72 與現有 Blackwell GB300 NVL72 在智慧體 AI 推理的每瓦效能上樹立了新標準。根據 SemiAnalysis 推出的 AgentX 基準測試,Vera Rubin NVL72 在每兆瓦 AI 工廠吞吐量上較 GB300 NVL72 最高提升 30 倍,而 GB300 NVL72 在大型混合專家(MoE)模型上較上一代 H200 NVL8 每兆瓦吞吐量最高提升 80 倍。
智慧體 AI 的興起正在改變推理負載的特徵。OpenRouter 的《State of AI》報告顯示,在 100 萬億 token 的真實使用中,平均每次請求的提示 token 數增長了約四倍,單個智慧體請求消耗的 token 量是普通聊天的 15 倍。這種從單輪互動到多步驟工作流的轉變,要求硬體和軟體棧能夠處理長上下文預填充、KV 快取複用、工具呼叫間隙以及動態併發。
AgentX 是 SemiAnalysis 開源基準套件 InferenceX 中的智慧體編碼基準,它通過回放預錄的 Claude Code 會話(包含推理與工具呼叫)來評估加速器在真實智慧體流量下的表現。與傳統的固定序列長度測試不同,AgentX 保留了會話的上下文、輸入輸出序列長度以及推理時間和工具呼叫延遲,從而真實再現 KV 快取容量壓力。該基準報告每兆瓦 token 吞吐量,並結合端到端歸一化互動性、標準互動性、端到端延遲和首 token 時間四個使用者體驗指標。
NVIDIA 表示,這些能效提升源於系統級最佳化,包括 MoE 服務執行時(SGLang、TensorRT-LLM、vLLM)、基於 DeepGEMM 的核心、混合精度格式(MXFP4、MXFP8)、NVIDIA Dynamo 會話感知服務棧,以及連線 72 個 GPU 的高頻寬 NVLink 擴充套件結構,實現了機架級協同推理。
值得注意的是,AgentX 基準由第三方 SemiAnalysis 開發,NVIDIA 的博文引用了其預覽結果。對於 AI 工廠運營商而言,每瓦效能直接關係到電力成本與資本開支,因此這一指標對算力採購決策至關重要。Vera Rubin 作為 NVIDIA 下一代平台,其能效優勢若得到驗證,可能進一步鞏固 NVIDIA 在 AI 推理市場的領導地位,並對競爭對手形成壓力。不過,實際部署效果仍需等待產品上市後的獨立驗證。