輝達近日釋出了 Groq 3 LPX,這是一款專為 Vera Rubin 平台設計的互動式 AI 推理加速器。據輝達開發者部落格介紹,該加速器在第三方基準測試中表現亮眼:在 Artificial Analysis 100K 上下文基準上,執行 Gemma 4 31B 模型時實現了 每秒 3431 輸出 token 的世界級互動速度,且未損失精度或模型質量。這一成績標誌著在長上下文場景下實現高互動性推理的重要進展。

長上下文與高互動性為何重要?智慧體(agentic)會話通常涉及多輪推理,每輪結束後,智慧體的輸出會被追加到不斷增長的上下文中,供後續所有輪次使用。隨著會話進行,上下文可能膨脹至數十萬 token,尤其是在會話超過數百輪時。這意味著,在任務後期,智慧體必須反覆處理此前學到的所有資訊。如果上下文受限,智慧體的能力將大打折扣。因此,最強大的智慧體不僅需要速度,還必須在會話增長時保持長上下文。

在推理系統中,張量並行(TP)等技術可帶來數量級的加速,但前提是系統能高效管理協調開銷。高互動性推理要求極小的批處理大小,此時固定的協調成本可能超過 TP 節省的時間。TP 涉及將計算拆分到多個晶片並行執行,然後合併結果。在極小批處理下,有效的 TP 需要緊密協調,許多小張量必須在計算單元間傳輸,且每個張量的到達和離開都需精確同步。通訊和結果合併的時間很容易與分散式計算節省的時間相當甚至更長。

Groq 3 LPX 通過編譯器排程的負載規劃解決了這一挑戰。其晶片間(C2C)機架內網路和計算與通訊的重疊設計,將首位元延遲降至最低,從而在極小批處理下也能實現有效的張量並行。這種確定性排程使得系統能夠高效處理長上下文 KV 快取,支援多智慧體推理。

基準測試進一步證實,Groq 3 LPX 在通用智慧體任務和編碼任務上均能持續提供高吞吐量,例如在 SPEED-Bench 上達到 每秒 4767 輸出 token 的中位數。此外,該加速器支援與 Vera Rubin NVL72 的多種協同執行配置,包括預填充-解碼分離、注意力-FFN 分離以及推測性外部草稿解碼,可擴充套件至 2 萬億引數 的模型。

輝達表示,Groq 3 LPX 擴充套件了 Vera Rubin 平台在高互動性服務層級的能力,使其能夠更好地支援 AI 工廠中的使用者體驗。這一技術突破對於需要長上下文、高互動性的智慧體應用具有重要意義,可能推動相關產業鏈的發展。不過,實際部署效果仍需進一步驗證。