在Hot Chips 2026大會上,輝達除了介紹Vera CPU和Rubin GPU外,還專門講解了其在Vera Rubin機架中使用的語言處理單元(LPU)。這些LPU來自輝達通過收購獲得的Groq公司,目前輝達自身尚未量產LPU,但相關研發正在進行中。

輝達在Vera Rubin叢集中引入LPU,旨在彌補GPU在推理解碼階段的不足。GPU在預填充階段表現出色,但在解碼階段,LPU憑藉大量片上SRAM,將模型資料儘可能靠近計算單元,從而顯著降低延遲,提升單使用者token生成速率。輝達在演講中展示了效能曲線,對比了token/秒/瓦與token/秒/使用者的關係,指出在追求更高使用者互動性(即更低token延遲)時,GPU效能會大幅下降,而LPX機架作為第二層硬體,能有效提升每使用者token率並降低延遲。

具體到LPX機架,單個機架在31B模型(Gemma 4)上每秒可解碼11000個token。本週早些時候,輝達釋出了由Artificial Analysis進行的第三方基準測試,結果顯示LPX機架的token輸出率比最接近的公開競爭對手(未點名,但疑似Cerebras CS-3)高出4倍。

Groq的LPU架構強調記憶體與計算的緊密連線,晶片完全確定性,無分支或非確定性來源,因此指令排程由軟體完成,無需複雜的排程硬體。每個LPU晶片同時充當處理器和路由器,編譯器統一排程所有處理與網路資源,且沒有硬體流控制或虛擬通道,設計極為精簡。一個LPX機架包含256個LPU,數千個晶片協同工作,如同一個巨大的LPU核心。

輝達在多個演講中反覆強調,智慧體AI是歷史上最複雜的計算工作負載,需要新的硬體開發方法和更多硬體。LPU的引入正是這一理念的體現,通過異構計算滿足不同階段的需求。對於Groq團隊而言,在Hot Chips上演講也頗具紀念意義,他們已加入輝達並參與這一專案。

此次釋出表明,輝達正積極構建多元化的AI計算生態,LPU作為補充,與GPU協同,為不同工作負載提供最佳化方案。對於AI產業投資者而言,這預示著推理效能的提升可能帶來更高效的算力利用,並影響未來資料中心的設計方向。