輝達近日披露了其下一代 Vera Rubin 平台在推理工作負載上的多項架構最佳化細節。隨著 AI 產業重心從大規模訓練轉向智慧體推理,Rubin 的設計目標是在從單個 GPU 到整機櫃乃至資料中心級別,全面提升推理效能與能效。該平台計劃於 今年晚些時候 推出。

Rubin GPU 採用雙計算芯粒封裝,通過輝達高頻寬介面互聯。晶片整合 224 個流式多處理器(SM),包含 896 個張量核心,並配備 288GB HBM4 視訊記憶體,提供 22 TB/s 的視訊記憶體頻寬。其核心推理效能指標為 50 PFLOPS(稀疏 NVFP4 格式),此外還支援 FP8/FP6、INT8、FP16/BF16 等多種資料型別。完整的 Vera Rubin NVL72 機櫃系統由 36 顆 Vera CPU 和 72 顆 Rubin GPU 構成。

在針對推理的最佳化中,輝達首先改進了 張量記憶體加速器(TMA)。TMA 是一個專用引擎,負責處理記憶體地址計算並將陣列資料直接載入到 GPU 的共享本地記憶體。隨著主流模型轉向混合專家(MoE)架構,專家權重可分佈在多個 GPU 上以高效利用有限的視訊記憶體。Rubin 的 TMA 支援在執行時通過 GPU 核心直接維護和更新統一的 MoE 描述符,減少了定位和移動專家權重的計算開銷,從而將更多 GPU 算力釋放給推理計算。

其次,Rubin 將張量核心在 K 維度 上的吞吐量提升了一倍。K 維度是矩陣乘法中的共享內維度,其大小直接影響張量核心的迴圈次數。輝達舉例稱,在 Blackwell 上需要四次迴圈的計算,Rubin 只需兩次即可完成,這對吞吐量、記憶體和延遲受限的核心均有顯著收益,並同時惠及推理的上下文處理和解碼階段。

在注意力機制方面,Rubin 對 Softmax 運算進行了重點最佳化。Softmax 是 Transformer 模型注意力計算的關鍵操作,其吞吐量可能成為推理瓶頸。Rubin 在 SM 的特殊功能單元(SFU)中進一步提升了 Softmax 吞吐量:在 FP32 指數運算上保持 Blackwell Ultra 的 2 倍加速,而在 BF16/FP16 指數運算上較 Blackwell Ultra 再翻倍,因此相比 Blackwell 實現了 4 倍 的吞吐量提升。

此外,Rubin 通過提供比 Blackwell 更細粒度的依賴管理,提高了 張量核心佔用率。在生成大型語言模型的啟用值時,依賴核心之間的協調需求常導致核心空閒,Rubin 的改進有助於減少這種空閒,提升整體計算效率。

Rubin 架構的這些最佳化表明,輝達正積極應對 AI 推理場景對低延遲、高吞吐和低單位成本的需求。隨著智慧體工作流對生成 token 的需求激增,從 GPU 到整機櫃的系統級效率提升,將直接影響資料中心運營商的算力成本與部署策略。