在 Hot Chips 2026 大會上,NVIDIA 對其下一代伺服器 CPU Vera 及其全新的 Olympus 核心架構進行了詳細披露。作為 NVIDIA 自研的 Arm 伺服器 CPU,Vera 擁有 88 個核心,是即將推出的 Vera Rubin AI 系統的關鍵組成部分,也是 NVIDIA 在伺服器 CPU 市場擴張野心的最新體現。
Vera 是 NVIDIA Grace CPU 的繼任者,後者曾用於 Grace Hopper 和 Grace Blackwell 兩代伺服器系統。與 Grace 相比,Vera 在設計上追求全面革新。它採用高 IPC(每時鐘週期指令數)設計,而非單純堆砌核心數,以更好地滿足 AI 工作負載對單執行緒效能的需求。晶片周圍配備 8 個 128 位 LPDDR5X 記憶體控制器,並通過 NVLink-C2C 介面與自家 Rubin GPU 緊密耦合,同時也能與其他支援 NVLink-C2C 的裝置或另一顆 Vera 晶片組成雙路純 CPU 系統。
NVIDIA 在演講中強調,AI 是迄今最複雜的計算工作負載,它並非單一任務,而是涉及多種工具和計算型別的完整工作流,因此不能只為單一用例最佳化。為此,Vera Rubin 系統在硬體和軟體層面都進行了深度協同設計,涵蓋 NVL72、LPX3、Bluefield 機架等元件。
在效能方面,NVIDIA 展示了其效能前沿曲線,即 token 吞吐量與使用者互動性之間的權衡。高批處理可以最大化 token 生成,但會犧牲響應時間。NVIDIA 聲稱,Vera Rubin 旨在將這一前沿推向各個方向,在吞吐量和互動性上同時提升。在更高的互動性水平下,Vera Rubin 的總吞吐量可達 Grace Blackwell 的 30 倍,但具體取決於曲線上的位置。
對於需要更高效能的客戶,NVIDIA 推出了 Groq LPX3 機架,利用 Groq 的專用硬體進行解碼加速,以進一步擴充套件效能曲線,實現高互動率而不至於效能崩潰。NVIDIA 聲稱,LPX3 的長上下文解碼速度比當前公共雲服務快 4 倍。
在 CPU 設計哲學上,NVIDIA 指出,傳統伺服器 CPU 傾向於多核但單核效能較弱,這並不適合 AI 工作負載。因此,Vera 採用了高 IPC 設計,以提升單執行緒效能。低延遲也是設計重點,因為 AI 代理需要在任務間快速切換。NVIDIA 還舉例說明,在無頭瀏覽器等代理工作負載中,Vera 的效能表現與傳統瀏覽器不同。
NVIDIA 將 Vera 與傳統伺服器 CPU 的差異化歸納為 五項創新:高 IPC、能效、資料吞吐量、安全/機密計算以及 I/O 頻寬。此外,NVIDIA 強調了 Vera 在負載下的效能表現,並提及“確定性”這一關鍵詞。
在 Olympus 架構方面,NVIDIA 展示了其邏輯圖,每個核心都包含大量硬體,擁有 10 寬解碼前端 和更大的後端。Olympus 架構是“代理優先”的,但也支援多執行緒。NVIDIA 採用了靜態分割槽的空間多執行緒技術,而非傳統的資源共享式 SMT,聲稱能達到與傳統 SMT 相同的效能,但更不易受某些問題影響。
總體而言,Vera CPU 的釋出標誌著 NVIDIA 在伺服器 CPU 領域的進一步深耕,其自研架構與 GPU 的深度協同,有望強化其在 AI 計算市場的整體競爭力。