在 Hot Chips 2026 大会上,NVIDIA 对其下一代服务器 CPU Vera 及其全新的 Olympus 核心架构进行了详细披露。作为 NVIDIA 自研的 Arm 服务器 CPU,Vera 拥有 88 个核心,是即将推出的 Vera Rubin AI 系统的关键组成部分,也是 NVIDIA 在服务器 CPU 市场扩张野心的最新体现。

Vera 是 NVIDIA Grace CPU 的继任者,后者曾用于 Grace HopperGrace Blackwell 两代服务器系统。与 Grace 相比,Vera 在设计上追求全面革新。它采用高 IPC(每时钟周期指令数)设计,而非单纯堆砌核心数,以更好地满足 AI 工作负载对单线程性能的需求。芯片周围配备 8 个 128 位 LPDDR5X 内存控制器,并通过 NVLink-C2C 接口与自家 Rubin GPU 紧密耦合,同时也能与其他支持 NVLink-C2C 的设备或另一颗 Vera 芯片组成双路纯 CPU 系统。

NVIDIA 在演讲中强调,AI 是迄今最复杂的计算工作负载,它并非单一任务,而是涉及多种工具和计算类型的完整工作流,因此不能只为单一用例优化。为此,Vera Rubin 系统在硬件和软件层面都进行了深度协同设计,涵盖 NVL72LPX3Bluefield 机架等组件。

在性能方面,NVIDIA 展示了其性能前沿曲线,即 token 吞吐量与用户交互性之间的权衡。高批处理可以最大化 token 生成,但会牺牲响应时间。NVIDIA 声称,Vera Rubin 旨在将这一前沿推向各个方向,在吞吐量和交互性上同时提升。在更高的交互性水平下,Vera Rubin 的总吞吐量可达 Grace Blackwell 的 30 倍,但具体取决于曲线上的位置。

对于需要更高性能的客户,NVIDIA 推出了 Groq LPX3 机架,利用 Groq 的专用硬件进行解码加速,以进一步扩展性能曲线,实现高交互率而不至于性能崩溃。NVIDIA 声称,LPX3 的长上下文解码速度比当前公共云服务快 4 倍

在 CPU 设计哲学上,NVIDIA 指出,传统服务器 CPU 倾向于多核但单核性能较弱,这并不适合 AI 工作负载。因此,Vera 采用了高 IPC 设计,以提升单线程性能。低延迟也是设计重点,因为 AI 代理需要在任务间快速切换。NVIDIA 还举例说明,在无头浏览器等代理工作负载中,Vera 的性能表现与传统浏览器不同。

NVIDIA 将 Vera 与传统服务器 CPU 的差异化归纳为 五项创新:高 IPC、能效、数据吞吐量、安全/机密计算以及 I/O 带宽。此外,NVIDIA 强调了 Vera 在负载下的性能表现,并提及“确定性”这一关键词。

在 Olympus 架构方面,NVIDIA 展示了其逻辑图,每个核心都包含大量硬件,拥有 10 宽解码前端 和更大的后端。Olympus 架构是“代理优先”的,但也支持多线程。NVIDIA 采用了静态分区的空间多线程技术,而非传统的资源共享式 SMT,声称能达到与传统 SMT 相同的性能,但更不易受某些问题影响。

总体而言,Vera CPU 的发布标志着 NVIDIA 在服务器 CPU 领域的进一步深耕,其自研架构与 GPU 的深度协同,有望强化其在 AI 计算市场的整体竞争力。