英伟达近日通过官方开发者博客详细介绍了其 Vera CPU 的架构设计,核心亮点是专为 智能体 AI(Agentic AI) 工作负载打造的 Olympus 核心。与传统的云 CPU 优先考虑核心密度和均匀工作负载的吞吐量不同,Vera CPU 将重点放在了最大化单线程性能上,以应对智能体 AI 中大量不规则、分支密集且对延迟敏感的软件路径。

智能体 AI 的工作模式与以往不同:智能体在沙盒中执行代码、调用工具、检索上下文、与数据库交互并分析结果,然后将信息返回给模型。这些循环在 AI 工厂中并发运行,使得 CPU 性能直接决定了每个智能体的响应速度和整个工厂的吞吐量。英伟达指出,智能体工作负载对 CPU 提出了四项关键要求:即使在插槽满载时也要有强大的单线程性能;每个核心有足够的内存带宽以维持多个活跃执行上下文的数据供应;并发下可预测的延迟;以及高效处理不规则控制流、长依赖链和指针密集型数据结构。

Olympus 核心 是 Vera CPU 的计算引擎,从零开始设计以最大化每周期指令数(IPC)。其前端采用了优化的分支预测器,包括一个 神经分支预测器,旨在提高对困难、统计偏差分支模式的预测准确性,减少错误执行路径。配合一个 10-wide 的解码引擎,每个周期能向核心输送更多指令,这对于处理智能体运行时、解释器、编译器、图分析等大型、分支密集的软件栈至关重要。

在核心的中段(Mid Core),Vera CPU 通过宽重命名与分配引擎、大型重排序缓冲区和大量物理寄存器,实现了更深的乱序执行。内存重命名、值预测和关键路径加速 等依赖项打破技术,有助于减少指针密集型代码和序列化操作带来的停顿,从而在长依赖链中挖掘出隐藏的并行性。

在内存子系统方面,Vera CPU 采用了 可扩展一致性架构(Scalable Coherency Fabric),提供高达 3.4 TB/s 的片上带宽和统一缓存。它支持 SOCAMM2 LPDDR5X 内存模块,可提供最高 1.2 TB/s 的聚合带宽,同时具备高可靠性、可用性和可维护性(RAS)以及高能效。这种内存架构旨在为每个活跃的执行上下文持续供应数据,避免因内存瓶颈拖累智能体的执行进度。

在互联与安全方面,Vera CPU 通过 NVLink-C2C 实现一致性、可扩展的数据移动,支持单 NUMA 双插槽架构。此外,它还集成了 PCIe 6.4CXL 3.1 等最新高速接口,并内置了 机密计算(Confidential Computing) 功能,以支持可预测的智能体工作负载吞吐量和安全的虚拟机隔离。

英伟达强调,Vera CPU 的 Olympus 核心是在 Vera Rubin 平台 的极端协同设计下开发的,该平台涵盖了 CPU、GPU、网络、存储、内存系统和软件。这种系统级方法使英伟达能够优化整个 AI 工厂的性能,而不仅仅是孤立地优化 CPU。随着智能体 AI 和强化学习对 CPU 侧执行的压力越来越大,Vera CPU 的设计目标正是加速那些日益决定端到端性能的不规则、分支密集和延迟敏感的软件路径。