英伟达首次直接挑战英特尔和 AMD 在 CPU 领域的主导地位。随着 Vera 的推出,这家 AI 芯片巨头正试图将其独立 CPU 销售给尽可能多的超大规模云服务商和其他云提供商。阿里巴巴、字节跳动、Meta、甲骨文、CoreWeave、Lambda、Nebius 和 NScale 已签约在其云中部署该芯片。作为英伟达 Grace CPU 的继任者,Vera 承诺提供 88 个定制 Armv9.2 核心、176 线程、支持高达 1.5 TB 的 LPDDR5X 内存,并且关键的是,它可以作为独立于英伟达 GPU 的单独平台提供。
然而,除了大量关于它将如何成为 AI 领域最佳 CPU 的营销宣传外,Vera 的内部工作原理直到最近在很大程度上仍是个谜。上月底,英伟达发布了一份白皮书,首次披露了其首款完全定制 CPU 的细节,其设计比任何人预期的都要奇特得多。
表面上,英伟达将 Vera 瞄准两个关键工作负载:第一个也是最不令人意外的是作为 AI 头节点,负责管理其即将推出的 Vera Rubin 系统中的 GPU;第二个更具争议性的用途是作为 AI 代理的主机,与驱动它们的 LLM 不同,AI 代理实际上并不在 GPU 上运行。据我们了解,Vera 的大部分核心架构都基于消除流水线和执行瓶颈,以便在这些角色中更有效。
单芯片计算,多 die 内存和 I/O
揭开 Vera 相当厚实的散热顶盖,你会发现负责 I/O、内存和计算的各种 chiplet。然而,这并不是 AMD 推广的 chiplet 架构的又一次翻版。与将数十个核心分布在多个 die 上的 x86 处理器制造商不同,Vera 的计算 die 是单芯片的。所有 88 个核心都封装在一块大硅片上,据我们所知,该硅片采用台积电的 3nm 工艺制造。英伟达认为,与竞争设计相比,其单芯片计算架构在核心间带宽和延迟方面都有优势。
围绕计算 die 的是各种 chiplet,包括八个 LPDDR5x 控制器,以及两个不同的 I/O die,一个负责 PCIe 6.4 和 CXL 3.1 连接,另一个专门用于芯片的 NVLink Chip-to-Chip 接口。在封装设计方面,Vera 与亚马逊的 Graviton 4 CPU 有些相似,后者也结合了单芯片计算 die,同时将 I/O 和内存功能分离到专用硅片上。
Vera CPU 超级芯片
与大多数现代数据中心 CPU 一样,Vera 支持单路和双路配置,后者被称为 Vera CPU 超级芯片。该超级芯片于 3 月在 GTC 上发布,通过 NVLink-C2C 连接两个 Vera CPU,双向带宽高达 1.8 TB/s,总计 176 个核心和 352 个线程。两个芯片由 16 个 SOCAMM2 LPDDR5x 内存模块供电,提供 2.4 TB/s 的聚合内存带宽(每个 1.2 TB/s)——大约是 AMD 于 2024 年推出的 Turin Epyc 处理器带宽的两倍。英伟达的智能体 AI 参考设计要求在单个液冷机架中容纳多达 128 个这样的超级芯片(256 个 CPU),总计 22,528 个核心和 384 TB 内存。
登顶 Olympus
此前,英伟达一直依赖 Arm 的现成 CPU 核心。例如,根据迭代版本的不同,英伟达的 Grace CPU 使用了 Arm 的 Neoverse V2(GB200/300)、Neoverse V3(AGX Thor)或 Cortex X925 和 A725 核心(GB10),具体取决于哪个最方便。随着 Vera 的推出,英伟达转向设计自己的 ARMv9.2 兼容核心,名为 Olympus。事实上,这款芯片的定制程度还有待商榷。我们被告知,该芯片大量基于现有的 Arm IP,从 Olympus 的架构框图可以看出原因。
Olympus 具有 10 宽解码和调度、八个整数 ALU、六个向量/FP 流水线(SVE 128)、四个加载单元和两个存储单元。与 AMD Turin Epyc 中的 Zen 5 核心或 Intel Granite Rapids Xeon 使用的 Redwood Cove 核心相比,它的前端和后端都很庞大。但与现成的 Arm 核心相比,Olympus 的前端和后端并没有打破任何记录。事实上,Olympus 看起来很像经过大幅修改的 Cortex X925。
尽管如此,英伟达声称 Olympus 具有完全定制的神经分支预测器,能够同时探索两个分支。分支预测是现代 CPU 性能的关键,涉及预测未来的代码路径并在需要之前提前执行。通过每周期预测两条路径,Vera 降低了错误预测的可能性,理论上提高了性能。据我们所知,Vera 的许多定制都是为了消除流水线和执行气泡,以最大化每时钟指令数(IPC)。特别是,英伟达声称其神经分支预测器比基于历史的方法具有更高的命中率,非常适合运行分支密集型工作负载,例如 AI 代码助手即时生成的 Python 脚本。
英伟达还声称在核心中段进行了多项创新,旨在缓解流水线停顿。内存重命名通过允许依赖指令在加载完成之前执行(如果能够推断出数据关系)来加速存储到加载的依赖链。“这对于指针密集型软件、图遍历、运行时框架和复杂的面向对象工作负载特别有益,”该公司解释道。英伟达还实现了一种值预测方案,该方案“识别稳定的依赖链并在值产生之前预测未来值,允许依赖指令推测性执行,同时稍后验证正确性”。
市场影响与竞争格局
Vera 的发布标志着英伟达从 GPU 供应商向完整数据中心平台提供商的战略转变。通过提供可独立于 GPU 销售的 CPU,英伟达直接进入了英特尔和 AMD 长期占据主导地位的市场。已签约的客户包括阿里巴巴、字节跳动、Meta、甲骨文、CoreWeave、Lambda、Nebius 和 NScale,这表明英伟达在云服务商中的吸引力正在扩大。
分析人士认为,Vera 的独特架构,特别是其神经分支预测器和内存重命名技术,可能为 AI 代理等特定工作负载带来性能优势。然而,其实际性能能否在真实场景中超越成熟的 x86 竞争对手,仍有待观察。此外,英伟达对 Arm IP 的依赖也引发了关于其“完全定制”说法的一些争议。
无论如何,Vera 的推出无疑加剧了数据中心 CPU 市场的竞争。对于投资者而言,这不仅是英伟达产品线的扩展,更是 AI 基础设施格局可能发生变化的信号。随着 AI 工作负载从单纯的 GPU 密集型计算向更多样化的混合模式发展,CPU 在 AI 系统中的作用将变得更加重要。