英伟达近日披露了其下一代 Vera Rubin 平台在推理工作负载上的多项架构优化细节。随着 AI 产业重心从大规模训练转向智能体推理,Rubin 的设计目标是在从单个 GPU 到整机柜乃至数据中心级别,全面提升推理性能与能效。该平台计划于 今年晚些时候 推出。
Rubin GPU 采用双计算芯粒封装,通过英伟达高带宽接口互联。芯片集成 224 个流式多处理器(SM),包含 896 个张量核心,并配备 288GB HBM4 显存,提供 22 TB/s 的显存带宽。其核心推理性能指标为 50 PFLOPS(稀疏 NVFP4 格式),此外还支持 FP8/FP6、INT8、FP16/BF16 等多种数据类型。完整的 Vera Rubin NVL72 机柜系统由 36 颗 Vera CPU 和 72 颗 Rubin GPU 构成。
在针对推理的优化中,英伟达首先改进了 张量内存加速器(TMA)。TMA 是一个专用引擎,负责处理内存地址计算并将数组数据直接加载到 GPU 的共享本地内存。随着主流模型转向混合专家(MoE)架构,专家权重可分布在多个 GPU 上以高效利用有限的显存。Rubin 的 TMA 支持在运行时通过 GPU 内核直接维护和更新统一的 MoE 描述符,减少了定位和移动专家权重的计算开销,从而将更多 GPU 算力释放给推理计算。
其次,Rubin 将张量核心在 K 维度 上的吞吐量提升了一倍。K 维度是矩阵乘法中的共享内维度,其大小直接影响张量核心的循环次数。英伟达举例称,在 Blackwell 上需要四次循环的计算,Rubin 只需两次即可完成,这对吞吐量、内存和延迟受限的内核均有显著收益,并同时惠及推理的上下文处理和解码阶段。
在注意力机制方面,Rubin 对 Softmax 运算进行了重点优化。Softmax 是 Transformer 模型注意力计算的关键操作,其吞吐量可能成为推理瓶颈。Rubin 在 SM 的特殊功能单元(SFU)中进一步提升了 Softmax 吞吐量:在 FP32 指数运算上保持 Blackwell Ultra 的 2 倍加速,而在 BF16/FP16 指数运算上较 Blackwell Ultra 再翻倍,因此相比 Blackwell 实现了 4 倍 的吞吐量提升。
此外,Rubin 通过提供比 Blackwell 更细粒度的依赖管理,提高了 张量核心占用率。在生成大型语言模型的激活值时,依赖内核之间的协调需求常导致核心空闲,Rubin 的改进有助于减少这种空闲,提升整体计算效率。
Rubin 架构的这些优化表明,英伟达正积极应对 AI 推理场景对低延迟、高吞吐和低单位成本的需求。随着智能体工作流对生成 token 的需求激增,从 GPU 到整机柜的系统级效率提升,将直接影响数据中心运营商的算力成本与部署策略。