英伟达在MLPerf Inference v6.1中首次提交了下一代Vera Rubin NVL72系统的预览成绩,在两项最具挑战性的基准测试中展现出对当前GB300 NVL72的显著性能领先。据英伟达博客披露,在Qwen3-VL基准的离线、服务器和交互三种场景下,Vera Rubin NVL72的吞吐量最高达到GB300 NVL72的3.7倍;在DeepSeek-R1基准上,吞吐量最高达到2.5倍。这些成绩使用了vLLM配合英伟达Dynamo开源推理框架,以及TensorRT-LLM库。

英伟达将推理经济性拆解为三个关键杠杆:系统性能决定单位时间生成的token数量,进而影响收入;扩展效率决定增加硬件时吞吐量能否成比例增长,从而降低服务大规模用户的资源需求;持续软件优化则决定既有基础设施投资能释放多少额外价值。三者背后是平台通用性——同一套基础设施可运行从训练到推理、从推荐到推理、从语言到视频的各类模型与负载,保持高利用率。

在扩展效率方面,英伟达提交的288块GPU跨四个GB300 NVL72机架的DeepSeek-R1成绩,在离线场景下实现了99%的扩展效率,吞吐量从单机架基线近乎线性增长。这一指标的意义在于:增加GPU并不自动带来成比例的吞吐量提升,若GPU数量翻倍而吞吐量仅有个位数百分比改善,基础设施成本将远超性能回报。英伟达通过机架内高带宽低延迟的scale-up互联、机架间高带宽网络以及跨节点的高效请求编排来实现这一效率。GB300 NVL72还在WAN 2.2文本转视频基准上展示了机架级效率,达到每秒0.65个720p视频、每个视频5.7秒,吞吐量较单节点高9倍、延迟低7.5倍

软件优化方面,英伟达在MLPerf Inference v6.1提交中的软件优化较v6.0版本带来最高1.6倍的性能提升,且优化在提交后仍在继续,后续还有进一步性能增益。

Vera Rubin的性能提升源于硬件与软件的全栈协同设计。其增强的Tensor Core和Transformer Engine加速了推理的prefill和decode两个阶段,NVFP4精度降低了模型权重、注意力和KV缓存的内存占用,在输出质量损失极小的前提下提升吞吐量。提交中大量使用了分离式服务(disaggregated serving),将prefill与decode分离,并配合大规模专家并行,以最大化DeepSeek-R1和Qwen3-VL这类混合专家模型的效率。NVL72的scale-up域由第六代NVLink和NVLink Switch驱动,数据包速率较现成以太网高10倍、延迟低3倍,为这些技术在机架规模上发挥作用提供了互联基础。

英伟达的协同设计也延伸至合作伙伴生态,Nebius同样提交了Vera Rubin NVL72预览成绩并展现出优异性能。此外,针对AI智能体多步推理、规划与行动的新兴负载,英伟达在SemiAnalysis AgentX基准的预览测试中,Vera Rubin NVL72性能达到GB300 NVL72的30倍。即将推出的MLPerf Endpoints基准将为智能体推理负载带来标准化测量,覆盖传统吞吐量基准未能捕捉的维度。

从产业视角看,MLPerf推理成绩是数据中心运营商评估算力性价比的重要参考。Vera Rubin相对GB300的吞吐量跃升与GB300近乎线性的扩展效率,共同指向单位token成本的下降路径。对于正在规划下一代AI基础设施的企业而言,性能、扩展效率与软件迭代速度三者叠加,将影响其采购决策与部署节奏;而互联技术、精度格式与推理框架的协同演进,也持续塑造着从芯片到系统到软件生态的竞争格局。