輝達在MLPerf Inference v6.1中首次提交了下一代Vera Rubin NVL72系統的預覽成績,在兩項最具挑戰性的基準測試中展現出對當前GB300 NVL72的顯著效能領先。據輝達部落格披露,在Qwen3-VL基準的離線、伺服器和互動三種場景下,Vera Rubin NVL72的吞吐量最高達到GB300 NVL72的3.7倍;在DeepSeek-R1基準上,吞吐量最高達到2.5倍。這些成績使用了vLLM配合輝達Dynamo開源推理框架,以及TensorRT-LLM庫。
輝達將推理經濟性拆解為三個關鍵槓桿:系統性能決定單位時間生成的token數量,進而影響收入;擴充套件效率決定增加硬體時吞吐量能否成比例增長,從而降低服務大規模使用者的資源需求;持續軟體最佳化則決定既有基礎設施投資能釋放多少額外價值。三者背後是平台通用性——同一套基礎設施可執行從訓練到推理、從推薦到推理、從語言到影片的各類模型與負載,保持高利用率。
在擴充套件效率方面,輝達提交的288塊GPU跨四個GB300 NVL72機架的DeepSeek-R1成績,在離線場景下實現了99%的擴充套件效率,吞吐量從單機架基線近乎線性增長。這一指標的意義在於:增加GPU並不自動帶來成比例的吞吐量提升,若GPU數量翻倍而吞吐量僅有個位數百分比改善,基礎設施成本將遠超效能回報。輝達通過機架內高頻寬低延遲的scale-up互聯、機架間高頻寬網路以及跨節點的高效請求編排來實現這一效率。GB300 NVL72還在WAN 2.2文本轉影片基準上展示了機架級效率,達到每秒0.65個720p影片、每個影片5.7秒,吞吐量較單節點高9倍、延遲低7.5倍。
軟體最佳化方面,輝達在MLPerf Inference v6.1提交中的軟體最佳化較v6.0版本帶來最高1.6倍的效能提升,且最佳化在提交後仍在繼續,後續還有進一步效能增益。
Vera Rubin的效能提升源於硬體與軟體的全棧協同設計。其增強的Tensor Core和Transformer Engine加速了推理的prefill和decode兩個階段,NVFP4精度降低了模型權重、注意力和KV快取的記憶體佔用,在輸出質量損失極小的前提下提升吞吐量。提交中大量使用了分離式服務(disaggregated serving),將prefill與decode分離,並配合大規模專家並行,以最大化DeepSeek-R1和Qwen3-VL這類混合專家模型的效率。NVL72的scale-up域由第六代NVLink和NVLink Switch驅動,資料包速率較現成乙太網路高10倍、延遲低3倍,為這些技術在機架規模上發揮作用提供了互聯基礎。
輝達的協同設計也延伸至合作伙伴生態,Nebius同樣提交了Vera Rubin NVL72預覽成績並展現出優異效能。此外,針對AI智慧體多步推理、規劃與行動的新興負載,輝達在SemiAnalysis AgentX基準的預覽測試中,Vera Rubin NVL72效能達到GB300 NVL72的30倍。即將推出的MLPerf Endpoints基準將為智慧體推理負載帶來標準化測量,覆蓋傳統吞吐量基準未能捕捉的維度。
從產業視角看,MLPerf推理成績是資料中心運營商評估算力價效比的重要參考。Vera Rubin相對GB300的吞吐量躍升與GB300近乎線性的擴充套件效率,共同指向單位token成本的下降路徑。對於正在規劃下一代AI基礎設施的企業而言,效能、擴充套件效率與軟體迭代速度三者疊加,將影響其採購決策與部署節奏;而互聯技術、精度格式與推理框架的協同演進,也持續塑造著從晶片到系統到軟體生態的競爭格局。