輝達副總裁 Ian Buck 在近期一場技術演講中,系統闡述了智慧體 AI 時代算力基礎設施的演進方向,並首次詳細披露了下一代平台 Vera Rubin 的設計思路。他的核心判斷是:AI 工廠的降本邏輯已經發生根本性重構,單純壓低硬體單價不再是有效路徑。
Ian Buck 指出,降低詞元成本最有效的方式並非降低 GPU 售價或採用低成本網路,而是每一代都交付大幅提升的算力效能。他給出的量化邏輯是:如果將節點或機架的效能提升 10 倍到 30 倍,這種提升會直接作用於成本公式的分子,從而降低整個資料中心每個詞元的成本。這一觀點直接挑戰了傳統 IT 採購中通過壓低硬體單價來控制成本的習慣。在 AI 工廠時代,算力效能呈指數級躍升,對總擁有成本(TCO)的拉動作用遠超晶片單價的微調。
工作負載的範式轉變是另一條主線。Ian Buck 回顧,2023 年突破性的 Chat 基準測試大約只有 1K 輸入詞元,KV Cache 規模約 4K,使用者以平均約三輪對話的方式互動,屬於典型的人機迴環模式。而智慧體 AI 徹底改變了這一格局。在 AgentX 基準測試中,平均輸入規模達到 142000 個詞元,KV Cache 規模因模型支援多達 100 萬詞元而變得異常龐大,互動輪數也呈爆發式增長。他特別強調,智慧體讓人類退出了互動迴圈,計算資源消耗速度完全取決於智慧體自我轉折與思考的速度。在 AgentX 基準測試中,算力需求在純數值層面直接提升了 100 倍。
這一變化對軟體最佳化提出了極高要求。Ian Buck 解釋,過去服務設計者可以依賴人類閱讀和打字所需的時間間隙來排程算力,而現在智慧體自我提問和轉折極快,系統必須支援從 1K 到 200K 甚至更長的動態輸入長度,每一種長度都需要全新的運算元核心最佳化與調優。同時,KV Cache 需要在資料中心範圍內統一管理,模型還必須做出決策並呼叫成千上萬個不同子智慧體,涉及 CPU 排程、Kubernetes 容器管理、推理層、工具呼叫層以及安全治理層的協同。
Vera Rubin 平台正是為應對這一複雜工作負載而設計。Ian Buck 表示,該平台並非單晶片或單一模型成本最佳化方案,而是面向整個智慧體工作負載的全棧架構。其基礎平台 Vera Rubin NVL72 建立在 Grace Blackwell 基礎之上,並加入基於 Groq LPU 技術的加速包以提升高價值工作負載效能。同時,輝達提取了原本連線在 Rubin GPU 上的 CPU,構建了專用的 Vera CPU 機架,採用自主設計的 Olympus 核心,配備 LPDDR 記憶體子系統,記憶體延遲比市面上其他方案低 40%,旨在讓 188 個核心保持高吞吐量並維持高單執行緒效能。
在規模化網路層面,Ian Buck 提到解耦推理已成為行業普遍做法,Prefill 與 Decode 階段分離執行,KV Cache 在儲存層通過 BlueField SmartNIC 進行管理、治理與向量檢索。他引用剛剛釋出的 SemiAnalysis 智慧體基準測試結果稱,Vera Rubin 在智慧體工作負載上實現了 30 倍的 AI 工廠吞吐量提升,根據帕累託曲線位置不同,部分場景效能提升甚至高達 60 倍。
評價指標本身也在轉移。Ian Buck 明確表示,對於每一代算力產品,唯一關鍵的指標是每兆瓦(MW)的總詞元吞吐量,而非單晶片 FLOPs 或單卡跑分。提高這一指標就能提升 AI 工廠產生營收的能力。他以 DeepSeek v4 為例說明,使用者可能希望思考速率達到每秒 100 個詞元以上,甚至提升到每秒 200 至 250 個詞元,以便智慧體在 65 輪互動中更快給出答案。
在延遲最佳化方面,Ian Buck 展示了 Groq 技術加持下的測試資料:對於擁有 100K 長上下文的模型,Gemma 4 上可實現每使用者每秒 3400 個詞元,Qwen 3.8 上可實現每使用者每秒 2529 個詞元。他強調,上下文越長,模型生成每個新詞元所需的檢索計算量越大,但這是智慧體應用場景的必需能力。
電力約束下的軟體挖潛是另一亮點。Ian Buck 介紹,通過軟體在機架與韌體層面動態管控功耗,確保其永不超出閾值,可以在完全相同的預留電力包絡下部署多達 40% 的機架,直接將吞吐量提升至每秒 12 億詞元。這意味著資料中心無需新建或增加電力配額,即可在原有電力包絡內提升 GPU 部署密度,打破了按硬體最大峰值功耗預留電力的靜態部署模式。
Ian Buck 還回顧了輝達平台的歷史延續性。他提到,在 NVIDIA 工作近 26 年,CUDA 平台已積累超過 8000 個主要應用,全球可追蹤到超過 1000 萬名開發者在 NVIDIA GPU 上開發,Hugging Face 上已有超過 300 萬個模型,其中約 3000 個模型佔據了約 90% 的下載量。他特別指出,COVID 初期釋出的 A100 的每小時例項租用價格隨時間推移不降反升,需求依然強勁,這體現了平台的長久耐用性。
從產業視角看,Ian Buck 的演講傳遞出幾個關鍵訊號。其一,AI 基礎設施的競爭焦點正從單點算力轉向系統級效率,每兆瓦詞元吞吐量成為核心 KPI,這意味著電力供應、網路頻寬、儲存管理和 CPU 協同能力將共同決定 AI 工廠的經濟性。其二,智慧體工作負載的複雜性遠超傳統推理,軟體最佳化與全棧協同設計的價值被顯著放大。其三,在電力供應日益受限的背景下,通過軟體定義電力技術挖掘存量產能,可能成為資料中心運營商在不新增資本開支情況下提升產出的重要手段。這些方向對理解輝達下一代產品路線圖及整個 AI 算力產業鏈的演進具有參考價值。