輝達超大規模與高效能運算副總裁Ian BuckAI Infra Summit上發表演講,聚焦AI工廠的能效問題。這場在聖克拉拉會議中心舉辦的活動今年吸引了超過8000名參會者,較去年的3500人大幅增長,已成為基礎設施技術領域的重要聚會。Buck在會上介紹了輝達平台上的多項新合作與成果。

在硬體生態方面,亞馬遜旗下Annapurna Labs正與輝達合作開發NVHBM定製高頻寬記憶體技術;d-Matrix則將NVLink Fusion平台與其Raptor XPU進行整合。這些合作指向同一個方向:讓AI工廠的各個元件更緊密地協同,以提升整體效率。

輝達與合作伙伴還公佈了一系列實測結果。Emerald AI與輝達合作,聯合矽谷電力(Silicon Valley Power)展示了商用AI工廠柔性負載專案。該系統成功響應了來自矽谷電力的數百次需求訊號,同時保護了AI工作負載的效能。Emerald AI計劃將NVIDIA DSX Flex用於其Conductor電網響應式電源管理軟體,該軟體能根據即時電網訊號和混合能源動態調整AI工廠的能耗。通過DSX Flex的自主負載均衡能力,Emerald AI可以自動降低低優先順序AI任務的功率,隨後恢復正常執行。DSX Flex能夠接收電網訊號——包括減載請求、需求響應事件和價格訊號——並在預設的工作負載層級內自動執行。最關鍵的任務持續執行,其餘任務則暫時暫停後恢復。這一能力使AI工廠可以作為靈活的電網資源執行,在電網需要緩解時降低需求,同時保護優先AI工作負載。

AI雲服務商Lambda公佈了NVIDIA DSX MaxLPSNVIDIA Blackwell伺服器上的首次驗證結果。DSX MaxLPS持續監控GPU和機架的功耗,動態將可用電力轉移到最需要的地方,並回收靜態配置下未被使用的容量。由於訓練和推理工作負載的功耗特徵不同,MaxLPS能夠最佳化混合工作負載AI工廠的電力分配。結果顯示:Lambda在通常分配給16個滿功率節點的電力預算內運行了19個節點,叢集整體token吞吐量提升24%,從約每秒400萬token增至每秒500萬token,同時每瓦效能提升23%。對於下一代NVIDIA Vera Rubin NVL72 AI工廠,在合適的部署環境中,DSX MaxLPS可在相同的兆瓦預算內實現最多40%的GPU容量提升。這意味著AI工廠運營商可以在相同的電力包絡內增加AI容量和token吞吐量,從而最大化每兆瓦的生產力和經濟價值。

輝達還介紹了Vera Rubin平台與Groq 3 LPX的組合方案。在AI工廠中,電力是核心約束,每瓦特都至關重要,因此從每兆瓦中榨取更多token成為AI基礎設施的關鍵。輝達通過基於Vera Rubin NVL72的全棧AI工廠來實現這一點——系統、網路、軟體和電源管理協同工作。在工廠層面,DSX MaxLPS隨需求升降動態調整機架間的電力分配,效果顯著:在相同的站點電力包絡內可增加最多40%的GPU,token吞吐量提升最多35%,且無需新增電力線路。在機架內部,智慧功率平滑軟體和擴充套件的能量緩衝吸收短時峰值,讓系統更接近持續需求執行,將閒置餘量轉化為有效算力。

對於代理式AI(agentic AI)——智慧體需要串聯推理步驟和工具呼叫——延遲和上下文長度會迅速累積。這正是NVIDIA Groq 3 LPX的用武之地,它為Vera Rubin增添確定性的超低延遲推理能力,並與DSX MaxLPS形成互補。輝達表示,該組合平台在2萬億引數以上模型上,每兆瓦token吞吐量比GB200 NVL72高出最多35倍

從更廣的視角看,AI基礎設施的衡量標準正從峰值效能快速轉向「每兆瓦有效代理式token數」。AI工廠必須從晶片到電網進行協同設計。輝達的全棧AI工廠平台涵蓋Vera Rubin系統、Dynamo推理軟體、NeMo庫以及網路元件——包括用於縱向擴充套件計算的NVLink、用於連線數千節點的Spectrum-X乙太網路和ConnectX SuperNIC、由BlueField驅動的上下文記憶體儲存以及用於基礎設施安全的BlueField DPU。這一整套方案的目標是讓AI基礎設施生成更多token、提升效率,並幫助客戶從每兆瓦電力中獲得更多價值。