CoreWeave 於 9 月 16 日宣佈,已在 CoreWeave Cloud 上完成多機架輝達 Vera Rubin NVL72 叢集的部署,把數百顆 Rubin GPU 連線成單一橫向擴充套件叢集,主要面向智慧體 AI(agentic AI)的訓練與推理需求。公司同時釋出 CoreWeave AI 物件儲存的兩項新能力:跨區域寫入加速和全新的 Archive 歸檔層,目的是讓這些工作負載所依賴的資料儘可能貼近 GPU。
CoreWeave 產品與工程執行副總裁 Chen Goldberg 表示,公司是首家驗證並部署 Vera Rubin NVL72 的 AI 雲服務商,證明這一機架級架構可以作為可靠的高效能雲服務執行;多機架版本把數百顆 Rubin GPU 連成一個叢集,對構建智慧體 AI 的客戶意味著更大規模、更快迭代和更高效率。
從硬體配置看,單台 NVIDIA Vera Rubin NVL72 機架整合 72 顆 Rubin GPU 與 36 顆 Vera CPU,並搭配 NVIDIA NVLink 6、ConnectX-9 SuperNICs 和 BlueField-4 DPUs。多機架方案則通過 NVIDIA Spectrum-X 乙太網路把數百顆加速器統一為單一叢集,從而支撐更大模型的訓練、更苛刻的推理負載以及規模化強化學習。CoreWeave 強調,這需要在計算、網路、儲存、冷卻、供電、韌體和軟體各層同時完成工程適配,使整套系統像一個協調整體執行。
在部署流程上,CoreWeave 通過 Mission Control 的 Rack LifeCycle Controller 自動完成機架硬體檢測、韌體更新、驗證、供電與冷卻協調;在進入生產前,還會結合輝達現場診斷與整機架負載測試,逐項比對結果,只有通過系統級驗證的機架才會投產。網路方面,每顆 Rubin GPU 配備兩個 ConnectX-9 SuperNIC,提供 1.6 Tb/s 的橫向擴充套件連線能力,支援多平面、多軌路徑,在非阻塞架構下每軌可支援約 12.8 萬顆 GPU;模組化拓撲允許在擴容時無需重新設計整個網路架構。
儲存側的新能力同樣圍繞延遲展開。CoreWeave AI 物件儲存的 LOTA(本地物件傳輸加速器)在每個 CoreWeave Kubernetes Service 節點上做託管快取,使讀取達到本地 NVMe 速度,相比傳統儲存叢集讀取延遲降低 8 倍,每顆 GPU 吞吐最高 7 GB/s,並隨叢集規模線性擴充套件。跨區域寫入加速則讓任務在本地寫入的同時,由 CoreWeave 在後台把資料複製到另一區域,使智慧體的中間狀態、檢索上下文和輸出能夠跟上推理節奏,GPU 不必等待。由於應用只看到一個儲存桶,客戶無需改動程式碼,許可權與保留規則在不同區域寫入時保持一致,也省去了手動跨區搬運資料的運維負擔。
Cohere 內部基礎設施總監 Cécile Robert-Michon 表示,其資料集橫跨多個區域,訓練計劃不能受制於跨區域檢索延遲;CoreWeave 的儲存方案讓資料在各區域形成統一檢視並在本地快取讀取,使訓練不再被網路拖慢。
此外,新推出的 Archive 歸檔層意在降低長期儲存關鍵資料的成本。CoreWeave 指出,團隊常因儲存成本而刪除本可保留的資料,例如接近成功的訓練檢查點、用於復現結果的資料集,或半年後可能被問及的模型版本。歸檔層的推出,使保留這類資料的決策在成本上更為可行。
整體來看,這條訊息的核心並非單一硬體釋出,而是 AI 雲在機架級算力之外,把網路與儲存一併納入系統級交付。對關注 AI 產業鏈的讀者而言,它提供了觀察 Rubin 平台從單機架驗證走向多機架規模化部署的視窗,也顯示 AI 雲廠商的競爭正從 GPU 供給延伸到資料通路與儲存成本控制。