AI 推理與原生計算公司 Runware 於 2026 年 8 月 4 日釋出 Sonic Inference Pod,這是一種集裝箱式模組化資料中心,旨在快速擴充面向模型提供商的 AI 推理基礎設施。與需要數年建設、每千兆瓦成本高達 90 億至 190 億美元的傳統資料中心不同,Sonic Inference Pod 可在 20 英尺集裝箱內提供 1 兆瓦算力,採用定製伺服器、PCB 和閉環冷卻系統,專為推理效能最佳化。據 Runware 稱,其設施成本比傳統千兆瓦級資料中心建設低最多 100 倍,並將這一節省直接傳遞給客戶,體現在 GPU 算力定價中。
Runware 計劃於 2026 年下半年根據客戶需求,在美國和歐洲部署由數十個 Pod 和數萬塊 GPU 組成的網路,這標誌著其首次向自有平台之外的客戶開放定製硬體。Runware 聯合創始人兼 CEO Flaviu Radulescu 表示,在運營大規模基礎設施 20 年後,他意識到傳統資料中心無法擴充套件推理能力,因為電力和冷卻無法滿足需求,因此他們從第一性原理重新設計,只保留推理所需的元件,採用液冷 GPU 和模組化格式,以便在已有電力的地方部署。他強調,這種方式能以比其他基礎設施提供商更快的速度生產和部署 1 千兆瓦算力,並具備內建冗餘和即時路由能力,以選擇最具成本效益的 GPU。
傳統資料中心大多為通用計算設計,而非 AI 專用。GPU 的功耗是普通伺服器的 8 至 20 倍,且需要更多冷卻,導致在標準資料中心執行 GPU 的公司往往只能使用少量機架,其餘空間閒置。Runware 反其道而行,去除了通用工作負載所需但推理不需要的元件:定製伺服器、PCB、機架和資料中心架構專為 GPU 工作負載設計,在更小的佔地面積內整合更多算力;運營和設施成本通常佔推理成本的約 35%,而 Runware 將其降至低個位數百分比,使其在所有標準 NVIDIA GPU 上的每 GPU 小時推理成本比同行低 30% 至 90%。
冷卻方面,傳統資料中心依賴蒸發冷卻系統,全球每年消耗超過 5600 億升水。Sonic Inference Pod 採用閉環無水冷卻,僅迴圈 1.5 立方米水,同時將 GPU 溫度控制在目標溫度 2°C 以內。由於每個 Pod 自包含且無需對電網做任何改動,可部署在任何有電力的地方,包括太陽能園區等可再生能源發電場。此外,Pod 可在任何國家邊界或司法管轄區內部署,滿足資料駐留或監管要求的組織可在本地專用基礎設施上執行推理。
Runware 表示,Sonic Inference Pod 現已在美國和歐洲上線,每個 Pod 加入一個分散式推理網路,作為單一結構管理,若某個 Pod 離線,會自動重新路由請求,以最佳化延遲、成本和可用性。公司目前接受前沿實驗室、AI 工作室、企業以及有主權 AI 或資料駐留需求的組織的諮詢,容量預訂已在 runware.ai 開放。
Higgsfield 戰略合作伙伴副總裁 Deykhan Ten 表示,他們最初使用 Runware 的模型 API,但由於其規模和效率,很快擴充套件到其推理基礎設施。他們的模型每週觸達數百萬使用者,可靠容量和成本效率至關重要,推理成本越低,能為使用者提供的價值就越多。
首批節點將支援 Runware 的完整模型目錄,包括前沿開源 LLM、專用微調模型,以及 Runware 自有的影像、影片和音訊媒體生成能力。Runware 是一家 AI 推理平台,構建並運營自己的模組化推理基礎設施,通過其專有 Sonic Inference Engine 提供,並可通過模型 API 和無伺服器部署訪問。該平台提供按使用量計費,每 token 成本最多可降低 10 倍。Runware 已為全球超過 100 萬開發者和 5 億終端使用者處理超過 200 億次請求,通過單一整合提供超過 40 萬個模型,客戶涵蓋電商、媒體、遊戲和創意工作流等領域。