AI 推理与原生计算公司 Runware 于 2026 年 8 月 4 日发布 Sonic Inference Pod,这是一种集装箱式模块化数据中心,旨在快速扩充面向模型提供商的 AI 推理基础设施。与需要数年建设、每千兆瓦成本高达 90 亿至 190 亿美元的传统数据中心不同,Sonic Inference Pod 可在 20 英尺集装箱内提供 1 兆瓦算力,采用定制服务器、PCB 和闭环冷却系统,专为推理性能优化。据 Runware 称,其设施成本比传统千兆瓦级数据中心建设低最多 100 倍,并将这一节省直接传递给客户,体现在 GPU 算力定价中。

Runware 计划于 2026 年下半年根据客户需求,在美国和欧洲部署由数十个 Pod 和数万块 GPU 组成的网络,这标志着其首次向自有平台之外的客户开放定制硬件。Runware 联合创始人兼 CEO Flaviu Radulescu 表示,在运营大规模基础设施 20 年后,他意识到传统数据中心无法扩展推理能力,因为电力和冷却无法满足需求,因此他们从第一性原理重新设计,只保留推理所需的组件,采用液冷 GPU 和模块化格式,以便在已有电力的地方部署。他强调,这种方式能以比其他基础设施提供商更快的速度生产和部署 1 千兆瓦算力,并具备内置冗余和实时路由能力,以选择最具成本效益的 GPU。

传统数据中心大多为通用计算设计,而非 AI 专用。GPU 的功耗是普通服务器的 8 至 20 倍,且需要更多冷却,导致在标准数据中心运行 GPU 的公司往往只能使用少量机架,其余空间闲置。Runware 反其道而行,去除了通用工作负载所需但推理不需要的组件:定制服务器、PCB、机架和数据中心架构专为 GPU 工作负载设计,在更小的占地面积内集成更多算力;运营和设施成本通常占推理成本的约 35%,而 Runware 将其降至低个位数百分比,使其在所有标准 NVIDIA GPU 上的每 GPU 小时推理成本比同行低 30% 至 90%。

冷却方面,传统数据中心依赖蒸发冷却系统,全球每年消耗超过 5600 亿升水。Sonic Inference Pod 采用闭环无水冷却,仅循环 1.5 立方米水,同时将 GPU 温度控制在目标温度 2°C 以内。由于每个 Pod 自包含且无需对电网做任何改动,可部署在任何有电力的地方,包括太阳能园区等可再生能源发电场。此外,Pod 可在任何国家边界或司法管辖区内部署,满足数据驻留或监管要求的组织可在本地专用基础设施上运行推理。

Runware 表示,Sonic Inference Pod 现已在美国和欧洲上线,每个 Pod 加入一个分布式推理网络,作为单一结构管理,若某个 Pod 离线,会自动重新路由请求,以优化延迟、成本和可用性。公司目前接受前沿实验室、AI 工作室、企业以及有主权 AI 或数据驻留需求的组织的咨询,容量预订已在 runware.ai 开放。

Higgsfield 战略合作伙伴副总裁 Deykhan Ten 表示,他们最初使用 Runware 的模型 API,但由于其规模和效率,很快扩展到其推理基础设施。他们的模型每周触达数百万用户,可靠容量和成本效率至关重要,推理成本越低,能为用户提供的价值就越多。

首批节点将支持 Runware 的完整模型目录,包括前沿开源 LLM、专用微调模型,以及 Runware 自有的图像、视频和音频媒体生成能力。Runware 是一家 AI 推理平台,构建并运营自己的模块化推理基础设施,通过其专有 Sonic Inference Engine 提供,并可通过模型 API 和无服务器部署访问。该平台提供按使用量计费,每 token 成本最多可降低 10 倍。Runware 已为全球超过 100 万开发者和 5 亿终端用户处理超过 200 亿次请求,通过单一集成提供超过 40 万个模型,客户涵盖电商、媒体、游戏和创意工作流等领域。