CoreWeave 于 9 月 16 日宣布,已在 CoreWeave Cloud 上完成多机架英伟达 Vera Rubin NVL72 集群的部署,把数百颗 Rubin GPU 连接成单一横向扩展集群,主要面向智能体 AI(agentic AI)的训练与推理需求。公司同时发布 CoreWeave AI 对象存储的两项新能力:跨区域写入加速和全新的 Archive 归档层,目的是让这些工作负载所依赖的数据尽可能贴近 GPU。
CoreWeave 产品与工程执行副总裁 Chen Goldberg 表示,公司是首家验证并部署 Vera Rubin NVL72 的 AI 云服务商,证明这一机架级架构可以作为可靠的高性能云服务运行;多机架版本把数百颗 Rubin GPU 连成一个集群,对构建智能体 AI 的客户意味着更大规模、更快迭代和更高效率。
从硬件配置看,单台 NVIDIA Vera Rubin NVL72 机架集成 72 颗 Rubin GPU 与 36 颗 Vera CPU,并搭配 NVIDIA NVLink 6、ConnectX-9 SuperNICs 和 BlueField-4 DPUs。多机架方案则通过 NVIDIA Spectrum-X 以太网把数百颗加速器统一为单一集群,从而支撑更大模型的训练、更苛刻的推理负载以及规模化强化学习。CoreWeave 强调,这需要在计算、网络、存储、冷却、供电、固件和软件各层同时完成工程适配,使整套系统像一个协调整体运行。
在部署流程上,CoreWeave 通过 Mission Control 的 Rack LifeCycle Controller 自动完成机架硬件检测、固件更新、验证、供电与冷却协调;在进入生产前,还会结合英伟达现场诊断与整机架负载测试,逐项比对结果,只有通过系统级验证的机架才会投产。网络方面,每颗 Rubin GPU 配备两个 ConnectX-9 SuperNIC,提供 1.6 Tb/s 的横向扩展连接能力,支持多平面、多轨路径,在非阻塞架构下每轨可支持约 12.8 万颗 GPU;模块化拓扑允许在扩容时无需重新设计整个网络架构。
存储侧的新能力同样围绕延迟展开。CoreWeave AI 对象存储的 LOTA(本地对象传输加速器)在每个 CoreWeave Kubernetes Service 节点上做托管缓存,使读取达到本地 NVMe 速度,相比传统存储集群读取延迟降低 8 倍,每颗 GPU 吞吐最高 7 GB/s,并随集群规模线性扩展。跨区域写入加速则让任务在本地写入的同时,由 CoreWeave 在后台把数据复制到另一区域,使智能体的中间状态、检索上下文和输出能够跟上推理节奏,GPU 不必等待。由于应用只看到一个存储桶,客户无需改动代码,权限与保留规则在不同区域写入时保持一致,也省去了手动跨区搬运数据的运维负担。
Cohere 内部基础设施总监 Cécile Robert-Michon 表示,其数据集横跨多个区域,训练计划不能受制于跨区域检索延迟;CoreWeave 的存储方案让数据在各区域形成统一视图并在本地缓存读取,使训练不再被网络拖慢。
此外,新推出的 Archive 归档层意在降低长期保存关键数据的成本。CoreWeave 指出,团队常因存储成本而删除本可保留的数据,例如接近成功的训练检查点、用于复现结果的数据集,或半年后可能被问及的模型版本。归档层的推出,使保留这类数据的决策在成本上更为可行。
整体来看,这条消息的核心并非单一硬件发布,而是 AI 云在机架级算力之外,把网络与存储一并纳入系统级交付。对关注 AI 产业链的读者而言,它提供了观察 Rubin 平台从单机架验证走向多机架规模化部署的窗口,也显示 AI 云厂商的竞争正从 GPU 供给延伸到数据通路与存储成本控制。