SpaceX正在对其AI数据中心的建设方式进行系统性调整,核心变化是从追求建设速度转向优先保障可靠性。据The Information援引知情人士消息,SpaceX新任管理团队正着手加装更多电力与冷却备用系统,要求数据中心在投入运营前完成更全面的测试,并减少对临时性电力与冷却设备的依赖。这一转向意味着其数据中心扩张速度可能显著放缓。

这一新做法与xAI此前「边建设边运营、后期补充冗余」的快速部署模式形成鲜明对比。xAI曾将极速建设视为在AI竞赛中的核心优势,其首座数据中心仅用122天便完成搭载10万块GPU的上线部署,这一速度曾被英伟达CEO黄仁勋称赞为「超人般的」成就。为实现这一节奏,xAI调集数千名承包商,采用多工序并行作业——冷却管道铺设、电气与网络布线等往往在同一区域同步推进,而非等上一阶段完工再启动下一阶段。SpaceX甚至在今年6月的IPO文件中将快速建设能力列为重要卖点。

但速度优先带来了明显的可靠性代价。据知情人士介绍,前两座数据中心上线时的冗余度仅为其他超大规模云计算服务商的一小部分,单点设备故障便可能导致整个算力集群瘫痪;建成初期频繁断电曾迫使AI研究人员将项目搁置数小时,并损失部分模型训练进度。此外,由于团队成员此前被赋予较高的采购自主权,数据中心内部设备规格参差不齐,进一步削弱了系统稳定性。

上周,施工作业意外影响一条输电线路,导致SpaceX位于田纳西州孟菲斯的大型数据中心发生一次备受关注的宕机事故。SpaceX表示,此次故障导致部分Grok模型下线,并对Anthropic、谷歌等算力租赁客户产生连锁影响。马斯克随后在X平台发帖称,公司正在采取纠正措施,确保此类事件不再发生。

人事层面的调整同步展开。今年6月下旬,马斯克对数据中心管理层实施大规模调整,由SpaceX老将Wesley Salandro接替Dan Rowland出任团队负责人。Rowland曾主导基础设施工程并一度直接向马斯克汇报,此前还参与过特斯拉Dojo超级计算机项目,在Salandro接手后不久离开。Salandro在SpaceX任职超过七年,曾担任Falcon和Dragon火箭的生产副总裁。此后数周内,多位核心负责人相继出走,涉及物理基础设施、数据中心安全、采购、财务等岗位,部分人员转投OpenAI、Anthropic等公司。为填补缺口,SpaceX向德克萨斯州Bastrop和佛罗里达州卡纳维拉尔角的火箭及Starlink工程师发出志愿支援号召,招募参与为期六至八周的轮岗。据悉逾1300名工程师报名,其中超过300人在过去一个月内正式加入数据中心项目。

新管理层不仅调整技术路线,也重塑了组织架构。据知情人士透露,SpaceX在此前相对扁平的管理结构中增设了多个中层管理职位,员工的设备采购授权和现场决策权随之收窄,这在客观上会进一步拖慢建设进度。马斯克本人似乎支持这一新策略——据两位知情人士称,近几个月他几乎每周都会造访孟菲斯的数据中心设施,通常选择周日到访。

从产业视角看,这次调整折射出AI算力扩张进入一个新阶段:当数据中心规模从数万块GPU迈向更大体量,电力供应、冷却冗余与运维稳定性对训练连续性的影响被放大,单次宕机就可能波及多家外部租户。对算力租赁客户而言,供应方的可靠性正成为与价格、交付速度同等重要的考量;对数据中心产业链而言,备用电源、冷却系统与测试验证环节的价值相应提升。不过知情人士也表示,尽管提前建设备用系统、加强测试势必放缓整体进程,SpaceX可能不会完全放弃此前的加速建设模式。如何在重建可靠性与保持扩张速度之间取得平衡,仍是这支新团队面临的核心挑战,尤其是在算力租用业务加速扩张、外部客户依赖度日益上升的当下。

截至发稿,SpaceX周四美股盘中上涨1.63%,早盘受获英国政府约4000万美元卫星服务订单的消息影响一度涨超3%,后有所回落。此外,根据招股书披露的安排,SpaceX在9月9日前后迎来IPO后第90天的一轮解禁,最多约3.19亿股Class A普通股获得出售资格,占相关180天锁定股份约7%。