马斯克在 X 上披露,SpaceXAI 的 Colossus 2 数据中心将于下周投运 22 万块英伟达 GB300 GPU,11 月再上线 22 万块,若进展顺利,12 月底前还会有第三批 22 万块到位。这意味着今年新增 66 万块 GB300,叠加现有在运设备后,SpaceXAI 的 GB300 总数将达到 110 万块,全部在运 GPU 总量升至 144 万块。

这一数字兑现了马斯克约两年前提出的目标——把 Colossus 超算扩展到百万 GPU 以上。按他给出的构成,Colossus 1 目前运行 15 万块 H100、5 万块 H200 和 3 万块 GB200;Colossus 2 则运行 11 万块 GB200 和 44 万块 GB300。两处站点合计,构成了上述 144 万块的在运规模。

值得注意的是,Colossus 1 混用 Hopper 与 Blackwell 两代 GPU,对训练 Grok 效率不高,因此马斯克将其租给 Anthropic 用于推理;Colossus 2 则全部采用 Blackwell 架构,以避免训练环节出现瓶颈。这种分工在算力调度上颇具代表性:老一代集群转向推理,新一代集群专注训练,反映出大模型厂商对异构算力按任务类型分层使用的思路。

从竞争节奏看,SpaceXAI 成立仅三年,而 Anthropic 与 OpenAI 分别已有六年和十年历史。以更短的时间堆出百万级 GPU 集群,是这条消息最受关注之处。不过,拿到 GPU 已不是当前最难的环节。数据中心建设普遍受制于电力供应,SpaceXAI 的应对方式是自建电源:公司规划了一座 1.2 吉瓦的自有电厂,以支撑系统全面上线。

自建供电也带来争议。公司此前因运行未获许可的燃气轮机被周边社区起诉,随后承诺拆除这些设备,但拆除周期长达一年,以便自有电厂逐步投运。这一插曲折射出 AI 数据中心扩张与地方监管、环境许可之间的摩擦正在增多。

百万 GPU 单站点并非 SpaceXAI 一家的目标。博通曾在 2024 年表示,其有三家超大规模客户计划在 2027 年前达到这一量级,但未披露客户身份。对马斯克而言,百万 GPU 只是起点:他表示 SpaceXAI 将在 2027 年把数据中心容量扩大七倍,并瞄准 2030 年实现 5000 万块 H100 等效算力。此外,SpaceX 还计划发射由百万颗卫星组成的轨道数据中心系统,尽管黄仁勋称这一构想目前仍属“梦想”。

整体来看,这条消息的关键不只是 GPU 数量,而是算力扩张的约束条件正在从芯片转向电力与土地。自建 1.2 吉瓦电厂、租出旧集群做推理、规划轨道数据中心,都是围绕这一约束做出的安排。对产业链而言,GB300 的集中交付节奏、燃气发电与电网接入设备、以及推理算力的对外供给,都是后续值得跟踪的变量。