智谱(Z.ai)近日完成了一座规模达到1GW的AI数据中心,据彭博社报道,该中心全部采用中国制造的芯片,并将用于模型训练。这一举动在全球AI建设潮中释放出新的产业信号:大模型公司正从算力使用者,转变为算力基础设施的组织者。
过去两年,全球AI行业最抢手的资源是英伟达GPU。从OpenAI到Meta、Google、Amazon,几乎所有头部公司都在争夺计算资源。行业最初聚焦模型能力,但逐渐发现,模型背后的算力系统同样决定迭代速度。算法可以调整,数据可以补充,但算力中心无法临时搭建——芯片需提前采购,机房需提前建设,电力也要排队接入。
于是,AI行业出现了一个颇具反差的场景:一群研究最前沿软件的公司,开始忙着找土地、谈能源、修数据中心。OpenAI推进Stargate项目,首批设施从1GW起步,整体规划达数GW;xAI在孟菲斯建设Colossus,规模扩至约2GW;Meta的Hyperion目标达到5GW;Anthropic通过与Amazon的长期合作锁定约5GW算力;Google则围绕TPU自建集群。国内,字节跳动和智谱也进入了1GW级建设阶段。
这些公司的方式各不相同:有的直接修建园区,有的与云厂商深度绑定,有的拥有自研芯片。但它们面对同一个时间差:模型几个月就会更新一次,数据中心却需要几年才能建成。今天签下的土地和电力合同,服务的可能是三年后的模型。建设算力中心,本质是在为尚未确定的下一代技术提前预留位置。
算力中心将AI公司带入了一个陌生世界。软件产品开发完成后可近乎零成本复制,数据中心却需要土地、变电设施、冷却设备、高速网络和长期能源合同。服务器进入机房前,可能已有数十亿美元投入到看不见的土建和供电工程中。基础设施基金、能源企业、地产商和长期债务,也开始进入大模型产业链。
这让AI竞争多了一层赌注。头部公司普遍相信,未来模型会消耗更多计算资源,因此必须提前扩建。但几年后的训练方式是否会改变、新增算力能否被充分利用、模型收入能否覆盖持续增长的成本,目前都没有确定答案。一座空闲的数据中心不会因为属于AI行业就变得更便宜——昂贵芯片只有持续运行,才可能转化为研发效率;一旦需求低于预期,它也可能迅速变成沉重的折旧负担。
智谱项目与海外同行最大的差别,在于其全部采用中国制造的芯片。全球公司的底层选择已经开始分化:OpenAI和xAI主要依赖英伟达,Meta在采购英伟达的同时推进自研MTIA,Anthropic使用Amazon Trainium与英伟达,Google坚持TPU,字节的相关项目采用华为昇腾。智谱则把整座1GW数据中心放在国产芯片体系上运行。
当模型公司只是在云上租用算力时,芯片更像一项被封装好的服务。开始建设自己的数据中心后,底层硬件会牵动整套系统:服务器如何设计、芯片之间如何通信、编译器和训练框架如何适配、故障发生后如何恢复,都需要重新磨合。单颗芯片能运行模型,与成千上万颗芯片能一起高效训练,并非同一件事。集群扩大后,任何通信延迟、软件兼容问题或设备故障,都可能让大量机器停下来等待。
英伟达的优势,很大一部分来自CUDA和长期积累的工程生态。使用这套体系扩建算力,更像在已铺好的高速公路上增加车道。智谱面对的情况更复杂:它既要扩大车流,还要参与修路。因此,1GW只是一个工程规模,不能直接等同于模型能力。这座数据中心最终有没有价值,要看它能否稳定承担大规模训练、保持较高利用率,以及能否真正缩短GLM系列模型的迭代周期。只有当机房里的芯片持续转化成新的模型和产品,算力中心才不只是一个醒目的数字。
过去,人们习惯通过排行榜和发布会观察AI竞争。下一轮差距,可能在模型登场前就已经形成——藏在提前锁定的电力、尚未安装的服务器,以及那些需要几年才能建成的数据中心里。智谱进入的,正是这场更慢、更重,也更难临时追赶的比赛。