AI對電力的巨大需求早已不是新聞,但一個更隱蔽的難題正浮出水面:資料中心用電量的劇烈波動正在損毀關鍵裝置,威脅設施可靠性,並向整個電網輸出不穩定風險。據彭博8月6日報道,電池、發電機、冷卻裝置等AI計算設施的核心繫統正因承受異常電力衝擊而出現故障或提前報廢。在xAI位於田納西州孟菲斯的Colossus超算設施,燃氣輪機已出現裂縫;英國多處規模較小的資料中心同樣出現輪機開裂問題。部分已安裝的穩壓電池在高強度執行下,數週乃至數月內便需更換。
這一問題的市場影響正在顯現。據報道,一位參與資料中心融資的知情人士透露,部分設施的實際執行時間已降至80%左右,遠低於全年不間斷執行的設計預期,若問題未能解決,未來12至24個月內將對相關專案投資者造成直接衝擊。與此同時,北美電力可靠性公司(NERC)今年早些時候發出罕見的三級警報,要求大型資料中心立即應對電網穩定性風險。
電力波動的根源在於GPU叢集的“毫秒級”衝擊。AI資料中心的用電模式與傳統資料中心存在本質差異:傳統設施的用電量相對平穩,而AI計算——尤其是模型訓練階段——會驅動數十萬塊GPU同步啟停,用電量在毫秒級時間內大幅躍升或驟降。Mainspring Energy Inc.創始人兼總裁Shannon Miller將這一現象形象地描述為:一座相當於波士頓規模的1吉瓦資料中心,其中一半的用電量可能每隔數秒便閃爍開關。而德克薩斯州和美國中西部規劃中的部分AI園區規模超過5吉瓦,平均用電量接近紐約市全市水平。前特斯拉高管、Heron Power Electronics Co.創始人Drew Baglino指出,AI資料中心的瞬時用電量有時會飆升至設計容量的50%以上——“一座1吉瓦的設施可能在瞬間消耗1.5吉瓦”。其公司正為輝達預計於2027年推出的下一代伺服器開發電力波動管理裝置。Uptime Institute英國首席顧問Amber Villegas-Williamson將這種衝擊比作駕車時反覆猛踩油門:“就像不斷超速運轉發動機,比勻速行駛磨損快得多。”
裝置損毀已成現實。據彭博採訪的逾三十位美歐電力專業人士,AI資料中心對物理裝置造成的壓力已有目共睹。報道稱,多位知情人士表示,資料中心所用小型天然氣內燃機的曲軸已出現斷裂。xAI的Colossus設施中,燃氣輪機出現裂縫,運營方隨後安裝電池以平滑電力波動、減輕輪機負荷。GeoPura Ltd.執行長Andrew Cunningham亦證實,英國多處規模較小的資料中心同樣出現輪機開裂問題。UL Solutions Inc.執行長Jennifer Scanlon指出,裝置裂損或磨損可能引發電弧閃絡——即電流在導體間跳躍——進而損毀AI晶片。Uptime Institute及多位業內人士表示,為穩壓而安裝的電池有時在數週乃至數月內便需更換。電池、電容器、變壓器、飛輪等穩壓裝置雖已存在,但在搶速建設AI算力的浪潮中,新建資料中心對這些技術的部署明顯不足。值得注意的是,這一問題遍及全球,從中東、非洲到歐洲和美國均有出現。
可靠性下滑直擊營收。裝置損毀帶來的直接後果是設施停機,而停機的代價極為高昂。Switch資料中心首席戰略官Jason Hoffman表示,關鍵裝置提前損毀的財務代價,“主要不是更換一個泵或斷路器的成本,而是昂貴算力資產因離線而無法創造收入的損失”。據估算,停機造成的收入損失從每分鐘數千美元到數十萬美元不等,因設施型別和工作負載而異。據報道,一個具體案例是:為確保微軟要求的99.999%可靠性,Joulent Inc.與雪佛龍聯合開發的德克薩斯州西部2.67吉瓦AI園區,不得不在工期中預留額外工程時間,供電啟動時間因此從2027年推遲至2028年。Joulent執行長Chris James表示,這一調整正是為了應對電力波動帶來的工程挑戰。報道稱,據一位參與資料中心融資的知情人士透露,行業普遍假設設施上線後將全年不間斷執行,但現實中部分設施的實際執行率已接近80%。若問題無法解決,未來12至24個月內將對相關專案投資者產生實質衝擊。分析指出,超大規模雲廠商數千億美元的資本開支已令投資者和貸款方神經緊繃。裝置損毀加速折舊的問題,與此前市場對GPU機架折舊速度的質疑相互疊加,令外界對AI資料中心能否兌現其盈利承諾產生更深層的疑慮。即便數分鐘的停機,也會直接侵蝕資料中心開發商的營收。而若實際執行率長期低於預期,專案的財務模型將面臨根本性重估。在AI基礎設施投資熱潮尚未退溫之際,這一結構性風險正成為投資者不得不正視的新變數。
電網穩定性告急。AI資料中心的電力波動不僅威脅設施自身,還向更廣泛的電網輸出不穩定性。據報道,施耐德電氣電能質量專家、全球產品經理Sreemant Roy警告稱,這類高度動態的負荷“會導致電網不穩定,若不加以糾正,可能引發停電或斷電”。他特別指出,資料中心可能引發次同步振盪,損壞電網其他節點的連線裝置,“這已令全球電力公司深感憂慮”。監管層面,NERC在過去兩年內多次發出警告,將資料中心列為電網穩定性的最大風險之一。據NERC去年9月的報告,在對美國逾33吉瓦在運資料中心的評估中,約四分之三的負荷模型“不足以反映資料中心的動態行為”。今年早些時候,NERC發出罕見的三級警報,要求大型資料中心於8月3日前提交應對方案。
面對上述挑戰,產業鏈各環節正積極尋求解決方案。輝達表示,自2024年釋出Blackwell GPU起,已加強與電力專家的合作。輝達超大規模基礎設施解決方案高階總監Dion Harris表示,公司正致力於在資料中心建設、設計、工程及電力輸送各環節實現更平穩的部署。在運營層面,部分資料中心使用者已採用“側邊計算”技術——執行不屬於訓練流程的虛擬計算任務,以維持GPU穩定執行、平滑用電波動。但批評者指出,這一方法在電力需求本已高漲之際造成了額外的電力浪費。在政策層面,美國能源部去年委託科羅拉多州丹佛附近的國家洛基山實驗室(NLR)建立測試平台,專門研究如何將AI安全接入電網。NLR專案經理Martha Symko-Davies表示,該平台配備GPU和發電裝置,供開發者測試其系統能否應對AI負荷的波動性,並將用於測試電池、軟體及其他穩壓裝置。“我們現在有機會把這件事做對,”她說。