谷歌AI基礎設施負責人Amin Vahdat在紅杉資本合夥人Sonia Huang的深度訪談中,系統闡述了這場被其稱為人類歷史上規模最大的資本開支建設背後的技術邏輯。他透露,谷歌今年資本開支預計超過2000億美元,其中大部分用於資料中心建設,而他本人正牽頭這一建設。
Vahdat首先糾正了業界衡量算力的方式。他認為FLOPS屬於"虛榮指標",只反映單顆晶片的理論上限,而真實工作負載的效能取決於數千乃至數萬顆加速器、CPU、網路與儲存如何協同。他更看重goodput(有效吞吐)——即在故障與同步等待等損耗之後,系統實際交付的有效算力。他解釋說,在10萬加速器規模上,總會有元件在壞,一旦同步工作負載中任一環節失敗,整個系統可能需回滾到上一個檢查點重算,這部分"無效功"正是goodput與throughput之間的差值。故障來源呈長尾分佈,涵蓋網路互連、硬體、編譯器缺陷、執行時錯誤乃至作業系統問題,且每代新產品都會帶來新的故障模式。
訪談中,Vahdat把長程智慧體(long-horizon agent)的興起視為過去一年影響資料中心設計的最大結構性變數。傳統人機互動存在數秒到數十秒的"人類節拍",天然限制請求頻率;而智慧體無需等待人類,響應延遲可從秒級壓縮至毫秒級,請求密度呈數量級提升。同時,智慧體在推理與編排環節大量依賴CPU——解析上一步響應、判斷下一步行動、從本地DRAM、遠端記憶體、SSD或HDD抓取上下文,這些操作都跑在CPU而非加速器上。因此他強調,加速計算需求上升的同時,CPU、網路、儲存等傳統資料中心元件的需求也在暴漲。這也帶來佈局兩難:若在加速器機架旁配置大量CPU機架,會破壞專用化設計;若分置不同建築,樓間網路將引入數百微秒排隊延遲並推高成本。
晶片層面,谷歌今年釋出的第八代TPU首次拆分為兩顆獨立晶片:8i用於推理、8t用於訓練。Vahdat稱這是對推理市場規模預判的直接結果——隨著推理在總算力需求中佔比預計升至50%乃至更高,專用化的邊際收益開始超過靈活性損失。但他強調拆分設定了安全閥:兩顆晶片均保留執行對方工作負載的能力,只是非專長方向性能有所折損,否則就必須提前精準預測六年生命週期內兩類負載的需求量,風險難以承受。在更宏觀的專用化譜系上,他提到從通用GPU到Transformer原語固化、乃至"將特定模型架構燒入矽片"的連續路徑,稱已有公司探索最後一步,谷歌認為矩陣乘法、softmax等原語已基本固化於硬體,進一步專用化到具體模型層"非常非常有趣"但尚未落地。
網路方面,谷歌約15年前率先將波長分波多工(WDM)引入資料中心,隨後疊加光路交換(optical circuit switching),在純光域完成路由,繞過傳統電分組交換逐包查表的環節。最初採用MEMS微機電開關,通過三維空間內精確控制微型反射鏡角度,把任意輸入光纖埠的光訊號導向指定輸出埠。該技術最初服務於兩個目標:在高頻通訊的計算叢集與儲存叢集之間建立光域捷徑,以及在無需人工移動光纖的前提下通過軟體控制器動態重構拓撲以擴縮容。在TPU叢集中,光路交換還具備容錯價值:某個TPU機架故障時,系統可在毫秒級內將光路重新指向備用機架,直接壓縮goodput損失。他還提到,軌道資料中心場景下元件間將真正轉向自由空間雷射通訊——這正是地面場景迴避該方案的原因(衰減損耗與大規模三維對準難度過高),但在太空環境中限制大幅弱化。
被問及最大約束,Vahdat的回答直接:電力是最根本的約束,其他問題似乎都知道如何在一段時間內解決,電力則是長期繫結問題。谷歌首選與公用事業併網而非自建獨立電源,理由是統計複用效應——若完全自給,達到99.99%以上可靠性意味著需建設兩倍裝機容量;通過長期協同在更大基數上平滑需求波動,雙方均可降低冗餘成本。谷歌承諾自行承擔因其接入所需新增的輸電線路和變電站費用,避免轉嫁其他使用者。但供需錯配現實存在:若某年需要1吉瓦而公用事業當年只能提供700兆瓦,谷歌可能臨時自建太陽能加儲能填補缺口,並在最熱月份將本地發電回饋電網。關於單體資料中心最優規模,他稱這是"大量爭論的來源"且高度依賴選址:訓練叢集偏向吉瓦級集中部署以最小化網路延遲,服務叢集則需分佈全球貼近使用者、單體更小。
Vahdat還描述了與DeepMind的協同設計,形容為"在晶片架構飛行途中做修改"。谷歌同時推進五至六代TPU:已量產、除錯上線、即將tape-out、設計中、概念階段,構成橫跨數年的並行流水線。對即將tape-out的晶片,若DeepMind提出能帶來重大收益的模型最佳化,雙方可緊急評估是否值得推遲tape-out以納入硬體修改;對設計階段的晶片,則進行三到四年維度的模型架構趨勢共預測。他還披露,谷歌目前已在使用Gemini為未來版本的Gemini設計硬體,形成模型輔助晶片設計的閉環。
對於十年後的算力形態,Vahdat給出兩條並行路徑。地面形態上,他預計整合度大幅提升,機架將從外部可見的繁複光纖束演變為"只有一小束光纖從機架裡出來"的高度整合單元,單個機架功耗可能達數兆瓦量級,進場安裝僅需接入電、水、光纖三路即可執行。在軌道路徑上,谷歌已將軌道資料中心列為正式推進的moonshot專案,核心邏輯是能源優勢:太空無大氣衰減使可用功率天然高出約40%,太陽同步軌道可實現98%至100%的日照覆蓋,而地面設施通常僅28%至35%,疊加後能量密度優勢可達3至4倍且無碳排放。主要挑戰在於冷卻、可靠性維修以及元件間通訊,但他認為這些問題"沒有根本性showstopper"。
對關注AI產業的讀者而言,Vahdat的表態提供了幾個可追蹤的訊號:電力而非晶片被超大規模廠商內部認定為長期瓶頸,意味著發電、輸電與儲能環節可能持續受益;軟體與模型最佳化對容量提升的貢獻"很可能不少於硬體",暗示算力供給的彈性部分來自演算法效率;而TPU推理與訓練分拆,則折射出推理市場在總算力中佔比快速膨脹的產業趨勢。