商湯大裝置在近日首次提出TPW(Tokens Per Watt)指標,旨在重新定義AI基礎設施的效能標尺。在Token經濟時代,AI基礎設施的效率衡量不再侷限於PUE(電力使用效率),而是轉向單位電力成本產生的有效Token數量。商湯大裝置智算中心總經理林海表示,AIDC需要被重新理解為連線電力與Token的價值平台,算力與電力的協同最佳化成為決定商業競爭力的關鍵變數。

傳統上,PUE作為資料中心總能耗與IT裝置能耗的比值,長期被視為衡量能效的“黃金標準”。過去十幾年,行業圍繞PUE進行了大量節能最佳化,如氣流組織、製冷系統、自然冷卻和液冷技術等。然而,隨著AIDC服務模式從“賣卡時”轉向“賣Token”,PUE的侷限性日益凸顯:它只關注“用了多少電”,卻無法回答“這些電產出了多少有效價值”。林海舉例說,調高送風溫度可能降低製冷能耗,使PUE資料更好看,但GPU與伺服器風扇功耗上升,總用電未必下降,Token產出成本甚至可能升高。

TPW指標正是在此背景下提出。它並非否定PUE,而是在PUE基礎上進一步打通從電力投入到Token產出的全鏈路效率評價,將分時電價等因素納入經濟性考量。TPW將電價、儲能、PUE、GPU利用率與模型效率等分散環節統一指向Token產出這一價值指標,為電網、IDC、算力平台和模型廠商提供了統一的價值語言,使算電協同變得可度量、可複製、可商業化。

為實現TPW提升,商湯大裝置提出了算電協同Agent,通過資料貫通、任務排程和算電協同三個層面進行系統級最佳化。首先,構建八級資料穿透體系,打通任務、算力資源與物理用電之間的對映關係,使每一度電與每一個算力任務精準對應。商湯大裝置智算中心運維總監張煦介紹,在臨港AIDC監控大屏上,任務即時功耗、節點GPU利用率、機櫃及樓層負荷、樓棟IT功率與進線側用電資料均納入同一條觀測鏈路,實現每一度電的去向和產出可追溯。

其次,根據任務時效要求進行智慧排程。線上推理等即時業務即時響應,而訓練、評測、批處理等任務則利用分鐘、小時乃至跨日的調節空間,自動安排到低電價、低負荷時段執行,在保障服務質量的同時提升整體資源利用率。這種最佳化不減少總用電量,而是通過最佳化時序讓同樣的容量和電量產出更多有效Token。

最後,結合容量挖潛、儲能排程和電網需求響應,實現算力與能源的動態協同。實測資料顯示,在既有供電條件下,IT有效承載能力可提升約60%,這一提升並非來自新增供電容量,而是通過系統級協同實現。

商湯臨港AIDC已對這套方法論進行了規模化驗證。在今年7月10日上海市迎峰度夏電力需求響應中,臨港AIDC率先啟動算電協同排程模式,午間常規用電負荷削減75%,可調負荷規模達23MW,通過非關鍵任務暫停、基礎設施降耗、儲能放電等措施,在兩小時內向電網釋放了4.6萬度削峰電量。這表明AIDC與電網的關係正在改變,智算中心從剛性負荷轉變為可運營、可排程的彈性資產。

算電協同Agent作為TPW落地的智慧排程系統,依託八級資料穿透體系、五大智慧決策鏈和六大運營能力,實現從感知、預測、決策、執行到度量的閉環。目前,該Agent已全面應用於商湯臨港AIDC,實現單位電力成本Token產出提升80%、平均電費單價低於同地區IDC約10%、算力負荷預測準確率達到96%。張煦表示,算電協同Agent採用平台化、模組化設計,並依託FDE(Field Domain Expert)專家體系形成標準化交付流程,新場景最快一週即可完成部署上線。

對於國家算力樞紐節點、萬卡級智算中心等大型AI基礎設施,算電協同Agent能夠統一排程算力、能源與儲能資源,提升叢集整體算效,最佳化綠電消納和綜合用能成本。對於算力運營商、AI雲服務商以及Token工廠,系統可結合電價預測、負載最佳化與算力排程,實現單位Token電力成本持續下降。對於企業級智算中心、科研機構以及行業AI平台,客戶無需重構現有基礎設施即可快速部署算電協同能力。

林海認為,從PUE到TPW,變化的不只是評價指標,更是AI基礎設施的執行方式。未來,算電協同將不再只是智算中心的節能手段,而是連線算力、能源與業務的核心能力。商湯大裝置希望通過算電協同Agent,讓系統最佳化能力實現標準化、產品化和規模化複製,推動AI基礎設施進入系統級算效時代。