商汤大装置在近日首次提出TPW(Tokens Per Watt)指标,旨在重新定义AI基础设施的效能标尺。在Token经济时代,AI基础设施的效率衡量不再局限于PUE(电力使用效率),而是转向单位电力成本产生的有效Token数量。商汤大装置智算中心总经理林海表示,AIDC需要被重新理解为连接电力与Token的价值平台,算力与电力的协同优化成为决定商业竞争力的关键变量。
传统上,PUE作为数据中心总能耗与IT设备能耗的比值,长期被视为衡量能效的“黄金标准”。过去十几年,行业围绕PUE进行了大量节能优化,如气流组织、制冷系统、自然冷却和液冷技术等。然而,随着AIDC服务模式从“卖卡时”转向“卖Token”,PUE的局限性日益凸显:它只关注“用了多少电”,却无法回答“这些电产出了多少有效价值”。林海举例说,调高送风温度可能降低制冷能耗,使PUE数据更好看,但GPU与服务器风扇功耗上升,总用电未必下降,Token产出成本甚至可能升高。
TPW指标正是在此背景下提出。它并非否定PUE,而是在PUE基础上进一步打通从电力投入到Token产出的全链路效率评价,将分时电价等因素纳入经济性考量。TPW将电价、储能、PUE、GPU利用率与模型效率等分散环节统一指向Token产出这一价值指标,为电网、IDC、算力平台和模型厂商提供了统一的价值语言,使算电协同变得可度量、可复制、可商业化。
为实现TPW提升,商汤大装置提出了算电协同Agent,通过数据贯通、任务调度和算电协同三个层面进行系统级优化。首先,构建八级数据穿透体系,打通任务、算力资源与物理用电之间的映射关系,使每一度电与每一个算力任务精准对应。商汤大装置智算中心运维总监张煦介绍,在临港AIDC监控大屏上,任务实时功耗、节点GPU利用率、机柜及楼层负荷、楼栋IT功率与进线侧用电数据均纳入同一条观测链路,实现每一度电的去向和产出可追溯。
其次,根据任务时效要求进行智能调度。在线推理等实时业务即时响应,而训练、评测、批处理等任务则利用分钟、小时乃至跨日的调节空间,自动安排到低电价、低负荷时段运行,在保障服务质量的同时提升整体资源利用率。这种优化不减少总用电量,而是通过优化时序让同样的容量和电量产出更多有效Token。
最后,结合容量挖潜、储能调度和电网需求响应,实现算力与能源的动态协同。实测数据显示,在既有供电条件下,IT有效承载能力可提升约60%,这一提升并非来自新增供电容量,而是通过系统级协同实现。
商汤临港AIDC已对这套方法论进行了规模化验证。在今年7月10日上海市迎峰度夏电力需求响应中,临港AIDC率先启动算电协同调度模式,午间常规用电负荷削减75%,可调负荷规模达23MW,通过非关键任务暂停、基础设施降耗、储能放电等措施,在两小时内向电网释放了4.6万度削峰电量。这表明AIDC与电网的关系正在改变,智算中心从刚性负荷转变为可运营、可调度的弹性资产。
算电协同Agent作为TPW落地的智能调度系统,依托八级数据穿透体系、五大智能决策链和六大运营能力,实现从感知、预测、决策、执行到度量的闭环。目前,该Agent已全面应用于商汤临港AIDC,实现单位电力成本Token产出提升80%、平均电费单价低于同地区IDC约10%、算力负荷预测准确率达到96%。张煦表示,算电协同Agent采用平台化、模块化设计,并依托FDE(Field Domain Expert)专家体系形成标准化交付流程,新场景最快一周即可完成部署上线。
对于国家算力枢纽节点、万卡级智算中心等大型AI基础设施,算电协同Agent能够统一调度算力、能源与储能资源,提升集群整体算效,优化绿电消纳和综合用能成本。对于算力运营商、AI云服务商以及Token工厂,系统可结合电价预测、负载优化与算力调度,实现单位Token电力成本持续下降。对于企业级智算中心、科研机构以及行业AI平台,客户无需重构现有基础设施即可快速部署算电协同能力。
林海认为,从PUE到TPW,变化的不只是评价指标,更是AI基础设施的运行方式。未来,算电协同将不再只是智算中心的节能手段,而是连接算力、能源与业务的核心能力。商汤大装置希望通过算电协同Agent,让系统优化能力实现标准化、产品化和规模化复制,推动AI基础设施进入系统级算效时代。