英伟达超大规模与高性能计算副总裁Ian BuckAI Infra Summit上发表演讲,聚焦AI工厂的能效问题。这场在圣克拉拉会议中心举办的活动今年吸引了超过8000名参会者,较去年的3500人大幅增长,已成为基础设施技术领域的重要聚会。Buck在会上介绍了英伟达平台上的多项新合作与成果。

在硬件生态方面,亚马逊旗下Annapurna Labs正与英伟达合作开发NVHBM定制高带宽内存技术;d-Matrix则将NVLink Fusion平台与其Raptor XPU进行集成。这些合作指向同一个方向:让AI工厂的各个组件更紧密地协同,以提升整体效率。

英伟达与合作伙伴还公布了一系列实测结果。Emerald AI与英伟达合作,联合硅谷电力(Silicon Valley Power)展示了商用AI工厂柔性负载项目。该系统成功响应了来自硅谷电力的数百次需求信号,同时保护了AI工作负载的性能。Emerald AI计划将NVIDIA DSX Flex用于其Conductor电网响应式电源管理软件,该软件能根据实时电网信号和混合能源动态调整AI工厂的能耗。通过DSX Flex的自主负载均衡能力,Emerald AI可以自动降低低优先级AI任务的功率,随后恢复正常运行。DSX Flex能够接收电网信号——包括减载请求、需求响应事件和价格信号——并在预设的工作负载层级内自动执行。最关键的任务持续运行,其余任务则暂时暂停后恢复。这一能力使AI工厂可以作为灵活的电网资源运行,在电网需要缓解时降低需求,同时保护优先AI工作负载。

AI云服务商Lambda公布了NVIDIA DSX MaxLPSNVIDIA Blackwell服务器上的首次验证结果。DSX MaxLPS持续监控GPU和机架的功耗,动态将可用电力转移到最需要的地方,并回收静态配置下未被使用的容量。由于训练和推理工作负载的功耗特征不同,MaxLPS能够优化混合工作负载AI工厂的电力分配。结果显示:Lambda在通常分配给16个满功率节点的电力预算内运行了19个节点,集群整体token吞吐量提升24%,从约每秒400万token增至每秒500万token,同时每瓦性能提升23%。对于下一代NVIDIA Vera Rubin NVL72 AI工厂,在合适的部署环境中,DSX MaxLPS可在相同的兆瓦预算内实现最多40%的GPU容量提升。这意味着AI工厂运营商可以在相同的电力包络内增加AI容量和token吞吐量,从而最大化每兆瓦的生产力和经济价值。

英伟达还介绍了Vera Rubin平台与Groq 3 LPX的组合方案。在AI工厂中,电力是核心约束,每瓦特都至关重要,因此从每兆瓦中榨取更多token成为AI基础设施的关键。英伟达通过基于Vera Rubin NVL72的全栈AI工厂来实现这一点——系统、网络、软件和电源管理协同工作。在工厂层面,DSX MaxLPS随需求升降动态调整机架间的电力分配,效果显著:在相同的站点电力包络内可增加最多40%的GPU,token吞吐量提升最多35%,且无需新增电力线路。在机架内部,智能功率平滑软件和扩展的能量缓冲吸收短时峰值,让系统更接近持续需求运行,将闲置余量转化为有效算力。

对于代理式AI(agentic AI)——智能体需要串联推理步骤和工具调用——延迟和上下文长度会迅速累积。这正是NVIDIA Groq 3 LPX的用武之地,它为Vera Rubin增添确定性的超低延迟推理能力,并与DSX MaxLPS形成互补。英伟达表示,该组合平台在2万亿参数以上模型上,每兆瓦token吞吐量比GB200 NVL72高出最多35倍

从更广的视角看,AI基础设施的衡量标准正从峰值性能快速转向「每兆瓦有效代理式token数」。AI工厂必须从芯片到电网进行协同设计。英伟达的全栈AI工厂平台涵盖Vera Rubin系统、Dynamo推理软件、NeMo库以及网络组件——包括用于纵向扩展计算的NVLink、用于连接数千节点的Spectrum-X以太网和ConnectX SuperNIC、由BlueField驱动的上下文内存存储以及用于基础设施安全的BlueField DPU。这一整套方案的目标是让AI基础设施生成更多token、提升效率,并帮助客户从每兆瓦电力中获得更多价值。