英伟达副总裁 Ian Buck 在近期一场技术演讲中,系统阐述了智能体 AI 时代算力基础设施的演进方向,并首次详细披露了下一代平台 Vera Rubin 的设计思路。他的核心判断是:AI 工厂的降本逻辑已经发生根本性重构,单纯压低硬件单价不再是有效路径。
Ian Buck 指出,降低词元成本最有效的方式并非降低 GPU 售价或采用低成本网络,而是每一代都交付大幅提升的算力性能。他给出的量化逻辑是:如果将节点或机架的性能提升 10 倍到 30 倍,这种提升会直接作用于成本公式的分子,从而降低整个数据中心每个词元的成本。这一观点直接挑战了传统 IT 采购中通过压低硬件单价来控制成本的习惯。在 AI 工厂时代,算力性能呈指数级跃升,对总拥有成本(TCO)的拉动作用远超芯片单价的微调。
工作负载的范式转变是另一条主线。Ian Buck 回顾,2023 年突破性的 Chat 基准测试大约只有 1K 输入词元,KV Cache 规模约 4K,用户以平均约三轮对话的方式交互,属于典型的人机回环模式。而智能体 AI 彻底改变了这一格局。在 AgentX 基准测试中,平均输入规模达到 142000 个词元,KV Cache 规模因模型支持多达 100 万词元而变得异常庞大,交互轮数也呈爆发式增长。他特别强调,智能体让人类退出了交互循环,计算资源消耗速度完全取决于智能体自我转折与思考的速度。在 AgentX 基准测试中,算力需求在纯数值层面直接提升了 100 倍。
这一变化对软件优化提出了极高要求。Ian Buck 解释,过去服务设计者可以依赖人类阅读和打字所需的时间间隙来调度算力,而现在智能体自我提问和转折极快,系统必须支持从 1K 到 200K 甚至更长的动态输入长度,每一种长度都需要全新的算子内核优化与调优。同时,KV Cache 需要在数据中心范围内统一管理,模型还必须做出决策并调用成千上万个不同子智能体,涉及 CPU 调度、Kubernetes 容器管理、推理层、工具调用层以及安全治理层的协同。
Vera Rubin 平台正是为应对这一复杂工作负载而设计。Ian Buck 表示,该平台并非单芯片或单一模型成本优化方案,而是面向整个智能体工作负载的全栈架构。其基础平台 Vera Rubin NVL72 建立在 Grace Blackwell 基础之上,并加入基于 Groq LPU 技术的加速包以提升高价值工作负载性能。同时,英伟达提取了原本连接在 Rubin GPU 上的 CPU,构建了专用的 Vera CPU 机架,采用自主设计的 Olympus 核心,配备 LPDDR 内存子系统,内存延迟比市面上其他方案低 40%,旨在让 188 个核心保持高吞吐量并维持高单线程性能。
在规模化网络层面,Ian Buck 提到解耦推理已成为行业普遍做法,Prefill 与 Decode 阶段分离运行,KV Cache 在存储层通过 BlueField SmartNIC 进行管理、治理与向量检索。他引用刚刚发布的 SemiAnalysis 智能体基准测试结果称,Vera Rubin 在智能体工作负载上实现了 30 倍的 AI 工厂吞吐量提升,根据帕累托曲线位置不同,部分场景性能提升甚至高达 60 倍。
评价指标本身也在转移。Ian Buck 明确表示,对于每一代算力产品,唯一关键的指标是每兆瓦(MW)的总词元吞吐量,而非单芯片 FLOPs 或单卡跑分。提高这一指标就能提升 AI 工厂产生营收的能力。他以 DeepSeek v4 为例说明,用户可能希望思考速率达到每秒 100 个词元以上,甚至提升到每秒 200 至 250 个词元,以便智能体在 65 轮交互中更快给出答案。
在延迟优化方面,Ian Buck 展示了 Groq 技术加持下的测试数据:对于拥有 100K 长上下文的模型,Gemma 4 上可实现每用户每秒 3400 个词元,Qwen 3.8 上可实现每用户每秒 2529 个词元。他强调,上下文越长,模型生成每个新词元所需的检索计算量越大,但这是智能体应用场景的必需能力。
电力约束下的软件挖潜是另一亮点。Ian Buck 介绍,通过软件在机架与固件层面动态管控功耗,确保其永不超出阈值,可以在完全相同的预留电力包络下部署多达 40% 的机架,直接将吞吐量提升至每秒 12 亿词元。这意味着数据中心无需新建或增加电力配额,即可在原有电力包络内提升 GPU 部署密度,打破了按硬件最大峰值功耗预留电力的静态部署模式。
Ian Buck 还回顾了英伟达平台的历史延续性。他提到,在 NVIDIA 工作近 26 年,CUDA 平台已积累超过 8000 个主要应用,全球可追踪到超过 1000 万名开发者在 NVIDIA GPU 上开发,Hugging Face 上已有超过 300 万个模型,其中约 3000 个模型占据了约 90% 的下载量。他特别指出,COVID 初期发布的 A100 的每小时实例租用价格随时间推移不降反升,需求依然强劲,这体现了平台的长久耐用性。
从产业视角看,Ian Buck 的演讲传递出几个关键信号。其一,AI 基础设施的竞争焦点正从单点算力转向系统级效率,每兆瓦词元吞吐量成为核心 KPI,这意味着电力供应、网络带宽、存储管理和 CPU 协同能力将共同决定 AI 工厂的经济性。其二,智能体工作负载的复杂性远超传统推理,软件优化与全栈协同设计的价值被显著放大。其三,在电力供应日益受限的背景下,通过软件定义电力技术挖掘存量产能,可能成为数据中心运营商在不新增资本开支情况下提升产出的重要手段。这些方向对理解英伟达下一代产品路线图及整个 AI 算力产业链的演进具有参考价值。