今年早些时候,亚马逊云服务(AWS)向其工程师下达了一项新指令:不惜一切代价节省 CPU 周期。据报道,由于 AI 工作负载给云基础设施带来压力,AWS 的 CPU 服务器容量等待时间急剧增加,这一情况似乎令 AWS 措手不及。
此前,AI 热潮主要推动了对 GPU 和内存的需求,CPU 因并行处理能力相对不足,被认为不适合 AI 模型推理,因而被边缘化。然而,AI 代理(agentic AI)系统的兴起正在改变这一局面。这类系统允许 AI 模型自主运行并调用子代理,从而大幅增加了对 CPU 的需求。
市场研究机构 Moor Insights & Strategy 的数据中心分析师 Matt Kimball 表示,2026 年 CPU 需求出现激增,其中很大一部分源于 AI 代理。“一个代理工作负载可能产生 100 个代理,如果推广到整个企业,这些代理可能变成数万、数十万甚至数百万个,”Kimball 说,“代理会生成子代理,进行 API 调用,并通过 Anthropic 的模型上下文协议与其他代理通信。”
AI 代理需要使用计算机,而计算机需要 CPU。Kimball 提到的“工具使用”指的是大语言模型(LLM)访问互联网、打开桌面文件以及使用各种软件来完成任务的能力。虽然 LLM 的推理主要在 GPU 或类似的 AI 加速器上执行,但 LLM 发出的工具调用通常由 CPU 处理。
英特尔高级研究员 Souvik Kundu 解释说:“AI 代理任务的许多组成部分本质上是 CPU 密集型工作。CPU 负责解析输出、决定调用哪个工具、进行 API 调用或运行代码、收集结果并反馈。”AMD 计算与企业 AI 副总裁 Madhu Rangarajan 也持类似观点,称“在我们的测试中,现实代理 AI 管道的八个阶段中有七个完全在 CPU 上运行。”
例如,一个负责编程的 LLM 可能会调用工具来写入文件、移动或替换文件、下载所需软件包,并在认为任务完成后构建软件。Kundu 与佐治亚理工学院的研究人员合著了一篇关于代理 AI 优化的论文,他们发现当 LLM 推理在 GPU 上执行时,CPU 常常处于空闲状态;反之,当工具调用在 CPU 上执行时,GPU 又常常闲置。为此,他们提出了调度优化方案,在持续负载下可将端到端延迟(代理工作负载从开始到结束的时间)缩短最多 1.8 倍。
然而,这些优化可能只是追赶一个不断变化的目标。代理系统以机器速度生成工作并不断倍增。OpenAI 曾无意中入侵 Hugging Face,其模型在一小时内触发了多达 300 个动作,而单个代理可以生成子代理,子代理又会进行自己的工具调用。此外,随着模型变得更加复杂,安全护栏可能会进一步增加 CPU 的工作负载。Kundu 表示,对代理行为的安全和政策检查通常是检查语法和日志文件的特定规则,护栏也可能使用小模型(参数少于 10 亿)来分析任务复杂性或意图。这些检查虽然可以在 GPU 上执行,但通常不会,因为其规模小且需要最小化延迟,因此工作仍留在 CPU 上。
佐治亚理工学院的博士生 Euijun Chung 与他人合著了另一篇论文,其发现与 Kundu 的研究互补。Chung 及其合著者发现,当服务器的 CPU 核心过少时,它向 GPU 分配工作的速度会落后,导致 GPU 因等待指令而停滞。此外,论文还涉及 LLM 工作负载的另一个关键要素:分词(tokenization)。分词是 LLM 推理的关键第一步,它将文本转换为可由模型处理的整数 token ID。与 LLM 推理所需的大部分矩阵运算不同,分词是分支性的、依赖数据的顺序字符串操作,虽然可以通过分块文本来并行化,但其并行程度远不及 LLM 推理的主体部分。
对于小型提示词,分词是相对简单的任务,不会给入门级 CPU 带来负担。然而,进行工具调用的代理模型必须解析并分词调用结果。“如果你有一个持续序列,比如 10 万个 token,而工具结果有 1000 个 token,分词器将不得不再次对整个序列进行分词,而且每次代理工具调用都必须进行分词,”Chung 说。这既增加了分词的频率,也增加了涉及的 token 数量。Chung 表示,未来的分词器可能会找到缓解这一问题的方法,但这在当前的 LLM 推理中仍然是一个问题。
论文发现,随着序列长度的增长,首 token 延迟(模型产生第一个回复词所需的时间)会急剧增加,而增加 CPU 核心数可以缓解这一问题。在较长序列长度的测试中,增加 CPU 核心数可将首 token 延迟减少约 1.5 倍至 7 倍。Chung 及其同事仅能测试较小的模型,如阿里巴巴的 Qwen 3-30B 和 Meta 的 Llama 3.1-70B,这受限于测试硬件的条件。
CPU 需求的回升对云服务商和芯片制造商都意味着新的挑战与机遇。对于 AWS 等云厂商而言,需要重新评估其基础设施的 CPU 资源配置,以应对代理 AI 带来的额外负载。对于英特尔、AMD 等 CPU 供应商,这可能是扩大市场份额的契机。同时,这也提醒投资者,AI 基础设施的投资焦点可能不再仅限于 GPU,CPU 的性能和供应也将成为影响 AI 应用体验和成本的关键因素。