今年早些時候,亞馬遜雲服務(AWS)向其工程師下達了一項新指令:不惜一切代價節省 CPU 週期。據報道,由於 AI 工作負載給雲基礎設施帶來壓力,AWS 的 CPU 伺服器容量等待時間急劇增加,這一情況似乎令 AWS 措手不及。

此前,AI 熱潮主要推動了對 GPU 和記憶體的需求,CPU 因並行處理能力相對不足,被認為不適合 AI 模型推理,因而被邊緣化。然而,AI 代理(agentic AI)系統的興起正在改變這一局面。這類系統允許 AI 模型自主執行並呼叫子代理,從而大幅增加了對 CPU 的需求。

市場研究機構 Moor Insights & Strategy 的資料中心分析師 Matt Kimball 表示,2026 年 CPU 需求出現激增,其中很大一部分源於 AI 代理。“一個代理工作負載可能產生 100 個代理,如果推廣到整個企業,這些代理可能變成數萬、數十萬甚至數百萬個,”Kimball 說,“代理會生成子代理,進行 API 呼叫,並通過 Anthropic 的模型上下文協議與其他代理通訊。”

AI 代理需要使用計算機,而計算機需要 CPU。Kimball 提到的“工具使用”指的是大語言模型(LLM)訪問網際網路、開啟桌面檔案以及使用各種軟體來完成任務的能力。雖然 LLM 的推理主要在 GPU 或類似的 AI 加速器上執行,但 LLM 發出的工具呼叫通常由 CPU 處理。

英特爾高階研究員 Souvik Kundu 解釋說:“AI 代理任務的許多組成部分本質上是 CPU 密集型工作。CPU 負責解析輸出、決定呼叫哪個工具、進行 API 呼叫或執行程式碼、收集結果並反饋。”AMD 計算與企業 AI 副總裁 Madhu Rangarajan 也持類似觀點,稱“在我們的測試中,現實代理 AI 管道的八個階段中有七個完全在 CPU 上執行。”

例如,一個負責程式設計的 LLM 可能會呼叫工具來寫入檔案、移動或替換檔案、下載所需軟體包,並在認為任務完成後構建軟體。Kundu 與佐治亞理工學院的研究人員合著了一篇關於代理 AI 最佳化的論文,他們發現當 LLM 推理在 GPU 上執行時,CPU 常常處於空閒狀態;反之,當工具呼叫在 CPU 上執行時,GPU 又常常閒置。為此,他們提出了排程最佳化方案,在持續負載下可將端到端延遲(代理工作負載從開始到結束的時間)縮短最多 1.8 倍。

然而,這些最佳化可能只是追趕一個不斷變化的目標。代理系統以機器速度生成工作並不斷倍增。OpenAI 曾無意中入侵 Hugging Face,其模型在一小時內觸發了多達 300 個動作,而單個代理可以生成子代理,子代理又會進行自己的工具呼叫。此外,隨著模型變得更加複雜,安全護欄可能會進一步增加 CPU 的工作負載。Kundu 表示,對代理行為的安全和政策檢查通常是檢查語法和日誌檔案的特定規則,護欄也可能使用小模型(引數少於 10 億)來分析任務複雜性或意圖。這些檢查雖然可以在 GPU 上執行,但通常不會,因為其規模小且需要最小化延遲,因此工作仍留在 CPU 上。

佐治亞理工學院的博士生 Euijun Chung 與他人合著了另一篇論文,其發現與 Kundu 的研究互補。Chung 及其合著者發現,當伺服器的 CPU 核心過少時,它向 GPU 分配工作的速度會落後,導致 GPU 因等待指令而停滯。此外,論文還涉及 LLM 工作負載的另一個關鍵要素:分詞(tokenization)。分詞是 LLM 推理的關鍵第一步,它將文本轉換為可由模型處理的整數 token ID。與 LLM 推理所需的大部分矩陣運算不同,分詞是分支性的、依賴資料的順序字串操作,雖然可以通過分塊文本來並行化,但其並行程度遠不及 LLM 推理的主體部分。

對於小型提示詞,分詞是相對簡單的任務,不會給入門級 CPU 帶來負擔。然而,進行工具呼叫的代理模型必須解析並分詞呼叫結果。“如果你有一個持續序列,比如 10 萬個 token,而工具結果有 1000 個 token,分詞器將不得不再次對整個序列進行分詞,而且每次代理工具呼叫都必須進行分詞,”Chung 說。這既增加了分詞的頻率,也增加了涉及的 token 數量。Chung 表示,未來的分詞器可能會找到緩解這一問題的方法,但這在當前的 LLM 推理中仍然是一個問題。

論文發現,隨著序列長度的增長,首 token 延遲(模型產生第一個回覆詞所需的時間)會急劇增加,而增加 CPU 核心數可以緩解這一問題。在較長序列長度的測試中,增加 CPU 核心數可將首 token 延遲減少約 1.5 倍至 7 倍。Chung 及其同事僅能測試較小的模型,如阿里巴巴的 Qwen 3-30B 和 Meta 的 Llama 3.1-70B,這受限於測試硬體的條件。

CPU 需求的回升對雲服務商和晶片製造商都意味著新的挑戰與機遇。對於 AWS 等雲廠商而言,需要重新評估其基礎設施的 CPU 資源配置,以應對代理 AI 帶來的額外負載。對於英特爾、AMD 等 CPU 供應商,這可能是擴大市場份額的契機。同時,這也提醒投資者,AI 基礎設施的投資焦點可能不再僅限於 GPU,CPU 的效能和供應也將成為影響 AI 應用體驗和成本的關鍵因素。