AI Agent的爆發式普及正在引發一場意想不到的算力危機——不是GPU,而是CPU。據科技媒體The Information 8月7日報道,亞馬遜雲服務(AWS)高管今年5月召集工程師開會,傳達警示性訊號:為確保EC2雲伺服器業務未來能滿足所有客戶需求,工程師必須盡一切可能節省算力資源,這一要求不僅涵蓋AI晶片,也明確指向傳統CPU伺服器。
這一內部動作折射出更廣泛的行業趨勢:隨著越來越多企業員工藉助AI Agent開發軟體,CPU需求急劇攀升,算力緊缺壓力已從GPU蔓延至整個計算基礎設施。AI諮詢機構Elendil Labs聯合創始人兼董事總經理Jing Xie表示,他觀察到客戶的人均IT支出翻倍,直接原因正是AI Agent的大規模使用。
內部告急的訊號十分明顯。知情人士透露,AWS已向各團隊設定截止期限,要求在今年晚些時候削減計算資源佔用。工程師們正在下線此前用於軟體開發、如今已閒置的EC2虛擬伺服器例項,以便將算力重新分配給外部客戶。一名在AWS工作數年的工程師表示,過去只需數小時便能獲取的CPU伺服器資源,如今需要等待數天,這在其職業生涯中從未遇到過,並直言這種等待可能影響專案交付進度。
AWS方面對此回應稱,即便面臨“大量需求”,公司仍能滿足“絕大多數內外部客戶的計算需求”,並強調正與內部團隊密切協作,確保EC2資源得到高效利用,“一如既往”。AWS同時表示,其給予員工的指導方針並未因當前的記憶體緊缺而發生改變。不過,外部客戶所受影響相對有限。一位協助企業使用AWS的顧問表示,他尚未觀察到客戶通過合同承諾的CPU算力出現運營層面的短缺。然而,AWS的“競價例項”(Spot Instances)——即AWS以大幅折扣出售、但可在兩分鐘內收回的溢位伺服器資源——近幾個月來已愈發難以大批次獲取。分析認為,這一訊號表明,AWS整體算力的供需缺口正在收窄,彈性空間已大幅壓縮。對於依賴低成本競價例項執行大規模工作負載的企業客戶而言,這或許預示著雲端計算成本上行壓力的到來。
此次CPU短缺的核心驅動力,是Agentic AI的快速普及。Jing Xie指出,AI Agent在執行過程中通常需要呼叫更多雲計算資源,並由此產生對CPU的持續性需求。“基本上,現在構建、生產和執行的大量工作,所需的CPU都比過去更多。”即便在AI開發流程內部,CPU同樣扮演著不可或缺的角色——例如,AI公司在為模型訓練準備資料時,需要通過CPU從文件、影像和影片中讀取原始資料。
晶片廠商的表態進一步印證了這一趨勢。英特爾CEO Lip-Bu Tan在今年4月的財報電話會議上披露,AI推理(即模型執行)中CPU與GPU的使用比例為1比4;而到7月,英特爾首席財務官David Zinsner表示這一比例已接近1比1。AMD和Arm的高管也發表了類似評論。除CPU本身外,與CPU配套使用的記憶體晶片供應不足,以及資料中心物理空間的限制,也在共同加劇這場算力緊缺。
算力的內外部分配平衡,已成為大型科技公司近兩年面臨的共同挑戰。據The Information此前報道,谷歌去年專門成立了一個由高階管理人員組成的委員會,負責在Google Cloud、DeepMind AI研究部門及消費者業務之間協調算力分配。即便如此,內部摩擦依然存在——谷歌明星AI研究員Noam Shazeer今年夏天早些時候因對算力獲取感到不滿而離職。
微軟的經驗則展示了另一面:算力管理效率的提升可以直接轉化為營收增長。微軟首席財務官Amy Hood在上月的財報電話會議上將Azure雲服務的部分增長歸因於CPU和GPU機群管理上的“效率提升”。“當我們能夠實現效率提升時,這些收益會被迅速貨幣化。”
這場由AI Agent引發的CPU短缺,正在重塑雲端計算行業的供需格局。對依賴雲算力的企業而言,競價例項的稀缺可能意味著成本上升;而對雲服務商而言,如何在內部研發與外部客戶之間平衡算力分配,將成為決定競爭力的關鍵。隨著AI Agent滲透率持續提升,CPU作為計算基礎設施的瓶頸效應或將進一步顯現。