AMD 與 Cerebras Systems 在 Advancing AI 2026 大會上宣佈了一項技術合作,共同推出一種解耦式 AI 推理平台。該方案將 AMD 的 Helios 機架級解決方案與 Cerebras 的 晶圓級引擎(Wafer-Scale Engine) 整合到單一推理工作流中,旨在同時滿足高吞吐與超低延遲需求。
AI 推理工作負載正變得越來越多樣化:高吞吐場景(如大規模內容生成)追求最大化令牌輸出,而編碼輔助、即時 AI 助手、自主代理等應用則要求極快的響應時間。這種分化推動了對異構基礎設施的需求——即用不同的計算技術匹配不同的工作負載。AMD 與 Cerebras 的聯合方案正是針對這一挑戰,通過解耦推理架構,將推理過程的兩大階段——提示處理與令牌生成——分別交由最適合的引擎處理。
具體而言,AMD Helios 負責高吞吐的提示處理與大型上下文視窗,提供機架級的可擴充套件效率;Cerebras 晶圓級引擎則專注於記憶體頻寬密集型的令牌生成階段,以超低延遲加速解碼。兩家公司表示,將這兩個引擎通過統一工作流連線,預計可實現每瓦每秒令牌數(T/s/W)提升高達 5 倍,同時不犧牲吞吐量或規模。
AMD CEO 蘇姿豐 表示,AI 推理正成為 AI 領域最大的基礎設施機遇之一,其多樣性要求更靈活的方法;AMD Helios 已為廣泛推理負載提供領先效能與規模,與 Cerebras 的合作將把這一領先優勢拓展到最延遲敏感的應用中,為即時代理式 AI 創造強大平台。Cerebras CEO Andrew Feldman 則指出,超快推理需求正以前所未有的速度增長,Cerebras 提供全球最快、超低延遲的推理能力,與 AMD 合作可將這一效能帶給更多客戶。
隨著 AI 進入軟體開發、自主代理、機器人、科學發現等領域,快速令牌生成的重要性日益凸顯——響應時間直接影響使用者體驗與系統實用性。該聯合方案正是為推理市場的超低延遲細分領域量身打造,以 AMD Helios 作為資料中心高吞吐與均衡推理負載的基礎。
Cerebras 計劃在其資料中心內部署 AMD Helios 系統,聯合方案預計於 2026 年下半年 通過 Cerebras Cloud 率先提供。兩家公司均未透露具體定價或客戶部署細節,但此舉標誌著 AI 推理基礎設施從單一晶片競爭走向異構系統級整合的新階段。