AMD 与 Cerebras Systems 在 Advancing AI 2026 大会上宣布了一项技术合作,共同推出一种解耦式 AI 推理平台。该方案将 AMD 的 Helios 机架级解决方案与 Cerebras 的 晶圆级引擎(Wafer-Scale Engine) 整合到单一推理工作流中,旨在同时满足高吞吐与超低延迟需求。

AI 推理工作负载正变得越来越多样化:高吞吐场景(如大规模内容生成)追求最大化令牌输出,而编码辅助、实时 AI 助手、自主代理等应用则要求极快的响应时间。这种分化推动了对异构基础设施的需求——即用不同的计算技术匹配不同的工作负载。AMD 与 Cerebras 的联合方案正是针对这一挑战,通过解耦推理架构,将推理过程的两大阶段——提示处理与令牌生成——分别交由最适合的引擎处理。

具体而言,AMD Helios 负责高吞吐的提示处理与大型上下文窗口,提供机架级的可扩展效率;Cerebras 晶圆级引擎则专注于内存带宽密集型的令牌生成阶段,以超低延迟加速解码。两家公司表示,将这两个引擎通过统一工作流连接,预计可实现每瓦每秒令牌数(T/s/W)提升高达 5 倍,同时不牺牲吞吐量或规模。

AMD CEO 苏姿丰 表示,AI 推理正成为 AI 领域最大的基础设施机遇之一,其多样性要求更灵活的方法;AMD Helios 已为广泛推理负载提供领先性能与规模,与 Cerebras 的合作将把这一领先优势拓展到最延迟敏感的应用中,为实时代理式 AI 创造强大平台。Cerebras CEO Andrew Feldman 则指出,超快推理需求正以前所未有的速度增长,Cerebras 提供全球最快、超低延迟的推理能力,与 AMD 合作可将这一性能带给更多客户。

随着 AI 进入软件开发、自主代理、机器人、科学发现等领域,快速令牌生成的重要性日益凸显——响应时间直接影响用户体验与系统实用性。该联合方案正是为推理市场的超低延迟细分领域量身打造,以 AMD Helios 作为数据中心高吞吐与均衡推理负载的基础。

Cerebras 计划在其数据中心内部署 AMD Helios 系统,联合方案预计于 2026 年下半年 通过 Cerebras Cloud 率先提供。两家公司均未透露具体定价或客户部署细节,但此举标志着 AI 推理基础设施从单一芯片竞争走向异构系统级整合的新阶段。