在 2026 年 Hot Chips 大会上,Cerebras 公司展示了其新一代机架级系统 CS-4,以及内置的 WSE-3T 晶圆级引擎。这是 Cerebras 首次推出专用的机架级系统,旨在将多个晶圆级引擎整合到一个单一扩展域中,从而在性能上与其他新兴技术竞争。CS-4 的核心是 WSE-3T,其时钟频率较上一代 WSE-3 翻倍,性能随之大幅提升。

CS-4 机架内集成了三个 WSE-3T 引擎,据 Cerebras 介绍,这使其在吞吐量和带宽等指标上实现了 6 倍的纸面提升。与上一代 CS-3 相比,CS-4 的 token 处理速度提升 2 倍,每瓦 token 数提升 10 倍,推理速度可达 GPU 的 30 倍。这些数字凸显了 Cerebras 在推理性能上的野心,尤其是在内存带宽方面,WSE-3T 依靠片上 SRAM 提供了高达 43,000 TB/秒的内存带宽。

CS-4 基于 Cerebras 自主研发的 Nexus 平台,该平台将成为未来几年公司系统的硬件骨干。Nexus 的设计采用前后分离结构:电源从系统前部接入,而计算模块以可插拔的“背包”形式安装在后部。每个背包不仅提供 I/O 连接,还负责电源和冷却。与 CS-3 相比,CS-4 的背包提供了两倍的电源和冷却能力,同时组件数量减少了 50%。

在电源分配方面,Cerebras 强调了其垂直设计的优势,使得 DC-DC 转换器能够非常靠近母线,从而减少电阻损耗。每个电源单元由 30A 断路器保护,支持高达 277V 的交流输入,每个背包最多可安装 30 个电源模块。电源从机架顶部馈入,交流配电系统实现了完全相位平衡。

在互联方面,Cerebras 的设计减少了线缆需求。每个晶圆内部通过 53PB/秒的内部结构在处理单元之间路由数据,而背包之间的直接晶圆链接使得晶圆间延迟低至 2 微秒,每个晶圆的聚合带宽为 2.4Tb/秒。这种设计不仅简化了部署,也降低了功耗和故障点。

Cerebras 还展示了 CS-4 在运行大型前沿模型方面的能力。CS-3 已经能够运行全球最大的前沿模型,而 CS-4 将支持更大的模型。此外,Cerebras 正在推进将 WSE 与 GPU 机架配对,以发挥两种加速器的优势,特别是利用 WSE 的高解码性能。目前,Cerebras 已计划将 WSE 与 AMD 即将推出的 Instinct MI455X 加速器配对。

总体而言,CS-4 代表了 Cerebras 向机架级系统迈进的关键一步,旨在通过更高的性能和能效,在 AI 推理市场与 GPU 竞争。其与 AMD 的合作也表明,异构计算可能成为未来 AI 基础设施的重要方向。