在 2026 年 Hot Chips 大會上,Cerebras 公司展示了其新一代機架級系統 CS-4,以及內建的 WSE-3T 晶圓級引擎。這是 Cerebras 首次推出專用的機架級系統,旨在將多個晶圓級引擎整合到一個單一擴充套件域中,從而在效能上與其他新興技術競爭。CS-4 的核心是 WSE-3T,其時脈頻率較上一代 WSE-3 翻倍,效能隨之大幅提升。

CS-4 機架內集成了三個 WSE-3T 引擎,據 Cerebras 介紹,這使其在吞吐量和頻寬等指標上實現了 6 倍的紙面提升。與上一代 CS-3 相比,CS-4 的 token 處理速度提升 2 倍,每瓦 token 數提升 10 倍,推理速度可達 GPU 的 30 倍。這些數字凸顯了 Cerebras 在推理效能上的野心,尤其是在記憶體頻寬方面,WSE-3T 依靠片上 SRAM 提供了高達 43,000 TB/秒的記憶體頻寬。

CS-4 基於 Cerebras 自主研發的 Nexus 平台,該平台將成為未來幾年公司系統的硬體骨幹。Nexus 的設計採用前後分離結構:電源從系統前部接入,而計算模組以可插拔的“背包”形式安裝在後部。每個背包不僅提供 I/O 連線,還負責電源和冷卻。與 CS-3 相比,CS-4 的背包提供了兩倍的電源和冷卻能力,同時元件數量減少了 50%。

在電源分配方面,Cerebras 強調了其垂直設計的優勢,使得 DC-DC 轉換器能夠非常靠近母線,從而減少電阻損耗。每個電源單元由 30A 斷路器保護,支援高達 277V 的交流輸入,每個背包最多可安裝 30 個電源模組。電源從機架頂部饋入,交流配電系統實現了完全相位平衡。

在互聯方面,Cerebras 的設計減少了線纜需求。每個晶圓內部通過 53PB/秒的內部結構在處理單元之間路由資料,而背包之間的直接晶圓連結使得晶圓間延遲低至 2 微秒,每個晶圓的聚合頻寬為 2.4Tb/秒。這種設計不僅簡化了部署,也降低了功耗和故障點。

Cerebras 還展示了 CS-4 在執行大型前沿模型方面的能力。CS-3 已經能夠執行全球最大的前沿模型,而 CS-4 將支援更大的模型。此外,Cerebras 正在推進將 WSE 與 GPU 機架配對,以發揮兩種加速器的優勢,特別是利用 WSE 的高解碼效能。目前,Cerebras 已計劃將 WSE 與 AMD 即將推出的 Instinct MI455X 加速器配對。

總體而言,CS-4 代表了 Cerebras 向機架級系統邁進的關鍵一步,旨在通過更高的效能和能效,在 AI 推理市場與 GPU 競爭。其與 AMD 的合作也表明,異構計算可能成為未來 AI 基礎設施的重要方向。