在 Hot Chips 2026 大會上,英特爾公佈了其面向智慧體 AI 推理的資料中心 GPU Crescent Island。這款晶片定位為350W 風冷 PCIe 卡,標配 160GB LPDDR5X 記憶體,但設計上允許 ODM 合作伙伴打造最高 480GB 記憶體的定製版本,並支援從 FP4FP64 的多種資料型別。英特爾首席企業 AI 系統架構師 Sumit Mohan 與英特爾院士 Hong Jiang 在演講中闡述了該產品以“每瓦 token 數”為核心的設計理念。

Crescent Island 是英特爾加速器產品線中的企業級資料中心方案,與面向本地智慧體計算機、AI 工作站的產品(如 Arc Pro GPU 和 SambaNova SN50 RDU)形成互補。英特爾展示的路線圖顯示,該架構並非第一代產品,而是其六年多來 GPU 架構演進的延續。

在計算架構上,Crescent Island 採用第三代 Xe 矩陣擴充套件(XMX) 引擎,配備 32 個 Xe 核心256 個 XMX 引擎,並採用 16 層脈動陣列設計,支援 FP4 精度協同釋出和 FP64 運算。與上一代 Xe2 架構(20 個 Xe 核心、4 層脈動陣列)相比,Crescent Island 在核心數和陣列深度上均有顯著提升,每個 Xe 核心擁有 1MB 通用暫存器檔案和 512KB L1 快取,並配備 32MB 統一 L2 快取

記憶體與資料移動是這款晶片的設計重點。SoC 整合媒體引擎(含四個解碼器和四個編碼器),並針對長上下文和壓縮域併發會話優化了 KV 快取容量。晶片通過 PCIe Gen5 x16 介面連線,並支援開放交換結構進行擴充套件。英特爾還強調了其功耗管理特性:在 G0 狀態主動空閒功耗不超過 50W,在 G8 低功耗狀態可降至約 10W,這得益於可配置分散式電源、基於資料包的 NoC 路由器以及激進的門控時鐘技術。

可靠性方面,Crescent Island 在關鍵記憶體上提供 ECC 和奇偶校驗,對內部 IP 結構的每一跳進行錯誤檢查,支援動態頁面下線、封裝後修復以及 PCIe 高階錯誤報告,旨在減少靜默資料損壞。這與輝達在 Hot Chips 上強調的 Vera Rubin NVL72 機架可靠性形成呼應。

軟體生態上,英特爾表示 Crescent Island 支援 vLLMSGLangllm-d 以及 NVIDIA Dynamo,使智慧體能夠在異構基礎設施上無需修改程式碼即可執行。英特爾對比了 160GB 記憶體與 96GB GPU(可能指輝達 RTX Pro 6000 Server),認為前者能在單卡上容納 FP8 權重和 KV 快取,從而支援更長上下文和更大模型,減少所需 GPU 數量。

英特爾還展示了智慧體推理中記憶體容量與頻寬“脫鉤”的趨勢:從 Llama 2 70B 到 Kimi K2 1T,權重規模增長約 7 倍,而每個 token 讀取的位元組數下降約 4 倍,這為 LPDDR5X 的高密度和 PCIe Gen5 交換擴充套件提供了發揮空間。此外,針對前沿混合專家模型,英特爾測得每次驗證通過可產生 2.9 至 4.9 個 token(使用 8-token 草稿樹),並主張利用投機解碼來填補自迴歸解碼中的計算空閒。

Crescent Island 的釋出表明,英特爾正試圖在智慧體 AI 推理這一快速增長的市場中,以記憶體容量和能效為差異化賣點,與輝達等競爭對手展開競爭。其開放軟體棧支援策略,也可能吸引希望避免供應商鎖定的企業使用者。不過,該產品能否在效能與生態上獲得市場認可,仍有待觀察。