在 Hot Chips 2026 大會上,英特爾公佈了其面向智慧體 AI 推理的資料中心 GPU Crescent Island。這款晶片定位為350W 風冷 PCIe 卡,標配 160GB LPDDR5X 記憶體,但設計上允許 ODM 合作伙伴打造最高 480GB 記憶體的定製版本,並支援從 FP4 到 FP64 的多種資料型別。英特爾首席企業 AI 系統架構師 Sumit Mohan 與英特爾院士 Hong Jiang 在演講中闡述了該產品以“每瓦 token 數”為核心的設計理念。
Crescent Island 是英特爾加速器產品線中的企業級資料中心方案,與面向本地智慧體計算機、AI 工作站的產品(如 Arc Pro GPU 和 SambaNova SN50 RDU)形成互補。英特爾展示的路線圖顯示,該架構並非第一代產品,而是其六年多來 GPU 架構演進的延續。
在計算架構上,Crescent Island 採用第三代 Xe 矩陣擴充套件(XMX) 引擎,配備 32 個 Xe 核心和 256 個 XMX 引擎,並採用 16 層脈動陣列設計,支援 FP4 精度協同釋出和 FP64 運算。與上一代 Xe2 架構(20 個 Xe 核心、4 層脈動陣列)相比,Crescent Island 在核心數和陣列深度上均有顯著提升,每個 Xe 核心擁有 1MB 通用暫存器檔案和 512KB L1 快取,並配備 32MB 統一 L2 快取。
記憶體與資料移動是這款晶片的設計重點。SoC 整合媒體引擎(含四個解碼器和四個編碼器),並針對長上下文和壓縮域併發會話優化了 KV 快取容量。晶片通過 PCIe Gen5 x16 介面連線,並支援開放交換結構進行擴充套件。英特爾還強調了其功耗管理特性:在 G0 狀態主動空閒功耗不超過 50W,在 G8 低功耗狀態可降至約 10W,這得益於可配置分散式電源、基於資料包的 NoC 路由器以及激進的門控時鐘技術。
可靠性方面,Crescent Island 在關鍵記憶體上提供 ECC 和奇偶校驗,對內部 IP 結構的每一跳進行錯誤檢查,支援動態頁面下線、封裝後修復以及 PCIe 高階錯誤報告,旨在減少靜默資料損壞。這與輝達在 Hot Chips 上強調的 Vera Rubin NVL72 機架可靠性形成呼應。
軟體生態上,英特爾表示 Crescent Island 支援 vLLM、SGLang、llm-d 以及 NVIDIA Dynamo,使智慧體能夠在異構基礎設施上無需修改程式碼即可執行。英特爾對比了 160GB 記憶體與 96GB GPU(可能指輝達 RTX Pro 6000 Server),認為前者能在單卡上容納 FP8 權重和 KV 快取,從而支援更長上下文和更大模型,減少所需 GPU 數量。
英特爾還展示了智慧體推理中記憶體容量與頻寬“脫鉤”的趨勢:從 Llama 2 70B 到 Kimi K2 1T,權重規模增長約 7 倍,而每個 token 讀取的位元組數下降約 4 倍,這為 LPDDR5X 的高密度和 PCIe Gen5 交換擴充套件提供了發揮空間。此外,針對前沿混合專家模型,英特爾測得每次驗證通過可產生 2.9 至 4.9 個 token(使用 8-token 草稿樹),並主張利用投機解碼來填補自迴歸解碼中的計算空閒。
Crescent Island 的釋出表明,英特爾正試圖在智慧體 AI 推理這一快速增長的市場中,以記憶體容量和能效為差異化賣點,與輝達等競爭對手展開競爭。其開放軟體棧支援策略,也可能吸引希望避免供應商鎖定的企業使用者。不過,該產品能否在效能與生態上獲得市場認可,仍有待觀察。