在 Hot Chips 2026 大会上,英特尔公布了其面向智能体 AI 推理的数据中心 GPU Crescent Island。这款芯片定位为350W 风冷 PCIe 卡,标配 160GB LPDDR5X 内存,但设计上允许 ODM 合作伙伴打造最高 480GB 内存的定制版本,并支持从 FP4 到 FP64 的多种数据类型。英特尔首席企业 AI 系统架构师 Sumit Mohan 与英特尔院士 Hong Jiang 在演讲中阐述了该产品以“每瓦 token 数”为核心的设计理念。
Crescent Island 是英特尔加速器产品线中的企业级数据中心方案,与面向本地智能体计算机、AI 工作站的产品(如 Arc Pro GPU 和 SambaNova SN50 RDU)形成互补。英特尔展示的路线图显示,该架构并非第一代产品,而是其六年多来 GPU 架构演进的延续。
在计算架构上,Crescent Island 采用第三代 Xe 矩阵扩展(XMX) 引擎,配备 32 个 Xe 核心和 256 个 XMX 引擎,并采用 16 层脉动阵列设计,支持 FP4 精度协同发布和 FP64 运算。与上一代 Xe2 架构(20 个 Xe 核心、4 层脉动阵列)相比,Crescent Island 在核心数和阵列深度上均有显著提升,每个 Xe 核心拥有 1MB 通用寄存器文件和 512KB L1 缓存,并配备 32MB 统一 L2 缓存。
内存与数据移动是这款芯片的设计重点。SoC 集成媒体引擎(含四个解码器和四个编码器),并针对长上下文和压缩域并发会话优化了 KV 缓存容量。芯片通过 PCIe Gen5 x16 接口连接,并支持开放交换结构进行扩展。英特尔还强调了其功耗管理特性:在 G0 状态主动空闲功耗不超过 50W,在 G8 低功耗状态可降至约 10W,这得益于可配置分布式电源、基于数据包的 NoC 路由器以及激进的门控时钟技术。
可靠性方面,Crescent Island 在关键内存上提供 ECC 和奇偶校验,对内部 IP 结构的每一跳进行错误检查,支持动态页面下线、封装后修复以及 PCIe 高级错误报告,旨在减少静默数据损坏。这与英伟达在 Hot Chips 上强调的 Vera Rubin NVL72 机架可靠性形成呼应。
软件生态上,英特尔表示 Crescent Island 支持 vLLM、SGLang、llm-d 以及 NVIDIA Dynamo,使智能体能够在异构基础设施上无需修改代码即可运行。英特尔对比了 160GB 内存与 96GB GPU(可能指英伟达 RTX Pro 6000 Server),认为前者能在单卡上容纳 FP8 权重和 KV 缓存,从而支持更长上下文和更大模型,减少所需 GPU 数量。
英特尔还展示了智能体推理中内存容量与带宽“脱钩”的趋势:从 Llama 2 70B 到 Kimi K2 1T,权重规模增长约 7 倍,而每个 token 读取的字节数下降约 4 倍,这为 LPDDR5X 的高密度和 PCIe Gen5 交换扩展提供了发挥空间。此外,针对前沿混合专家模型,英特尔测得每次验证通过可产生 2.9 至 4.9 个 token(使用 8-token 草稿树),并主张利用投机解码来填补自回归解码中的计算空闲。
Crescent Island 的发布表明,英特尔正试图在智能体 AI 推理这一快速增长的市场中,以内存容量和能效为差异化卖点,与英伟达等竞争对手展开竞争。其开放软件栈支持策略,也可能吸引希望避免供应商锁定的企业用户。不过,该产品能否在性能与生态上获得市场认可,仍有待观察。