在 Hot Chips 2026 大会上,英特尔公布了其面向智能体 AI 推理的数据中心 GPU Crescent Island。这款芯片定位为350W 风冷 PCIe 卡,标配 160GB LPDDR5X 内存,但设计上允许 ODM 合作伙伴打造最高 480GB 内存的定制版本,并支持从 FP4FP64 的多种数据类型。英特尔首席企业 AI 系统架构师 Sumit Mohan 与英特尔院士 Hong Jiang 在演讲中阐述了该产品以“每瓦 token 数”为核心的设计理念。

Crescent Island 是英特尔加速器产品线中的企业级数据中心方案,与面向本地智能体计算机、AI 工作站的产品(如 Arc Pro GPU 和 SambaNova SN50 RDU)形成互补。英特尔展示的路线图显示,该架构并非第一代产品,而是其六年多来 GPU 架构演进的延续。

在计算架构上,Crescent Island 采用第三代 Xe 矩阵扩展(XMX) 引擎,配备 32 个 Xe 核心256 个 XMX 引擎,并采用 16 层脉动阵列设计,支持 FP4 精度协同发布和 FP64 运算。与上一代 Xe2 架构(20 个 Xe 核心、4 层脉动阵列)相比,Crescent Island 在核心数和阵列深度上均有显著提升,每个 Xe 核心拥有 1MB 通用寄存器文件和 512KB L1 缓存,并配备 32MB 统一 L2 缓存

内存与数据移动是这款芯片的设计重点。SoC 集成媒体引擎(含四个解码器和四个编码器),并针对长上下文和压缩域并发会话优化了 KV 缓存容量。芯片通过 PCIe Gen5 x16 接口连接,并支持开放交换结构进行扩展。英特尔还强调了其功耗管理特性:在 G0 状态主动空闲功耗不超过 50W,在 G8 低功耗状态可降至约 10W,这得益于可配置分布式电源、基于数据包的 NoC 路由器以及激进的门控时钟技术。

可靠性方面,Crescent Island 在关键内存上提供 ECC 和奇偶校验,对内部 IP 结构的每一跳进行错误检查,支持动态页面下线、封装后修复以及 PCIe 高级错误报告,旨在减少静默数据损坏。这与英伟达在 Hot Chips 上强调的 Vera Rubin NVL72 机架可靠性形成呼应。

软件生态上,英特尔表示 Crescent Island 支持 vLLMSGLangllm-d 以及 NVIDIA Dynamo,使智能体能够在异构基础设施上无需修改代码即可运行。英特尔对比了 160GB 内存与 96GB GPU(可能指英伟达 RTX Pro 6000 Server),认为前者能在单卡上容纳 FP8 权重和 KV 缓存,从而支持更长上下文和更大模型,减少所需 GPU 数量。

英特尔还展示了智能体推理中内存容量与带宽“脱钩”的趋势:从 Llama 2 70B 到 Kimi K2 1T,权重规模增长约 7 倍,而每个 token 读取的字节数下降约 4 倍,这为 LPDDR5X 的高密度和 PCIe Gen5 交换扩展提供了发挥空间。此外,针对前沿混合专家模型,英特尔测得每次验证通过可产生 2.9 至 4.9 个 token(使用 8-token 草稿树),并主张利用投机解码来填补自回归解码中的计算空闲。

Crescent Island 的发布表明,英特尔正试图在智能体 AI 推理这一快速增长的市场中,以内存容量和能效为差异化卖点,与英伟达等竞争对手展开竞争。其开放软件栈支持策略,也可能吸引希望避免供应商锁定的企业用户。不过,该产品能否在性能与生态上获得市场认可,仍有待观察。