英特尔 Crescent Island 数据中心 GPU 亮相 Hot Chips 2026
英特尔在 Hot Chips 2026 发布面向智能体推理的 Crescent Island GPU,显存 160GB…
在 Hot Chips 2026 大会上,英特尔首次详细披露了其面向智能体 AI 推理的数据中心 GPU——Crescent Island。企业级 AI 系统首席架构师 Sumit Mohan 与英特尔院士 Hong Jiang 登台演讲,围绕「每瓦 token 数」、大容量显存与开放软件栈三大维度,勾勒出这款新品的设计思路。
定位:智能体推理专用加速器
英特尔将 Crescent Island 定位于企业级数据中心的旗舰推理加速器,与 Arc Pro GPU、SambaNova SN50 RDU 等共同覆盖从本地端 AI 工作站到数据中心智能中心的全栈需求。官方强调,智能体工作负载与普通聊天机器人不同,工具调用、长上下文以及 CPU-GPU 协同会同时给延迟、显存容量与系统吞吐带来压力,因此产品设计从一开始就以这三项指标为锚点。
核心规格与架构
Crescent Island 是一款 350W 风冷 PCIe GPU,核心数据如下:
- 显存:标配 160GB LPDDR5x,ODM 合作伙伴可扩展至 480GB,覆盖 FP4、MXFP4 至 FP64 数据类型。
- 架构:基于 Xe3p,搭载 32 个 Xe 核心,共 256 个 XMX 引擎。
- 计算单元:第三代 Xe Matrix Extensions,3 路扩展矩阵引擎,支持 FP4 精度同发与 FP64,底层为 16 深度脉动阵列。
- 缓存:每 Xe 核心 1MB GRF 与 512KB L1,全芯片 32MB 统一 L2。
- 互联:PCIe Gen5 x16,通过开放交换 Fabric 实现横向扩展,可搭配三代以上至强服务器 CPU。
- 功耗:G0 状态活动空闲功耗 50W 以下,G8 状态低功耗空闲约 10W,采用分布式可配供电与独立 GT / 媒体 DVFS 轨。
英特尔还介绍了强大的 RAS(可靠性、可用性、可维护性)特性,包括关键内存 ECC、IP Fabric 逐跳错误检查、动态页下线、封装后硬修复以及 PCIe 高级错误上报,用于降低静默数据损坏风险。
面向智能体推理的优化
Crescent Island 的核心卖点是「每瓦 token 数」与大容量显存。英特尔指出,从 Llama 2 70B 到 Kimi K2 1T,模型权重增长约 7 倍,而每 token 读取字节数下降约 4 倍,容量与带宽已经解耦,这正是 LPDDR5x 密度优势可发挥作用之处。
产品层面的具体设计包括:
- KV-cache 感知路由与预填(prefill)优化,降低长上下文推理开销。
- 单卡可容纳 FP8 权重与 KV cache,支持更大模型与更长上下文,相比 96GB 竞品(如 NVIDIA RTX Pro 6000 Server)减少所需 GPU 数量。
- 推测解码(speculative decoding):在前沿 MoE 模型上,每个验证轮次可退役 2.9 至 4.9 个 token(8 token 草稿树),把自回归解码的空档利用起来。
软件生态
英特尔强调 Crescent Island 沿用已获数百家 ISV 信任的开放开发栈,提供 Day-0 驱动、固件与参考系统,并原生支持 vLLM、SGLang、llm-d 与 NVIDIA Dynamo,使智能体应用可在异构基础设施上无需改动代码即可运行。代际对比来看,Crescent Island(Xe3p)相比 Battlemage(Xe2)的 20 核、4 深度脉动 XMX,在核心数、矩阵深度、单核容量与片上缓存等指标上均实现数倍提升,延续了英特尔过去六年以上的数据中心加速器路线。
