英特尔在今年的 Hot Chips 大会上深入探讨了新月岛 (Crescent Island),该公司将赌注押在人工智能工作负载下一阶段的数据中心 GPU:代理推理上。演讲由首席企业人工智能系统架构师 Sumit Mohan 和英特尔院士 Hong Jiang 主持,主要围绕该公司定义代理时代的三个指标——每瓦代币、大内存容量和开放软件堆栈。
时机很重要。 Nvidia 在同一场会议上详细介绍了其 Vera Rubin NVL72 机架规模系统,Hot Chips 2026 上的每个加速器供应商现在都在宣传效率而不是原始峰值性能。英特尔的答案是将主流 AI GPU 使用的内存技术替换为每 GB 更便宜的技术,这引起了引人注目的头条新闻。 更多相关背景,请参阅我们的AI新闻。
350 瓦的 480GB PCIe 卡
Crescent Island 是一款 350 瓦风冷 PCIe GPU。英特尔品牌卡配备 160GB LPDDR5X 内存,但该设计允许 ODM 合作伙伴构建高达 480GB 的变体,大约是典型高端加速卡容量的三倍,并且足以为长上下文和多会话代理工作负载保留非常大的 KV 缓存。该设计涵盖从 FP4 和 MXFP4 到 FP64 的数据类型。
内存的选择是产品的战略决策。 LPDDR5X 以带宽换取容量和成本,这符合推理工作负载概况,其中巨大的上下文窗口和工具调用循环比原始计算消耗更多的内存容量。英特尔围绕“每瓦代币”构建整个设计——每单位能量提供更有用的输出,而不是在峰值 FLOPS 比较中获胜。
Xe3P 芯片:32 个内核,256 个 XMX 引擎
从本质上讲,Crescent Island 是英特尔的 Xe3P 架构,英特尔将其视为相对于基于 Battlemage 的 Xe2 一代的一代飞跃。 Xe2 提供 20 个 Xe 核心和一个 4 深脉动 XMX 阵列,而 Crescent Island 则提供 32 个 Xe 核心和 16 深脉动阵列,总共为 256 个 XMX 引擎提供动力。
第三代Xe Matrix Extensions增加了三路扩展Xe矩阵设计,具有FP4精度联发和FP64支持。每个 Xe 核心都带有 1MB 通用寄存器文件和 512KB L1 缓存,并在整个设备中共享 32MB 统一 L2。带有四个解码器和四个编码器的媒体引擎位于旁边,整个 SoC 通过 PCIe Gen5 x16 连接,支持跨开放交换结构的扩展。英特尔列出的 G0 状态下的活动空闲功耗为 50 瓦或更低,而低功耗 G8 状态下的活动空闲功耗约为 10 瓦,这是通过分布式电源域、具有主动时钟门控的基于数据包的片上网络路由器以及用于图形和媒体的独立 DVFS 导轨来实现的。
从服务器剧本借用的 RAS 功能
对于数据中心部分,可靠性工程的阶段时间与吞吐量一样多——Nvidia 在 Vera Rubin 上也倾向于这个主题。 Crescent Island 跨关键内存结构提供 ECC 和奇偶校验、内部互连结构每一跳的错误检查、动态页面离线、硬封装后修复以及 PCI Express 高级错误报告。英特尔表示,这种组合可以减少静默数据损坏,这种故障模式对于长期运行的无人值守推理来说最为重要。
英特尔还将该部件纳入从 Arc Pro 工作站 GPU 到其收购的 SambaNova SN50 RDU 的产品组合中,其中 Crescent Island 是位于顶部的企业数据中心锚点。该公司展示了六年多前的路线图谱系,将 GPU 视为成熟的第三代设计,而不是第一次尝试。该卡于 6 月在台北电脑展上首次亮相; Hot Chips 提供了其背后的架构细节。
为什么代理推理青睐这种设计
工作负载争论是英特尔宣传中最有趣的部分。代理人工智能——链接工具调用、保持长时间上下文开放以及在 CPU 和 GPU 之间协调的模型——同时对延迟、内存容量和系统吞吐量征税,而不是聊天机器人服务的批量吞吐量配置文件。用于长上下文和压缩域并发会话的 KV 缓存容量已明确内置到 SoC 设计中。
这一框架也解释了 LPDDR5X 的赌注。如果下一波 AI 计算是需要大量内存的代理而不是训练运行,那么 350 瓦的 480GB 卡是基于 HBM 的优质部件的可靠替代品 - 只要软件堆栈能够提供。英特尔对开放堆栈和开放交换结构的重视正是针对那些对英伟达集成平台锁定持谨慎态度的买家。
新月岛不会取代主导人工智能头条新闻的训练加速器,英特尔也没有在会议上透露定价或供货情况。但作为对英特尔认为推理发展方向的陈述——大内存、精益功耗、开放结构——它是今年热门芯片中更清晰的架构故事之一。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →