OpenAI 发布了其定制推理芯片 Jalapeo 的第一个基准测试结果,这些数字令人震惊:在 SemiAnalysis 的 InferenceX 基准测试中,与当前可用的最先进的推理处理器相比,新芯片的每用户令牌数和每千瓦吞吐量更高——这一比较包括 Nvidia 的 Blackwell 系统。研究结果于周二在帕洛阿尔托举行的 Hot Chips 会议上公布,同时还对芯片的构建方式进行了详细的技术研究。对于追踪支持每个 AI 模型发布 的计算竞赛的读者来说,它是今年最重要的硬件数据点之一。
OpenAI 硬件主管 Richard Ho 在 TechCrunch 报道的新闻发布会上表示:“最重要的是,结果表明,其性能比现有技术有了非常非常显着的进步。” “Jalapeño 可以在每单位功率上服务更多的 AI 工作,同时也可以更快地返回响应。为大量客户提供服务非常高效,但延迟也非常低。”
专为完整推理流程打造的芯片
Jalapeo 于 2026 年 6 月推出,是 OpenAI 的首款定制芯片,与 Broadcom 密切合作开发,OpenAI 自己的 AI 模型协助芯片的开发过程。此次合作可以追溯到 2025 年 10 月,当时 OpenAI 与这家网络巨头共同制定了多代定制加速器计划。
OpenAI 表示,Jalapeo 与通用 GPU 的不同之处在于,它的设计与其所服务的模型相一致。由于该公司控制着整个堆栈——人工智能产品、模型、芯片和内存——其工程师能够攻击推理过程中经常引起摩擦的特定阶段。
特别是,Jalapeño 旨在最大限度地减少处理的预填充和通信阶段的延迟,OpenAI 表示,在大规模服务大型语言模型时,这经常成为瓶颈。
“我们设计 Jalapeo 是为了最大限度地减少数据移动和通信延迟,”该公司在介绍结果的博客文章中写道。 “这意味着模型状态(包括生成响应时使用的 KV 缓存)可以显式放置并保留在本地,同时系统为每个推理阶段激活计算、内存和网络的正确组合。”
最后一点对于任何运行生产人工智能工作负载的人来说都很重要。 KV 缓存(模型在生成响应时保存的累积上下文)是现代推理中最大的内存和带宽问题之一。将其保留在本地并进行显式管理,而不是在集群中进行调整,是消除延迟和功耗的经典方法。
比布莱克威尔更好——目前
标题中的比较是与 Nvidia Blackwell 系统进行的比较,该系统目前是前沿人工智能推理的主力。 SemiAnalysis 同日发布的题为“OpenAI Jalapeo:优于 Nvidia Blackwell”的独立分析对该芯片的早期结果得出了类似的结论,该故事很快成为黑客新闻上讨论最多的文章之一。
但 OpenAI 高管和分析师都敦促谨慎行事。 Ho 估计,Jalapeño 将在 2026 年底“以非常小规模”部署,并在 2027 年进行更大规模的部署。当 Jalapeo 达到全面规模时,竞争可能会显着推进——Nvidia 的路线图继续变化,而包括谷歌、亚马逊和微软在内的其他超大规模企业都在推出自己的定制芯片。
正如 TechCrunch 指出的那样,根据当今最先进技术衡量的基准只是一个快照,而不是保证。到 2026 年,一款以效率取胜的芯片必须继续战胜 Nvidia 及其竞争对手明年推出的任何产品。
为什么 OpenAI 正在构建自己的芯片
战略逻辑很简单:推理是 OpenAI 最大的经常性成本。每个 ChatGPT 查询、每个 API 调用和每个代理任务都会消耗计算量,并且以市场价格从 Nvidia 租用该计算量会随着使用规模的扩大而挤压利润。针对 OpenAI 自己的模型进行调整的定制芯片(与 Broadcom 联合设计并由 OpenAI 模型本身塑造)使该公司能够以每瓦特和每美元为更多用户提供服务。
Jalapeo 还计划作为一个多代平台,而不是一次性的部分。 OpenAI 表示,打算一起开发人工智能产品、模型、芯片和内存,以便每一代芯片都与其将运行的模型共同优化。如果第一代成果能够在生产中发挥作用,墨西哥辣椒将成为后续所有产品的模板。
风险不仅仅限于 OpenAI。三年来,Nvidia 在人工智能加速器领域的主导地位一直是该行业最严峻的瓶颈,而每一个可靠的替代方案——无论是来自谷歌的 TPU 团队、亚马逊还是现在的 OpenAI——都会改变每个构建人工智能基础设施的人的谈判格局。据报道,Nvidia 本身警告客户,随着内存成本飙升,AI 服务器的价格将上涨 15% 或更多,这只会增强内部替代品的吸引力。
接下来会发生什么
目前,Jalapeño 仍处于预生产阶段,论文数量很有希望。真正的测试将在 2026 年底到来,届时第一批小批量部署将会到来,尤其是在 2027 年,届时 OpenAI 预计将实现有意义的规模。关键问题仍未得到解答:数据中心规模的实际可靠性、总体拥有成本与租用的 Blackwell 容量的比较,以及效率优势是否能在 Nvidia 的下一代产品中生存下来。
尽管如此,第一个基准测试仍标志着一个里程碑:大型人工智能实验室首次公开展示定制推理芯片,该芯片似乎在效率方面击败了现有的最佳实验室。对于一个将英伟达供应视为战略生命线的行业来说,这是一个真正的拐点。
---
保持人工智能领先地位获取最新的人工智能新闻、分析和突破——尽在一个地方。
阅读更多人工智能新闻 →