AMD 和 Cerebras Systems 公布了一项技术合作伙伴关系,旨在构建新型人工智能推理基础设施,将 AMD 的机架级 Helios 平台与 Cerebras 的晶圆级引擎 (WSE) 结合在一个单一的分解工作流程中。 AMD 于 2026 年 7 月 23 日在 AMD 的 Advancing AI 2026 活动中宣布,此次合作直接针对延迟和吞吐量瓶颈,这些瓶颈使推理成为生成式 AI 时代最昂贵的问题之一。有关该行业快速发展的领域的最新动态,请关注我们的突发人工智能新闻 报道。

核心思想是不再强迫一个芯片做所有事情。在传统的推理堆栈中,单个 GPU 系列既处理消化提示的繁重预填充工作,又处理生成每个新标记的微妙的顺序工作。这是一种妥协,因为这两项工作的要求截然不同。 AMD 和 Cerebras 认为,分工(一种称为分类推理的技术)可以让每个引擎发挥其最擅长的作用。

两个引擎如何分工

根据AMD的官方公告,AMD Helios将作为高性能、可扩展的吞吐量引擎,利用AMD Instinct GPU来快速处理大批量的输入。与此同时,Cerebras 晶圆级引擎将处理超快速、超低延迟的解码和令牌生成。 Cerebras' chips are built on entire wafers rather than diced into individual dies, giving them enormous on-chip memory bandwidth that is particularly well suited to streaming out tokens without stalling.

两家公司表示,通过结合这两个计算引擎,联合解决方案预计每瓦每秒提供高达 5 倍的令牌,随着提供商在速度和能源成本方面展开竞争,这一指标已成为推理经济学的核心记​​分卡。 AMD 的新闻稿中引用了这一数字,并在 Tom's Hardware、Investing.com 和 Yahoo Tech 等媒体上进行了报道。

挑战 Nvidia 的统治地位

此次合作也是一个战略信号。 Nvidia 的 CUDA 生态系统和 GPU 系列目前在人工智能训练和推理领域占据主导地位,挑战者越来越多地得出结论,在单一架构上正面击败现有企业是很困难的。 《商业内幕》将这笔交易描述为AMD通过押注推理来向英伟达发起攻击,随着模型从开发转向生产,人工智能计算阶段预计将增长最快。

对于 AMD 来说,与 Cerebras 的合作扩大了其 Instinct 和 Helios 路线图在训练之外的吸引力。 Cerebras 与 AMD(纳斯达克股票代码:AMD)一起在纳斯达克上市,股票代码为 CBRS,与主要加速器供应商的整合为其晶圆级技术提供了进入大型企业和云部署的更清晰途径。 Cerebras 计划在自己的数据中心部署 AMD Helios,两家公司预计联合解决方案将在 2026 年下半年首先通过 Cerebras Cloud 提供。

为什么分解现在很重要

推理成本已成为人工智能行业的一个决定性压力点。随着模型变得越来越大并且应用程序需要实时响应,生成每个令牌的费用以及用户等待它的延迟可以决定产品是否可行。 Disaggregated inference treats prefill and decode as separate workloads that can be routed to the hardware best matched to each, a design philosophy that companies like Cerebras have championed for over a year.

AMD-Cerebras 的声明表明,这种方法正在从一种颠覆性的想法转变为行业认可的架构。通过将吞吐量专家与延迟专家配对,两家公司押注推理的未来不是一个芯片来统治所有这些,而是​​一个由专业引擎组成的协调系统。

看什么

还有几个问题。每秒每瓦 5 倍令牌的数字是一个预期,而不是第三方基准,实际性能将取决于客户运行的特定模型和工作负载。 Cerebras Cloud 发布之后的定价和可用性细节尚未披露,也不清楚该解决方案何时会到达其他云提供商。

尽管如此,这笔交易还是凸显了人工智能硬件的更广泛转变:单一 GPU 架构将服务于人工智能管道的每个阶段的假设正在被打破。如果 AMD 和 Cerebras 能够兑现他们的效率主张,分类推理可能会成为构建最大的人工智能系统的标准部分。

保持人工智能领先地位

人工智能硬件领域正在分裂成不同的专业阵营,这对成本、速度和竞争的影响是巨大的。在 AI Buzz Wire 上 阅读更多 AI 新闻,了解每项重大交易、发布和基准测试。