AMDとCerebras Systemsは、AMDのラックスケールHeliosプラットフォームとCerebrasのWafer-Scale Engine(WSE)を単一の細分化されたワークフローで組み合わせる、新しい種類のAI推論インフラストラクチャを構築するための技術提携を発表した。 2026 年 7 月 23 日に AMD の Advancing AI 2026 イベントで発表されたこの提携は、推論を生成 AI 時代で最もコストのかかる問題の 1 つとしてきたレイテンシとスループットのボトルネックに直接狙いを定めています。業界のこの急速に変化する分野の最新情報については、AI ニュース速報 の記事をフォローしてください。

中心となるアイデアは、1 つのチップにすべての処理を強制するのをやめるということです。従来の推論スタックでは、単一の GPU ファミリが、プロンプトを消化するという重い事前入力作業と、新しいトークンをそれぞれ生成する繊細な連続作業の両方を処理します。 2 つのジョブには要求が大きく異なるため、これは妥協点です。 AMDとCerebrasは、分解推論として知られる手法である作業を分割することで、各エンジンが最も得意なことを実行できると主張している。

2 つのエンジンがどのように役割を分担するか

AMDの公式発表によると、AMD Heliosは高性能でスケーラブルなスループットエンジンとして機能し、AMD Instinct GPUを利用して大量の入力バッチを迅速に処理します。一方、Cerebras Wafer-Scale Engineは、超高速、超低遅延のデコードとトークン生成を処理します。 Cerebras のチップは、個々のダイに分割されるのではなく、ウェーハ全体に構築されているため、膨大なオンチップ メモリ帯域幅が得られ、停止することなくトークンをストリーミングアウトするのに特に適しています。

両社は、2 つの計算エンジンを組み合わせることで、この共同ソリューションは 1 秒あたりワット当たり最大 5 倍のトークンを提供できると期待されていると述べています。この指標は、プロバイダーが速度とエネルギーコストの両方で競争する中で、推論経済学の中心的なスコアカードとなっています。この数字はAMDのプレスリリースで引用され、Tom's Hardware、Investing.com、Yahoo Techなどのメディアで報道された。

Nvidia の優位性を狙う一撃

このパートナーシップは戦略的なシグナルでもあります。 Nvidia の CUDA エコシステムと GPU ラインナップは現在、AI のトレーニングと推論を支配しており、単一のアーキテクチャで既存の企業に正面から勝つのは難しいとの結論に挑戦する者が増えています。 Business Insiderは、この契約を、AMDが推論に賭けてNvidiaに狙いを定めている、つまりモデルが開発から本番に移行するにつれて最も急速に成長すると予想されるAIコンピューティングの段階であると説明した。

AMD にとって、Cerebras と組み合わせることで、Instinct と Helios のロードマップの魅力がトレーニングを超えて広がります。 AMD (NASDAQ: AMD) と並んでティッカー CBRS でナスダック市場で取引されている Cerebras にとって、大手アクセラレータ ベンダーとの統合により、同社のウェハ スケール テクノロジは大企業やクラウド展開へのより明確な道筋が得られます。 Cerebras は AMD Helios を自社のデータセンターに導入する予定であり、両社はまず共同ソリューションが 2026 年後半に Cerebras Cloud を通じて利用可能になると予想しています。

なぜ今、細分化が重要なのか

推論コストは、AI 業界にとって決定的な圧力ポイントとなっています。モデルが大きくなり、アプリケーションがリアルタイムの応答を要求するようになると、各トークンの生成にかかるコストと、ユーザーがトークンを待つために経験する待ち時間が、製品が実行可能かどうかを決定する可能性があります。分解された推論は、プリフィルとデコードを別々のワークロードとして扱い、それぞれに最適なハードウェアにルーティングできます。これは、Cerebras のような企業が 1 年以上にわたって支持してきた設計哲学です。

AMD-Cerebras の発表は、アプローチが反乱的なアイデアから業界で承認されたアーキテクチャに移行していることを示唆しています。スループットのスペシャリストとレイテンシのスペシャリストを組み合わせることで、両社は推論の未来がすべてを支配する 1 つのチップではなく、特化されたエンジンの調整されたシステムであることに賭けています。

何を見るか

いくつかの疑問が残っています。 1 秒あたりワットあたりの 5 倍のトークン数は、サードパーティのベンチマークではなく予想値であり、実際のパフォーマンスは、顧客が実行する特定のモデルとワークロードによって異なります。 Cerebras Cloud の発売以降の価格と提供可能性の詳細は明らかにされておらず、このソリューションが他のクラウド プロバイダーにいつ提供されるかは不明です。

それでも、この契約は AI ハードウェアにおける広範な変化を浮き彫りにしています。単一の GPU アーキテクチャが AI パイプラインのすべての段階に対応するという前提が揺らぎつつあります。 AMD と Cerebras が効率性に関する主張を実現できれば、分離推論が最大規模の AI システム構築方法の標準部分となる可能性があります。

AI の一歩先を行く

AI ハードウェアの状況は専門化されたグループに分かれており、コスト、速度、競争への影響は計り知れません。 AI Buzz Wire の AI ニュースの続きを読む を参照して、あらゆる主要な取引、リリース、ベンチマークの最新情報を入手してください。