Cerebras は、新しい WSE-3 Turbo ウェーハスケール プロセッサを中心に構築されたラックスケール AI 推論システムである CS-4 を公開し、同社が Nvidia のデータセンター帝国に代わる速度の代替手段としての地位を確立しているため、このマシンは GPU ベースのシステムよりも最大 30 倍高速な推論を実現すると主張しています。
火曜日に発表され、同社の製品ページやロイター通信、ブルームバーグ、ザ・レジスターからの一連の報道で詳しく発表されたこの発表は、セレブラス社の上場以来最も重要なハードウェア刷新を記念するものであり、IPO以来株価が低迷していた同社にとって極めて重要な瞬間となった。投資家は注目しているようだ。セレブラス(CBRS)の株価はこのニュースを受けて急騰し、インベスターズ・ビジネス・デイリーはAI推論市場が「非常に急速に成長している」というCEOのコメントを引用した。
AI モデルの応答速度を高める競争の加速を追跡している読者にとって、CS-4 の発売は、この四半期で最も重要なハードウェア ストーリーの 1 つであり、コンピューティング環境を再形成し続ける AI 業界の対象範囲の広範な変化の真っ只中に上陸しました。
CS-4 の中身
目玉のコンポーネントは、Cerebras のディナープレートサイズのウェーハ スケール エンジンのアップグレード バージョンである WSE-3 Turbo です。 The Register の技術詳細調査によると、WSE-3T は新しいシリコンではなく、2 年前の WSE-3 と同じ TSMC 5nm プロセス、46,225 平方ミリメートルのダイ面積、4 兆個のトランジスタ、900,000 個のコア、および 44 GB のオンウェハ SRAM を保持しています。
その代わりに、Cerebras は既存のチップをさらに強化することで、パフォーマンスの 2 倍を達成しました。 WSE-3T は、スパース FP16 コンピューティングを 2 倍の 250 ペタ FLOPS、デンス FP16 パフォーマンスを 2 倍の推定 25 ペタ FLOPS、メモリ帯域幅を 2 倍の 43.2 ペタバイト/秒、I/O 帯域幅を 2 倍の 2.4 テラビット/秒に高めます。レジスターの推定では、同社のシリコンのクロック速度は現在約 2.8 GHz であり、前世代の約 1.4 GHz から増加しています。
Cerebras 氏によると、その秘訣は、プロセッサーからわずか 0.5 ミリメートルの位置に配置された再設計された電力供給システムです。これは、従来の GPU ボードの典型的な約 50 ミリメートルよりも約 100 倍近い距離にあります。この近接性により、ボードレベルの電力損失がほぼなくなり、2 倍の電力がウェーハに到達できるようになり、より高速なトークン生成の背後にあるより高い動作周波数が可能になります。
Nexus ラックのアーキテクチャ
CS-4 は、チップ自体を超えて、Cerebras が Nexus プラットフォーム アーキテクチャと呼ぶものを導入しています。これは、初めての真のラックスケール設計であり、Nvidia の NVL72 および AMD の Helios ラック システムに対する直接的な回答です。各 CS-4 は、自己完結型の「ウェーハスケール バックパック」に収容された最大 3 つの WSE-3T プロセッサを搭載できます。これは、ウェーハ、電力変換、直接液体冷却、高速 I/O および制御電子機器を 50% 少ないコンポーネントで 1 つのアセンブリに折りたたむ 3D パッケージです。
モジュラー設計により、安定した電源、冷却、ネットワーク層がコンピューティングから分離されます。同社によれば、Cerebras PowerRack は、コンピューティングが到着する前に設置して設備認定を行うことができ、バックパックを所定の位置にスライドさせて設置できるため、導入時間を数日から数時間に短縮できます。
消費電力はかなりのものです。 Register はバックパックあたり約 46 kW、システムの総消費電力は 120 ~ 140 kW と見積もっています。これは目を引く数字ですが、AMD と Nvidia が今年後半に出荷すると予想されている 240 ~ 250 kW のラック システムに比べれば控えめに見えます。
スイッチを殺す
おそらく、技術的に最も興味深い選択は相互接続です。 Cerebras は、AWS が Trainium3 アクセラレータに採用したアプローチであるスイッチを介してウェハ間のトラフィックをルーティングするのではなく、隣接するウェハが互いに直接通信する 2D トーラス トポロジにチップを配線します。この設計により、ウェハ間のレイテンシが 5 マイクロ秒からわずか 2 マイクロ秒に短縮され、セレブラスによれば、このメッシュは、現在存在するものを快適に超えて、最大 50 兆個のパラメータのモデルをサポートできるとのことです。
スピードの結果は驚くべきものです。ベンチマーク会社 Artificial Analysis は、単一の CS-4 システムで、gpt-oss-120b 上のユーザーあたり最大 4,400 トークン/秒を測定しました。これは、現在利用可能な最速の GPU ベースの推論サービスの約 350 トークン/秒のおよそ 12 倍です。 Cerebras はまた、このシステムは 10 兆パラメータを超えるモデル上で 1 秒あたり 1,000 トークンを超えるトークンを維持できると主張しています。
細分化されたパートナーシップ戦略
特に、Cerebras は推論パイプライン全体を独自のシリコン上で実行しようとしていません。同社は AWS および AMD と提携して、推論のコンピューティング集中型のプロンプト処理段階をそれぞれ Trainium XPU および Instinct GPU にオフロードし、その大規模な SRAM 予備が威力を発揮するレイテンシに敏感なデコード段階の処理をウェハスケール エンジンに任せています。
CS-4 の発売により、Cerebras と OpenAI との連携も拡大します。 Yahoo Finance は、AI 推論の高速化を目的とした新しい OpenAI と AMD のパートナーシップとともにこの発表を報告しました。この発表は、両社が 8 月初めに導入した Ultrafast モードを基盤としており、ユーザーに最大 750 トークン/秒の GPT-5.6 Sol を提供しました。
見出しの数字の裏にある注意点
業界アナリストは、マーケティングの数字については慎重になるよう呼びかけています。 The Register は、Cerebras のヘッドラインである 250 ペタ FLOPS はスパース性に依存しているが、これは一般に大規模な言語モデルの推論には役立たないこと、また、WSE-3 には独自の SRAM を飽和させる計算能力がなかったため、ピーク メモリ帯域幅の数値はほとんど理論上のものであると指摘しています。この出版物はまた、なぜ Cerebras が SRAM 容量を増やすのではなく、パフォーマンスを 2 倍にしたのかについても疑問を呈しています。SRAM 容量は、5 年前の WSE-2 の発売以来、意味のある増加はしていません。これは、デコード アクセラレータがメモリから最も恩恵を受ける分離推論の時代において、興味深い選択です。
それでも、市場機会は現実のものです。 AI チャットボットとエージェントがこれまで以上に高速な応答時間を要求する中、推論速度が真の競争上の差別化要因となっており、Cerebras は、その型破りなウエハースケール技術を商業的なペースで反復できることを実証しました。
最初の CS-4 の出荷は今四半期に始まり、最初のシステムは 9 月末までにオンラインになる予定です。それが Nvidia の優位性を弱めるのに十分であるかどうかはまだわかりませんが、久しぶりに、業界最速の AI 推論が新しいアドレスを取得しました。
AI の先を行く
CS-4 のようなハードウェアの発売は市場を動かし、AI システムができることを再定義します。 AI ニュースの続きを読む を参照して、あらゆる発展を追い続けてください。
最新の AI 報道を詳しく見る→