Nvidia は、Groq 3 LPX インタラクティブ推論アクセラレータを本格的に稼働させたと、2026 年 8 月 24 日の Hot Chips カンファレンス中に発表しました。 Nvidia の Vera Rubin プラットフォームを拡張したこのチップは、アクティブな 100,000 トークンのコンテキスト ウィンドウでオープンソースの Gemma 4 31B モデルを実行しながら、Artificial Analysis ベンチマークで 1 秒あたり 3,400 個の出力トークンという記録を達成しました。これは、そのモデルでこれまでに記録された最速のパフォーマンスです。
この発表は、Nvidia による推論専門会社 Groq の 200 億ドル買収によるこれまでで最も重要な製品のマイルストーンを記念するもので、同社は現在、低遅延推論の需要が急増していることからこの取引を活用しようと取り組んでいます。 CNBC は、Nvidia が最初の Groq ラックが年末までにオンラインになるだろうと述べていると報じました。このストーリーの詳細については、現在進行中の AI 業界の報道 をご覧ください。
トークン生成速度が重要な理由
エージェント AI システム (推論、ツールの呼び出し、コードの記述とテスト、および数百または数千の推論ステップを反復するプログラム) は、膨大な量の出力トークンを生成します。対話性またはデコード スループットと呼ばれる、これらのトークンが生成される速度によって、エージェントが作業の各ステップをどれだけ早く完了できるかが決まります。
Nvidia によると、Groq 3 LPX は、最も近い代替プラットフォームと比べて、エージェントや遅延に敏感なワークロードに対して 4 倍高速な応答性を提供します。異機種混在環境では、Vera Rubin NVL72 システムがコンテキストの取り込みとプレフィル計算を処理し、Groq 3 LPX ユニットが遅延に敏感なトークン生成フェーズを処理します。
「推論は AI の成長エンジンです」と Nvidia の創設者兼 CEO のジェンセン フアン氏は発表の中で述べています。 「Vera Rubin は、エージェント AI の時代に向けて設計されたワークロードに最適化された AI ファクトリー構成でそのビジョンを拡張し、超高速トークン生成のための LPX でパフォーマンスのフロンティアを前進させます。」
ハードウェアの内部
StorageReview の技術分析によると、各 2U 水冷コンピューティング トレイには、ホスト CPU、ファブリック拡張ロジック、DRAM とともに 16 個の Groq 3 LPU が搭載されており、さらに BlueField-4 DPU または ConnectX-9 ネットワーク カードが搭載されています。このトレイには、フロント パネルに 32 個の LPU チップツーチップ光リンクと 400Gb/s イーサネットが搭載されています。
ラックスケールでは、Groq 3 LPX 導入には、高速の直接チップ間相互接続を介してリンクされた最大 256 個の LP30 アクセラレータが組み込まれています。これらのラックは、NVIDIA の広範な Vera Rubin AI ファクトリー インフラストラクチャに差し込まれます。これは、同社がこれまでで最も広範なプラットフォームであると説明しています。BlueField-4 DPU、Vera CPU ラック、Vera BlueField-4 STX ストレージ、Spectrum-6 SPX イーサネット ネットワーキングを含む 5 つの専用ラック構成に 7 つのディスクリート チップが搭載されています。
Nvidia はまた、プラットフォーム レベルのパフォーマンスに関する主張を更新し、Vera Rubin NVL72 は 140,000 トークンのエージェント コーディング ワークロードで GB300 NVL72 と比較してメガワットあたり最大 30 倍のトークン スループットを実現し、ユーザーごとの対話性の目標が高まるにつれて利点が拡大すると述べました。
アスタリスクの付いたベンチマーク
見出しの 1 秒あたり 3,400 トークンという数字には、注目に値する警告が含まれています。 StorageReview が指摘したように、Nvidia の結果は 8 月 21 日にプライベートのプレリリース エンドポイントで測定されたものですが、比較された競合する数値はライブのサーバーレス運用エンドポイントからのものです。一般に利用可能なサービスでの実際のパフォーマンスは、記録を樹立したベンチマーク構成とは異なる場合があります。
それでも、独立したベンチマーク組織である Artificial Analysis は、そのコンテキスト長での Gemma 4 31B の測定史上最速の結果を記録しており、専用シリコンが推論のデコード フェーズを劇的に高速化できるという基礎的な主張は、業界がエージェント ワークロード向けに再構築してきた方法と一致しています。
クラウドの導入が始まります
アムステルダムに本社を置く AI クラウドである Nebius は、Groq 3 LPX の導入に取り組んだ最初のプロバイダーであり、同社の実稼働推論プラットフォームである Nebius Token Factory にそれを導入する予定です。
「生成とは、AI システムの実際の応答性を決定する推論の段階であり、NVIDIA Groq 3 LPX はまさにそれを加速するために構築されています」と Nebius の最高技術責任者である Danila Shtan 氏は述べています。 「Nebius Token Factory を介して AI を実稼働環境に導入する最初の AI クラウドとして、開発者がすでに使用しているのと同じ API を介して、新しいスタックに移行することなく、エージェントのループのすべてのステップが即座に感じられるようにしています。」
現在 Nvidia ファミリーの一員となっている推論プロバイダーの Groq は、このプラットフォームの初期採用者の 1 社になる予定です。
全体像
完全生産の発表は、AI インフラストラクチャ市場がトレーニングから推論へといかに急激に方向転換したかを示しています。企業が生のモデルの事前トレーニングからリアルタイムの推論と自律エージェントのオーケストレーションに予算をシフトするにつれて、トークンの経済性、つまりトークンをどれだけ早く生成できるか、エネルギーコストはどれくらいかが競争の中心的な戦場となっています。
Nvidia にとって、Groq 3 LPX は、クラウド プロバイダーや新興企業のカスタム シリコンが同様に同じエージェント推論ワークロードを追いかけているときに、自社の AI ファクトリー フランチャイズの防御を拡張します。 CNBC が報じたように、今年稼働するラックは、買収が完了してから数か月後に最初の生産システムを顧客の手に渡すことになる、つまり半導体業界標準による迅速な統合となる。
同社は新システムの価格を明らかにしていない。 Groq 3 LPX は、AI クラウド パートナーを通じて利用可能な場合にその都度提供され、Nebius が既存の API エンドポイントを通じて開発者にアクセスを提供する最初の企業となる予定です。
---
AI の先を行く最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。
AI ニュースをもっと読む→