MLCommons は 2026 年 9 月 16 日に MLPerf Inference v6.1 ベンチマーク結果を発表し、その見出しは NVIDIA の次世代プラットフォームに関するものでした。 NVIDIA の発表によると、Vera Rubin NVL72 システムは、史上初のプレビュー提出で、NVIDIA の現在のフラッグシップ GB300 NVL72 の最大 3.7 倍のスループットを実現しました。これは、Blackwell Ultra の後継製品が AI 推論経済にとって何を意味するのかを示す初期の兆候です。
Vera Rubin は、NVIDIA の次期データセンター プラットフォームであり、暗黒物質の重要な証拠を提供した天体物理学者にちなんで名付けられました。 MLPerf プレビュー結果は、システムの独立して整理された最初の公開パフォーマンス データです。 この件の詳細は、AIニュースをご覧ください。
デビューの裏にある数字
NVIDIA は、v6.1 スイートで最も要求の厳しい 2 つのワークロード、DeepSeek-R1 推論モデルと Qwen3-VL ビジョン言語モデルに関する Vera Rubin NVL72 プレビュー結果を提出しました。
Qwen3-VL では、Vera Rubin NVL72 は、NVIDIA の Dynamo オープンソース推論フレームワークで vLLM を実行し、オフライン、サーバー、およびインタラクティブ シナリオ全体で GB300 NVL72 よりも最大 3.7 倍高いスループットを実現しました。 DeepSeek-R1 では、NVIDIA の TensorRT-LLM ライブラリを使用し、スループットは以前のフラッグシップよりも最大 2.5 倍高くなりました。
どちらの数値も、NVIDIA が MLCommons の非公開部門に提出したものであり、MLPerf の監査済みルールに従って作成されたことを意味しますが、プレビュー結果は明らかにまだ最適化中のプラットフォームの初期の測定値です。
ゲインの構築方法
NVIDIA は、この飛躍は単一のコンポーネントではなく、ハードウェアとソフトウェアにわたるフルスタックの共同設計によるものであると考えています。
シリコン側では、Vera Rubin が強化された Tensor コアと更新された Transformer Engine を導入し、推論の両方の段階 (計算負荷の高いプリフィル フェーズとメモリに依存するデコード フェーズ) を高速化します。このプラットフォームは NVFP4 の精度に依存しており、これによりモデルの重み、アテンション、KV キャッシュのメモリ フットプリントが縮小され、NVIDIA が出力品質の損失を最小限に抑えてスループットを向上させます。
ソフトウェア側では、提出物では、プリフィルとデコードを異なるタスクに分離する分離サービングと、DeepSeek-R1 や Qwen3-VL などのモデルのエキスパートの混合レイヤーに完全な作業を供給し続けるための大規模なエキスパート並列処理が使用されました。
相互接続は 3 番目の柱です。 NVL72 ラック設計は、第 6 世代 NVLink および NVLink スイッチを使用して 72 個の GPU を単一のスケールアップ ドメインに結び付けます。NVIDIA によれば、これにより、既製のイーサネットよりも 10 倍高いパケット レートと 3 倍低いレイテンシが実現され、これがラックスケールの分散サービスを実用化する基盤となります。
GB300 はほぼ完璧なスケーリングを示します
現在のフラッグシップ製品には、v6.1 ラウンドで独自のニュースがありました。 NVIDIA の DeepSeek-R1 申請は、1 つの GB300 NVL72 ラック (GPU 72 基) から 4 つのラック、288 GPU まで拡張され、オフライン シナリオで 99% の拡張効率を達成し、追加されたハードウェアにほぼ比例してスループットが向上しました。
スケーリング効率は、より多くのハードウェアを購入することで実際に比例してより多くの容量を購入できるかどうかを決定するため、データセンター事業者が注意深く監視している指標です。ラック全体のほぼ線形のスケーリングは、この規模でのボトルネックがラック間通信ではなく GPU ごとのパフォーマンスのままであることを示唆しています。
ソフトウェアは複雑化し続ける
MLPerf ラウンドで繰り返されるパターンが再び発生しました。ソフトウェアの改善だけで、NVIDIA の v6.1 提出では v6.0 と比較して最大 1.6 倍のパフォーマンスが向上し、v6.1 の提出期限後も最適化が継続され、さらなる利益がもたらされたと同社は述べています。
購入者にとって、これが意味するのは、特定のラックは、ハードウェアを更新しなくてもその寿命にわたって速度が向上するということです。ダイナミックな NVIDIA は、ソフトウェア スタックが成熟するにつれて設置ベースが下落するのではなく、むしろ価値が高まると主張してきました。
エージェントのワークロードがベンチマークを再構築
v6.1 ラウンドでは、推論の使用目的の変化も反映されています。 NVIDIA は、複数のステップにわたって推論、計画、行動する AI エージェントを中心に設計された SemiAnalysis の AgentX ベンチマークのプレビュー テストを指摘し、そこで Vera Rubin NVL72 が GB300 NVL72 の 30 倍のパフォーマンスを発揮したと述べています。
MLCommons is also preparing a dedicated benchmark for this shift: the upcoming MLPerf Endpoints benchmark aims to standardize measurement of agentic inference workloads that traditional throughput tests capture poorly. As inference moves from single-prompt chat toward long multi-step agent sessions, latency and interactive consistency matter as much as raw tokens per second — and benchmarks are being rebuilt accordingly.
Nebius and the Ecosystem Arrive Early
Cloud provider Nebius also submitted Vera Rubin NVL72 preview results, which NVIDIA highlighted as evidence of strong early ecosystem performance. Early third-party submissions are typically a sign that next-generation systems are moving from lab sampling toward broader availability, though neither NVIDIA's post nor MLCommons' release specifies general-availability timing.
Why It Matters for AI Economics
NVIDIA frames the results in revenue terms: each Vera Rubin NVL72 rack generates significantly more tokens, serves more users and lowers cost per token relative to a GB300 NVL72 rack. In an industry where inference demand is being driven by reasoning models and agent workloads that consume orders of magnitude more compute per query than simple chat, per-rack throughput is the number that determines how many users a fixed data-center budget can serve.
The usual caveats apply: these are vendor submissions in a preview round, on two models chosen by NVIDIA, with optimizations still landing. But the direction is unambiguous. MLPerf's first look at Vera Rubin suggests the performance climb that has defined AI infrastructure since 2023 has no plateau in sight — and that the next rack-refresh cycle will again reset the economics of serving AI at scale.
---
AIの最新情報をお届けAIの最新ニュース、分析、ブレイクスルーを一箇所で。
AIニュースをもっと読む →