独立系開発者は、3,040 億パラメータの専門家混合システムである DeepSeek の V4 フラッシュ モデルが単一の AMD MI300X GPU 上で運用環境で実行でき、重み量子化やオフロードを行わずにシングル ストリーム デコードで 1 秒あたり 168.6 トークンを達成できることを実証しました。 GitHub で公開され、2026 年 8 月 4 日に Hacker News のトップに浮上したこの研究は、AMD のハードウェアが Nvidia に依存せずにフロンティア規模のオープン モデルを提供できるというこれまでで最も明確な証拠を提供します。
開発者の Ryan Zhou によって管理されているこのリポジトリには、完全な Docker Compose スタック、ピン留めされたファイル オーバーレイ、および 1 台の MI300X で DeepSeek-V4-Flash-0731 チェックポイントを実行するためのチューニング テーブルが含まれています。 AMD と Nvidia 間のチップ戦争に関する AI ニュース速報 を追跡している読者にとって、この結果は重要です。フロンティア推論には Nvidia の最新かつ最も高価なハードウェアが必要であるという前提に疑問を投げかけるものだからです。
数字
vLLM の ROCm ナイトリー ビルドを使用してピン留めされたソフトウェア スタックで測定されたベンチマーク パフォーマンスは、単一の AMD アクセラレータで何ができるかについての説得力のあるストーリーを物語っています。
- シングルストリーム デコード: 1 秒あたり 168.6 トークン。リアルタイム チャットやエージェント ワークロードに十分な速度です。
- プレフィル スループット: 調整されたカーネルでは 1 秒あたり約 7,900 ~ 8,500 トークン。これは、長いプロンプトが 1 秒未満で処理されることを意味します。
- 8 つの同時ストリーム: 合計で 1 秒あたり 542 トークン、ストリームごとに 1 秒あたり 90.3 トークンになります。
- 64 ストリーム バースト: 1 秒あたり 830 トークンが集約され、メモリ不足エラーやエンジン障害は発生しません。
- コンテキストの長さ: テストでは 256,000 トークンが検証され、アーキテクチャは最大 100 万をサポートします。
モデル全体は 156.67 ギガバイトの高帯域幅メモリを占有し、MI300X の 192 ギガバイト HBM3 プール内に完全に収まります。追加の量子化や重みオフロードは必要なかったので、モデルの完全な精度が維持されました。
MI300X が機能する理由
AMD MI300X には、これほど大規模なモデルの単一 GPU 展開を可能にする 2 つの特性があります。これは、Nvidia H100 SXM5 の 2.4 倍の容量である 192 ギガバイトの HBM3 メモリと、毎秒 5.3 テラバイトのメモリ帯域幅を備えています。この展開の基礎を築いた開発者 Fergus Finn による別の記事では、MI300X の価格は同等の Nvidia ハードウェアの定価の約半分であると推定されています。
この特定の 3,040 億パラメータのチェックポイントでは、メモリ容量が決定的な要素となります。このモデルは完全にオンチップ メモリに収まり、20 ギガバイトの GPU キー値キャッシュ プールと、排除されたプレフィックス キャッシュ エントリ用の 96 ギガバイトの CPU 層のための余地が残されています。 1 枚のカードで、一般的な 2 ~ 8 個の同時ストリームと最大 64 個のストリームのバーストを処理でき、多くの実稼働推論ワークロードには十分です。
エンジニアリングのハードル
MI300X で DeepSeek V4 Flash を実行するのは簡単ではありませんでした。公式 vLLM レシピは、Nvidia ハードウェアと、MI325X や MI355X などの新しい AMD GPU をカバーしていますが、7 月 31 日のチェックポイントの単一 MI300X 実稼働構成はカバーしていません。
このリポジトリには、解決する必要のあるいくつかのエンジニアリング上の問題が文書化されています。 MI300X は、新しい AMD チップで使用されている標準とは異なる FP8 数値形式のバリアントを使用しており、間違ったセマンティクスを想定しているカーネルは、係数 2 で結果が生成される可能性があります。開発者はまた、高同時実行での専門家混合ルーティング、因果関係の投機的検証、CPU キーと値の同期を修正する必要がありましたが、そのうちのいくつかはアップストリーム vLLM で未修正のままです。
このリポジトリは、正確性オーバーレイ、投機的ドラフティングによる検証済みのサービング構成、パッケージ化されたテーブルに欠けていたチップ形状の AITER GEMM チューニング テーブル、GPU キャッシュと CPU オフロードを組み合わせたハイブリッド キー/値戦略を追加します。
チップ戦争の意味
このデモンストレーションは、AI における AMD の野望にとって極めて重要な瞬間に到来します。 Nvidia は、自社の CUDA ソフトウェア エコシステムによって支えられ、AI アクセラレータ市場の圧倒的多数を支配していますが、多くの開発者は、AMD がそれを越えるのに苦労している堀であると考えています。 SemiAnalysis は、「AMD は CUDA の堀を打ち破ることができるか?」というタイトルの 2026 年 7 月の分析で、その疑問を直接調査しました。そしてその答えについては未だに議論が続いている。
しかし、このようなオープンソース プロジェクトは、認識のギャップをあと一歩で解消します。単一の MI300X がフロンティア規模のモデルを競争力のある速度で提供できる場合、AMD のコストに関する議論を無視するのは難しくなります。 AMDはまた、独自のオープンモデルポートフォリオを構築しており、独自のInstinct GPUでゼロからトレーニングされた完全なオープンモデルであるInstella-MoE-16Bをリリースし、15メガワットのMI355XプラットフォームでZyphraと提携しています。
一方、DeepSeek 自体はフロンティア AI のコストを削減してきました。調査会社の分析によると、V4 フラッシュ モデルはすでに最も安価な有名モデルであり、GPT-5.6 Luna に匹敵する 60% 低いコストでした。安価な AMD ハードウェアと組み合わせることで、Nvidia エコシステムの外で大規模モデルを提供する経済性が急速に向上しています。
オープンソースの利点
このリポジトリは、2026 年の AI 開発におけるより広範なテーマを強調しています。つまり、オープンウェイト モデルとオープンソースの推論ツールにより、かつては資金豊富な研究所の独占的領域であった展開を独立したエンジニアが複製して最適化できるようになります。この作業では、完全な構成、チューニング テーブル、途中で修正された特定のバグを公開することで、深刻な AI ワークロード用に AMD ハードウェアを検討している人にとって障壁が低くなります。
AI の先を行く
AI 推論をめぐる AMD と Nvidia の戦いは激化しており、この展開のようなオープンソースの貢献により、競争環境は静かに変化しています。ハードウェア、オープン モデル、インフラストラクチャにおける 最新の AI 開発 については、引き続き当社の報道をご覧ください。
AI ニュースをもっと読む→