OpenAI は、カスタム推論チップである Jalapeño の最初のベンチマーク結果を公開しました。その数値は驚くべきものです。SemiAnalysis の InferenceX ベンチマークでは、新しいシリコンは、現在利用可能な最先端の推論プロセッサよりもユーザーあたりのトークンと 1 キロワットあたりのスループットの両方を記録しました。これは Nvidia の Blackwell システムを含む比較です。この結果は火曜日、パロアルトで開催された Hot Chips カンファレンスで、チップの製造方法に関する詳細な技術的考察とともに発表されました。すべての AI モデルのリリース を支えるコンピューティング競争を追跡している読者にとって、これは今年最も重要なハードウェア データポイントの 1 つです。

TechCrunchが報じた記者会見で、OpenAIのハードウェア責任者リチャード・ホー氏は「要するに、結果は最先端技術を上回る非常に大幅なパフォーマンスの進歩を示しているということだ」と述べた。 「Jalapeño は、電力単位当たりにより多くの AI 作業を処理できると同時に、応答をより迅速に返すことができます。多数の顧客にサービスを提供するのは非常に効率的ですが、遅延も非常に低くなります。」

完全な推論パイプライン用に構築されたチップ

Jalapeño は、OpenAI の最初のカスタム シリコンとして 2026 年 6 月に発表され、Broadcom との緊密な協力のもと開発され、OpenAI 独自の AI モデルがチップの開発プロセスを支援しました。この提携自体は、OpenAI がネットワーキング大手と協力して多世代のカスタム アクセラレータ プログラムの計画を立てた 2025 年 10 月に遡ります。

OpenAI によると、Jalapeño が汎用 GPU と異なるのは、提供されるモデルに合わせて設計されたことです。同社は AI 製品、モデル、チップ、メモリなどのフルスタックを制御しているため、エンジニアは摩擦を引き起こすことが多い推論プロセスの特定のフェーズを攻撃することができました。

特に、Jalapeño は、処理の事前入力フェーズと通信フェーズでの遅延を最小限に抑えるように設計されており、OpenAI によれば、大規模な言語モデルを大規模に提供する場合、この遅延がボトルネックになることがよくあります。

同社は結果を紹介するブログ投稿で「データの移動と通信遅延を最小限に抑えるようにハラペーニョを設計した」と述べた。 「これは、システムが推論フェーズごとにコンピューティング、メモリ、ネットワーキングの適切な組み合わせをアクティブにしている間、応答の生成中に使用される KV キャッシュを含むモデルの状態を明示的に配置してローカルに維持できることを意味します。」

最後の点は、実稼働 AI ワークロードを実行している人にとって重要です。 KV キャッシュ (応答の生成中にモデルが保持する蓄積されたコンテキスト) は、現代の推論におけるメモリと帯域幅の最大の悩みの 1 つです。クラスター全体でシャッフルするのではなく、ローカルに保持して明示的に管理するのが、レイテンシーと電力を取り戻すための古典的な方法です。

ブラックウェルよりも優れています — 今のところ

見出しの比較は、現在フロンティア AI 推論の主力である Nvidia Blackwell システムとの比較です。セミアナリシスが同日発表した「OpenAI ハラペーニョ: Nvidia Blackwell よりも優れている」と題した独立した分析でも、チップの初期の結果について同様の結論に達し、この話はすぐにハッカー ニュースで最も話題になった項目の 1 つになりました。

しかし、OpenAIの幹部もアナリストも同様に注意を促している。ホー氏は、ハラペーニョは「非常に少量」で2026年末に展開され、2027年にはさらに大規模な展開が行われるだろうと見積もった。ハラペーニョが本格化する頃には、競争は大きく進歩している可能性がある。NVIDIAのロードマップは動き続けており、Google、Amazon、Microsoftなど他のハイパースケーラーはいずれも独自のカスタムシリコンを推進している。

TechCrunch が指摘したように、今日の最先端技術に対して測定されたベンチマークはスナップショットであり、保証ではありません。 2026 年に効率性で勝つチップは、来年 Nvidia とそのライバルが出荷するどんな製品に対しても勝ち続けなければなりません。

OpenAI が独自のシリコンを構築している理由

戦略ロジックは単純です。推論は OpenAI の最大の経常コストです。すべての ChatGPT クエリ、すべての API 呼び出し、すべてのエージェント タスクはコンピューティングを消費し、そのコンピューティングを Nvidia から市場価格でレンタルすると、使用量が拡大するにつれて利益が圧迫されます。 OpenAI 独自のモデルに合わせて調整されたカスタム チップ(Broadcom と共同設計され、OpenAI モデル自体によって形成された)により、同社はワット当たり、ドル当たり、より多くのユーザーにサービスを提供できるようになります。

ハラペーニョは、一回限りの製品ではなく、多世代のプラットフォームとしても計画されています。 OpenAIは、AI製品、モデル、チップ、メモリを一緒に開発し、各世代のシリコンが実行されるモデルと合わせて最適化されるようにするつもりだと述べた。第 1 世代の結果が実稼働環境で維持される場合、ハラペーニョはその後のすべてのテンプレートになります。

賭け金は OpenAI を超えて広がります。 AI アクセラレータにおける Nvidia の優位性は、ここ 3 年間、業界で最も厳しい単一のボトルネックであり、Google の TPU チーム、Amazon、または現在の OpenAI からのものであっても、あらゆる信頼できる代替案が、AI インフラストラクチャを構築するすべての人にとっての交渉の状況を変えています。伝えられるところによると、NVIDIA 自体は、メモリコストの高騰に伴い AI サーバーの価格が 15% 以上値上がりすることについて顧客に警告しているとのことですが、これは自社代替製品の魅力をさらに高めるだけです。

次に何が起こるか

今のところ、ハラペーニョはまだ試作段階であり、論文数は有望です。本当の試練は、最初の小規模なボリュームがデプロイされる 2026 年末、特に OpenAI が意味のある規模を期待する 2027 年に到来します。データセンター規模での実世界の信頼性、総所有コストとブラックウェルのレンタル容量、そして効率性の優位性が Nvidia の次世代に対して生き残れるかどうかなど、重要な疑問は未解決のままです。

それでも、最初のベンチマークはマイルストーンを示しています。大手 AI ラボの 1 つが、効率性の面で既存のベストを上回ると思われるカスタム推論シリコンを初めて公に実証しました。 Nvidia の供給を戦略的なライフラインとして扱ってきた業界にとって、これは真の転換点です。

---

AI の先を行く

最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。

AI ニュースをもっと読む→