OpenAI は、2026 年 7 月 30 日に 3 つの GPT-5.6 モデルのうち 2 つの API 価格を引き下げ、ファミリーが一般提供開始されてからわずか 3 週間で最も安い層を 80% 値下げしました。この動きは、大手モデルメーカーが大量のコスト重視のワークロードを求めていかに積極的に競争しているか、そして同社の顧客が現在あらゆるトークンをどれだけ厳密に数えているかを示している。 AI 経済における広範な変化の詳細については、最新の AI 開発 をご覧ください。

何が変わったのか

OpenAI が公開した料金表と API 変更ログによると、100 万トークンあたりの標準価格は次のようになりました。

  • GPT-5.6 Luna: 入力 20 セント、出力 1.20 ドル、1 ドルと 6 ドルから値下げ - 80% 削減
  • GPT-5.6 Terra: 2.50 ドルと 15 ドルから 2 ドルと 12 ドルに値下げ - 20% 割引
  • GPT-5.6 Sol (フラッグシップ): 5 ドルと 30 ドル、変更なし

3 つの階層はすべて、2026 年 7 月 9 日に、より高い料金で一般提供が開始され、ファミリーの商用開始からわずか 21 日で価格が再設定されました。ロイターとCNBCは両方とも削減を確認し、アクシオスは最も大幅な削減がLunaモデルに適用されたと報告した。

カットはすべてのサービス層を通過します

値下げはヘッドライン価格に限定されません。これらは料金表のすべてのオプションに反映されます。

  • バッチ処理とフレックス処理はどちらも標準価格の半額で、Luna は 100 万トークンあたり 10 セントのインプットと 60 セントのアウトプットになります。
  • キャッシュされた入力読み取り、90% 割引、Luna では 100 万トークンあたり 2 セント、Terra では 20 セントに下がります。
  • ロングコンテキスト リクエストは、入力レートの 2 倍、出力の 1.5 倍で請求され、Luna の場合は 40 セントと 1.80 ドルになります。

すでに一括分類、抽出、または長いエージェント ループを安価な階層でルーティングしているチームにとって、同じ通話の料金は 1 日前に比べて数分の一で済みます。

Anthropic とのカットの比較

Anthropic の価格設定ページによると、Luna の価格は、入力で 20 セント、出力で 1.20 ドルで、Anthropic の最も安価な公開モデルである Haiku 4.5 を入力で約 5 倍、出力で約 4 倍下回っています。 Terra の新しい料金は、2026 年 8 月 31 日に導入価格が終了した後に Claude Sonnet 5 が請求する予定の 3 ドルと 15 ドルを下回っています。

両方のラインナップの最上位にある Sol は、価格が 5 ドルと 25 ドルの Anthropic の Opus 5 よりも依然として生産コストが高くなります。

優先処理が高速モードになります

同じ変更ログ エントリで「優先処理」が廃止され、「高速モード」に置き換えられました。 OpenAI によると、フラッグシップの Sol モデルについては、Fast モードは 2 倍の価格で標準速度の最大 2.5 倍で動作し、スイッチには下位互換性があり、リクエストはコードを変更せずに Fast モードへの優先ルートのタグがすでに付けられています。

ファストモード料金は、Sol が 10 ドルと 60 ドル、Terra が 4 ドルと 24 ドル、Luna が 40 セントと 2.40 ドルです。特に、Anthropic は同じ製品を同じ名前、同じ条件で販売しており、2 つのレート表は地域固定推論にも収束しています。OpenAI は、顧客がデータ常駐を必要とする 2026 年 3 月 5 日以降にリリースされたモデルに対して 10% の値上げを請求するのに対し、Anthropic は米国のみの推論に標準レートの 1.1 倍を請求します。

安価な層が安くなった理由

削減の前日に、OpenAI は推論スタック全体の最適化について説明したエンジニアリング投稿を公開しました。同社の技術スタッフ 5 名は、Codex コーディング ツール内で実行されている Sol が本番 GPU カーネルを書き換えたと書いています。OpenAI によれば、その作業によってエンドツーエンドのサービス提供コストが 20% 削減されるとのことです。このモデルはまた、数百回の実験を経て独自の投機的復号ドラフト モデルを再設計しました。この変更により、トークン生成効率が 15% 以上向上したと考えられています。

これらは OpenAI 独自のスタックに関する数値ですが、値下げの対象となる同じコスト センター、つまり Codex と ChatGPT の背後にあるエージェント ハーネスを示しています。 OpenAI は、ツールの出力をデフォルトで 10,000 トークンに制限し、モデルに表示される履歴を追加のみに保持するため、ステップごとに命令を再送信するエージェント ループは、入力レート全体を支払うのではなく、プロンプト キャッシュにヒットします。同社はこの記事の締めくくりに、「内部の改善を、より広く利用できるコスト効率の高いインテリジェンスの形でユーザーに還元する」と約束した。料金表は 1 日後に届きました。

クラウド パートナーと請求

OpenAI は、Amazon Bedrock 経由でトラフィックをルーティングする購入者には AWS から請求が行われ、その料金は同社が公開しているカードとは異なる場合があると指摘しました。単一のクラウド ベンダーを通じてモデル アクセスを一元化する企業が増えるにつれ、OpenAI の直接価格と顧客が仲介業者を通じて実際に支払う金額とのギャップが、見出しの数字そのものと同じくらい重要になるでしょう。

すべてのトークンをカウントする市場

企業のバイヤーが推論支出をこれまで以上に厳密に監査するため、土地が削減されます。今週初めのレポートでは、主要プラットフォーム全体で企業の AI 請求額が急増する中、無制限の「トークンマックスシング」(コストを監視せずに量を増やす)の時代がいかに衰退しつつあるかを文書化しました。 OpenAIが利益を銀行に預けるのではなく、内部コストの節約を顧客に還元するという決定は、現在、競争の戦いがどこで行われていると同社が考えているかを明確に示している。Solが依然としてプレミアム価格を設定しているフロンティアではなく、実際にほとんどの本番トラフィックが存在する安価な大容量層で行われているのだ。

Sol の価格は変更されていないため、開発者にとっての実際の決定は、ファミリーの出荷以来 OpenAI が定めたとおり、つまり各リクエストがどの層を必要とするかということになります。違いは、その決定を誤った場合のコストが劇的に下がったことです。

---

AI の先を行く

最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。

AI ニュースをもっと読む→