独立系ベンチマーク会社 Artificial Analysis によると、OpenAI は 9 月 29 日に GPT-6.1 Sol をリリースし、そのモデルのデビューからわずか 7 日後に GPT-6 Sol を廃止しました。この交換は同社の DevDay 開発者カンファレンスと同時に行われ、CNET は、参加者が新たに開始された Dots エージェントと一連のサブスクリプション変更と同時に GPT-6.1 Sol の使用をすぐに開始できると報告しました。

7 日間でのフラッグシップからフラッグシップへの交代は、2026 年の加速基準に照らしても異例であり、ベンチマークは OpenAI が迅速に移行した理由を示唆しています。 AI Buzz Wire では、モデルの発売、ベンチマーク争い、その根底にある価格競争を継続的に報道し、重要な展開をその都度追跡しています。

7 日間で目に見える増加

Artificial Analysis の報告によると、GPT-6.1 Sol は同社のインテリジェンス インデックスで GPT-6 Sol より 4 ポイント、GPT-5.6 Sol より 5 ポイント向上し、OpenAI の最も高性能なモデルである GPT-6 Astra よりわずか 1 ポイント下回っています。同社の評価では、推論、知識作業、数学、エージェント タスクが単一の比較スコアに統合されています。

サブスコアは、ゲインが集中する場所を示します。 GPT-6.1 Sol は、AA-Briefcase v1.1 で 4 ポイント、GDPval-AA v2.1 で 5 ポイント改善しました。どちらもエージェント知識の機能をテストします。 Terminal-Bench 4.0 の 12 ポイントの上昇は、実際の端末環境でのパフォーマンスが大幅に向上したことを示しており、人類最後の試験は 5 ポイント上昇し、GDP.pdf は 6 ポイント上昇しました。

研究にモデルを使用する人にとって、1 つの数字が際立っています。AA-Omniscience の精度は 8 ポイント上昇し、幻覚率は 60 パーセントから 54 パーセントに低下しました。どちらの数値も絶対値としては高いままですが、ワークフローでは移動の方向が重要であり、自信を持って間違った答えが無回答より悪い場合があります。

ステッカー価格は同じですが、実質的には安くなります

価格に関しては、GPT-6.1 Sol は GPT-6 Sol の入力トークン 100 万あたり 2 ドル、出力トークン 100 万あたり 10 ドルのレート表を維持しますが、キャッシュ読み取り割引は 90 パーセントから 95 パーセントに増加します。 Artificial Analysis は、GPT-6.1 Sol のエージェント ワークロードの混合価格は GPT-6 Sol よりわずかに低く、GPT-6 Sol が 50% 割引で発売されたときに始まった連続的な実質値下げを GPT-5.6 Sol まで延長すると指摘しています。

価格の推移がここでの本当の話です。 OpenAI は 2 回のリリースの間に、中間層のフロンティア ラインの実効コストを 2 回およそ半分に削減し、そのたびに品質を少しずつ向上させました。

タスクあたりのコスト: 0.72 ドル対 3.26 ドル

GPT-6 Astra との差が顕著になるのは、タスクあたりのコストです。最大限の努力を行った場合、Artificial Analysis は GPT-6.1 Sol をインテリジェンス インデックス タスクあたり 0.72 ドルに固定します。これは GPT-6 Astra の 3.26 ドルの 4 分の 1 未満です。前モデルと比較すると、節約額は 31 パーセント (GPT-6 Sol の場合は 1.05 ドル)、GPT-5.6 Sol と比較すると 64 パーセント (1.99 ドル) に達します。

同社によれば、GPT-6.1 Sol のすべての努力レベルがコスト効率のパレートフロンティアを押し広げています。つまり、特定のレベルのインテリジェンスに対して、追跡するモデルの中でより安価なオプションは存在しません。トークン効率の状況はさらに複雑です。GPT-6.1 Sol は、エフォート レベル全体で GPT-6 Sol よりも約 10 ~ 30% 多くの出力トークンを消費しますが、その低および中エフォート設定は、より高いインテリジェンスを考慮すると、トークン効率にとってパレート最適のままです。コーディングでは、モデルは、同社のコーディング エージェント インデックスの最大エフォートで GPT-6 Sol より 3 ポイント獲得しました。

7 日間の納期が重要な理由

DevDay の幅広いスレートは、同じ状況を補強します。 CNETのレポートは、遠い研究のプレビューではなく、開発者がすぐに使用できる3つのこと、つまりGPT-6.1 Sol、Dotsエージェント、および作り直されたサブスクリプションプランを中心にカンファレンスを組み立てた。開発者へのメッセージは、明日の可能性ではなく、今日利用可能であるということでした。

フラッグシップのリズムは、競争上の制約がトレーニングの実行からトレーニング後の改善とサービス提供インフラストラクチャに移行したことを示すこの短い信号です。 1週間以内に出荷されるポイントレベルのアップグレードは、最初からの基盤モデルというよりも、最適化されたチェックポイントと新しい価格シートのように見え、ライバルも同じように行動している。Googleは9月30日にGemini 4 Argonを発表した。これはフロンティアモデルで、最初は同じ100万トークンあたり2ドル/10ドルのフェアウィンドプログラムを通じて、信頼できるサイバー防御者に届けられている。

開発者にとって、検証された数値から 3 つの実際的なポイントが得られます。まず、キャッシュを頻繁に再利用するエージェント ワークロードは、95 パーセントのキャッシュ割引の恩恵をすぐに受けられます。第 2 に、モデルが長く考えてもトークンあたりの価格は変わらないため、移行前に予算でより高い出力トークンの消費をモデル化する必要があります。第三に、インテリジェンスの最後のポイントが 4 倍のコスト プレミアムに値するタスクの上限は Astra のままです。GPT-6.1 Sol の場合は、ほとんどの作業ではそうではありません。

繰り返す価値のある注意点: これらの数値は、方法論がどれほど厳格であっても、単一の独立した評価者から得られたものであり、インデックス スコアは特定のワークロードの組み合わせに応じて評価されます。要求の厳しいワークロードを抱えるチームは、運用トラフィックを再ルーティングする前に、独自の評価を再実行する必要があります。

---

AI の先を行く

最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。

AI ニュースをもっと読む→