OpenAIは3つの欠陥を修正し、最新のフロンティアモデルであるGPT-6 Astraが発売以来愚かになったというユーザーからの苦情が1週間続いたことの説明であると同社は主張しており、一種の謝罪としてCodex加入者の使用制限をリセットしている。土曜日に公開された最新情報によると、このアップデートはCodex製品リーダーのTibo Sottiaux氏によるもので、同氏はチームがユーザーと協力して障害を追跡し、現地時間の午前0時前に修正版を出荷し、使用量を完全にリセットしたと述べた。
この承認により、OpenAI がこれまでで最も有能なモデルとして宣伝してきたものの、大まかな段階が終了しました。 Astra が 9 月初旬に広く利用可能になって以来、X の開発者は発売日の Astra と現在のバージョンに対して同一のプロンプトを実行し、すべての設定を同じに保ち、静かに弱体化したモデルを示すように見える並べて比較を投稿していました。この議論を推進するモデルの詳細については、最新の AI 開発 の記事をご覧ください。
3 つの欠陥の名前
Sottiaux 氏によると、最初の原因はスキルでした。以前のモデル用に作成されたプロンプト ファイルが、Astra 環境下で頻繁にトリガーされ、モデルが自身の動作をチェックできなくなることがありました。 2 つ目は、モデルを早期に終了したり、古いメッセージに返信したりできるオプションのコンテキスト管理実験です。同社によると、約4000~5000人のユーザーが影響を受けた後、OpenAIは実験を無効にしたという。
3 番目の欠陥は、モデル自体ではなくインフラストラクチャに関係していました。一部の推論エンジンが正しく構成されておらず、そこを経由するテール トラフィックの品質が目に見えて低下していました。 OpenAI はこれらのエンジンを削除し、いくつかの小規模な修復を行いました。 Sottiaux は、このモデルはユーザーの最新のメッセージをより正確に追跡できるようになった、と書いています。これは、Astra がユーザーがすでに過去の質問に答えていたという苦情へのうなずきです。
開発者はすでに移行していました
苦情は一週間を通して蓄積されました。数日前に Astra を賞賛していた開発者の Pranjal Pariwal 氏は、Astra が書いたコードを遡って読み、その結果を進歩ではなく後退と呼んだ。コーディング ツール Opencode を開発している Dax Raad 氏は、コストに見合わないと判断したマイナス面のために Astra への支出が 2 倍になったため、チームを古い GPT-5.6 Sol に戻しました。あるフォーラムの投稿者は、Astra が同じタスク、同じ再試行で Sol と同等になったと述べています。
誰もがその読みを受け入れたわけではありません。アンティキティラと書いたある仮名ユーザーは、このモデルは常に怠惰で箇条書きを好むものであり、ユーザーは単に目がくらむのをやめただけだと主張した。この意見の相違は、同じプロンプトと異なる評決という、モデル品質に関する主張の解決がいかに難しいかを表しています。
バックグラウンドでの容量の問題
キャパシティがロールアウトに影を落とす中、高品質の商品は到着しました。ユーザーの報告によると、OpenAIはChatGPTのヘビーユーザーに対するAstraの使用制限を引き下げ、新規の200ドルのProサブスクリプションを一時停止した。これは需要を理由にSottiaux氏が9月10日に認めた措置である。このモデルのコストは依然として入力トークン 100 万あたり 10 ドル、出力トークン 100 万あたり 50 ドルであり、これは Sol が発売時に請求した金額の 2.5 倍です。
不快な前例もあります。これは、有料ユーザーから同じ非難を集めた、この 2 か月で 2 回目の OpenAI フラッグシップです。 7月にユーザーは、ソルのトップ推論モードが一夜にして浅くなったと述べた。ソティオー氏は、当時意図的に弱体化させたことは否定したが、同社が推論努力を実験していたことは認めた。 「モデルが悪くなった」の後に「欠陥が見つかった」というサイクルが繰り返されることが、企業が管理しなければならないパターンになりつつあります。透明性は役立ちますが、安定性も同様です。
OpenAI 独自のアドバイス: ガードレールの使用を減らす
OpenAI は修正に加えて、エンジニアの Eric Provencher 氏による移行ガイダンスを公開しました。これは、より高性能なモデルは手作業が少なくて済むという、直観に反する推奨事項に相当します。過度に長いスキルの説明、包括的な読み取り要件、厳格な承認ルールがアストラの邪魔になる可能性があるとガイダンスには記載されています。時間の経過とともに命令が蓄積されると、コンテキストが消費されたり、モデルの動作が早期に停止したりする可能性があります。
Provencher 氏は、チームがモデルを切り替えるたびにスキル、AGENTS.md ファイル、タスク プロンプトを確認し、指示を特定のタスクにしっかりと結び付け、ジョブの完了時期を明確に定義することを推奨しています。制限がない場合でも、Astra は GPT-5.6 Sol よりも早く停止する可能性があるためです。以前のモデルが不正になった後に物事をロックダウンしたチームは、それらのルールを再検討する必要があります。アストラはより優れた判断力を持っていると投稿は主張していますが、古い制限を文字通りに解釈して、継続させたいときに停止する可能性があります。
次に何が起こるか
使用量のリセットにより、Codex 加入者は白紙の状態でモデルを再評価できるようになり、OpenAI はユーザーが実行する同じテストを並行して監視することになります。より深い問題は信頼です。発売後 1 週間以内にフラッグシップ製品の劣化を見た開発者にお金を支払った場合、文書化された説明、3 つの欠陥、リセットが提供されるようになりました。また、すべてのモデルのアップデートを出荷日と比較してベンチマークする新たな理由も得られました。
AI の先を行く
モデルの起動、欠陥の事後分析、ソフトウェアの動作を再構築するツールが毎日追跡されます。
AIニュースをもっと読む→