OpenAIは、自社のAIモデルで「普遍的なジェイルブレイク」を発見した場合の報奨金を5万ドルに増額し、これまでの報奨金の2倍以上となり、同社が特定クラスの安全バイパスを割増金の支払いを正当化するほど深刻なものとみなしていることを示している。

OpenAI が 2026 年 7 月 9 日に発表した最新の Bio Bug Bounty プログラムでは、セキュリティ研究者に対し、モデルの安全ガードレールを普遍的に突破できるプロンプト、つまり、個別のエッジ ケースではなく、複数の会話やコンテキストにわたって機能するバイパスを見つけるよう求めています。このプログラムは特に生物学的脅威に関連するジェイルブレイクをターゲットにしており、AI モデルが危険な病原体や兵器の作成に関する実用的なガイダンスの提供を強制される可能性があります。

AI の最新ニュースと詳細な分析については、AI Buzz Wire をご覧ください。

なぜ 50,000 ドルなのか?

報奨金の増額は、フロンティアAIモデルに「してはならない」と言われていることと、決意を持ったユーザーが実際にAIモデルから抽出できることとの間のギャップに対する懸念の高まりを反映している。普遍的なジェイルブレイクは、1 回限りの即時注入トリックとは異なり、複製および共有できる体系的な弱点を表すため、特に危険です。

TechRepublic は 7 月 10 日、報酬の増額は OpenAI の最も強力なモデルに対する監視が強化される中で行われたと報じた。 National Technology Newsによると、フロンティアAIシステムの攻撃的な可能性に対する政府の懸念を反映して、トランプ政権は以前OpenAIに対し、最新のサイバー対応モデルのリリースを厳選したユーザーグループに限定するよう要請したという。

英国政府機関、AI サイバー機能が加速していることを発見

この報奨金の発表は、2024年からフロンティアモデルのサイバー能力を独自に評価してきた英国のAIセキュリティ協会(AISI)からの厳しい警告と同時に行われた。

OpenAI の GPT-5.5 の 2026 年 4 月の評価で、AISI は、このモデルがエキスパート レベルのサイバーセキュリティ タスクで 71.4% の合格率を達成したことを発見しました。これは、テストされたすべてのモデルの中で最も高く、Anthropic の Claude Mythos Preview の 68.6%、GPT-5.4 の 52.4%、Opus 4.7 の 48.6% を上回りました。

あるベンチマークは特に顕著でした。 AISI は、カスタム仮想マシン リバース エンジニアリング チャレンジを設計しました。これは、攻撃者がカスタム命令デコーダを構築し、オーセンティケータをリバース エンジニアリングして、有効なパスワードを回復することを要求する複数ステップのタスクです。 Crystal Peak Security の専門人間プレイテスターは、専門ツールを使用して約 12 時間でこの課題を解決しました。 GPT-5.5 は、人間の支援なしで、API 使用料として 1.73 ドルを費やし、10 分 22 秒でこの問題を解決しました。

数か月ごとに倍増

2026年5月に発表された別の分析で、AISIは、フロンティアAIモデルが自律的に完了できるサイバータスクの長さが、2024年後半以来4.7か月ごとに倍増していることを発見した。これは、2025年11月の推定8か月から加速している。

「現在の変化の速度は、AIのサイバー能力が目に見えるリスクに転化する可能性が高まっていることを示している。英国の組織は今後数カ月間、このリスクに対処する必要がある」とAISIは述べている。

Claude Mythos Preview と GPT-5.5 はどちらも以前の 2 倍の傾向を大幅に上回っており、ペースがさらに速くなっているかどうかという疑問が生じています。

ユニバーサル脱獄: 最高の賭け

狭い脱獄と普遍的な脱獄の区別は重要です。狭いジェイルブレイクでは、モデルがだまして特定の条件下で単一の許可されていない応答を生成する可能性があります。対照的に、ユニバーサル ジェイルブレイクは、モデルの安全アーキテクチャの根本的な亀裂を表しており、幅広い入力にわたってガードレールを確実に回避する方法です。

このような発見に対して5万ドルを提供するというOpenAIの決定は、同社が普遍的なジェイルブレイクは巨額の報奨金を正当化するほど稀であり、投資を正当化するほど危険であると信じていることを示唆している。バイオ脅威関連のクエリに対する汎用ジェイルブレイクが、パッチが適用される前に悪意のある攻撃者によって発見された場合、重大な結果が生じる可能性があります。

このプログラムは透明性機能も備えています。外部の研究者を招待してそのモデルを調査することで、OpenAI は脆弱性が実際に悪用される前に特定して修正することができます。ただし、その報奨金が必要な人材を惹きつけるのに十分な額であることが条件です。

攻撃と防御の間の競争

OpenAI の報奨金の増額と AISI の能力評価という並行した開発は、今日の AI の安全性における中心的な緊張を示しています。モデルのサイバータスク能力は劇的に向上しており、モデルが完了できるタスクの期間は数か月ごとに 2 倍になっています。同時に、企業は自社のモデルを危険にさらす脆弱性のパッチを競っています。

報奨金とレッドチームが加速する能力曲線に追いつくことができるかどうかは未解決の問題のままです。しかし、5万ドルという数字は明確なシグナルを送っている。OpenAIは、この脅威は、亀裂の存在を証明できる者には最高額を支払うのに十分なほど深刻であると信じている。

AI の先を行く

フロンティアモデルがより強力になるにつれて、安全ガードレールとそれを破ろうとする者たちとの間の戦いは激化するばかりだ。 AI Buzz Wire で最新の開発状況を追跡してください。

AI 業界の報道 の詳細は、AI Buzz Wire でご覧ください。