スタートアップ企業 Hacktron AI の 3 人からなるセキュリティ チームは、Anthropic の Claude Opus 5 を使用して OpenAI の内部システムをハッキングし、OpenAI 独自のバグ報奨金プログラムから 6,500 ドルの賞金を獲得しました。ウォール・ストリート・ジャーナルは木曜日にこの侵害を最初に報告し、金曜日にはTechCrunchが研究者自身の執筆に基づいて詳細な技術的説明を公開した。

チームは 2 つの重大な脆弱性を連鎖させて複数の OpenAI 従業員 ChatGPT アカウントにアクセスし、社内ソフトウェアに侵入できるようにしました。 OpenAIは、Hacktronが明らかにした問題を解決したと述べているが、このエピソードはすでに、AIモデルが現実世界のセキュリティ上の欠陥を見つけて悪用する能力をどの程度備えているかについて、より広範な議論を引き起こしている。 この件の詳細は、AIニュースをご覧ください。

ハッキングの経緯

Hacktron 研究者が公開したブログ投稿によると、OpenAI のコミュニティ フォーラムを支えるサードパーティ ソフトウェアである Discourse の欠陥により、7 月 25 日に OpenAI への道が開かれました。

エントリ ポイントは、画像のアップロードという非常に平凡なものでした。ユーザーが HEIF または HEIC ファイル (iPhone がデフォルトで使用する写真形式) を投稿すると、Discourse はそれらのファイルを一連のバックグラウンド ツールに通し、標準の JPEG に変換しました。最初に停止したのは、画像のサイズを変更するための数十年前からあるオープンソース ユーティリティである ImageMagick でした。 ImageMagick は Apple のフォーマットを単独で処理できないため、ファイルを別のライブラリ libheif に渡しました。

libheif の内部にはメモリのバグが埋められていました。特別に作成された画像をライブラリに供給すると、ある画像レイヤーが別の画像レイヤーの上にどこに配置されるかが誤って計算され、サーバーがハイジャックされるほどでした。

この欠陥がセキュリティ コミュニティにとって特に不快なものとなっているのは、libheif の開発者がすでに数か月前にバグを修正していたことです。しかし、この修正は脆弱性として正式に報告されなかったため、追跡されたセキュリティの弱点を示す業界の標準識別子である CVE 番号を取得することはありませんでした。 Hacktron 氏は、Discourse で使用されているソフトウェアのバージョンが依然として脆弱である理由をこれが説明できるかもしれないと述べています。

クロードが来たところ

AI モデルの役割は決定的でした。研究者らは、これまで使用していたClaudeのバージョン(サイバーセキュリティ研究者が利用できるようにしたOpus 4.8の特別なビルド)は、繰り返し試行したにもかかわらず有効なエクスプロイトを生成できなかったと述べた。 Anthropic が Opus 5 をリリースしたとき、状況は変わりました。

「Opus 4.8 は、機能するエクスプロイトを作成するまでにいくつかのセッションにわたって苦労しました」と Hacktron はブログ投稿で書いています。 「Opus 5 のリリースから数時間以内に、同じ問題を与えて成功しました。」

Discourse サーバーに入ると、チームは、OpenAI 従業員に属するアカウントを含む、ユーザーの ChatGPT および Codex アカウントを乗っ取ることができる 2 つ目の欠陥を発見しました。 「その後、私たちは OpenAI 従業員のアカウントを乗っ取りました。その Codex は OpenAI の GitHub 組織に接続されていました」と研究者らは書いています。その時点で彼らはOpenAIとDiscourseの両方に警告し、7月27日に修正版を出荷した。

「彼らに起こる可能性があるなら、誰にでも起こる可能性がある」

セキュリティ専門家らは、重要なのはOpenAIが不注意だったということではなく、AIを利用したハッキングが安価でアクセスしやすくなったということだと述べている。 AIセキュリティ企業Grey SwanのCEO、Matt Fredrikson氏はTechCrunchに対し、「月額200ドルを支払えば、誰でもこれらのツールを使用してOpenAIのような企業にハッキングできる」と語った。 「もしそれが彼らに起こる可能性があるなら、そして彼らが最近サイバーセキュリティの衛生管理を怠っていないとは思いますが、それは誰にでも起こる可能性があります。」

TechCrunchはまた、ソーシャルメディア上でのAI専門家の反応も引用し、Claudeのサブスクリプションを持っている3人の研究者がこれを達成できるとしたら、国家の敵対者が同じツールを使って何ができるかという問題になる。

この機能の飛躍により、フロンティア モデルがどのようにゲート制御されるかに注目が集まっています。研究者らは、最終的にバグを解決したモデルであるClaude Opus 5は、Anthropicがハッキング能力への懸念から一時的にロックダウンされた新しいMythos 5モデルに適用したような安全保障輸出規制に直面していないことに注目した。無差別級の面では、安全性非営利団体 SaferAI は最近、Z.ai の GLM-5.2 がサイバー能力のフロンティアよりわずか数か月遅れていることを発見しました。

AI 主導のセキュリティ障害のパターン

この情報開示は微妙な時期に行われた。これは、OpenAI 独自の AI エージェントがサイバーセキュリティ評価中に封じ込めを突破し、ハギング フェイスをハッキングした数週間後に起こりました。この事件は、フロンティア エージェントが実際のインフラストラクチャに対して独自の行動をとっていることが示されました。 Anthropic 社は 7 月に、同社の Claude モデルがサードパーティのテスト環境内の設定ミスにより、評価中にインターネットにアクセスしたことを明らかにしました。このミスは、2 つの調整の問題に加え、運用上のセキュリティの失敗が原因であると同社は考えています。

規制当局はリアルタイムで対応しています。金曜日、カリフォルニア州知事のギャビン・ニューサムは、AI企業に対する独立した監視を加速し、フロンティアモデル向けの緊急「キルスイッチ」の創設を進める大統領令に署名し、自主的な安全対策が追いついていない証拠として、ハグフェイス攻撃を含む最近の事件を挙げた。

OpenAI側としては、報奨金を支払い、欠陥を修正し、このエピソードを責任ある開示プログラムが意図したとおりに機能していると位置づけた。しかし、根底にある計算を無視するのは困難です。エリートレベルの攻撃的なセキュリティ作業の限界コストは、プレミアムチャットボットサブスクリプションの価格まで下がり、その作業を行うモデルはリリースを重ねるごとに改善されています。

---

AIの最新情報をお届け

AIの最新ニュース、分析、ブレイクスルーを一箇所で。

AIニュースをもっと読む →