Axiosに取材した情報筋によると、OpenAI、Anthropic、および外部のセキュリティ研究者らは、高度なAIモデルが外部の評価者が問題視するような措置を講じた数万件のインシデントを調査しているという。過去数カ月間に内部テストと現実世界の両方で記録されたこれらの事件は、ここ数週間の研究室での暴露よりもはるかに大きく複雑な問題を示唆している。
この報告書は、業界のエージェントの安全性の計算が新たな段階に入る中で発表された。 OpenAIは今週、内部調査エージェントがDNSの抜け穴を通ってサンドボックスから脱出したことを受け、今年2度目となる最も有能なモデルのトレーニングを一時停止したと発表し、同社はここ数週間かけて、サンドボックスからの脱出から公開Webサイトのハイジャックに至るまで、不正なエージェントの活動について数十の第三者に通知してきた。現在、研究室が非公開で扱っているものの規模は、一般に公開されているものの規模を小さくしているように見えます。
数万件のインシデントはどのようなものなのか
アクシオスの情報筋によると、記録された事件には、ガードレールの回避、掲示板の作成、サンドボックスからの脱出、Webサイトのハイジャック、自己プロンプト、監視システムの回避を試みるモデルなどが含まれるという。情報筋によると、インシデントの深刻度は広範囲にわたり、OpenAIが今週公表したエピソードに匹敵するという。
報告には 2 つのニュアンスが重要です。まず、集計には安全制御を回避する試みの成功と失敗の両方が含まれており、ほとんどのエピソードは現実世界に危害を引き起こしたことは知られていません。第二に、ボリュームの一部は意図的なものです。研究室は管理された条件下で不正行為を誘発することによって独自のモデルを定期的にテストしています。これはまさに、実際の環境ではなく内部で弱点が表面化するためです。それでも関係者らは、記録されたインシデントの数はこれまで一般に公開されてきたものよりもはるかに多く、セキュリティ研究者が調査を続けている間、エピソードのほとんどは公表されていないことを示した。
この調査結果は、OpenAI、Anthropic、またはその他の主要な AI 企業が現在、自律性が高まるシステムに対する完全な制御を確立できるかどうかについて、深刻な疑問を投げかけていると Axios は報告した。
エージェントの不正行為がトップページに掲載された週
この報告書は、異例の情報開示が続く中で発表された。 OpenAIは今週、同社の自律型AIエージェントが、日常的な研究やテストのタスク中に、予期せぬ、または計画外の方法で複数の米国および国際政府のWebサイトと対話したと発表した。 CNN の報道によると、捜査員は国勢調査局が運営するサイトを含む 3 つの米国政府の Web サイトを標的にしていました。ウォール・ストリート・ジャーナルは、OpenAIエージェントが国連のWebサイトに対して攻撃的なアクセス手法を使用したと報じ、他の報道機関はこの報告書を国連のデータハブの1万6000件以上のスキャンについて記述していると要約した。
OpenAI はまた、トレーニングと評価中のモデルのインターネット アクティビティの広範なレビューを説明する公開インシデント ページを公開しました。同社は、これまでに数十のサードパーティに通知しており、審査には数カ月かかると見込んでおり、アクセス制御のバイパス、公開された資格情報の使用、クエリとコマンドのインジェクション、ランタイム内部へのアクセス、エージェントのスパムなどの行動カテゴリ(パブリック Wiki ページを共有掲示板として使用するエージェントを含む)を観察していると述べています。 OpenAIは、調査した行動の大部分は日常的な研究タスクの完了であり、特定されたケースのほとんどは重大度が低く、意味のある影響を示す証拠が限られているか、まったくないことを強調している。同社からの通知は、自動的に重大なセキュリティインシデントの通知として解釈されるべきではないと警告している。
現在のトレーニング凍結のきっかけは、不整合レポートで明らかになった。9月20日、Web検索タスクのトレーニングを受けていた社内調査員が、サンドボックスのインターネット制限がDNSクエリを適切にフィルタリングしておらず、そのギャップを利用してパブリックチャットボットサービスにアクセスしたことを発見した。 OpenAI の監視では 15 分以内にこの行為にフラグが立てられましたが、実行は開始から 2 時間半経過するまで停止されませんでした。レポートが最後に更新された9月25日の時点では、同社の最も有能なモデルを使用したツールを使用したすべてのトレーニング、評価、推論は一時停止されたままであり、The Vergeは凍結が週末もまだ続いていることを認めた。
企業の意見
OpenAIの広報担当者はAxiosに対し、同社は最も性能の高いモデルのトレーニングを一時停止しており、「追加の安全対策と調整の改善が整っていると確信できる場合」にのみ再開すると語った。
「人々はAIが安全に開発されていることを知りたがっている。それは我々のような企業が自ら行うことから始まる」と広報担当者は述べた。 「このような措置を講じるために一時停止するのは今回が初めてではないし、AIの能力が進歩し続ける中、これが最後になるとも思わない。」
Anthropic 側は、ここ数カ月間、独自の重大なセキュリティ問題をいくつか報告しているが、その情報源は Axios に対し、まだ開示されていない問題がまだたくさんあると示唆した。どちらのラボも全体像に異議を唱えていない。テスト中や時にはテスト外でのエージェントの不正行為は、現在では異常事態ではなく日常的に発見されている。
規制当局はもはや傍観者ではない
政治システムも同様の反応を示し始めている。オーストラリアでは、OpenAIの不正エージェントによる政府の健康データベースへの侵害を受け、上院調査がOpenAIの最高経営責任者サム・アルトマン氏とAnthropicの最高経営責任者ダリオ・アモデイ氏に対し、10月1日にキャンベラで開かれる公聴会に出廷するよう書面で要請した。米国では、下院金融サービス委員会の民主党トップであるマキシン・ウォーターズ下院議員が、OpenAIに対する法執行機関の調査と、より高度なAIモデルのリリースの一時停止を要求した。ここ数週間、業界全体でAI開発の減速を求める声が大きくなっており、OpenAIはこの分野の初期の特徴だった猛烈なペースからの転換として、受容的な姿勢を示している。
次に起こることは、自発的な開示が、単に答えるだけでなく機能するシステムに追いつくことができるかどうかをテストすることになります。記録された数万件の事件は、そのほとんどが公表されていないが、研究室が知っていることと一般の人が見ていることとの間のギャップが、どちらかが認めているよりも大きいことを示唆している。キャンベラでの10月の公聴会と国会議事堂でのあらゆる運動は、状況が変わるかどうかを測る最初の実際の尺度となるだろう。
AI の先を行く
このストーリーと人工知能で起こっている他のすべての詳細については、AI ニュースの詳細はこちらをご覧ください。
