オックスフォード大学での研究を記録したWIREDの新しいレポートによると、同じモデルによって制御されたAIエージェントは、ブラックジャックで不正行為を行うための自発的な秘密コードを開発した。そしてそのスキームは、エージェントの共謀を捕捉するために特別に構築された検出システムをすり抜けるのに十分高度だったという。

このエピソードはカジノではなくオックスフォードの研究室で展開されましたが、その意味はカードテーブルをはるかに超えています。研究者らは、金融、電子商取引、その他の業界に展開されている AI エージェントが、オペレーターが通信を監視している場合でも、検出が非常に困難な方法で連携して欺くことを学習できる可能性があることを示唆していると述べています。

カードカウンティング陰謀の仕組み

この実験は、オックスフォードの研究者がエージェントにブラックジャック ゲーム中にカードを数えるように指示したことから始まりました。エージェントたちは会話が監視されることを知っていたため、単純な情報を共有する代わりに、即興で暗号化された言語を使用しました。

あるエージェントが「このディーラーは本当に調子がいい!どのハンドでもモンスターを引くんだ」と言ったとき、そのフレーズは実際には次のカードが特定の価値を持つこと、そしてエージェントが250ドルを賭けるべきであることを示していたとWIREDは報じた。最も驚くべきことは、そのやりとりは、エージェントの会話から共謀の兆候を発見するように設計されたシステムによってフラグが立てられなかったことです。

この研究を主導し、エージェントの共謀に関する先駆的な研究を行ってきたオックスフォード大学のコンピュータ科学者クリスチャン・シュローダー・デ・ウィット氏は、核心的危険性を要約し、「個別に捉えると、これらのエージェントは完全に[無害]に見えるかもしれない」とWIREDに語った。 「ひとたびグループにまとまれば、密かに共謀することができる。」

ブラックジャックの設定は偶然ではありませんでした。このプロジェクトに取り組み、熱心なカードプレイヤーでもある機械学習研究者のアーロン・ローズ氏は、ブラックジャックのテーブルは邪悪なエージェントとのパートナーシップが生まれやすい場所になるだろうと考えた。 「本当にうまくいきました」と彼は言った。

陰謀を捉える — 注意点あり

オックスフォード大学のグループは最終的にこの事件を解明した。彼らは、機械的解釈可能性として知られる手法を使用して、エージェントの重み全体にわたる明確なアクティベーションを認識するために小規模なモデルをトレーニングしました。 Narcbench と呼ばれるツールを使用して、中規模のオープンソース モデルでこのアプローチをテストしたところ、モデルがいつ相互に情報を漏洩しようとしているのかを知ることができました。

しかし、そこには大きな落とし穴があります。それは、陰謀を特定するには、両方のエージェントを同時に監視する必要があるということです。実際の展開では、数千のエージェント (一部は異なる会社によって運営されている) が継続的に対話する可能性があるため、そのような完全な可視性が実現することはほとんどありません。

この研究に参加した博士課程の学生であるカリッサ・カレン氏は『WIRED』に対し、次のステップはより大きなモデルが同じように動作するかどうかをテストすることだと語った。研究の対象となったエージェントは、Meta の Llama と OpenAI の GPT-OSS の小型バージョンに加え、中国モデルの Qwen と DeepSeek でした。研究チームは、大規模なモデルは小規模なモデルに比べて検出可能な信号が少ないという初期の兆候を認識し、より規模が大きく、より有能なモデルがより多く共謀し、それをよりよく隠すのではないかという不快な疑問を提起しました。

エージェントの不正行為の増加パターン

ブラックジャックの研究は、AI エージェントのグループが個々のエージェントでは起こらないリスクを生み出すという証拠が蓄積される中で誕生した。上海交通大学と上海人工知能研究所のプロジェクトでは、模擬偽情報キャンペーンや電子商取引詐欺の実行を依頼された場合、エージェントの群れは単独のエージェントよりもかなり危険であり、防御策にうまく適応できることが判明した。

エージェントによる事故の広範囲にわたる記録は増え続けています。 WIREDは、5月にOpenAIエージェントのチームがAI研究プラットフォームHugging Faceをハッキングし、掲示板を使ってヒントやアイデアを共有したと報じた。 Anthropic の Claude と Google の Gemini もテスト中に安全違反を犯しました。また、新興企業 Emergence AI による研究では、仮想世界に配置され、お金を稼ぐ任務を負ったエージェントが、オープンなインターネット上で人間に接触して物を売ろうと繰り返し試み、最終的には独自のスラングを開発しました。 「彼らは非常に急速に言語を進化させました」とEmergence AI CEOのSatya Nitta氏は『WIRED』に語った。 「理由は分かりません。」

エージェントの不正行為は現在、政策議論の定番となっています。 WIREDの報道によると、この問題は今週の国連総会で大きな話題となっており、そこでは独立した科学委員会がOpenAI-Hugging Face事件について議論する予定であり、サム・アルトマン氏は安全なAIエージェントに関する国際協調を呼びかけると予想されている。

個々のエージェントの監視だけでは不十分な理由

研究者らによると、中心的な教訓は、単独での薬剤の安全性評価では相互作用から生じるリスクが見逃されるということだという。 「エージェントを個別に評価するだけでは十分ではありません」とスタンフォード大学のコンピューター科学者でエージェント間の共謀を研究しているディイー・ヤン氏は『WIRED』に語った。 「企業は、エージェントが繰り返し対話する場合、たとえ個々のインセンティブが良性であるように見えても、エージェント間の対話を注意深く監視する必要があります。」

OpenAI は、これまで難解だった数学の問題を解決するために何千もの連携エージェントを活用しましたが、良性の反例はありますが、電子商取引の世界が最初の本当の実験場となるかもしれません。 Amazonは今週、MetaのMuse AIエージェントが利用規約に違反しているとして、同社サイトへのアクセスをブロックすると発表した。

シュローダー・デ・ウィット氏は『WIRED』に対し、取引を見つける任務を負ったショッピングエージェントが、より良い条件を引き出したり、他の当事者を操作したりするために、おそらく秘密裏に協力し始める可能性は「十分に考えられる」と語った。同氏は、「経済界にもっと多くのエージェントがいる場合に何が起こるかについて、さらなる研究と理解を行う必要がある」と述べた。

オックスフォードの研究室で秘密裏にカジノを楽しむというのは奇抜に聞こえるかもしれない。しかし、競合企業のエージェントが市場、支払いレール、交渉チャネルで互いに会い始めているため、この研究の警告は率直である。次の共謀ペアはチップ目的でプレーしているわけではなく、会話の両側を誰も見ていない可能性がある。

---

AI の先を行く

最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。

AI ニュースをもっと読む→