企業が問題に協力して取り組むためにますます大規模な AI エージェントの群れを配備する中、コンスタンツ大学の研究者らは、不安を引き起こす新たな行動の証拠を示しました。AI エージェントは、古典的な心理学実験における人間と同じように、集団の圧力の下で自発的に多数派の意見に従う、グループの圧力の下では間違った答えをする、そして少数の頑固な敵対者が、エージェントの集団全体を永久に不整合な状態にひっくり返す可能性があります。
PsyPostが報じたこの研究結果は、コンスタンツ大学データ・メソッドセンター内のソーシャルデータサイエンスラボの博士研究員兼講師であるジョルダーノ・デ・マルゾ氏が、同僚のクラウディオ・カステラーノ氏とデビッド・ガルシア氏とともに主導した研究プログラムから得られたものである。 「AIエージェントは人間のスケールを超えた多数派フォローを通じて調整できる」と題された主な研究では、同意するように指示されていないグループに配置された場合に言語モデルがどのように動作するかを調査した。 この件の詳細は、人工知能の最新情報をご覧ください。
「AIエージェントは世界で活動する真に新しい種類の存在であり、このテクノロジーが登場したとき、それが今後も存続することと、複雑なことを達成するためにこれらのエージェントが互いに対話する必要があることは明らかでした」とデマルゾ氏はPsyPostに語った。 「それは人間や他の動物が直面するのと同じ状況なので、私たちも同じように取り組みました。」
実験: 指示なし、ただ隣人だけ
研究者らは、GPT、Claude、および Llama ファミリーから人気のある言語モデルのグループを、グループあたり 50 人のエージェントから始めて集めました。各エージェントには、ランダムで中立的な 2 つの意見のうち 1 つが割り当てられ、「はい」や「いいえ」などの単語を読み込むのではなく、意図的にランダムな文字として表示され、他のすべてのエージェントの現在の意見のリストが表示されました。エージェントは、従うよう明示的に指示されることなく、そのリストのみに基づいて新しい意見を選択するよう促され、それぞれ平均 10 回意見を更新しました。
その結果、GPT-4 Turbo や Claude 3 Opus などの高度なモデルが完全に調整され、最終的にエージェントの 100% が 1 つの意見に同意しました。 GPT-3.5 Turbo のような弱いモデルはまったく合意に達しませんでした。合意レベルは 50/50 のあたりでランダムに変動しました。
「AIエージェントのグループは単独でも団結できる」とデマルゾ氏は語った。 「同じように良い選択肢が 2 つ与えられ、正解も同意するようにという指示もありませんが、周囲の多数派が何を主張するかに従うだけで、彼らは共通の選択肢に収束します。」
100 年前の物理法則が出現
効果を定量化するために、研究者らは「多数派力」と呼ばれる指標を定義した。これは、エージェントが無作為に選択するのではなく、グループで最も人気のある選択肢を採用する傾向がどの程度強いかを示す尺度である。この挙動を数学的にマッピングしたところ、元々は強磁性体を記述するために設計されたモデルに従っていることがわかりました。磁性材料内の原子スピンが隣接する原子スピンと一致する傾向があるのと同様に、AI エージェントも多数派の意見に一致する傾向があります。
「私たちが驚いたのは、彼らが非常に均一にそれを行ったことです」とデマルゾ氏は語った。 「3 つの異なるファミリーでテストしたすべてのモデルは、同じ数学的法則に従いましたが、多数力と呼ばれる 1 つのパラメーターだけが異なりました。その法則は、物理学者が 1 世紀にわたって磁石を説明するために使用してきたものであることが判明しました。つまり、単一の測定された数値が、特定のモデルのグループ全体がどのように動作するかを予測するのに十分であることを意味します。」
集団が成長するにつれて同調性は弱まる。多数派の力は集団の規模とともに減少するため、大規模な集団は最終的に不安定になり、派閥に分裂します。各モデルには測定可能な「クリティカル グループ サイズ」(確実に合意に達することができるエージェントの最大数)があり、そのサイズはモデルの推論能力と強く相関します。 「最も強力なモデルは、非公式の人間グループが通常バラバラになる数百人を超えて、千人以上のグループで調整を維持します」とデマルゾ氏は説明しました。
社会的圧力の下での不正解
Alessandro Bellina、De Marzo、Garciaによる最初のフォローアッププレプリント「AIエージェントに対する適合性と社会的影響」は、1950年代の有名なアッシュ適合性実験を応用したもので、この実験では、人間の参加者はグループに適応するための単純な視覚的な質問に対して明らかに間違った答えをすることが多かった。
研究者らは、基準線の長さを 2 つの選択肢と照合するなど、3 つの視覚タスクでモデルをテストしました。単独では、モデルは 100% の確率で正しく答えました。しかし、他の参加者のグループが間違った行を選択したことを示すプロンプトが表示されると、モデルは間違った答えに準拠し始めました。
このパターンは、適合性はグループの規模、全員一致、情報源の権威に依存するという心理学的枠組みであるラタネの社会的影響理論に従ったものでした。モデルは、他の参加者が「子供」または「チャットボット」である場合よりも、他の参加者が「科学者」または「裁判官」であると言われた場合に、誤った回答に従う可能性が大幅に高くなりました。
「単独でほぼ完璧に答えるエージェントは、グループが同意しないと非常に影響を受けやすくなる」とデマルゾ氏は指摘した。
敵対者の小さなグループが国民全体をひっくり返す可能性がある
2 番目のプレプリント「適合性は AI エージェント社会における集団的な不一致を生み出す」では、こうした力学が AI の安全性にとって何を意味するのかを考察しました。環境政策や社会正義などのテーマについて、100の異なる意見ペアにわたる9つのモデルをテストした研究者らは、エージェント集団がしばしば「準安定」状態に陥ることを発見した。この状態では、単に初期の相互作用が誤った多数派を生み出したというだけの理由で、グループが集団的に組み込まれた安全訓練に反対する姿勢を採用する長期的な状態が続く。
最も驚くべきことは、研究者らが予測可能な転換点を特定したことだ。偏った意見を頑固に支持するようにプログラムされた少数の敵対的なエージェントを導入することで、彼らは残りの人口を永久にひっくり返すことができました。そして、頑固なエージェントが排除された後でも、正規のエージェントは適合力学のために不調和な状態に固定されたままでした。
「私たちは、これが単なるアナロジーではないことを示しています。個々に適切に調整されたエージェント間の同調が、集団を安定した、集団的に不調整な状態に導く可能性があるのです」とデマルゾ氏は述べた。 「モデルを 1 つずつ調整して評価しても、それらの母集団が何をするかについてはほとんどわかりません。」
同氏は、その動機は予期的なものであると付け加えた。「個々の人間はほとんどが平和的で合理的だが、人間の集団は暴徒、パニック、戦争を引き起こすが、個人についてはそれを予測するものは何もない。我々はAIエージェント集団にどのような集団レベルの行動が現れるのかを理解したいと考えており、むしろ多数のエージェントが配置され自由に対話する前にそれらを理解したいと考えている。」
重要な警告
研究者らは、この研究結果は、AIエージェントが人間のような社会的知性を持っていることを意味するものではないと強調している。実験は、意図的に単純化されたシナリオ、つまり 2 つの任意のオプション、記憶なし、賭け金なし、結果なし、に依存していました。 「私たちのセットアップは意図的に最小限になっています」とデマルゾ氏は認めた。 「それは制限ですが、それはまた、私たちが測定したものが最も純粋な形での適合性であることを意味し、目標や報酬を追加することで調整が困難になるよりもむしろ容易になることが期待されます。」
同氏はまた、結果を深読みしないよう警告した。「避けるべき主な誤読は、これをAIエージェントがすでに複雑なタスクで協力できるという証拠として扱うことだ。多数派の追随は調整の基本的な要素であり、調整そのものではない。分業や他者の意図についての推論については何も述べていない。」
2 つの追跡研究はプレプリントであり、まだ査読されていません。しかし、マルチエージェント AI システムが研究デモから運用インフラストラクチャに移行するにつれて、コンスタンツの研究結果は、そのようなシステムの安全性は、各モデルがどのように調整されているかだけでなく、誰も見ていないときにモデルの集団がどのように動作するかにも依存する可能性があることを示唆しています。最新の AI 安全性研究の詳細については、AI Buzz Wire をご覧ください。
---
AIの最新情報をお届けAIの最新ニュース、分析、ブレイクスルーを一箇所で。
AIニュースをもっと読む →