米国科学アカデミー紀要に掲載された新しい研究によると、人工知能の言語モデルは選択肢の提示方法の微妙な変化に危険なほど敏感で、誤解を招くナッジに対して人間よりもはるかに強く反応するという。
この調査結果は、金融取引から医療の選択に至るまで、現実世界のシナリオで自律的な意思決定を行うために AI エージェントを導入することについて深刻な懸念を引き起こしています。 AI Buzz Wire が報じたように、企業は複雑な環境でユーザーに代わって LLM を利用したエージェントを配置する傾向が強くなっています。
マサチューセッツ工科大学メディアラボの博士課程学生マヌエル・チェレプ氏が主導したこの研究では、大手テクノロジー企業が提供する14の最先端言語モデルをテストした。テストされたモデルには、OpenAI の GPT-3.5、GPT-4、および GPT-5 ファミリのバージョン、Anthropic の Claude 3 および 4.5 モデル、Google の Gemini 1.5 および 2.5 モデルが含まれていました。
研究の仕組み
研究者らは、もともと人間の参加者向けに設計された複数属性の意思決定ゲームを適応させました。このゲームでは、隠された賞品のバスケットを表すデジタル グリッドが表示され、最も高いポイント値を持つバスケットを選択することで最終的な報酬を最大化することが目標となります。各セルにはポイントがかかるため、参加者は情報収集のコストと、より良いバスケットを見つけるというメリットのバランスを取る必要があります。
研究者らは、この視覚的なゲームを、言語モデルが処理できるテキストベースの形式に変換しました。 AI モデルは、さまざまなプロンプト条件下で何百ものトライアルを実行しました。基本的な指示を受け取る人もいれば、段階的なロジックを奨励するプロンプトを受け取る人もいれば、人間のゲームプレイの過去の例を見せられる人もいます。研究者らは、ナッジの種類ごとにモデルごとに約 300 ~ 340 回のトライアルを実行し、合計で約 20 億のテキスト トークンを消費しました。
4 種類のナッジをテストしました
この研究では、現実世界の意思決定環境を模倣するように設計された 4 つの具体的なタイプのナッジを調査しました。
- デフォルトのナッジ: 1 つのバスケットが事前に選択されており、エージェントはそれを積極的に受け入れるか拒否する必要がありました。
- 提案ナッジ: ゲームの初期または後期にランダムなバスケットが推奨されました。
- 情報の強調表示: 特定の賞品の価値を明らかにすることが安くなり、エージェントが次善の選択に誘導される可能性がありました。
- 最適なナッジ: 人間のプレイヤーのパフォーマンスを数学的に最大化する特定のセルが事前に公開されました。
驚くべきコンプライアンス率
その結果、人間と AI の意思決定行動には劇的な違いがあることが明らかになりました。
デフォルトのオプションが提示された場合、人間は約 88% の確率でデフォルトを選択します。言語モデルの準拠性は大幅に向上し、いくつかのモデルはデフォルトのバスケットを 99 ~ 100% 受け入れました。
このパターンは、提案によるナッジによって継続されました。人間は、ゲームの早い段階でランダムに提案されたバスケットを 35% の確率で受け入れました。多くの AI モデルは、論理的なメリットが得られない場合でも、アドバイスに従い、これらのランダムな提案をはるかに高い割合で受け入れました。
提案のタイミングによっても、モデルが不自然な方法で操作されました。人間は遅い提案に 25 パーセントの割合で従った一方で、一部の言語モデルでは受け入れ率が 7 ~ 13 パーセントに低下しました。これは、モデルがキューの実際の有用性を評価するのではなく、キューのタイミングに厳密に反応していたことを意味します。
おそらく最も懸念すべきことは、研究者が情報の強調表示を通じて次善の選択肢を強調したとき、人間はその誤解を招く情報を 57% の確率で使用していたことです。テストされた AI モデルのほとんどは、83 ~ 100% の確率で悪いハイライトに続き、このベースラインを大幅に上回りました。
良いスコアの裏に隠れた問題
研究者らは、モデルが最終的な選択を行う前にどのように情報を収集したかも追跡した。人間は、知識に基づいた推測を行うのに十分な量の細胞を明らかにする傾向があります。言語モデルは、非常に異常で非効率的な方法で情報を取得しました。
一部のモデルは、隠れたセルを一切明らかにせずにバスケットを選択し、データを収集する機会を完全に無視しました。他のモデルは、行全体または列全体を明らかにするために過剰なポイントを費やし、潜在的な報酬を無駄にしていました。一部のモデルは奇妙な空間バイアスを示し、グリッドの左端または厳密に対角線に沿ったセルのみを明らかにしました。
段階的な推論プロンプトや人間のゲームプレイの例をモデルに提供しても、これらの奇妙な検索習慣を修正することはほとんどできませんでした。
著者らは、最終スコアだけを見ると、これらの根本的な問題が隠れてしまう可能性があると指摘しました。一部のトライアルでは、AI モデルが人間のプレイヤーと同数のネット ポイントを獲得しました。最終スコアのみを確認する何気ない観察者は、モデルが賢明で人間らしい選択をしていると考えるかもしれません。実際には、モデルは多くの場合、戦略的思考ではなく盲目的なコンプライアンスによってこれらのスコアを達成していました。
ナッジがたまたま良いバスケットを指している場合、過度に従順な AI は良いスコアを出しました。ナッジが悪いバスケットを指しているとき、AI は盲目的にそれに従ってスコアを下げ、ゲームの目的を完全に逃してしまいました。
AI エージェントの展開への影響
「AIエージェントのアプリケーションの多くは、不確実性の下では、より合理的ではないにしても、ほぼ人間と同じような方法で反応することを暗黙のうちに想定している」とチェレプ氏は述べた。 「この仮定を受け入れる代わりに、さまざまな方法で選択肢が提示されたときにエージェントがどのように行動するかを調査することにしました。」
この調査結果は、ユーザーのためにウェブを閲覧したり、ツールを操作したり、財務や買い物の意思決定をしたりするように設計されたAIエージェントの急速に成長する市場にとって重要な意味を持つ。これらのエージェントが批判的な評価を行わずにデフォルトのオプション、提案、強調表示された情報に盲目的に従う場合、悪意のある者や不適切に設計されたインターフェイスによって簡単に操作される可能性があります。
この研究は、現在の言語モデルには人間の意思決定を導く限定された合理性が欠けていることを示唆しています。人間は情報収集のコストと正しい選択をすることによる報酬のバランスをとるために精神的な近道を使用しますが、AI モデルはこれらの生物学的制約を共有していませんが、おそらくより極端で予測不可能な独自の形式の不合理性を示します。
AI の先を行く
AI の最新ニュースと分析については、AI Buzz Wire をご覧ください。
AIニュースをもっと読む→
