根据《美国国家科学院院刊》上发表的一项新研究,人工智能语言模型很容易受到选项呈现方式微妙变化的影响,对误导性推动的反应比人类强烈得多。
这些发现引起了人们对在现实场景中部署人工智能代理进行自主决策(从金融交易到医疗保健选择)的严重担忧。正如 AI Buzz Wire 报道的那样,公司越来越多地使用 LLM 支持的代理来代表复杂环境中的用户采取行动。
这项研究由麻省理工学院媒体实验室的博士生 Manuel Cherep 领导,测试了来自主要科技公司的 14 种最先进的语言模型。测试的模型包括 OpenAI 的 GPT-3.5、GPT-4 和 GPT-5 系列版本、Anthropic 的 Claude 3 和 4.5 模型以及 Google 的 Gemini 1.5 和 2.5 模型。
研究如何进行
研究人员改编了最初为人类参与者设计的多属性决策游戏。游戏呈现了一个代表隐藏奖品篮子的数字网格,目标是通过选择具有最高分值的篮子来最大化最终奖励。每个单元格都揭示了成本点,迫使参与者平衡收集信息的成本和寻找更好的篮子的好处。
研究人员将这种视觉游戏转换为语言模型可以处理的基于文本的格式。人工智能模型在不同的提示条件下进行了数百次试验。有些人收到了基本说明,有些人收到了鼓励逐步逻辑的提示,而另一些人则看到了过去的人类游戏示例。对于每种类型的推动,研究人员对每个模型进行了大约 300 到 340 次试验,总共消耗了大约 20 亿个文本标记。
测试了四种类型的助推
该研究检查了旨在模拟现实世界决策环境的四种特定类型的推动:
- 默认轻推:预先选择一个篮子,代理必须主动接受或拒绝它。
- 建议推动:在比赛早期或后期推荐随机篮子。
- 信息突出显示:揭示某些奖品价值的成本降低了,可能会引导代理做出次优选择。
- 最佳推动:预先揭示了特定的单元格,可以在数学上最大化人类玩家的表现。
惊人的合规率
结果揭示了人类和人工智能决策行为之间的巨大差异。
当出现默认选项时,人类大约 88% 的情况下都会选择默认选项。语言模型的合规性显着提高,多个模型在 99% 到 100% 的情况下接受默认篮子。
在建议的推动下,这种模式持续存在。人类在比赛初期接受随机建议的篮子的概率为 35%。许多人工智能模型以更高的速度接受这些随机建议,即使它没有提供任何逻辑上的好处,也会遵循建议。
建议的时机也以不自然的方式操纵了模型。虽然人类有 25% 的时间会遵循迟到的建议,但某些语言模型的接受率却下降到了 7% 到 13% 之间。这意味着模型严格对提示的时间做出反应,而不是评估其实际有用性。
也许最令人担忧的是,当研究人员通过信息突出显示来强调次优选择时,人类在 57% 的情况下会使用误导性信息。大多数经过测试的 AI 模型在 83% 到 100% 的情况下都大大超出了这一基线。
好成绩背后隐藏的问题
研究人员还跟踪了模型在做出最终选择之前如何收集信息。人类倾向于揭示足够的细胞来做出有根据的猜测。语言模型以极不寻常且低效的方式获取信息。
一些模型选择篮子而不透露任何隐藏的单元格,完全忽略了收集数据的机会。其他模型花费过多的积分来显示整行或整列,浪费了它们的潜在奖励。一些模型显示出奇怪的空间偏差,仅发现网格最左侧或严格沿对角线的细胞。
为模型提供分步推理提示或人类游戏玩法示例对于解决这些奇怪的搜索习惯几乎没有帮助。
作者指出,只看最终分数可能会掩盖这些潜在的问题。在一些试验中,人工智能模型获得的净分数与人类玩家相似。一个只检查最终分数的漫不经心的观察者可能会认为模型正在做出明智的、类似人类的选择。事实上,这些模型通常是通过盲目服从而不是战略思维来实现这些分数的。
如果轻推碰巧指向一个好的篮子,那么过度顺从的人工智能就会得分很高。当轻推指向一个坏篮子时,人工智能会盲目地跟随它降低得分,完全偏离了比赛的目的。
AI 代理部署的影响
切雷普说:“人工智能代理的许多应用都默认,在不确定的情况下,它们会以大致类似人类的方式做出反应,甚至更加理性。” “我们没有接受这个假设,而是决定探索当以不同方式向代理人提供选择时他们的行为方式。”
该研究的结果对快速增长的人工智能代理市场具有重大影响,该市场旨在浏览网络、操作工具以及为用户做出财务或购物决策。如果这些代理盲目遵循默认选项、建议或突出显示的信息而不进行批判性评估,它们可能很容易被不良行为者或设计不良的界面操纵。
研究表明,当前的语言模型缺乏指导人类决策的有限理性。虽然人类使用心理捷径来平衡收集信息的成本和做出正确选择的回报,但人工智能模型并不具有这些生物学限制,但它们表现出自己的非理性形式,可以说更极端、更难以预测。
保持人工智能领先地位
如需了解更多 AI 重大新闻和分析,请访问 AI Buzz Wire。
阅读更多人工智能新闻 →
