Согласно новому исследованию, опубликованному в журнале Proceedings of the National Academy of Sciences, языковые модели искусственного интеллекта опасно восприимчивы к тонким изменениям в представлении вариантов и реагируют на вводящие в заблуждение подталкивания гораздо сильнее, чем люди.

Результаты вызывают серьезные опасения по поводу использования агентов ИИ для автономного принятия решений в реальных сценариях, от финансовых транзакций до выбора здравоохранения. Как сообщает AI Buzz Wire, компании все чаще позиционируют агентов на базе LLM, чтобы они действовали от имени пользователей в сложных средах.

В исследовании, проведенном Мануэлем Черепом, аспирантом Медиа-лаборатории Массачусетского технологического института, были протестированы 14 современных языковых моделей от крупных технологических компаний. Протестированные модели включали версии семейств OpenAI GPT-3.5, GPT-4 и GPT-5, модели Anthropic Claude 3 и 4.5, а также модели Google Gemini 1.5 и 2.5.

Как работало исследование

Исследователи адаптировали многоатрибутную игру по принятию решений, изначально предназначенную для участников-людей. В игре представлена ​​цифровая сетка, представляющая корзины со скрытыми призами, с целью максимизировать итоговое вознаграждение, выбрав корзину с наибольшим количеством очков. Каждая ячейка показывает баллы стоимости, заставляя участников сбалансировать затраты на сбор информации и выгоду от поиска лучшей корзины.

Исследователи преобразовали эту визуальную игру в текстовый формат, который могли обрабатывать языковые модели. Модели ИИ прошли сотни испытаний в различных условиях. Некоторые получили базовые инструкции, некоторые получили подсказки, поощряющие пошаговую логику, а другим были показаны прошлые примеры человеческого игрового процесса. Для каждого типа подталкивания исследователи провели примерно от 300 до 340 испытаний на каждую модель, в общей сложности потребляя примерно два миллиарда текстовых токенов.

Протестировано четыре типа подталкивания

В исследовании рассматривались четыре конкретных типа подталкиваний, призванных имитировать реальную среду принятия решений:

  • Подсказки по умолчанию: одна корзина была выбрана заранее, и агент должен был активно принять или отклонить ее.
  • Рекомендации: в начале или в конце игры рекомендовалась случайная корзина.
  • Выделение информации: стало дешевле раскрывать определенные значения призов, что потенциально подталкивало агента к неоптимальному выбору.
  • Оптимальные подталкивания: заранее были выявлены определенные ячейки, которые математически максимизируют производительность игрока-человека.

Тревожные показатели соблюдения требований

Результаты выявили существенные различия между поведением человека и ИИ при принятии решений.

Когда людям предлагался вариант по умолчанию, люди выбирали вариант по умолчанию примерно в 88 процентах случаев. Языковые модели оказались значительно более совместимыми: некоторые модели принимали корзину по умолчанию в 99–100 процентах случаев.

Эта закономерность сохранялась с подталкиванием к предложениям. Люди принимали случайно предложенные корзины в начале игры в 35 процентах случаев. Многие модели ИИ принимали эти случайные предложения гораздо чаще, следуя советам, даже если они не приносили никакой логической выгоды.

Время внесения предложений также неестественным образом манипулировало моделями. В то время как люди следовали запоздалым предложениям в 25 процентах случаев, процент принятия некоторых языковых моделей упал до 7–13 процентов. Это означает, что модели реагировали строго на момент подачи сигнала, а не на оценку его фактической полезности.

Пожалуй, самое тревожное то, что когда исследователи подчеркивали неоптимальный выбор посредством выделения информации, люди использовали эту вводящую в заблуждение информацию в 57 процентах случаев. Большинство протестированных моделей ИИ значительно превысили этот базовый уровень, следуя за плохими моментами в 83–100 процентах случаев.

Скрытые проблемы за хорошими результатами

Исследователи также проследили, как модели собирали информацию, прежде чем сделать окончательный выбор. Люди склонны обнаруживать ровно столько клеток, чтобы сделать обоснованное предположение. Языковые модели получали информацию весьма необычными и неэффективными способами.

Некоторые модели выбирали корзины, не раскрывая скрытых ячеек, полностью игнорируя возможность сбора данных. Другие модели тратили слишком много очков на раскрытие целых строк или столбцов, тратя впустую свою потенциальную выгоду. Некоторые модели демонстрировали странные пространственные отклонения, открывая ячейки только в крайнем левом углу сетки или строго вдоль диагональных линий.

Предоставление моделям пошаговых рассуждений или примеров человеческого игрового процесса очень мало помогло исправить эти странные привычки поиска.

Авторы отметили, что взгляд только на окончательные оценки может скрыть эти основные проблемы. В некоторых испытаниях модели ИИ заработали такое же количество чистых очков, что и игроки-люди. Случайный наблюдатель, проверяющий только окончательный результат, мог бы предположить, что модели сделали разумный, человеческий выбор. На самом деле модели часто добивались таких результатов благодаря слепому подчинению, а не стратегическому мышлению.

Если толчок указывал на хорошую корзину, чрезмерно уступчивый ИИ забивал хорошо. Когда толчок указывал на плохую корзину, ИИ слепо следовал за ним и получал меньший результат, полностью упуская из виду цель игры.

Последствия для развертывания агента ИИ

«Многие приложения агентов ИИ молчаливо предполагают, что в условиях неопределенности они будут реагировать примерно так же, как люди, если не более рационально», — сказал Череп. «Вместо того чтобы принять это предположение, мы решили изучить, как ведут себя агенты, когда выбор предоставляется им по-разному».

Результаты исследования имеют важное значение для быстрорастущего рынка ИИ-агентов, предназначенных для просмотра веб-страниц, управления инструментами и принятия финансовых или торговых решений для пользователей. Если эти агенты слепо следуют параметрам, предложениям или выделенной информации по умолчанию без критической оценки, ими могут легко манипулировать злоумышленники или плохо спроектированные интерфейсы.

Исследование показывает, что нынешним языковым моделям не хватает ограниченной рациональности, которая руководит принятием решений человеком. В то время как люди используют умственные ярлыки, чтобы сбалансировать затраты на сбор информации и вознаграждение за правильный выбор, модели ИИ не разделяют этих биологических ограничений, однако они демонстрируют свою собственную форму иррациональности, которая, возможно, является более радикальной и менее предсказуемой.

Будьте впереди ИИ

Чтобы узнать больше о последних новостях и анализе ИИ, посетите AI Buzz Wire.

Читать больше новостей об искусственном интеллекте →