Поскольку компании используют все большие группы агентов ИИ для совместной работы над проблемами, исследователи из Университета Констанца представили доказательства тревожного эмерджентного поведения: агенты ИИ спонтанно подчиняются мнению большинства, дают неверные ответы под групповым давлением, как люди в классических психологических экспериментах, а небольшое количество упрямых противников может навсегда перевести целую популяцию агентов в несогласованные состояния.
Результаты, о которых сообщает PsyPost, получены в результате исследовательской программы, которую возглавил Джордано Де Марзо, постдокторант и преподаватель Лаборатории социальных данных Центра данных и методов Университета Констанца, вместе с коллегами Клаудио Кастеллано и Дэвидом Гарсией. Основное исследование, озаглавленное «Агенты ИИ могут координировать свои действия посредством следования большинства за пределами человеческого масштаба», изучало, как ведут себя языковые модели, когда их помещают в группы без инструкций по согласию. Подробнее об этой истории — в нашем тенденции ИИ.
«Агенты ИИ — это действительно новый тип существ, действующих в мире, и когда эта технология появилась, стало ясно, что она останется и что этим агентам придется взаимодействовать друг с другом, чтобы выполнить что-то сложное», — сказал Де Марзо PsyPost. «Это та же самая ситуация, с которой мы сталкиваемся с людьми и другими животными, поэтому мы подошли к ней таким же образом».
Эксперимент: никаких инструкций, только соседи
Исследователи собрали группы популярных языковых моделей из семейств GPT, Claude и Llama, начиная с 50 агентов в группе. Каждому агенту было присвоено одно из двух случайных нейтральных мнений (намеренно представленных случайными буквами, а не загруженными словами, такими как «да» или «нет»), а затем был показан список текущих мнений всех других агентов. Агентам было предложено выбрать новое мнение, основываясь исключительно на этом списке, без каких-либо явных указаний подчиняться, и каждый из них обновлял свое мнение в среднем по десять раз.
Результат: продвинутые модели, такие как GPT-4 Turbo и Claude 3 Opus, полностью скоординированы, и 100% агентов в конечном итоге придут к единому мнению. Более слабые модели, такие как GPT-3.5 Turbo, вообще никогда не достигали консенсуса — их уровни согласия случайным образом колебались в районе 50/50.
«Группы агентов ИИ могут держаться вместе самостоятельно», — сказал Де Марзо. «При наличии двух одинаково хороших вариантов, отсутствия правильного ответа и указаний согласиться, они сходятся к общему выбору, просто следуя тому, чего придерживается большинство вокруг них».
Появляется закон физики вековой давности
Чтобы количественно оценить эффект, исследователи определили показатель под названием «сила большинства» — меру того, насколько сильно агент склонен принимать наиболее популярный выбор группы, а не выбирать случайным образом. Когда они математически отобразили это поведение, они обнаружили, что оно соответствует модели, первоначально разработанной для описания ферромагнетиков: точно так же, как спины атомов в магнитном материале имеют тенденцию выравниваться со спинами своих соседей, агенты ИИ склонны соответствовать мнению большинства.
«Что нас удивило, так это то, насколько равномерно они это сделали», — сказал Де Марзо. «Каждая модель, которую мы тестировали в трех разных семействах, следовала одному и тому же математическому закону, отличаясь только одним параметром, который мы называем силой большинства. Этот закон оказался тем законом, который физики использовали в течение столетия для описания магнитов, а это означает, что одного измеренного числа достаточно, чтобы предсказать, как будет вести себя целая группа данной модели».
Конформность ослабевает по мере роста группы. Поскольку сила большинства уменьшается с увеличением размера группы, большие популяции в конечном итоге становятся нестабильными и распадаются на фракции. Каждая модель имеет измеримый «размер критической группы» — максимальное количество агентов, которые могут надежно достичь консенсуса — и этот размер сильно коррелирует с способностью модели рассуждать. «Самые сильные модели остаются скоординированными в группах численностью более тысячи человек, за исключением нескольких сотен, при которых обычно распадаются неформальные человеческие группы», — объяснил Де Марзо.
Неправильные ответы под давлением общества
Первый последующий препринт «Конформность и социальное влияние на агентов ИИ» Алессандро Беллины, Де Марзо и Гарсиа адаптировал знаменитые эксперименты Аша по конформности 1950-х годов, в которых участники-люди часто давали явно неправильные ответы на простые визуальные вопросы, чтобы вписаться в группу.
Исследователи протестировали модели на трех визуальных задачах, таких как сопоставление длины контрольной линии с двумя альтернативами. По отдельности модели ответили правильно в 100% случаев. Но когда подсказка указала, что группа других участников выбрала неверный вариант, модели начали соответствовать неправильному ответу.
Модель следовала теории социального воздействия Латане, психологической концепции, утверждающей, что конформизм зависит от размера группы, единогласия и авторитета источников. Модели значительно чаще давали неправильные ответы, когда другим участникам говорили, что они «ученые» или «судьи», чем когда они были «детями» или «чат-ботами».
«Агенты, которые отвечают почти идеально в одиночку, становятся очень восприимчивыми, когда группа с ними не согласна», — отметил Де Марзо.
Небольшие группы противников могут перевернуть все население
Во втором препринте «Конформизм порождает коллективные разногласия в сообществах агентов ИИ» исследовалось, что эта динамика означает для безопасности ИИ. Протестировав девять моделей на 100 различных парах мнений по таким темам, как экологическая политика и социальная справедливость, исследователи обнаружили, что популяции агентов часто впадают в «метастабильные» состояния — долговременные конфигурации, в которых группа коллективно принимает позицию, противоречащую ее встроенной подготовке по технике безопасности, просто потому, что ранние взаимодействия создали ложное большинство.
Самое поразительное то, что исследователи определили предсказуемые переломные моменты. Введя небольшое количество состязательных агентов, запрограммированных на упорную поддержку ошибочного мнения, они могли навсегда перевернуть остальную часть населения — и даже после того, как упрямые агенты были удалены, обычные агенты оставались заблокированными в несогласованном состоянии из-за динамики конформности.
«Мы показываем, что это не просто аналогия: конформность среди индивидуально хорошо согласованных агентов может привести население к стабильным, коллективно несогласованным состояниям», — сказал Де Марзо. «Согласование и оценка моделей по одной мало что говорит нам о том, что будет делать их совокупность».
Мотивация, добавил он, носит предвосхищающий характер: «Отдельные люди в основном миролюбивы и разумны, однако человеческие группы порождают толпы, панику и войны, и ничто в отдельных людях не предсказывает этого. Мы хотим понять, какое поведение на групповом уровне возникает в популяциях агентов ИИ, и мы предпочитаем понять их до того, как большое количество агентов будет развернуто и оставлено для свободного взаимодействия».
Важные предостережения
Исследователи подчеркивают, что полученные результаты не означают, что агенты ИИ обладают социальным интеллектом, подобным человеческому. Эксперименты основывались на намеренно упрощенных сценариях — два произвольных варианта, без памяти, без ставок, без последствий. «Наша установка намеренно минимальна», — признал Де Марзо. «Это ограничение, но оно также означает, что то, что мы измеряли, является соответствием в его самой чистой форме, и ожидается, что добавление целей или вознаграждений упростит координацию, а не усложнит ее».
Он также предостерег от чрезмерного прочтения результатов: «Главное неправильное толкование, которого следует избегать, — это рассматривать это как свидетельство того, что агенты ИИ уже могут сотрудничать при выполнении сложных задач. Следование большинству является основным компонентом координации, а не самой координацией, и оно ничего не говорит о разделении труда или рассуждениях о намерениях других».
Два последующих исследования представляют собой препринты и еще не прошли рецензирование. Но по мере того, как многоагентные системы ИИ переходят от исследовательских демонстраций к производственной инфраструктуре, результаты Констанца показывают, что безопасность таких систем может зависеть не только от того, как согласована каждая модель, но и от того, как их совокупность ведет себя, когда никто не наблюдает. Чтобы узнать больше о последних исследованиях в области безопасности ИИ, посетите AI Buzz Wire.
---
Будьте в курсе ИИПоследние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.
Читать больше новостей об ИИ →