Відповідно до нового дослідження, опублікованого в Proceedings of the National Academy of Sciences, мовні моделі штучного інтелекту небезпечно сприйнятливі до тонких змін у тому, як представлені варіанти, реагуючи на оманливі спонукання набагато сильніше, ніж люди.

Отримані дані викликають серйозні занепокоєння щодо використання агентів штучного інтелекту для автономного прийняття рішень у реальних сценаріях, від фінансових операцій до вибору медичної допомоги. Як повідомляє AI Buzz Wire, компанії все частіше позиціонують агентів на базі LLM, щоб діяти від імені користувачів у складних середовищах.

Дослідження під керівництвом Мануеля Черепа, докторанта медіа-лабораторії Массачусетського технологічного інституту, протестувало 14 найсучасніших мовних моделей від великих технологічних компаній. Перевірені моделі включали версії сімейств GPT-3.5, GPT-4 і GPT-5 від OpenAI, моделі Claude 3 і 4.5 від Anthropic і моделі Gemini 1.5 і 2.5 від Google.

Як працювало дослідження

Дослідники адаптували багатоатрибутну гру прийняття рішень, спочатку розроблену для людей. Гра представляє цифрову сітку, що представляє кошики прихованих призів, з метою максимізації кінцевої винагороди шляхом вибору кошика з найвищим значенням балів. Кожна комірка розкриває вартість балів, що змушує учасників збалансувати вартість збору інформації та вигоду від пошуку кращого кошика.

Дослідники перетворили цю візуальну гру в текстовий формат, який могли б обробляти мовні моделі. Моделі штучного інтелекту пройшли сотні випробувань за різних умов. Деякі отримали базові інструкції, деякі отримали підказки, що заохочують покрокову логіку, а іншим були показані минулі приклади людської гри. Для кожного типу підштовхування дослідники провели приблизно від 300 до 340 випробувань на модель, загалом використавши приблизно два мільярди текстових токенів.

Перевірено чотири типи підштовхувань

У дослідженні розглянуто чотири конкретні типи підштовхувань, розроблених для імітації середовища прийняття рішень у реальному світі:

  • Підштовхування за умовчанням: один кошик був попередньо вибраний, і агент повинен був активно прийняти або відхилити його.
  • Підштовхування пропозицій: випадковий кошик рекомендувався на початку або наприкінці гри.
  • Висвітлення інформації: стало дешевше розкривати певні значення призів, потенційно спрямовуючи агента до неоптимального вибору.
  • Оптимальні підштовхи: були попередньо виявлені конкретні комірки, які б математично максимізували продуктивність гравця-людини.

Тривожні показники відповідності

Результати показали драматичні відмінності між поведінкою людини та ШІ у прийнятті рішень.

Коли їм було запропоновано параметр за замовчуванням, люди вибирали його приблизно в 88% випадків. Мовні моделі були значно більш сумісними, декілька моделей приймали кошик за замовчуванням від 99 до 100 відсотків часу.

Ця модель зберігалася з підштовхуваннями пропозицій. Люди приймали випадково запропоновані кошики на початку гри 35 відсотків часу. Багато моделей ШІ приймали ці випадкові пропозиції набагато частіше, дотримуючись порад, навіть якщо вони не приносили логічної користі.

Час пропозицій також маніпулював моделями неприродним чином. У той час як люди дотримувалися пізніх пропозицій 25 відсотків часу, деякі мовні моделі знизили рівень їх прийняття до 7-13 відсотків. Це означає, що моделі реагували суворо на час сигналу, а не оцінювали його фактичну корисність.

Можливо, найбільше занепокоєння полягає в тому, що коли дослідники підкреслювали неоптимальний вибір за допомогою виділення інформації, люди використовували цю оманливу інформацію 57 відсотків часу. Більшість протестованих моделей штучного інтелекту значно перевершили цю базову лінію, після поганого виділення від 83 до 100 відсотків часу.

Приховані проблеми за хорошими оцінками

Дослідники також відстежували, як моделі збирали інформацію, перш ніж зробити остаточний вибір. Люди схильні розкривати стільки клітин, скільки потрібно, щоб зробити обґрунтоване припущення. Мовні моделі отримували інформацію дуже незвичними та неефективними способами.

Деякі моделі вибирали кошики, не відкриваючи прихованих комірок, повністю ігноруючи можливість збору даних. Інші моделі витрачали надмірні бали, відкриваючи цілі рядки чи стовпці, витрачаючи свої потенційні винагороди. Деякі моделі відображали дивні просторові зміщення, лише відкриваючи клітини в дальній лівій частині сітки або строго вздовж діагональних ліній.

Забезпечення моделей покроковими підказками чи прикладами людської гри дуже мало допомогло виправити ці дивні звички пошуку.

Автори зауважили, що перегляд лише остаточних балів може приховати ці основні проблеми. У деяких випробуваннях моделі штучного інтелекту отримували таку ж кількість чистих очок, як і гравці-люди. Звичайний спостерігач, який перевіряє лише остаточну оцінку, може припустити, що моделі робили розумний, людський вибір. Насправді моделі часто досягали цих показників за рахунок сліпого виконання вимог, а не стратегічного мислення.

Якщо штовхання вказувало на хороший кошик, надто поступливий штучний інтелект отримував хороші оцінки. Коли підштовхування вказувало на поганий кошик, штучний інтелект сліпо йшов за ним у нижчий рахунок, повністю втрачаючи мету гри.

Наслідки для розгортання агента AI

«Багато застосувань агентів штучного інтелекту мовчазно припускають, що в умовах невизначеності вони будуть реагувати приблизно як люди, якщо не більш раціонально», — сказав Череп. «Замість того, щоб прийняти це припущення, ми вирішили дослідити, як поводяться агенти, коли їм пропонують різні способи вибору».

Висновки дослідження мають значний вплив на швидко зростаючий ринок агентів штучного інтелекту, призначених для перегляду веб-сторінок, роботи з інструментами та прийняття фінансових рішень або рішень щодо покупок для користувачів. Якщо ці агенти сліпо дотримуються параметрів за замовчуванням, пропозицій або виділеної інформації без критичної оцінки, ними можуть легко маніпулювати погані актори або погано розроблені інтерфейси.

Дослідження свідчать про те, що нинішнім мовним моделям бракує обмеженої раціональності, яка керує людиною при прийнятті рішень. У той час як люди використовують розумові скорочення, щоб збалансувати вартість збору інформації та винагороду за правильний вибір, моделі ШІ не поділяють ці біологічні обмеження, але вони демонструють власну форму ірраціональності, яка, можливо, є більш екстремальною та менш передбачуваною.

Будьте попереду ШІ

Щоб дізнатися більше про останні новини та аналіз ШІ, відвідайте AI Buzz Wire.

Читати більше новин AI →