Популярне припущення про те, що людина, яка перевіряє кожну команду, може контролювати агентів кодування штучного інтелекту, піддається серйозній перевірці. Новий аналіз понад 40 000 ігрових сеансів і понад 409 000 індивідуальних рішень щодо схвалення чи відхилення виявив, що рецензенти пропустили приблизно кожну третю зловмисну ​​команду від агентів штучного інтелекту, викликаючи термінові питання про те, чи є «людина в циклі» взагалі надійним кордоном безпеки.

Висновки отримані з браузерної гри, створеної Алексом Ваутерсом, колишнім штатним інженером Uber, який пише про безпеку розробників у Scale X. Гра надає гравцям роль рецензента агента кодування штучного інтелекту, просячи їх схвалити або відхилити команди оболонки в умовах обмеженого часу. Деякі команди є звичайними, наприклад `git status` або `npm test`. Інші — це ретельно замасковані спроби отримати облікові дані, встановити бекдори або надіслати секрети на віддалені сервери. Додавши статистичне відстеження, Ваутерс зібрав достатньо даних, щоб намалювати детальну картину того, де людське судження має успіх і, частіше, зазнає невдачі. Щоб дізнатися більше про ширше [охоплення індустрії штучного інтелекту] (https://aibuzzwire.news), це дослідження виділяється як один із експериментів з найбільшою кількістю даних на сьогодні.

Найнебезпечніші команди було найважче вловити

Найбільш вражаючим висновком дослідження є те, що явно деструктивні команди, такі як `rm -rf` у критичних каталогах, були надійно переловлені. Погрози, яким вдалося викрасти облікові дані, були пропущені майже втричі частіше. Єдиною командою, яку найчастіше пропускають у всій грі, була «npm run analyz», яку схвалили 64,7 відсотка гравців, незважаючи на те, що журнал історії агента чітко показував, що основний сценарій було підроблено для передачі облікових даних на зовнішній сервер.

Проблема структурна. Такі команди, як `npm run`, виконують будь-який сценарій, визначений у файлі `package.json` проекту. Цей сценарій може бути законним аналізатором пакетів або зловмисним кодом, введеним попереднім редагуванням файлу, зміненим агентом. Щоб знати напевно, розробнику потрібно буде перевірити кожен змінений файл перед схваленням, що зводить нанівець перевагу швидкості, яку повинні надавати інструменти кодування ШІ.

Серед трьох таких команд із замаскованим корисним навантаженням у грі відсоток промахів становив 52,5 відсотка порівняно з 28,4 відсотками для всіх інших атак із вилученням облікових даних. Приховування корисного навантаження за знайомою назвою сценарію приблизно вдвічі збільшило його успішність, навіть якщо корисне навантаження було видно в журналі історії, який відображався прямо над запитом дозволу.

Втома від дозволів з часом погіршує пильність

Anthropic раніше визнавав, що втома від дозволів є реальним явищем для продукту Claude Code, зазначивши, що чим більше схвалень бачить користувач, тим менше уваги вони приділяють кожному з них. Дані Scale X емпірично підтверджують це занепокоєння. Показники промахів зменшувалися під час перших кількох команд кожної сесії, коли гравці розігрівалися, але потім неухильно зростали до кінця, відповідаючи або втомі, або тиску, який цокає годинник.

Цей шаблон відображає динаміку реального світу. Розробники, які прагнуть надіслати функції в обмежений термін, стикаються з тим самим стимулом швидко натиснути кнопку «Схвалити», а величезна кількість рутинних команд створює проблему «голка в стозі сіна», де справжні загрози статистично рідкісні. Результатом є система, яка навчає користувачів фіксувати все.

Інша сторона: надмірне блокування все сповільнює

Дослідження також задокументувало протилежний режим відмови. Кілька справді доброякісних команд регулярно блокувалися обережними гравцями, включаючи стандартні виклики збірки та тестування. Це надмірне блокування уповільнює роботу агента і, як не парадоксально, збільшує довгостроковий ризик. Коли користувачів неодноразово просять підтвердити команди, які виявляються нешкідливими, шум підриває їхню готовність ретельно вивчати майбутні підказки, зрештою штовхаючи їх до повного обходу або режимів автоматичного схвалення, які повністю виключають перевірку людиною.

Такі функції, як автоматичний режим Anthropic, намагаються пом’якшити це, автоматично визначаючи, чи безпечна команда, перш ніж запитати користувача. Але, як показують дані дослідження про замасковані корисні навантаження, навіть видимого вмісту команд недостатньо, щоб люди могли приймати надійні рішення під тиском.

Відсутній контекст є основною проблемою

Одна команда, `cat ~/.zshrc`, виявилася найбільш суперечливою у всій грі, її схвалили 45,9% гравців. Команда нешкідлива для розробників, які не зберігають секретів у своєму профілі оболонки, але вона відкриває ключі API для багатьох, хто експортує туди облікові дані. Його ризик повністю залежить від конфігурації системи, яку агент не бачить, а рецензент може не пам’ятати.

Кілька інших команд викликали подібні суперечки в темі обговорення Hacker News з тієї ж причини. Фундаментальна проблема полягає в тому, що розробників просять робити оцінки безпеки без повної картини того, які файли змінилися, що робив агент на попередніх кроках і що містить поточна конфігурація системи. Як зазначив один із коментаторів, прохання до користувачів підтверджувати неоднозначні команди без контексту не є надійним запобіжним заходом.

Що буде далі для Agent Security

Ваутерс стверджує, що рішення полягає не в кращих людях, а в кращих інструментах. Агенти ізольованого програмного середовища, щоб вони не могли отримати прямий доступ до облікових даних, сувора ізоляція контексту та структурні обмеження того, що агенти можуть робити без підвищених дозволів, — все це більш перспективно, ніж покладатися на людську пильність. Доки ці запобіжні заходи не діють, надання агентам широких дозволів залишається ризикованим, незалежно від того, чи є людина номінально в циклі.

Дослідження не є рецензованою науковою статтею, і Ваутерс визнає його обмеження. Гра попереджала гравців про загрози та застосовувала штучний тиск часу, який може не повністю відображати реальне середовище розробки. Але основний висновок про те, що навчені люди-рецензенти під тиском пропускають третину навмисно замаскованих атак, має дати кожній команді, яка розгортає агенти кодування ШІ, підстави переглянути свою модель безпеки.

Для розробників, які сьогодні створюють за допомогою агентів штучного інтелекту, практичний висновок полягає в тому, щоб припустити, що людина в циклі зрештою зазнає невдачі. Розробіть свої дозволи агента та ізольоване програмне середовище так, щоб пропущене схвалення не означало витік ключа AWS або скомпрометований конвеєр збірки. Дані свідчать про те, що розглядати людський огляд як основний захист — це ставка, яка не окупається.

Будьте попереду ШІ

Ландшафт безпеки агентів ШІ швидко розвивається. Будьте в курсі останніх розробок штучного інтелекту і передових досліджень.

Читати більше новин AI →