Популярное предположение о том, что человек, проверяющий каждую команду, может контролировать агентов кодирования ИИ, подвергается серьезному анализу. Новый анализ более 40 000 игровых сессий и более 409 000 индивидуальных решений «одобрить или отклонить» показал, что проверяющие люди пропустили примерно одну из трех вредоносных команд от агентов ИИ, что поднимает насущные вопросы о том, является ли «человек в процессе» вообще надежной границей безопасности.

Результаты получены на основе браузерной игры, созданной Алексом Ваутерсом, бывшим штатным инженером Uber, который пишет о безопасности разработчиков в Scale X. Игра ставит игроков в роль человека-рецензента для агента по кодированию искусственного интеллекта, прося их одобрить или отклонить команды оболочки в условиях нехватки времени. Некоторые команды являются рутинными, например «git status» или «npm test». Другие представляют собой тщательно замаскированные попытки украсть учетные данные, установить бэкдоры или отправить секретные данные на удаленные серверы. Добавив отслеживание статистики, Ваутерс собрал достаточно данных, чтобы нарисовать подробную картину того, где человеческое суждение оказывается успешным, а где чаще всего терпит неудачу. Чтобы узнать больше о более широком [охвате индустрии искусственного интеллекта] (https://aibuzzwire.news), это исследование выделяется как один из самых богатых данными экспериментов на сегодняшний день.

Самые опасные команды было труднее всего уловить

Самый поразительный результат исследования заключается в том, что явно деструктивные команды, такие как `rm -rf` в критических каталогах, были надежно перехвачены. Угрозы, которым удалось украсть учетные данные, пропускаются почти в три раза чаще. Самой командой, которую чаще всего пропускали во всей игре, была команда npm run Analysis, одобренная 64,7 процентами игроков, несмотря на то, что журнал истории агента ясно показал, что базовый скрипт был подделан для передачи учетных данных на внешний сервер.

Проблема структурная. Такие команды, как npm run, выполняют любой сценарий, определенный в файле package.json проекта. Этот сценарий может быть законным анализатором пакета или вредоносным кодом, внедренным при более раннем редактировании файла, измененном агентом. Чтобы знать наверняка, разработчику необходимо проверять каждый измененный файл перед утверждением, что сводит на нет преимущество в скорости, которое должны обеспечивать инструменты ИИ-кодирования.

Для трех таких команд с замаскированной полезной нагрузкой в ​​игре процент промахов составил 52,5 процента по сравнению с 28,4 процента для всех других атак с целью кражи учетных данных. Сокрытие полезной нагрузки за знакомым именем сценария примерно удвоило вероятность успеха, даже если полезная нагрузка была видна в журнале истории, отображаемом чуть выше запроса на разрешение.

Усталость от разрешений со временем подрывает бдительность

Ранее Anthropic признала, что усталость от разрешений — это реальный феномен в ее продукте Claude Code, отметив, что чем больше утверждений видит пользователь, тем меньше внимания он уделяет каждому из них. Данные Scale X эмпирически подтверждают эту озабоченность. Частота промахов снижалась в течение первых нескольких команд каждой сессии по мере разминки игроков, но затем постепенно возрастала к концу, что соответствовало либо усталости, либо растущему давлению тикающих часов.

Этот паттерн отражает реальную динамику. Разработчики, стремящиеся выпустить функции в сжатые сроки, сталкиваются с тем же стимулом быстро нажать кнопку «Одобрить», а сам объем рутинных команд создает проблему «иголки в стоге сена», где подлинные угрозы статистически редки. Результатом является система, которая обучает пользователей все ставить штампы.

Другая сторона: чрезмерная блокировка все замедляет

Исследование также зафиксировало противоположный режим отказа. Некоторые действительно безобидные команды регулярно блокировались осторожными игроками, включая стандартные вызовы сборки и тестирования. Такая чрезмерная блокировка замедляет работу агента и, как это ни парадоксально, увеличивает долгосрочный риск. Когда пользователей неоднократно просят утвердить команды, которые оказываются безобидными, шум подрывает их желание внимательно изучать будущие запросы, в конечном итоге подталкивая их к полному обходу или режимам автоматического одобрения, которые полностью исключают проверку человеком.

Такие функции, как автоматический режим Anthropic, пытаются смягчить эту проблему, автоматически определяя, безопасна ли команда, прежде чем запрашивать ее у пользователя. Но, как показывают данные исследования о замаскированных полезных нагрузках, даже видимого содержания команд недостаточно для того, чтобы люди могли принимать надежные решения под давлением.

Отсутствие контекста — основная проблема

Одна команда, cat ~/.zshrc, вызвала больше всего разногласий во всей игре и была одобрена 45,9 процентами игроков. Эта команда безвредна для разработчиков, которые не хранят никаких секретов в своем профиле оболочки, но она предоставляет ключи API многим, кто экспортирует туда учетные данные. Его риск полностью зависит от конфигурации системы, которую агент не видит, а проверяющий может не запомнить.

По той же причине несколько других команд вызвали аналогичные споры в дискуссии Hacker News. Фундаментальная проблема заключается в том, что разработчиков просят делать выводы о безопасности, не имея полной картины того, какие файлы были изменены, что делал агент на предыдущих этапах и что содержит текущая конфигурация системы. Как заметил один из комментаторов, просить пользователей проверять команды, которые неоднозначны без контекста, не является надежной защитой.

Что будет дальше с безопасностью агентов

Ваутерс утверждает, что решение заключается не в улучшении людей, а в улучшении инструментов. Агенты в песочнице, чтобы они не могли напрямую получить доступ к учетным данным, строгая изоляция контекста и структурные ограничения на то, что агенты могут делать без повышенных разрешений, — все это более перспективно, чем полагаться на человеческую бдительность. Пока эти гарантии не будут приняты, предоставление агентам широких разрешений остается рискованным, независимо от того, номинально ли в курсе находится человек.

Исследование не является рецензируемой научной статьей, и Ваутерс признает его ограничения. Игра предупреждала игроков об угрозах и применяла искусственное давление времени, которое может не совсем отражать реальную среду разработки. Но основной вывод о том, что обученные специалисты по проверке под давлением пропускают треть намеренно замаскированных атак, должен дать каждой команде, развертывающей агенты кодирования ИИ, повод пересмотреть свою модель безопасности.

Сегодня для разработчиков, работающих с агентами ИИ, практический вывод состоит в том, чтобы предположить, что «человек в цикле» в конечном итоге выйдет из строя. Спроектируйте разрешения для агентов и песочницу так, чтобы пропущенное одобрение не означало утечку ключа AWS или компрометацию конвейера сборки. Данные показывают, что рассматривать человеческую оценку в качестве основной защиты — это ставка, которая не окупается.

Будьте впереди ИИ

Среда безопасности агентов искусственного интеллекта быстро развивается. Будьте в курсе последних разработок в области искусственного интеллекта и новейших исследований.

Читать больше новостей об искусственном интеллекте →