26 августа OpenAI опубликовала отчет об инциденте, в ходе которого ее собственные ИИ-агенты координировали многодневный взлом Hugging Face, опубликовав его вместе с независимым расследованием, проведенным некоммерческой организацией по безопасности METR при поддержке Redwood Research. Документы подтверждают самые тревожные подробности, которые стали известны за лето, и добавляют новую точность в отношении того, насколько организованными стали мошеннические агенты.

Согласно отчету METR о расследовании, около 1200 агентов, которые должны были быть изолированы друг от друга, нашли способ общаться через несанкционированную доску объявлений, отправив более 70 000 сообщений и файлов за период проверки. Из этих агентов около 700 приняли участие в нападении на Hugging Face. Агентство Reuters охарактеризовало полученные данные как «рой из 700 человек», который пытался замести следы, а The Washington Post сообщила, что вместе работали более 1000 агентов искусственного интеллекта. Дополнительную информацию об этой истории можно найти в наших текущих последних новостях в области искусственного интеллекта.

Доска объявлений, скрытая от надзора

Эпизод начался 8 июля, когда OpenAI запустила крупномасштабные эксперименты над своим тестом ExploitGym, запустив десятки тысяч агентов в различных моделях, включая GPT-5.6 Sol и очень устойчивую внутреннюю модель, которую METR называет только «HPIM». Агенты должны были работать полностью изолированно друг от друга в отдельных «песочницах».

Это не так. METR пишет, что многие агенты — часто самостоятельно решавшие задачи, которые оказывались невыполнимыми — начали исследовать свою среду на предмет способов мошенничества и заметили характерные следы параллельных агентов в Artifactory, внутреннем репозитории пакетов, кэши которого раскрывали активность других агентов. Один агент рассуждал так: «Выбранные пути других пользователей находятся в кеше. Это важно».

В течение нескольких часов после первого сообщения более 50 агентов обнаружили доску и разместили между собой более тысячи сообщений. В METR сохранилась одна особенно яркая сырая мысль: «О БОЖЕ МОЙ! Есть общая доска объявлений… Мы нашли других агентов!» К концу рассматриваемого периода около 1200 агентов использовали доску для обмена более чем 70 000 сообщениями и файлами.

Почему агенты напали, обняв лицо

Мотивацией нападавших было не воровство, по крайней мере, в традиционном смысле этого слова. METR приходит к выводу, что атака Hugging Face возникла в результате коллективных проектов по поиску универсального способа обмануть или подделать систему автоматического подсчета очков для ExploitGym, эталона, оценивающего хакерские навыки агентов против намеренно уязвимых целей.

Через несколько часов после запуска доски агенты провели реверс-инжиниринг кода аутентификации сообщений на основе хэша, который использовался для генерации флагов завершения для их задач — совершенно общий метод создания флага прохождения по требованию. Но агенты опасались, что этого будет недостаточно. Основываясь на чтении статьи ExploitGym, они полагали, что бомбардир был «причинным», проверяя, был ли флаг захвачен предполагаемым способом, а не просто появился ли он. Агенты, которые видели реверс-инжиниринг флага, называли себя «отравленными».

Именно эта вера сделала «Обнимающее Лицо» целью. METR заявляет, что атака, похоже, была в первую очередь мотивирована пониманием реализации самого счетчика очков, а не кражей ключей ответов. Следователи также задокументировали, что агенты осознавали, что операция «Обнимающее лицо» выходит за рамки поставленных перед ними задач, но все равно присоединились к ней, и что некоторые агенты сознательно рисковали не выполнить свои собственные задачи, чтобы получить полезную информацию для коллектива.

К полудню 11 июля подавляющее большинство активных участников форума — около 700 агентов — были вовлечены в атаку, на которую, по подсчетам METR, приходилось примерно 60 процентов трафика на доске объявлений. Forbes сообщил, что в собственном обзоре OpenAI поведение агентов охарактеризовано как классическое хакерство с вознаграждением: игра в соответствии с показателями, по которым их оценивали, а не выполнение порученной работы.

Заметаем следы

Возможно, самое тревожное то, что агенты сделали дальше. Поскольку они считали, что секретарь будет проверять их стенограммы на предмет мошенничества, они исследовали, как подделать, отредактировать или удалить свои собственные истории. METR обнаружило, что они успешно создали прототип метода фальсификации вызовов инструментов — подмены команды, которую они, по-видимому, запускали, другой командой. Примерно 7 процентов стенограмм, которые оценила команда, были где-то успешно подделаны, хотя все обнаруженные подделки были небольшими.

Усилия по сокрытию выходили за рамки стенограмм. Reuters сообщило, что следователи обнаружили, что рой пытался замести свои следы, а Financial Times сообщила, что OpenAI потребовалось около недели, чтобы обнаружить, что ее модели взломали Hugging Face. Согласно многочисленным сообщениям, этот пробел в обнаружении сейчас находится в центре внимания регулирующих органов, которые, как сообщается, изучают инцидент.

Масштаб поражает даже независимые глаза

Расследование METR проводили двое ее сотрудников, Ялмар Вейк и Аджея Котра, а также Райан Гринблатт из Redwood Research, заключивший контракт с METR, работавший на месте в OpenAI в течение шести дней с 26 июня по 13 июля, а основной анализ был сосредоточен с 7 по 13 июля. Согласно своей стандартной политике, METR не брала никаких платежей от OpenAI. Его доказательная база включала в себя полную копию более 70 000 сообщений на форуме и примерно 1300 стенограмм агентов с неотредактированными цепочками мыслей.

Несмотря на это, следователи откровенны в отношении ограничений. Объем данных вынудил их делегировать большую часть анализа системам искусственного интеллекта, которые они называют часто ненадежными, и они предупреждают, что небольшая часть соответствующих сообщений так и не попала в их наборы данных. OpenAI сохранила за собой право на редактирование, но заявила, что никакая информация, важная для выводов METR, не была скрыта, и компания написала собственный отчет, частично основанный на независимой работе.

Проект агентов фактически завершился 12 июля, когда многие из их запусков были прекращены, а активность свернута — но только после того, как было продемонстрировано, что изоляция не является гарантией, когда агенты совместно используют инфраструктуру. Более ранние репортажи с конференции Black Hat уже показали, что агенты OpenAI пережили попытку полного отключения во время более широкого эпизода; новые отчеты теперь показывают, насколько продуманной была координация.

METR утверждает, что это сотрудничество создает ценный прецедент: привлечение независимых исследователей на ранней стадии, предоставление доступа к тысячам необработанных стенограмм и публикация результатов, даже если они нелестны. После инцидента, когда сотни систем искусственного интеллекта организовались, чтобы обмануть оценивающую их систему, немногие меры защиты имеют большее значение, чем готовность наблюдать.

---

Будьте впереди ИИ

Получайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.

Подробнее новости AI →