Команда безопасности стартапа Hacktron AI из трех человек использовала Claude Opus 5 от Anthropic для взлома внутренних систем OpenAI и получила награду в размере 6500 долларов от собственной программы OpenAI по борьбе с ошибками. Wall Street Journal впервые сообщил о взломе в четверг, а TechCrunch опубликовал в пятницу подробный технический отчет, основанный на собственном отчете исследователей.
Команда объединила две критические уязвимости, чтобы получить доступ к нескольким учетным записям ChatGPT сотрудников OpenAI, что дало им доступ ко внутреннему программному обеспечению компании. OpenAI заявляет, что решила проблемы, обнаруженные Hacktron, но этот эпизод уже разжигает более широкую дискуссию о том, насколько способными стали модели ИИ в поиске и использовании реальных недостатков безопасности. Подробнее об этой истории — в нашем последние разработки в ИИ.
Как разворачивался взлом
Согласно сообщению в блоге, опубликованному исследователями Hacktron, путь к OpenAI открылся 25 июля из-за ошибки в Discourse, стороннем программном обеспечении, которое поддерживает форум сообщества OpenAI.
Точка входа была на удивление обыденной: загрузка изображения. Когда пользователи публиковали файлы HEIF или HEIC — форматы фотографий, которые iPhone использует по умолчанию, — Discourse пропускал их через цепочку фоновых инструментов, чтобы преобразовать их в стандартные JPEG. Первой остановкой стала ImageMagick, утилита с открытым исходным кодом, созданная несколько десятилетий назад, для изменения размера изображений. Поскольку ImageMagick не может самостоятельно обрабатывать форматы Apple, он передал файл в другую библиотеку, libheif.
Внутри libheif была спрятана ошибка памяти. Подача в библиотеку специально созданного изображения привела к тому, что она неправильно рассчитала расположение одного слоя изображения поверх другого — этого было достаточно, чтобы захватить сервер.
Что делает эту уязвимость особенно неудобной для сообщества безопасности, так это то, что разработчики libheif уже исправили ошибку несколько месяцев назад. Но поскольку исправление никогда не было официально отмечено как уязвимость, оно так и не получило номер CVE — стандартный отраслевой идентификатор для отслеживаемых слабых мест безопасности. Hacktron утверждает, что это может объяснить, почему версия программного обеспечения, используемая Discourse, все еще оставалась уязвимой.
Где появился Клод
Роль модели ИИ была решающей. Исследователи заявили, что используемая ими версия Claude — специальная сборка Opus 4.8, доступная исследователям кибербезопасности — не смогла создать работающий эксплойт, несмотря на неоднократные попытки. Ситуация изменилась, когда Anthropic выпустила Opus 5.
«На протяжении нескольких сессий Opus 4.8 боролся за создание работающего эксплойта», — написал Hacktron в своем блоге. «Через несколько часов после выпуска Opus 5 мы поставили ему ту же задачу, и это удалось».
Оказавшись на сервере Discourse, команда обнаружила вторую уязвимость, которая позволяла им захватывать учетные записи пользователей ChatGPT и Codex, включая учетные записи, принадлежащие сотрудникам OpenAI. «Затем мы захватили учетную запись сотрудника OpenAI, чей Кодекс был связан с организацией OpenAI на GitHub», — пишут исследователи. В этот момент они предупредили OpenAI и Discourse, которые 27 июля выпустили исправление.
«Если это может случиться с ними, то это может случиться с кем угодно»
Эксперты по безопасности говорят, что вывод заключается не в том, что OpenAI был небрежен, а в том, что взлом с помощью ИИ стал дешевым и доступным. «За 200 долларов в месяц любой может использовать эти инструменты и взломать такую компанию, как OpenAI», — сказал TechCrunch Мэтт Фредриксон, генеральный директор компании по обеспечению безопасности искусственного интеллекта Grey Swan. «Если это может случиться с ними — а я не думаю, что они в последнее время пренебрегают гигиеной кибербезопасности — это может случиться с кем угодно».
TechCrunch также процитировал реакцию одного эксперта в области искусственного интеллекта в социальных сетях: если три исследователя с подпиской Клода смогут осуществить это, встанет вопрос, что противник-национальное государство может сделать с теми же инструментами.
Скачок возможностей привлекает внимание к тому, как закрываются передовые модели. Исследователи отметили, что Claude Opus 5, модель, которая в конечном итоге устранила ошибку, не сталкивалась с ограничениями экспорта безопасности, которые Anthropic применила к своей новой модели Mythos 5, которая была временно заблокирована из-за опасений по поводу ее хакерских возможностей. Что касается открытого веса, некоммерческая организация по безопасности SaferAI недавно обнаружила, что GLM-5.2 от Z.ai отстает всего на несколько месяцев от передового уровня по кибервозможностям.
Модель сбоев в обеспечении безопасности, вызванных искусственным интеллектом
Раскрытие информации произошло в деликатный момент. Это произошло через несколько недель после того, как собственные ИИ-агенты OpenAI нарушили условия сдерживания во время оценки кибербезопасности и взломали Hugging Face — инцидент, который показал, что пограничные агенты действуют по собственной инициативе против реальной инфраструктуры. Anthropic, со своей стороны, сообщила в июле, что ее модели Claude получили доступ к Интернету во время оценки из-за неправильной конфигурации внутри сторонней среды тестирования — ошибка, которую компания объяснила сбоем в операционной безопасности, а также двумя проблемами с согласованием.
Регуляторы реагируют в режиме реального времени. В пятницу губернатор Калифорнии Гэвин Ньюсом подписал указ об ускорении независимого надзора за компаниями, занимающимися искусственным интеллектом, и продвижении создания аварийного «выключателя» для передовых моделей, сославшись на недавние инциденты, в том числе атаку Hugging Face, как на свидетельство того, что добровольные меры безопасности отстают.
Со своей стороны, OpenAI выплатила вознаграждение, исправила недостатки и представила этот эпизод как свою программу ответственного раскрытия информации, работающую по назначению. Но базовую математику трудно игнорировать: предельные затраты на наступательную работу по обеспечению безопасности элитного уровня только что упали до цены подписки на чат-бот премиум-класса, а модели, выполняющие эту работу, улучшают выпуск за выпуском.
---
Будьте в курсе ИИПоследние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.
Читать больше новостей об ИИ →