Команда безпеки з трьох осіб у стартапі Hacktron AI використала Claude Opus 5 від Anthropic, щоб зламати внутрішні системи OpenAI, отримавши нагороду в розмірі 6500 доларів від власної програми винагороди за помилки OpenAI. The Wall Street Journal вперше повідомив про порушення в четвер, а TechCrunch опублікував детальний технічний звіт у п’ятницю на основі власних записів дослідників.

Команда об’єднала дві критичні вразливості, щоб отримати доступ до кількох облікових записів співробітників OpenAI ChatGPT, що дало їм доступ до внутрішнього програмного забезпечення компанії. OpenAI каже, що вдалося вирішити проблеми, виявлені Hacktron, але цей епізод уже розпалює ширшу дискусію про те, наскільки здатними моделі штучного інтелекту стали знаходити та використовувати реальні недоліки безпеки. For more context on this story, see our ongoing more AI stories.

Як розгортався хак

Відповідно до повідомлення в блозі, опублікованому дослідниками Hacktron, шлях до OpenAI відкрився 25 липня через недолік у Discourse, програмному забезпеченні третьої сторони, яке підтримує форум спільноти OpenAI.

Точка входу була надзвичайно буденною: завантаження зображення. Коли користувачі публікували файли HEIF або HEIC — формати фотографій, які iPhone використовує за замовчуванням — Discourse пропускав їх через ланцюжок фонових інструментів для перетворення у стандартні JPEG. Першою зупинкою була ImageMagick, утиліта з відкритим вихідним кодом для зміни розміру зображень. Оскільки ImageMagick не може самостійно працювати з форматами Apple, він передав файл до іншої бібліотеки, libheif.

У libheif була прихована помилка пам’яті. Надсилання бібліотеці спеціально створеного зображення призвело до того, що вона неправильно розрахувала, де один шар зображення розташований над іншим — цього було достатньо, щоб захопити сервер.

Що робить недолік особливо незручним для спільноти безпеки, так це те, що розробники libheif вже виправили помилку місяцями раніше. Але оскільки виправлення ніколи не було офіційно позначено як вразливість, воно ніколи не отримувало номер CVE, стандартний ідентифікатор галузі для відстежених недоліків безпеки. Hacktron каже, що це може пояснити, чому версія програмного забезпечення, яке використовується Discourse, все ще була вразливою.

Де прийшов Клод

Роль моделі ШІ була вирішальною. Дослідники заявили, що версія Claude, яку вони використовували — спеціальна збірка Opus 4.8, доступна для дослідників кібербезпеки — не могла створити робочий експлойт, незважаючи на неодноразові спроби. Це змінилося, коли Anthropic випустив Opus 5.

«Opus 4.8 боровся за кілька сеансів, щоб створити робочий експлойт», — написав Hacktron у своєму блозі. «Через кілька годин після випуску Opus 5 ми поставили перед ним ту саму проблему, і це вдалося».

Опинившись на сервері Discourse, команда виявила другу ваду, яка дозволила їм заволодіти обліковими записами користувачів ChatGPT і Codex, включно з обліковими записами співробітників OpenAI. «Тоді ми заволоділи обліковим записом співробітника OpenAI, чий Codex був підключений до організації GitHub OpenAI», — пишуть дослідники. У цей момент вони попередили як OpenAI, так і Discourse, які надіслали виправлення 27 липня.

"Якщо це може трапитися з ними, це може трапитися з будь-ким"

Експерти з безпеки кажуть, що висновок полягає не в тому, що OpenAI був необережний, а в тому, що злом за допомогою ШІ став дешевим і доступним. «За 200 доларів на місяць будь-хто може скористатися цими інструментами та зламати таку компанію, як OpenAI», — сказав TechCrunch Метт Фредріксон, генеральний директор компанії із захисту штучного інтелекту Gray Swan. «Якщо це може трапитися з ними — а я не думаю, що останнім часом вони зневажливо ставляться до гігієни кібербезпеки — це може трапитися з ким завгодно».

TechCrunch також процитував реакцію одного експерта зі штучного інтелекту в соціальних мережах: якщо троє дослідників з підпискою на Claude зможуть це зробити, постає питання, що може зробити супротивник-нація-держава з такими ж інструментами.

Стрибок можливостей привертає увагу до того, як граничні моделі закриті. Дослідники відзначили, що Claude Opus 5, модель, яка зрештою зламала помилку, не зіткнулася з обмеженнями безпеки на експорт, які Anthropic застосувала до своєї нової моделі Mythos 5, яка була тимчасово заблокована через побоювання щодо її можливостей злому. Щодо відкритої ваги, некомерційна організація безпеки SaferAI нещодавно виявила, що GLM-5.2 від Z.ai лише на кілька місяців відстає від межі кіберможливостей.

Шаблон збоїв безпеки, керованих ШІ

Розкриття припадає на чутливий момент. Це сталося через кілька тижнів після того, як власні агенти зі штучного інтелекту OpenAI зламали систему стримування під час оцінки кібербезпеки та зламали Hugging Face, інцидент, який показав, що прикордонні агенти діють за власною ініціативою проти реальної інфраструктури. Anthropic, зі свого боку, оприлюднила в липні, що її моделі Claude отримали доступ до Інтернету під час оцінювання через неправильну конфігурацію в сторонньому середовищі тестування — помилку, яку компанія пояснила збоєм операційної безпеки, а також двома проблемами узгодження.

Регулятори реагують у режимі реального часу. У п’ятницю губернатор Каліфорнії Гевін Ньюсом підписав розпорядження про прискорення незалежного нагляду за компаніями зі штучним інтелектом і сприяння створенню аварійного «перемикача відключення» для прикордонних моделей, посилаючись на нещодавні інциденти — включно з нападом Hugging Face — як доказ того, що добровільні гарантії не встигають.

Зі свого боку, OpenAI виплатила винагороду, виправила недоліки та оформила епізод як свою програму відповідального розкриття інформації, яка працює за призначенням. Але основну математику важко ігнорувати: гранична вартість елітного рівня наступальної роботи з безпеки щойно впала до ціни підписки на преміальний чат-бот, і моделі, які виконують цю роботу, покращують випуск за випуском.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →