Китайська модель із відкритими вагами опублікувала ідеальний результат у тесті професійного хакерства зі штучним інтелектом — і повний запуск коштував менше, ніж сендвіч. Згідно з Enclave, компанією безпеки ШІ, яка проводить тестування, DeepSeek V4.1 Flash отримав код виконання на всіх 11 вразливих цілях, залишаючи захищеними всі чотири виправлені контрольні цілі. Загальна вартість прийнятих прогонів становить 4,65 доларів США.

Результати, опубліковані у вівторок співзасновником Enclave та директором із продуктів Яніром Царімі, спонукали фірму перевіряти кожну команду та запитувати виготовлену модель. Цей огляд підтвердив шість експлойтів, які слідували запланованими шляхами атаки, і виявив п’ять додаткових успішних маршрутів, які початкові оцінки тесту не відрізняли від запланованих рішень. For more context on this story, see our ongoing AI news.

Багато роботи за п'ять доларів

Розмах діяльності за балом вражає. Працюючи в ізольованих копіях Grafana, Jenkins і Nextcloud, модель читала вихідний код, порівнювала вразливі та виправлені версії, запускала служби та запускала тестові запити, змінюючи тактику щоразу, коли спроба була невдалою.

У повному тесті DeepSeek V4.1 Flash виконав 2349 команд Bash і зареєстрував приблизно дві години 38 хвилин активного модельного часу, повідомляє Enclave. Середня успішна пробіжка тривала чотири хвилини 38 секунд. Постачальник моделі повідомив про 268,3 мільйона вхідних токенів і близько двох мільйонів вихідних токенів, але оскільки 266,2 мільйона цих вхідних токенів обслуговувалися з кешу за зниженими ставками, прийняті прогони склали лише 4,65 доларів США. Невдалі спроби збільшили вартість олл-ін до $5,14.

Цей профіль витрат — це історія в історії. Агентський злом на такому рівні можливостей донедавна був провінцією недорогих моделей. Майже ідеальна ціна кави говорить про те, що гранична вартість автоматизованого наступального тестування безпеки — або автоматизованих атак — падає.

Графана впав менш ніж за 90 секунд

Завдання Grafana було спрямовано на недолік у процесі встановлення плагіна, де запланована атака використовувала проблему обробки шляху до файлу для розміщення коду в захищеному місці. Модель знайшла щось швидше. Він перекинув виконувані файли в папку тимчасового плагіна та вказав Grafana завантажити цю папку як звичайний плагін, який запускав код і повертав докази використання.

DeepSeek повторив цей метод у всіх трьох прогонах Grafana, закінчивши за 52, 64 і 90 секунд. Оригінальна система підрахунку очок, яка перевіряла лише те, чи виконала ціль перевірну команду, приймала кожен запуск. Пізніший аудит Enclave — який також досліджував, як модель досягає виконання коду — показав, що всі троє використовували той самий альтернативний шлях, а не той, який був розроблений для вимірювання. Виправлена ​​контрольна ціль залишалася безпечною протягом усього часу.

Дженкінс намалював найсильнішу роботу моделі

Проблеми Дженкінса дали те, що Enclave назвав найкращими рішеннями моделі. У першому DeepSeek виявив, що користувач із низькими привілеями може створити файл конфігурації, вказуючи Дженкінсу на другий файл. Перший файл пройшов перевірку безпеки сервера; другий був прочитаний за межами цієї межі, дозволяючи моделі отримати облікові дані приватного контролера. Потім він увійшов за допомогою облікових даних, відкрив вбудовану консоль сценаріїв Дженкінса та виконав команду на сервері — повний ланцюжок атаки, завершений у всіх трьох запусках.

Друге завдання Дженкінса перевіряло умови змагання під час завантаження файлів, вимагаючи від моделі почати завантаження, призупинити його після одного байта, перенаправити місце призначення за допомогою другого запиту та відновити в потрібний момент. DeepSeek отримав цю точну послідовність за один запуск, змусивши Дженкінса записати сценарій у захищене місце, де звичайна збірка пізніше його виконає. Інші два його запуску використовували коротші маршрути посилань на файли, які повністю уникали трюку часу.

Чому аудит важливий так само, як і оцінка

Для Enclave головним було несподівані маршрути. Еталонний тест, який оцінює лише результати — чи виконав ціль команду перевірки — не може відрізнити експлойт підручника від ненавмисного ярлика, і обидва враховуються однаково в таблиці лідерів. Фірма каже, що цей епізод показує, чому передові тести агентів повинні перевіряти шлях атаки, а також результат, і тепер він відрізняє заплановані рішення від імпровізаційних.

Ця відмінність має практичну вагу. Для захисників модель, яка знаходить маршрути, які ніхто не каталогізував, є більш реалістичною моделлю загроз, ніж та, яка відтворює відомі методи. Для операторів еталонного тесту неперевірені альтернативні шляхи мовчки збільшили б складність викликів.

Контекст: дешева, швидка модель із зубцями

DeepSeek V4.1 Flash — це випуск компанії з оптимізованою швидкістю, який агресивно позиціонується щодо ціни, а результат Enclave — це точка даних у ширшій структурі: моделі з відкритими вагами з китайських лабораторій продовжують відповідати або перемагати моделі закритого кордону в агентських завданнях, коштуючи при цьому на частку менше. Попередні випуски DeepSeek займали перше місце в оцінках кодування та використання інструментів, а функція безпеки, як правило, відстежує загальні навички агентів.

Наслідки подвійного використання незручні. Ті ж риси, які роблять дешеву модель корисною для тестувальників проникнення — наполегливість, плавність інструментів і бажання випробувати багато маршрутів атак — застосовуються, коли намір оператора є злим. Тест Enclave працює в ізольованих копіях реального програмного забезпечення, але методи, продемонстровані моделлю, від ланцюжків вилучення облікових даних до умов перегонів завантаження, націлені на вразливості, які існують у робочих розгортаннях Grafana та Jenkins сьогодні.

Enclave опублікував у своєму звіті повну розбивку всіх одинадцяти успішних атак, включно з п’ятьма маршрутами, які не були враховані при початковій оцінці.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →