Новий тест від фірми з безпеки додатків Semgrep дав несподіваний результат: відкрита модель китайської Zhipu AI перевершила Claude з Anthropic у виявленні реальних недоліків безпеки в програмному забезпеченні. Цей висновок підживлює дискусію про те, чи обов’язково найпотужніший ШІ є найдорожчим чи найбільш обмеженим.
Оскільки потужна модель Mythos від Anthropic заблокована за забороною на експорт у США, команди безпеки, які шукають доступну альтернативу, звертаються до доступних варіантів, таких як GLM 5.2, щоб отримати найновішу інформацію про індустрію ШІ. Тест Semgrep, опублікований 22 червня, показує, що полювання може окупитися раніше, ніж очікувалося.
Що перевірив Semgrep
Semgrep оцінив модельний ряд відкритих і граничних моделей за своїм внутрішнім тестом виявлення IDOR. IDOR — незахищені прямі посилання на об’єкти — це помилки керування доступом, які дозволяють одному користувачеві отримати доступ до даних іншого користувача. Відомо, що їх важко виявити за допомогою традиційного статичного аналізу, оскільки недолік логічний, а не синтаксичний: код технічно дійсний, у ньому просто відсутня перевірка авторизації.
Компанія вдосконалює робочий процес для виявлення цих уразливостей, поєднуючи свій механізм на основі правил із міркуваннями ШІ. Щоб виділити, скільки продуктивності забезпечує сама модель порівняно з каркасом навколо неї, дослідники перевірили набір популярних моделей відкритої ваги через мінімальний джгут — просту установку Pydantic з використанням однакових підказок IDOR, що надаються кожній моделі, без виявлення кінцевих точок і без керованої навігації. Підказка пропонувала лише базову стратегію пошуку та кілька вказівок щодо того, як виглядає IDOR — трохи більше, ніж «ось код, знайдіть помилки», але набагато менше, ніж те, що отримують прикордонні агенти кодування, коли працюють у повному конвеєрі Semgrep.
IDOR є постійним головним болем для команд безпеки додатків, оскільки вони проходять крізь звичайні сканери. Інструмент на основі правил може позначати відсутність перевірки введення, але розуміння того, чи справді конкретна кінцева точка відкриває дані іншого користувача, потребує міркувань щодо бізнес-логіки додатка — саме того типу контекстного судження, у якому великі мовні моделі стають все більш ефективними.
GLM 5.2 бере на себе лідерство
Видатною була GLM 5.2, модель Zhipu AI з відкритою вагою. Не запускаючи нічого, окрім простої підказки, він набрав 39% F1 за виявлення IDOR — перевершивши 32% Клода Коду на сім повних балів. За даними Semgrep, відкрита модель також перевершила Claude Opus 4.8 у виконанні цього завдання, що зробило її найпотужнішою випробуваною опцією без кордонів.
Економіка була настільки ж вражаючою. За ціною GLM 5.2 запуск коштував приблизно 0,17 долара за знайдену вразливість. Для організацій, які можуть сканувати тисячі кінцевих точок, Semgrep зазначив, що вартість кожної помилки часто є вирішальним фактором у тому, чи практична техніка виявлення в масштабі.
Інші претенденти у відкритій вазі відстали далі. MiniMax M3 набрав 23% F1, а Kimi K2.7 Code – 22%, обидва кластери значно поступаються Claude Code. Semgrep охарактеризував GLM 5.2 як явний виняток, а не репрезентативний результат для відкритої вагової категорії.
Збруя все ще має значення
Незважаючи на перемогу у відкритій вазі в категорії сирих швидкостей, власний спеціально побудований конвеєр Semgrep залишився лідером у загальному заліку. Мультимодальна установка компанії, яка поєднує в собі міркування ШІ з виявленням на основі правил і структурованим переліком кінцевих точок, досягла від 53% до 61% F1, залежно від конфігурації. Ця прогалина підкреслює оригінальне запитання дослідників: яку частину продуктивності виявлення вразливостей становить модель, а яку архітектуру навколо неї?
Відповідь, здається, "обидва, але більше, ніж люди припускають, це збруя". GLM 5.2 довів, що ефективна модель може виконувати значущу роботу з мінімальною підтримкою, але вона все ще не може відповідати системі, розробленій спеціально для цієї проблеми.
Команда Semgrep, до складу якої входили дослідники Пакстон-Фір, Сет Джаксік, Бренден Ноблітт і Ерік Б’юкенен, заявили, що вони «щиро шоковані», що відкрита модель, яка запускає голі підказки, перевершила агента кодування на кордоні в складному завданні безпеки.
Mythos вдома
Цей показник має додаткову вагу на поточному геополітичному тлі. Заголовок допису в блозі — «У нас є Mythos вдома» — є чітким посиланням на той факт, що орієнтована на кібербезпеку модель Anthropic Mythos фактично недоступна для більшої частини світу. Після того, як адміністрація Трампа заборонила особам, які не є громадянами США, використовувати Mythos і його обмежений брат Fable 5, глобальні команди безпеки втратили доступ до того, що вважалося найпотужнішим штучним інтелектом для наступальної та оборонної роботи безпеки.
У цьому вакуумі доступні відкриті моделі заповнюють прогалину. Той факт, що GLM 5.2, який можна безкоштовно завантажити та розгорнути будь-де, вже може зрівнятися з власними моделями передових компаній або перевершити їх у конкретних завданнях безпеки, свідчить про те, що негативний ефект від заборони на експорт може бути меншим, ніж очікувалося. Якщо найкраща «необмежена» модель продовжує вдосконалюватися, стратегічна цінність накопичення прикордонних можливостей зменшується.
Наразі результат вузький: єдиний тест для одного класу вразливості. Але це сигнал про те, що межа відкритої ваги закривається швидше, ніж багато хто припускав, і що доступність, а не сирі можливості, може стати визначальною змінною в системі безпеки ШІ.
Знахідка також викликає незручні питання для передових лабораторій. Якщо вільно доступна модель уже може зрівнятися з пропрієтарними системами щодо завдань міркування щодо безпеки, конкурентна боротьба навколо закритих моделей звужується, особливо коли експортний контроль робить ці закриті моделі недоступними для багатьох частин глобального ринку. Відкриті розробники, не обтяжені обмеженнями використання, можуть повторювати та розгортати всюди одночасно.
Будьте попереду ШІ
Розрив між передовим і відкритим штучним інтелектом скорочується завдяки найновішим новинам штучного інтелекту і дослідженням, які змінюють безпеку, інфраструктуру та політику.
Читати більше новин AI →


