Новый тест от компании Semgrep, занимающейся безопасностью приложений, дал неожиданный результат: модель открытого веса китайской Zhipu AI превзошла Claude от Anthropic при обнаружении реальных недостатков безопасности в программном обеспечении. Это открытие подливает масла в дискуссию о том, является ли наиболее способный ИИ обязательно самым дорогим или самым ограниченным.
Поскольку мощная модель Mythos от Anthropic заблокирована запретом на экспорт в США, группы безопасности, ищущие доступную альтернативу, обращаются к открытым вариантам, таким как [GLM 5.2] (https://aibuzzwire.news), чтобы получить новейшие сведения об индустрии искусственного интеллекта. Тест Семгрепа, опубликованный 22 июня, предполагает, что охота может окупиться раньше, чем ожидалось.
Что тестировал Semgrep
Компания Semgrep оценила линейку моделей с открытым весом и передовых моделей с помощью своего внутреннего теста обнаружения IDOR. IDOR — небезопасные прямые ссылки на объекты — представляют собой ошибки контроля доступа, которые позволяют одному пользователю получить доступ к данным другого пользователя. Их, как известно, трудно обнаружить с помощью традиционного статического анализа, поскольку ошибка носит скорее логический, чем синтаксический характер: код технически корректен, в нем просто отсутствует проверка авторизации.
Компания совершенствует рабочий процесс для обнаружения этих уязвимостей, объединив свой механизм, основанный на правилах, с рассуждениями ИИ. Чтобы определить, насколько производительность зависит от самой модели по сравнению с каркасом вокруг нее, исследователи прогнали ряд популярных моделей с открытым весом с помощью минимального оборудования — простой установки Pydantic, использующей одну и ту же подсказку IDOR, заданную для каждой модели, без обнаружения конечных точек и без управляемой навигации. В подсказке предлагалась только базовая стратегия поиска и несколько указаний на то, как выглядит IDOR — немного больше, чем «вот код, найдите ошибки», но гораздо меньше, чем то, что получают передовые агенты кодирования при работе внутри полного конвейера Semgrep.
IDOR — постоянная головная боль для групп по обеспечению безопасности приложений, поскольку они не проходят сквозь трещины обычных сканеров. Инструмент, основанный на правилах, может отметить отсутствие проверки входных данных, но понимание того, действительно ли конкретная конечная точка предоставляет данные другого пользователя, требует размышлений о бизнес-логике приложения — именно такого контекстного суждения, в котором большие языковые модели становятся все более эффективными.
GLM 5.2 берет на себя инициативу
Выдающейся моделью стала GLM 5.2, модель Zhipu AI с открытым весом. Не используя ничего, кроме простой подсказки, он набрал 39% F1 по обнаружению IDOR, превзойдя 32% у Claude Code на семь полных баллов. По словам Семгрепа, модель с открытым весом также превзошла Claude Opus 4.8 по этой задаче, что сделало ее самым сильным из протестированных вариантов без границ.
Экономика была столь же поразительной. При цене GLM 5.2 прогон стоил примерно 0,17 доллара за каждую найденную уязвимость. Семгреп отметил, что для организаций, которые могут сканировать тысячи конечных точек, стоимость одной ошибки часто является решающим фактором в том, будет ли метод обнаружения практичным в масштабе.
Остальные претенденты в открытом весе отставали еще дальше. MiniMax M3 набрал 23% в F1, а Kimi K2.7 Code получил 22%, оба значительно ниже Claude Code. Семгреп охарактеризовал GLM 5.2 как явное исключение, а не репрезентативный результат для категории открытого веса.
Ремень все еще имеет значение
Несмотря на победу в открытом весе в категории сырых субстанций, собственный конвейер Semgrep, специально построенный, оставался абсолютным лидером. Мультимодальная установка компании, которая сочетает в себе рассуждения ИИ с обнаружением на основе правил и структурированным перечислением конечных точек, достигла показателя F1 от 53% до 61%, в зависимости от конфигурации. Этот пробел подчеркивает первоначальный вопрос исследователей: насколько производительность обнаружения уязвимостей зависит от модели, а насколько от архитектуры вокруг нее?
Ответ, кажется, «и то, и другое, но это больше, чем люди думают, — это ремни безопасности». GLM 5.2 доказал, что работоспособная модель может выполнять значимую работу с минимальной поддержкой, но она все еще не может соответствовать системе, разработанной специально для решения этой проблемы.
Команда Semgrep, в которую входили исследователи Пакстон-Фир, Сет Джаксик, Бренден Ноблитт и Эрик Бьюкенен, заявила, что они «искренне шокированы» тем, что модель с открытым весом, использующая пустую подсказку, превзошла передового агента кодирования в сложной задаче безопасности.
Мифы дома
Этот ориентир имеет дополнительный вес на нынешнем геополитическом фоне. Название поста в блоге — «У нас дома есть мифы» — является явной ссылкой на тот факт, что модель мифов Anthropic, ориентированная на кибербезопасность, фактически недоступна для большей части мира. После того, как администрация Трампа запретила гражданам, не являющимся гражданами США, использовать Mythos и его ограниченную версию Fable 5, группы глобальной безопасности потеряли доступ к тому, что многие считали наиболее способным ИИ для наступательных и оборонительных задач по обеспечению безопасности.
В этом вакууме пробел заполняют доступные модели с открытым весом. Тот факт, что GLM 5.2, который можно бесплатно загрузить и развернуть где угодно, уже может соответствовать передовым запатентованным моделям или превосходить их в конкретных задачах безопасности, предполагает, что сдерживающий эффект запрета на экспорт может быть меньшим, чем предполагалось. Если лучшая «неограниченная» модель будет продолжать совершенствоваться, стратегическая ценность накопления передовых возможностей уменьшится.
На данный момент результат узок: единый тест для одного класса уязвимостей. Но это сигнал о том, что граница открытого веса закрывается быстрее, чем многие предполагали, и что доступность, а не чистые возможности, может стать определяющей переменной в сфере безопасности ИИ.
Это открытие также поднимает неудобные вопросы для пограничных лабораторий. Если свободно доступная модель уже может соответствовать проприетарным системам в решении задач безопасности, конкурентный ров вокруг закрытых моделей сужается — особенно когда экспортный контроль делает эти закрытые модели недоступными для части мирового рынка. Разработчики с открытым кодом, не обремененные ограничениями на использование, могут выполнять итерации и развертывания повсюду одновременно.
Будьте впереди ИИ
Разрыв между передовым и открытым ИИ сокращается благодаря [последним новостям ИИ] (https://aibuzzwire.news) и исследованиям, меняющим безопасность, инфраструктуру и политику.
Читать больше новостей об искусственном интеллекте →


