Z.ai, пекинская компания по искусственному интеллекту, также известная как Zhipu, выпустила GLM-5.3, новую версию своей флагманской модели, которая, по словам компании, является ее самой мощной системой с открытым весом для разработки программного обеспечения, которая неожиданно развила огромные навыки кибербезопасности. Анонсированный 14 августа и подробно описанный в блоге компании, GLM-5.3 построен на той же базовой модели с примерно 700 миллиардами параметров, что и его предшественник GLM-5.2, выпущенный в июне. Каждое улучшение, по словам компании, происходит в результате обучения, а не на более широкой основе. Этот релиз является последним в волне китайских моделей с открытым весом, призванных вытеснить закрытые системы от Anthropic и OpenAI. Для трекера модели AI Buzz Wire GLM-5.3 является четким сигналом о том, что граница открытого веса сокращает разрыв в кодировании быстрее, чем многие ожидали.

Успехи полностью зависят от пост-тренировки

Z.ai прямо говорит о своем подходе к GLM-5.3: «Масштабирование после обучения — это все, что мы сделали». Компания сохранила стек обучения с подкреплением, который она представила в GLM-5.2, включая IndexShare для эффективной обработки длинного контекста, SAO для обучения с подкреплением при выполнении долгосрочных задач и фреймворк с открытым исходным кодом под названием slime для крупномасштабного асинхронного обучения. За последний месяц в этот стек просто добавилось больше сред, более разнообразных задач и больше вычислительных ресурсов.

Выгода проявляется в тестах кодирования. В Terminal Bench 3.0 показатель GLM-5.3 подскочил с показателя GLM-5.2 с 4,6 до 28,3 — более чем шестикратное улучшение. Он публикует самые современные результаты с открытым исходным кодом на Terminal Bench 3.0 и на последнем экзамене агентов, а также повышает показатель агентских возможностей ALE-CLI с 23,8 до 28,5. Z.ai сообщает об улучшении на 50% по сравнению с GLM-5.2 в своем собственном тесте Z.ai Code Bench, частном тесте, предназначенном для оценки агентов кодирования в реалистичных средах разработки и снижения риска загрязнения общедоступными наборами тестов.

Важно отметить, что выигрыш достигается за счет повышения эффективности токенов, а не просто лучших результатов. При высоких усилиях GLM-5.3 достигает 31,4% завершения по внутреннему тесту при примерно 50 000 выходных токенов на задачу, что, по словам Z.ai, превосходит Anthropic Claude Opus 4.8 с показателем 29,5% с 120 000 токенов. GLM-5.3 по-прежнему отстает от более продвинутой Claude Fable 5 от Anthropic, которая достигает 39,5% при максимальном усилии.

Неожиданный скачок в кибервозможностях

Самый яркий результат от GLM-5.3 — не в кодировании, а в безопасности. По мере того, как Z.ai масштабировала пост-обучение и вводила в комплекс обучения данные и среды обнаружения уязвимостей, компания ожидала, что модель улучшится при поиске и анализе недостатков. Что удивило команду, так это то, как быстро развивались эти возможности.

GLM-5.3 не просто стал лучше выявлять отдельные ошибки; он начал анализировать несколько этапов эксплуатации, формируя последовательные планы для полных цепочек атак. В CyberGym, тесте, проверяющем, может ли модель идентифицировать и проверять уязвимости в исходном коде «белого ящика», GLM-5.3 набирает 84,5% по сравнению с 77,2% у GLM-5.2. Это лучший результат в тесте, опережающий Mythos 5 с 83,8% и GPT-5,6 Sol с 83,6%. На ExploitBench, который требует более глубокого анализа реальных уязвимостей и их использования, GLM-5.3 более чем вдвое превосходит GLM-5.2, достигнув 54,4%, хотя он значительно отстает от Mythos 5 с 78,0% и GPT-5.6 Sol с 76,5%.

Z.ai наблюдает последовательную закономерность: чем выше по цепочке эксплуатации находится эталон, тем больше выигрыш по сравнению с GLM-5.2, а также тем шире остающийся разрыв до закрытой границы. «Возможности растут быстрее всего именно там, где мы больше всего отстаем», — отмечает компания.

Обнаружение реальных уязвимостей

Кибер-навыки не ограничиваются критериями. Z.ai сообщает, что начиная с GLM-5.2 он сотрудничает с несколькими командами безопасности в Китае, чтобы протестировать свои модели на реальных кодовых базах. После экспертной проверки, проверки и дедупликации модель выявила 2436 уязвимостей в 269 проектах, включая 1097 проблем средней и высокой степени серьезности. Результаты охватывают системные ядра, операционные системы, браузерные движки, инфраструктуру с открытым исходным кодом, веб-приложения и сетевые протоколы — многие из которых оставались незамеченными в течение многих лет или даже десятилетий, причем самые старые из них датируются примерно 40 годами.

Эти результаты перекликаются с работой, которую Anthropic описала в своем собственном мультиагентном исследовании безопасности, в котором скоординированные группы агентов использовались для поиска уязвимостей в программном обеспечении с открытым исходным кодом в больших масштабах.

Открытые веса — с задержкой

Z.ai сообщает, что выпустит гири GLM-5.3 через две недели, как только будет завершена оценка безопасности и закалка. Эта преднамеренная задержка отражает напряжение, пронизывающее это объявление: модель, которая развивает мощные наступательные кибервозможности быстрее, чем ожидали ее создатели, является именно той системой, которая поднимает вопросы об ответственном выпуске. Компания подчеркивает, что ее согласованность обучения и развертывания была улучшена до высокой степени числовой точности, и что большая часть трудностей масштабирования перешла от самой модели к разработке реалистичных, поддающихся проверке сред задач.

Конкурентная картина ясна. GLM-5.3 сокращает расстояние до закрытой границы в области кодирования и агентских задач, одновременно заявляя о явном лидерстве, по крайней мере, в одном важном тесте по обнаружению уязвимостей. Это модель с открытыми весами — это означает, что после выпуска веса будут свободно доступны для скачивания, изучения и развития. Ускорит ли эта открытость прогресс или вызовет новые проблемы безопасности, дискуссия о том, что GLM-5.3 почти гарантированно возобновится.

Будьте впереди ИИ

Чтобы быть в курсе последних выпусков моделей ИИ, сражений в тестах и отраслевого анализа, добавьте в закладки AI Buzz Wire.

Подробнее новости AI →