Z.ai, пекінська компанія зі штучного інтелекту, також відома як Zhipu, випустила GLM-5.3, нову ітерацію своєї флагманської моделі, яка, за словами компанії, є її найпотужнішою відкритою системою для розробки програмного забезпечення, яка неочікувано розвинула величезні навички кібербезпеки. GLM-5.3, оголошений 14 серпня та детально описаний у блозі компанії, побудований на тій же базовій моделі приблизно з 700 мільярдами параметрів, що й його попередник GLM-5.2, випущений у червні. Кожне вдосконалення, за словами компанії, відбувається на основі післянавчання, а не на більшій основі. Цей випуск є останнім у хвилі китайських відкритих моделей, які прагнуть випередити закриті системи від Anthropic і OpenAI. Для трекера моделі AI Buzz Wire GLM-5.3 є чітким сигналом того, що відкрита вага закриває розрив у кодуванні швидше, ніж багато хто очікував.
Прибуток, повністю створений після навчання
Z.ai прямо говорить про свій підхід до GLM-5.3: «Масштабування після навчання — це все, що ми зробили». Компанія перенесла стек навчання з підкріпленням, який вона представила з GLM-5.2 — включаючи IndexShare для ефективної обробки тривалого контексту, SAO для навчання з підкріпленням у довгострокових завданнях і фреймворк із відкритим кодом під назвою slime для великомасштабного асинхронного навчання. За останній місяць він просто влив більше середовищ, більше різноманітних завдань і більше обчислень у цей стек.
Виплата відображається на тестах кодування. На термінальному стенді 3.0 GLM-5.3 підскочив з оцінки GLM-5.2 4,6 до 28,3 — це більш ніж шестикратне покращення. Він публікує сучасні результати з відкритим вихідним кодом на Terminal Bench 3.0 і на Agents' Last Exam, а також покращує з 23,8 до 28,5 показник ALE-CLI щодо агентських можливостей. Z.ai повідомляє про 50% покращення в порівнянні з GLM-5.2 у своєму внутрішньому Z.ai Code Bench, приватному тесті, призначеному для оцінки агентів кодування в реалістичних середовищах розробки та зниження ризику зараження загальнодоступними наборами тестів.
Важливо те, що переваги пов’язані з кращою ефективністю токенів, а не лише з кращими результатами. При високих зусиллях GLM-5.3 досягає 31,4% завершення за внутрішнім тестом при приблизно 50 000 вихідних жетонів на завдання, що, за словами Z.ai, перевершує Claude Opus 4.8 від Anthropic на 29,5% із 120 000 токенів. GLM-5.3 все ще поступається більш просунутій Claude Fable 5 від Anthropic, яка досягає 39,5% при максимальних зусиллях.
Неочікуваний стрибок у кіберпотужності
Найбільш вражаючим результатом GLM-5.3 є не кодування, а безпека. Оскільки Z.ai масштабувався після навчання та вводив дані та середовища для виявлення вразливостей у навчальну суміш, він очікував, що модель покращиться у пошуку та міркуванні про недоліки. Що здивувало команду, так це те, як швидко розвивалася ця здатність.
GLM-5.3 не просто став краще виявляти окремі помилки; він почав міркувати про кілька етапів експлуатації, формуючи узгоджені плани повних ланцюжків атак. У CyberGym, тесті, який перевіряє, чи може модель ідентифікувати та підтверджувати вразливості з вихідного коду білої скриньки, GLM-5.3 набирає 84,5%, у порівнянні з 77,2% GLM-5.2. Це найкращий результат у бенчмарку, випереджаючи Mythos 5 із 83,8% і GPT-5.6 Sol із 83,6%. На ExploitBench, який вимагає більш глибоких міркувань про реальні вразливості та їх використання, GLM-5.3 більш ніж удвічі перевищує оцінку GLM-5.2, досягаючи 54,4%, хоча він залишається значно позаду Mythos 5 з 78,0% і GPT-5.6 Sol з 76,5%.
Z.ai спостерігає послідовну закономірність: чим далі в ланцюжку експлуатації знаходиться еталонний тест, тим більший приріст у порівнянні з GLM-5.2, а також тим більший розрив, що залишився до закритого кордону. «Потенціал зростає найшвидше саме там, де ми найвідсталі», — зазначає компанія.
Виявлення вразливостей у реальному світі
Кібернавички не обмежуються тестами. Z.ai повідомляє, що після GLM-5.2 він працює з кількома командами безпеки в Китаї, щоб перевірити свої моделі на реальних кодових базах. Після експертного огляду, скринінгу та дедуплікації модель виявила 2436 уразливостей у 269 проектах, у тому числі 1097 проблем середнього та високого рівня серйозності. Знахідки охоплюють системні ядра, операційні системи, двигуни браузерів, інфраструктуру з відкритим вихідним кодом, веб-додатки та мережеві протоколи — багато з яких залишалися непоміченими роками або навіть десятиліттями, причому найстаріші датуються приблизно 40 роками.
Ці результати перегукуються з роботою, яку Anthropic описав у своєму власному дослідженні багатоагентної безпеки, де скоординовані зграї агентів використовувалися для масштабного пошуку вразливостей у програмному забезпеченні з відкритим кодом.
Відкриті ваги — із затримкою
Z.ai каже, що випустить гирі GLM-5.3 через два тижні, після завершення оцінки безпеки та загартування. Ця навмисна затримка відображає напругу, що пронизує через оголошення: модель, яка розвиває потужні наступальні кібер-можливості швидше, ніж передбачали її творці, є саме тією системою, яка викликає питання щодо відповідального випуску. Компанія наголошує, що її узгодженість між навчанням і розгортанням покращено до високого ступеня чисельної точності, і що значна частина труднощів у масштабуванні перемістилася з самої моделі на розробку реалістичних середовищ завдань, які можна перевірити.
Змагальна картина зрозуміла. GLM-5.3 звужує відстань до закритого кордону для програмування та агентських завдань, водночас претендуючи на повне лідерство принаймні в одному основному тесті виявлення вразливостей. Це робиться як відкрита модель ваги — це означає, що після випуску ваги стануть у вільному доступі для всіх, хто їх зможе завантажувати, вивчати та використовувати. Чи прискорює ця відкритість прогрес чи викликає нові проблеми безпеки – дискусія GLM-5.3 майже гарантовано відновиться.
Будьте попереду ШІ
Щоб переглянути найновіші випуски моделей штучного інтелекту, порівняльні битви та аналіз галузі, додайте закладку AI Buzz Wire.
Читати більше новин AI →