Z.ai, firma zajmująca się sztuczną inteligencją z siedzibą w Pekinie, znana również jako Zhipu, wypuściła GLM-5.3, nową wersję swojego flagowego modelu, który według firmy jest jej najpotężniejszym jak dotąd systemem o otwartej masie do inżynierii oprogramowania – i który nieoczekiwanie rozwinął ogromne umiejętności w zakresie cyberbezpieczeństwa. Ogłoszony 14 sierpnia i szczegółowo opisany w firmowym poście na blogu, GLM-5.3 jest zbudowany na tym samym modelu podstawowym o około 700 miliardach parametrów, co jego poprzednik GLM-5.2, wydany w czerwcu. Firma twierdzi, że każde ulepszenie wynika z szkolenia po szkoleniu, a nie z większych podstaw. To najnowsze wydanie z fali chińskich modeli o otwartej wadze, których celem jest prześcignięcie systemów zamkniętych firm Anthropic i OpenAI. W przypadku modułu śledzącego modele AI Buzz Wire GLM-5.3 jest wyraźnym sygnałem, że otwarta granica zamyka lukę w kodowaniu szybciej, niż wielu się spodziewało.
Zyski zbudowane w całości po treningu
Z.ai otwarcie mówi o swoim podejściu do GLM-5.3: „Skalowanie po treningu to wszystko, co zrobiliśmy”. Firma przeniosła stos do uczenia się przez wzmacnianie, który wprowadził w GLM-5.2 — w tym IndexShare do wydajnego przetwarzania długiego kontekstu, SAO do uczenia się przez wzmacnianie w przypadku zadań o długim horyzoncie czasowym oraz framework o otwartym kodzie źródłowym o nazwie slime do treningu asynchronicznego na dużą skalę. W ciągu ostatniego miesiąca po prostu wlano do tego stosu więcej środowisk, bardziej zróżnicowanych zadań i więcej mocy obliczeniowych.
Zapłata pojawia się we wszystkich testach porównawczych kodowania. W Terminal Bench 3.0 GLM-5.3 przeskakuje z wyniku GLM-5.2 wynoszącego 4,6 do 28,3, co stanowi ponad sześciokrotną poprawę. Publikuje najnowocześniejsze wyniki typu open source w Terminal Bench 3.0 i ostatnim egzaminie dla agentów, a także poprawia się z 23,8 do 28,5 w pomiarze zdolności agenta ALE-CLI. Z.ai zgłasza 50% poprawę w stosunku do GLM-5.2 w swoim wewnętrznym Z.ai Code Bench, prywatnym benchmarku zaprojektowanym do oceny agentów kodujących w realistycznych środowiskach programistycznych i zmniejszania ryzyka zanieczyszczenia z publicznych zestawów testowych.
Co najważniejsze, zyski wiążą się z lepszą wydajnością tokenów, a nie tylko lepszymi wynikami. Przy dużym wysiłku GLM-5.3 osiąga 31,4% ukończenia wewnętrznego testu porównawczego przy około 50 000 tokenów wyjściowych na zadanie, co według Z.ai przewyższa Claude Opus 4.8 firmy Anthropic na poziomie 29,5% i 120 000 tokenów. GLM-5.3 wciąż ustępuje bardziej zaawansowanemu Claude Fable 5 firmy Anthropic, który przy maksymalnym wysiłku osiąga 39,5%.
Nieoczekiwany skok w zakresie możliwości cybernetycznych
Najbardziej uderzającym rezultatem GLM-5.3 nie jest kodowanie, ale bezpieczeństwo. W miarę jak Z.ai skalował szkolenie po szkoleniu i wprowadzał do zestawu szkoleniowego dane i środowiska umożliwiające wykrywanie podatności, spodziewał się, że model poprawi się w znajdowaniu i wnioskowaniu o wadach. Tym, co zaskoczyło zespół, było to, jak szybko rozwinęła się ta zdolność.
GLM-5.3 nie tylko stał się lepszy w wykrywaniu izolowanych błędów; zaczął rozważać wiele etapów eksploatacji, tworząc spójne plany kompletnych łańcuchów ataków. W CyberGym, benchmarku sprawdzającym, czy model potrafi zidentyfikować i zweryfikować luki w kodzie źródłowym typu white-box, GLM-5.3 uzyskuje 84,5%, w porównaniu z 77,2% GLM-5.2. To najlepszy wynik w benchmarku, wyprzedzając Mythos 5 z wynikiem 83,8% i GPT-5.6 Sol z wynikiem 83,6%. W ExploitBench, który wymaga głębszego przemyślenia na temat rzeczywistych luk w zabezpieczeniach i ich wykorzystania, GLM-5.3 ponad dwukrotnie przewyższa wynik GLM-5.2, osiągając 54,4% — choć pozostaje daleko w tyle za Mythos 5 z 78,0% i GPT-5.6 Sol z 76,5%.
Z.ai obserwuje spójny wzór: im dalej w łańcuchu eksploatacji znajduje się benchmark, tym większa przewaga nad GLM-5.2 – i tym szersza pozostaje różnica do zamkniętej granicy. „Możliwości rosną najszybciej dokładnie tam, gdzie jesteśmy najbardziej w tyle” – zauważa firma.
Wykrywanie luk w zabezpieczeniach w świecie rzeczywistym
Umiejętności cybernetyczne nie ograniczają się do testów porównawczych. Z.ai informuje, że od wersji GLM-5.2 współpracuje z kilkoma zespołami ds. bezpieczeństwa w Chinach, aby przetestować swoje modele w porównaniu z bazami kodu ze świata rzeczywistego. Po dokonaniu przeglądu przez ekspertów, sprawdzeniu i deduplikacji model zidentyfikował 2436 luk w zabezpieczeniach w 269 projektach, w tym 1097 problemów o średniej do wysokiej wadze. Odkrycia obejmują jądra systemów, systemy operacyjne, silniki przeglądarek, infrastrukturę open source, aplikacje internetowe i protokoły sieciowe — wiele z nich pozostało niezauważonych przez lata, a nawet dziesięciolecia, a najstarsze pochodzą sprzed około 40 lat.
Wyniki te odzwierciedlają prace opisane przez firmę Anthropic w ramach własnych badań nad bezpieczeństwem wieloagentowym, podczas których skoordynowane roje agentów były wykorzystywane do poszukiwania na dużą skalę luk w zabezpieczeniach oprogramowania typu open source.
Otwarte ciężary — z opóźnieniem
Z.ai twierdzi, że wypuści obciążniki GLM-5.3 w ciągu dwóch tygodni, po zakończeniu oceny bezpieczeństwa i utwardzeniu. To celowe opóźnienie odzwierciedla napięcie panujące w ogłoszeniu: model, który rozwija potężne ofensywne możliwości cybernetyczne szybciej, niż przewidywali jego twórcy, jest dokładnie tym rodzajem systemu, który rodzi pytania dotyczące odpowiedzialnego uwalniania. Firma podkreśla, że spójność szkoleń i wdrażania została poprawiona do wysokiego stopnia precyzji numerycznej oraz że większość trudności w skalowaniu przeniosła się z samego modelu na projektowanie realistycznych, weryfikowalnych środowisk zadaniowych.
Obraz konkurencji jest jasny. GLM-5.3 zmniejsza dystans do zamkniętej granicy w zakresie kodowania i zadań agentycznych, jednocześnie zapewniając całkowitą przewagę w co najmniej jednym głównym benchmarku wykrywania podatności. Robi to jako model z otwartą wagą — co oznacza, że po wydaniu ciężarki będą swobodnie dostępne dla każdego, aby je pobrać, przestudiować i na nich budować. To, czy ta otwartość przyspiesza postęp, czy rodzi nowe obawy dotyczące bezpieczeństwa, jest debatą, w której GLM-5.3 z pewnością rozgorzeje na nowo.
Wyprzedź sztuczną inteligencję
Najnowsze wydania modeli sztucznej inteligencji, bitwy porównawcze i analizy branżowe znajdziesz w zakładce AI Buzz Wire.
Przeczytaj więcej aktualności o sztucznej inteligencji →