Z.ai, compania de inteligență artificială cu sediul la Beijing, cunoscută și sub numele de Zhipu, a lansat GLM-5.3, o nouă iterație a modelului său emblematic despre care compania spune că este cel mai capabil sistem deschis de până acum pentru inginerie software - și unul care a dezvoltat în mod neașteptat abilități formidabile de securitate cibernetică. Anunțat pe 14 august și detaliat într-o postare pe blogul companiei, GLM-5.3 este construit pe același model de bază de aproximativ 700 de miliarde de parametri ca și predecesorul său GLM-5.2, lansat în iunie. Fiecare îmbunătățire, spune compania, vine mai degrabă din post-formare decât dintr-o fundație mai mare. Lansarea este cea mai recentă dintr-un val de modele chinezești deschise care vizează să depășească sistemele închise de la Anthropic și OpenAI. Pentru modelul de urmărire AI Buzz Wire, GLM-5.3 este un semnal clar că frontiera cu greutate deschisă închide decalajul de codare mai repede decât se așteptau mulți.

Câștiguri construite în întregime pe post-antrenament

Z.ai este direct cu privire la abordarea sa cu GLM-5.3: „Scalarea post-antrenament este tot ce am făcut”. Compania a preluat stiva de învățare-întărire pe care a introdus-o cu GLM-5.2 – inclusiv IndexShare pentru procesarea eficientă a contextului lung, SAO pentru învățare prin consolidare pe sarcini cu orizont lung și un cadru open-source numit slime pentru formarea asincronă la scară largă. În ultima lună, pur și simplu a turnat mai multe medii, sarcini mai diverse și mai mult calcul în acea stivă.

Recompensa se afișează în cadrul benchmark-urilor de codare. Pe Terminal Bench 3.0, GLM-5.3 sare de la scorul GLM-5.2 de 4,6 la 28,3 - o îmbunătățire de peste șase ori. Acesta postează rezultate de ultimă generație open-source pe Terminal Bench 3.0 și pe Ultimul examen al agenților și îmbunătățește de la 23.8 la 28.5 măsura ALE-CLI a capacității agentice. Z.ai raportează o îmbunătățire cu 50% față de GLM-5.2 la nivelul său intern Z.ai Code Bench, un benchmark privat conceput pentru a evalua agenții de codare în medii de dezvoltare realiste și pentru a reduce riscul de contaminare de la seturile de testare publice.

În mod esențial, câștigurile vin cu o eficiență mai bună a tokenului, nu doar cu rezultate mai bune. La un efort ridicat, GLM-5.3 atinge 31,4% de finalizare a benchmark-ului intern la aproximativ 50.000 de jetoane de ieșire per sarcină, despre care Z.ai spune că depășește Claude Opus 4.8 de la Anthropic la 29,5% cu 120.000 de jetoane. GLM-5.3 urmează încă mai avansatul Claude Fable 5 de la Anthropic, care atinge 39,5% la efort maxim.

Un salt neașteptat în capacitatea cibernetică

Cel mai izbitor rezultat de la GLM-5.3 nu este în codificare, ci în securitate. Pe măsură ce Z.ai a scalat post-antrenament și a introdus date și medii de descoperire a vulnerabilităților în mixul de instruire, se aștepta ca modelul să se îmbunătățească la găsirea și raționamentul cu privire la defecte. Ceea ce a surprins echipa a fost cât de repede s-a dezvoltat această capacitate.

GLM-5.3 nu a devenit doar mai bun la identificarea bug-urilor izolate; a început să raționeze pe mai multe etape de exploatare, formând planuri coerente pentru lanțuri complete de atac. Pe CyberGym, un etalon de referință care testează dacă un model poate identifica și valida vulnerabilitățile din codul sursă cutie albă, GLM-5.3 are scoruri de 84,5%, în creștere față de 77,2% ale lui GLM-5.2. Acesta este cel mai bun rezultat de referință, înaintea lui Mythos 5 cu 83,8% și GPT-5,6 Sol cu ​​83,6%. Pe ExploitBench, care necesită un raționament mai profund despre vulnerabilitățile reale și exploatarea acestora, GLM-5.3 dublează scorul lui GLM-5.2, ajungând la 54,4% – deși rămâne cu mult în urma lui Mythos 5, cu 78,0% și GPT-5.6 Sol, cu 76,5%.

Z.ai observă un model consistent: cu cât se află mai sus în lanțul de exploatare, cu atât este mai mare câștigul față de GLM-5.2 - și, de asemenea, cu atât este mai mare decalajul rămas față de frontiera închisă. „Capacitatea crește cel mai rapid exact acolo unde suntem cel mai în urmă”, notează compania.

Descoperiri de vulnerabilități în lumea reală

Abilitățile cibernetice nu se limitează la benchmark-uri. Z.ai raportează că de la GLM-5.2, a lucrat cu mai multe echipe de securitate din China pentru a-și testa modelele pe baze de cod din lumea reală. După examinare, screening și deduplicare de către experți, modelul a identificat 2.436 de vulnerabilități în 269 de proiecte, inclusiv 1.097 de probleme de gravitate medie spre mare. Descoperirile acoperă nucleele de sistem, sistemele de operare, motoarele de browser, infrastructura open-source, aplicațiile web și protocoalele de rețea - dintre care multe au trecut neobservate de ani sau chiar decenii, cele mai vechi datând de aproximativ 40 de ani.

Aceste rezultate reflectă munca pe care Anthropic a descris-o în propria sa cercetare de securitate multiagent, în care roiuri coordonate de agenți au fost folosite pentru a căuta vulnerabilități în software-ul open-source la scară.

Greutăți deschise — Cu întârziere

Z.ai spune că va elibera greutățile GLM-5.3 în două săptămâni, odată ce evaluarea siguranței și întărirea sunt finalizate. Acea întârziere deliberată reflectă o tensiune care traversează anunțul: un model care dezvoltă capacități cibernetice puternice ofensive mai repede decât anticipau creatorii săi este exact genul de sistem care ridică întrebări despre eliberarea responsabilă. Compania subliniază că consecvența instruirii și implementării a fost îmbunătățită la un grad ridicat de precizie numerică și că o mare parte din dificultatea de scalare s-a mutat de la modelul în sine la proiectarea unor medii de sarcini realiste și verificabile.

Imaginea competitivă este clară. GLM-5.3 restrânge distanța până la frontiera închisă în ceea ce privește sarcinile de codare și agenție, pretinzând în același timp liderul absolut pe cel puțin un punct de referință major pentru descoperirea vulnerabilităților. Face acest lucru ca un model deschis - ceea ce înseamnă că, odată lansate, greutățile vor fi disponibile gratuit pentru a putea descărca, studia și construi pe baza oricui. Indiferent dacă această deschidere accelerează progresul sau ridică noi preocupări de securitate, este o dezbatere că GLM-5.3 este aproape garantat să reaprindă.

Rămâi înaintea AI

Pentru cele mai recente lansări de modele AI, bătălii de referință și analize din industrie, marcați AI Buzz Wire.

Citiți mai multe știri AI →