Z.ai, het in Beijing gevestigde bedrijf voor kunstmatige intelligentie, ook bekend als Zhipu, heeft GLM-5.3 uitgebracht, een nieuwe versie van zijn vlaggenschipmodel dat volgens het bedrijf het meest capabele open-weight-systeem tot nu toe is voor software-engineering – en een systeem dat onverwacht formidabele vaardigheden op het gebied van cyberbeveiliging heeft ontwikkeld. GLM-5.3, aangekondigd op 14 augustus en gedetailleerd in een blogpost van het bedrijf, is gebouwd op hetzelfde basismodel met ongeveer 700 miljard parameters als zijn voorganger GLM-5.2, uitgebracht in juni. Elke verbetering, zegt het bedrijf, komt voort uit post-training en niet uit een grotere basis. De release is de laatste in een golf van Chinese open-weight-modellen die erop gericht zijn de gesloten systemen van Anthropic en OpenAI te verslaan. Voor de AI Buzz Wire modeltracker is GLM-5.3 een duidelijk signaal dat de open-weight frontier de coderingskloof sneller dicht dan velen hadden verwacht.
Winsten volledig gebaseerd op post-training
Z.ai is bot over zijn aanpak met GLM-5.3: "Het opschalen na de training is het enige dat we hebben gedaan." Het bedrijf nam de leerstack voor versterking over die het introduceerde met GLM-5.2 – inclusief IndexShare voor efficiënte lange-contextverwerking, SAO voor versterkend leren bij taken met een lange horizon, en een open-sourceframework genaamd slime voor grootschalige asynchrone training. De afgelopen maand heeft het eenvoudigweg meer omgevingen, meer diverse taken en meer rekenkracht in die stapel gestort.
De uitbetaling wordt zichtbaar in alle codeerbenchmarks. Op Terminal Bench 3.0 springt GLM-5.3 van de GLM-5.2-score van 4,6 naar 28,3 – een meer dan zesvoudige verbetering. Het publiceert open-source state-of-the-art resultaten op Terminal Bench 3.0 en op het Agents' Last Exam, en verbetert van 23.8 naar 28.5 op de ALE-CLI-maatstaf voor agentische capaciteiten. Z.ai rapporteert een verbetering van 50% ten opzichte van GLM-5.2 op zijn eigen Z.ai Code Bench, een particuliere benchmark die is ontworpen om codeeragenten in realistische ontwikkelomgevingen te evalueren en het risico op besmetting door openbare testsets te verminderen.
Cruciaal is dat de winst gepaard gaat met een betere token-efficiëntie, en niet alleen met betere resultaten. Bij hoge inspanning bereikt GLM-5.3 een voltooiing van 31,4% op de interne benchmark met ongeveer 50.000 outputtokens per taak, wat volgens Z.ai Anthropic's Claude Opus 4.8 overtreft met 29,5% met 120.000 tokens. GLM-5.3 volgt nog steeds de meer geavanceerde Claude Fable 5 van Anthropic, die bij maximale inspanning 39,5% haalt.
Een onverwachte sprong in cybercapaciteiten
Het meest opvallende resultaat van GLM-5.3 ligt niet op het gebied van codering, maar op het gebied van beveiliging. Naarmate Z.ai na de training schaalde en gegevens en omgevingen voor het ontdekken van kwetsbaarheden in de trainingsmix introduceerde, verwachtte het bedrijf dat het model zou verbeteren in het vinden van en redeneren over fouten. Wat het team verraste, was hoe snel dat vermogen zich ontwikkelde.
GLM-5.3 werd niet alleen beter in het opsporen van geïsoleerde bugs; het begon over meerdere exploitatiestadia heen te redeneren en coherente plannen te vormen voor volledige aanvalsketens. Op CyberGym, een benchmark die test of een model kwetsbaarheden uit de white-box-broncode kan identificeren en valideren, scoort GLM-5.3 84,5%, vergeleken met de 77,2% van GLM-5.2. Dat is het beste resultaat op de benchmark, vóór Mythos 5 met 83,8% en GPT-5.6 Sol met 83,6%. Op ExploitBench, dat een diepere redenering over echte kwetsbaarheden en de exploitatie ervan vereist, verdubbelt GLM-5.3 de score van GLM-5.2 ruimschoots en bereikt 54,4% – hoewel het ver achter Mythos 5 blijft met 78,0% en GPT-5.6 Sol met 76,5%.
Z.ai neemt een consistent patroon waar: hoe hogerop in de exploitatieketen een benchmark zich bevindt, hoe groter de winst ten opzichte van GLM-5.2 – en ook hoe groter de resterende kloof met de gesloten grens. "De capaciteit groeit het snelst, precies daar waar we het verst achterlopen", merkt het bedrijf op.
Ontdekkingen van kwetsbaarheden in de echte wereld
De cybervaardigheden beperken zich niet tot benchmarks. Z.ai meldt dat het sinds GLM-5.2 met verschillende beveiligingsteams in China heeft samengewerkt om zijn modellen te testen aan de hand van echte codebases. Na beoordeling, screening en deduplicatie door deskundigen identificeerde het model 2.436 kwetsbaarheden in 269 projecten, waaronder 1.097 problemen met een gemiddelde tot hoge ernst. De bevindingen omvatten systeemkernels, besturingssystemen, browser-engines, open-source infrastructuur, webapplicaties en netwerkprotocollen – waarvan er vele jarenlang of zelfs tientallen jaren onopgemerkt waren gebleven, waarbij de oudste dateren van ongeveer 40 jaar geleden.
Deze resultaten weerspiegelen het werk dat Anthropic heeft beschreven in zijn eigen multi-agent beveiligingsonderzoek, waarbij gecoördineerde zwermen agenten werden gebruikt om op grote schaal naar kwetsbaarheden in open-sourcesoftware te zoeken.
Open gewichten — Met vertraging
Z.ai zegt dat het de GLM-5.3-gewichten binnen twee weken zal vrijgeven, zodra de veiligheidsevaluatie en verharding zijn voltooid. Deze opzettelijke vertraging weerspiegelt de spanning die door de aankondiging heen loopt: een model dat sneller krachtige offensieve cybercapaciteiten ontwikkelt dan de makers hadden verwacht, is precies het soort systeem dat vragen oproept over verantwoorde vrijgave. Het bedrijf benadrukt dat de consistentie tussen training en uitrol is verbeterd tot een hoge mate van numerieke precisie, en dat een groot deel van de moeilijkheid bij het opschalen is verschoven van het model zelf naar het ontwerp van realistische, verifieerbare taakomgevingen.
Het concurrentiebeeld is duidelijk. GLM-5.3 verkleint de afstand tot de gesloten grens op het gebied van coderen en agentische taken, terwijl het de regelrechte voorsprong claimt op ten minste één grote benchmark voor het ontdekken van kwetsbaarheden. Het doet dit als een open-weight-model – wat betekent dat, zodra ze zijn vrijgegeven, de gewichten voor iedereen gratis beschikbaar zullen zijn om te downloaden, te bestuderen en erop voort te bouwen. Of die openheid de vooruitgang versnelt of nieuwe veiligheidsproblemen oproept, is een debat dat GLM-5.3 vrijwel gegarandeerd weer zal oplaaien.
Blijf AI een stap voor
Voor de nieuwste releases van AI-modellen, benchmarkgevechten en sectoranalyses kunt u een bladwijzer maken voor AI Buzz Wire.
Lees meer AI-nieuws →