Z.ai, det Pekingbaserade företaget för artificiell intelligens, även känt som Zhipu, har släppt GLM-5.3, en ny version av sin flaggskeppsmodell som företaget säger är dess mest kapabla öppna viktsystem hittills för mjukvaruteknik – och ett som oväntat har utvecklat formidabel cybersäkerhetskompetens. GLM-5.3, som tillkännagavs den 14 augusti och beskrivs i ett företagsblogginlägg, är byggd på samma basmodell på ungefär 700 miljarder parametrar som sin föregångare GLM-5.2, som släpptes i juni. Varje förbättring, säger företaget, kommer från efterutbildning snarare än en större grund. Releasen är den senaste i en våg av kinesiska modeller med öppen vikt som syftar till att konkurrera ut slutna system från Anthropic och OpenAI. För modellspåraren AI Buzz Wire är GLM-5.3 en tydlig signal om att den öppna viktgränsen sluter kodningsgapet snabbare än många förväntade sig.
Vinster bygger helt på efterutbildning
Z.ai är rakt på sak om sitt tillvägagångssätt med GLM-5.3: "Att skala efter träning är allt vi gjorde." Företaget förde över den förstärkningsinlärningsstacken som introducerades med GLM-5.2 — inklusive IndexShare för effektiv långkontextbearbetning, SAO för förstärkningsinlärning på uppgifter med lång horisont och ett ramverk med öppen källkod som kallas slime för storskalig asynkron träning. Under den senaste månaden har det helt enkelt hällt fler miljöer, fler olika uppgifter och mer datorer i den stacken.
Utdelningen visas över riktmärken för kodning. På Terminal Bench 3.0 hoppar GLM-5.3 från GLM-5.2:s poäng på 4,6 till 28,3 — en mer än sexfaldig förbättring. Den publicerar state-of-the-art-resultat med öppen källkod på Terminal Bench 3.0 och på Agents' Last Exam, och förbättrar från 23,8 till 28,5 på ALE-CLI-måttet på agentförmåga. Z.ai rapporterar en 50 % förbättring jämfört med GLM-5.2 på sin interna Z.ai Code Bench, ett privat riktmärke utformat för att utvärdera kodningsagenter i realistiska utvecklingsmiljöer och minska risken för kontaminering från offentliga testset.
Avgörande är att vinsterna kommer med bättre tokeneffektivitet, inte bara bättre resultat. Vid hög ansträngning når GLM-5.3 31,4 % färdigställande på det interna riktmärket med ungefär 50 000 output-tokens per uppgift, vilket Z.ai säger överträffar Anthropics Claude Opus 4.8 på 29,5 % med 120 000 tokens. GLM-5.3 följer fortfarande Anthropics mer avancerade Claude Fable 5, som når 39,5 % vid maximal ansträngning.
Ett oväntat språng i cyberkapacitet
Det mest slående resultatet från GLM-5.3 är inte i kodning utan i säkerhet. När Z.ai skalade efter träning och introducerade sårbarhetsupptäcktsdata och miljöer i träningsmixen, förväntade den sig att modellen skulle förbättras när det gäller att hitta och resonera om brister. Det som förvånade laget var hur snabbt den förmågan utvecklades.
GLM-5.3 blev inte bara bättre på att upptäcka isolerade buggar; det började resonera över flera stadier av exploatering och bildade sammanhängande planer för kompletta attackkedjor. På CyberGym, ett riktmärke som testar om en modell kan identifiera och validera sårbarheter från white-box-källkod, får GLM-5.3 84,5 %, upp från GLM-5.2:s 77,2 %. Det är det bästa resultatet på benchmark, före Mythos 5 på 83,8 % och GPT-5,6 Sol på 83,6 %. På ExploitBench, som kräver djupare resonemang om verkliga sårbarheter och deras exploatering, mer än fördubblar GLM-5.3 GLM-5.2:s poäng och når 54.4 % – även om den ligger långt efter Mythos 5 på 78.0 % och GPT-5.6 Sol på 76.5 %.
Z.ai observerar ett konsekvent mönster: ju längre upp i exploateringskedjan ett riktmärke sitter, desto större blir vinsten över GLM-5.2 – och desto större blir det kvarvarande gapet till den stängda gränsen. "Förmågan växer snabbast precis där vi är längst efter", konstaterar företaget.
Upptäckter av sårbarhet i verkliga världen
Cyberkompetensen är inte begränsad till riktmärken. Z.ai rapporterar att den sedan GLM-5.2 har arbetat med flera säkerhetsteam i Kina för att testa sina modeller mot verkliga kodbaser. Efter expertgranskning, screening och deduplicering identifierade modellen 2 436 sårbarheter i 269 projekt, inklusive 1 097 medel till hög svårighetsgrad. Resultaten sträcker sig över systemkärnor, operativsystem, webbläsarmotorer, öppen källkodsinfrastruktur, webbapplikationer och nätverksprotokoll - av vilka många hade gått obemärkt förbi i år eller till och med årtionden, med de äldsta som går tillbaka ungefär 40 år.
Dessa resultat eko arbete Anthropic har beskrivit i sin egen säkerhetsforskning med flera agenter, där koordinerade svärmar av agenter användes för att leta efter sårbarheter i öppen källkod i stor skala.
Öppna vikter — Med en fördröjning
Z.ai säger att det kommer att släppa GLM-5.3-vikterna om två veckor, när säkerhetsutvärderingen och härdningen är klar. Den avsiktliga fördröjningen återspeglar en spänning som löper genom tillkännagivandet: en modell som utvecklar potenta offensiva cyberkapaciteter snabbare än dess skapare förväntade sig är exakt den typ av system som väcker frågor om ansvarsfull frigivning. Företaget betonar att konsistensen av utbildning och utrullning har förbättrats till en hög grad av numerisk precision, och att mycket av svårigheten att skala har flyttats från själva modellen till designen av realistiska, verifierbara uppgiftsmiljöer.
Konkurrensbilden är tydlig. GLM-5.3 minskar avståndet till den stängda gränsen när det gäller kodnings- och agentuppgifter samtidigt som den tar den direkta ledningen på minst ett stort riktmärke för sårbarhetsupptäckt. Det gör det som en modell med öppen vikt – vilket innebär att, när de väl släppts, kommer vikterna att vara fritt tillgängliga för alla att ladda ner, studera och bygga vidare på. Huruvida denna öppenhet påskyndar framstegen eller väcker nya säkerhetsproblem är en debatt som GLM-5.3 nästan garanterat kommer att återuppstå.
Ligg före AI
För de senaste AI-modellsläppen, benchmark-strider och branschanalyser, bokmärk AI Buzz Wire.
Läs mer AI-nyheter →