Het mysteriemodel dat een week lang ontwikkelaars charmeerde onder de anonieme naam Ox Alpha heeft nu een officiële identiteit. Het Chinese Z.AI heeft GLM-5.3-Flash gelanceerd, een native multimodaal, open-weight-model dat is uitgebracht onder de tolerante MIT-licentie – en het bedrijf zegt dat de hele stealth-preview werd uitgevoerd op in China gemaakte AI-chips. Met de lancering wordt een van de meest bekeken raadspellen in de AI-industrie dit jaar afgesloten. Voor achtergrondinformatie over hoe het verhaal zich ontvouwde, zie onze nieuwste AI-ontwikkelingen.
Wat Z.ai daadwerkelijk heeft verzonden
GLM-5.3-Flash is een mix van experts-model met in totaal 320 miljard parameters en 18 miljard actieve parameters – een opmerkelijke daling ten opzichte van de 32 miljard actieve parameters van zijn GLM-4.5-voorganger. Het is het eerste native multimodale model in de GLM-5-familie, dat tekst- en beeldinvoer accepteert, en het ondersteunt een contextvenster van een miljoen tokens, volgens de aankondiging van Z.ai.
Het model is getraind op een multimodaal corpus van 30 biljoen tokens, en de architectuur ervan combineert lineaire aandacht voor lokale afhankelijkheden met spaarzame aandacht voor de mondiale context. Een component die Z.ai IndexPool aanroept, comprimeert groepen indexeringssleutelvectoren om de latentie en het geheugengebruik bij lange contextlengten te beperken. Het bedrijf rapporteert drie keer minder aandachtscomputers en een 4,4-voudige vermindering van de KV-cachegrootte vergeleken met GLM-5.3.
Benchmarkclaims en prijzen
Op de Artificial Analysis Intelligence Index v4.1.1 scoorde GLM-5.3-Flash 57 – een cijfer dat het aan de top van de huidige modelranglijst van Artificial Analysis plaatst, ruim boven de vergelijkingsmediaan van 18. Z.ai zegt dat het beter presteert dan GLM-5.2 in de gerapporteerde coderings- en agentische tests voor een tiende van de prijs, en benadert Claude Opus 4.8 van Anthropic op zijn interne coderingsbenchmark. Op DeepSWE v1.1 scoorde het model 63,4 versus 46,2 voor GLM-5.2; op AutomationBench bereikte het 48,8 tegen 26,2. Zoals TestingCatalog opmerkte, betekenen de verschillende evaluatieharnassen, contextlimieten en generatie-instellingen dat vergelijkingen tussen tests sterk afhankelijk zijn van elke opstelling.
De prijzen positioneren het model als agressief goedkoop: $0,15 per miljoen inputtokens en $0,50 per miljoen outputtokens, met een prompt-cachekorting van 83%, volgens Artificial Analysis. Z.ai noemt een gereduceerde prijs van $ 0,045 per Intelligence Index-taak.
De Chinese chiphoek
Het meest strategisch belangrijke detail is de infrastructuur, en niet de inlichtingen. Vóór de lancering draaide het model vanaf 20 augustus anoniem als 'ox-alpha' op OpenRouter en OpenCode, en Z.ai zegt dat het op die diensten het populairste model van de week werd - waarbij het verkeer volledig via binnenlandse Chinese accelerators werd afgehandeld. Om dat te ondersteunen heeft Z.ai een op SGLang gebaseerde serveerstapel gebouwd die codering, prefill en decodering scheidt, wat een drievoudige winst oplevert in de end-to-end serveerprestaties van tienduizenden Chinese AI-chips.
Dat is belangrijker dan één leverancier. Het is een openbare demonstratie dat een aan de grenzen grenzend Chinees model op grote schaal kan worden bediend zonder Nvidia-hardware, een datapunt dat westerse beleidsmakers en chipmakers niet zullen negeren. The New Stack vatte de release samen als goedkoop, goed en geserveerd op Chinese chips - drie kwaliteiten die tot nu toe zelden samen werden geclaimd.
Open gewichten, echte inzet
De gewichten zijn beschikbaar op Hugging Face onder de MIT-licentie, waarbij lokale implementatie wordt ondersteund via SGLang, vLLM en TokenSpeed. GLM Coding Plan-abonnees krijgen GLM-5.3-Flash onmiddellijk live met drie keer het bruikbare quotum van GLM-5.3, en de multimodale mogelijkheden ervan worden zichtbaar in ZCode via browsergebruik en computergebruik-integraties.
Visueel redeneren staat centraal in de release: Z.ai heeft het model getraind om gerenderde interfaces, gameplay en 3D-uitvoer te inspecteren, en vervolgens zijn eigen werk te beoordelen en te herzien op basis van visuele feedback. Dezelfde aanpak strekt zich uit tot documenten, spreadsheets, presentaties en dashboards – de brood-en-boter-artefacten van kantoorwerk, en dat is precies waar de rivaliserende release van Qwen op dezelfde dag ook zijn grootste winst claimt.
De beslissing met open gewichten is van belang voor het ecosysteem buiten hobbyisten. MIT-licenties zijn de meest tolerante licentie op het gebied van AI: voor commercieel gebruik, wijziging en herdistributie gelden geen copyleft-verplichtingen. Onafhankelijke hosts kunnen GLM-5.3-Flash op hun eigen hardware leveren, het verfijnen voor branches van juridische beoordeling tot industriële automatisering, en het in producten inbedden zonder over voorwaarden te onderhandelen – een optie die wordt afgesloten door alleen-API-grensmodellen.
Waarom de stealth-lancering werkte
De anonieme uitrol gaf Z.ai iets wat marketingbudgetten niet kunnen kopen: merkonafhankelijke validatie. Ontwikkelaars hebben Ox Alpha op zijn merites geadopteerd, zonder de inkadering van een Chinees laboratorium versus Amerikaanse gevestigde exploitanten. Tegen de tijd dat Bloomberg Z.AI bevestigde als de maker en Business Insider het 'mysterie opgelost' verklaarde, stond het model op neutraal terrein al bovenaan de ranglijsten van de gemeenschap.
De concurrentiedruk is nu expliciet. Een multimodaal model met een context van één miljoen tokens, door MIT gelicentieerde gewichten en outputprijzen van minder dan een dollar dwingt elke gevestigde exploitant zijn prijslijst te rechtvaardigen. De Pareto-grens voor prijs versus prestatie – zo denken ontwikkelaars feitelijk – is opnieuw getekend, zoals de alom gevolgde AI-commentator Andrew Curran het op X heeft gezet.
De open vraag is de duurzaamheid: of benchmark-leads stand houden bij vijandig gebruik in de echte wereld, en hoe snel westerse laboratoria op de prijs reageren. Hoe dan ook, de week van anonieme speculatie eindigde met een model met naam, downloadbare gewichten en een vloot die geen Amerikaans silicium gebruikt.
---
Blijf AI een stap voorOntvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.
Lees meer AI-nieuws →