Den mystiska modellen som tillbringade en vecka med att charma utvecklare under det anonyma namnet Ox Alpha har nu en officiell identitet. Kinas Z.AI har lanserat GLM-5.3-Flash, en inbyggd multimodal modell med öppen vikt släppt under den tillåtande MIT-licensen - och företaget säger att hela smygförhandsvisningen serverades på kinesisktillverkade AI-chips. Lanseringen avslutar ett av de mest sedda gissningsspelen i AI-branschen i år. För bakgrund om hur historien utvecklades, se vår senaste AI-utvecklingen.

Vad Z.ai faktiskt skickade

GLM-5.3-Flash är en blandning av experter modell med totalt 320 miljarder parametrar och 18 miljarder aktiva parametrar – en anmärkningsvärd minskning från de 32 miljarder aktiva parametrarna i dess GLM-4.5 föregångare. Det är den första inbyggda multimodala modellen i GLM-5-familjen, som accepterar text- och bildinmatning, och den stöder ett sammanhangsfönster som når en miljon tokens, enligt Z.ais tillkännagivande.

Modellen tränades på en multimodal korpus med 30 biljoner token, och dess arkitektur blandar linjär uppmärksamhet för lokala beroenden med sparsam uppmärksamhet för globala sammanhang. En komponent Z.ai kallar IndexPool komprimerar grupper av indexeringsnyckelvektorer för att begränsa latens och minnesanvändning vid långa sammanhangslängder. Företaget rapporterar tre gånger mindre uppmärksamhetsberäkning och en 4,4-faldig minskning av KV-cachestorlek jämfört med GLM-5.3.

Benchmark-anspråk och prissättning

På Artificial Analysis Intelligence Index v4.1.1 fick GLM-5.3-Flash 57 – en siffra som placerar den i toppen av Artificial Analysis nuvarande modellrankning, långt över jämförelsemedianen på 18. Z.ai säger att den överträffar GLM-5.2 över rapporterade kodnings- och agenttester till en tiondel av priset och 4 tiondelar av Claude. dess interna kodningsriktmärke. På DeepSWE v1.1 fick modellen 63,4 mot 46,2 för GLM-5.2; på AutomationBench nådde den 48,8 mot 26,2. Som TestingCatalog noterade betyder olika utvärderingsledningar, kontextgränser och generationsinställningar att jämförelser mellan olika tester är mycket beroende av varje inställning.

Prissättningen positionerar modellen som aggressivt billig: $0,15 per miljon inmatade tokens och $0,50 per miljon output tokens, med en 83% prompt-cache-rabatt, enligt artificiell analys. Z.ai nämner en rabatterad kostnad på 0,045 USD per uppgift i Intelligence Index.

Den kinesiska spånvinkeln

Den mest strategiskt betydelsefulla detaljen är infrastruktur, inte intelligens. Före lanseringen kördes modellen anonymt som "ox-alpha" på OpenRouter och OpenCode från och med den 20 augusti, och Z.ai säger att den blev veckans mest populära modell på dessa tjänster – med trafik helt och hållet på inhemska kinesiska acceleratorer. För att stödja det byggde Z.ai en SGLang-baserad serveringsstack som separerar kodning, förfyllning och avkodning, vilket rapporterar en trefaldig vinst i end-to-end serveringsprestanda över tiotusentals kinesiska AI-chips.

Det betyder mer än en leverantör. Det är en offentlig demonstration av att en gränsöverskridande kinesisk modell kan serveras i stor skala utan Nvidia-hårdvara, en datapunkt som västerländska beslutsfattare och chiptillverkare inte kommer att ignorera. The New Stack sammanfattade releasen som billig, bra och serverad på kinesiska chips - tre kvaliteter som sällan gjort anspråk på tillsammans förrän nu.

Öppna vikter, verklig utplacering

Vikterna är tillgängliga på Hugging Face under MIT-licensen, med lokal distribution som stöds av SGLang, vLLM och TokenSpeed. GLM Coding Plan-prenumeranter får GLM-5.3-Flash live omedelbart med tre gånger den användbara kvoten av GLM-5.3, och dess multimodala möjligheter exponeras i ZCode genom integrationer med webbläsaranvändning och datoranvändning.

Visuellt resonemang är centralt i releasen: Z.ai tränade modellen att inspektera renderade gränssnitt, spel och 3D-utdata, och sedan bedöma och revidera sitt eget arbete utifrån visuell feedback. Samma tillvägagångssätt sträcker sig till dokument, kalkylblad, presentationer och dashboards - kontorsarbetets bröd-och-smörartefakter, vilket är precis där Qwens rivaliserande släpp samma dag också hävdar sina största vinster.

Det öppna viktbeslutet är viktigt för ekosystemet bortom hobbyister. MIT-licenser är den mest tillåtande vanliga licensen inom AI: kommersiell användning, modifiering och omdistribution har inga copyleft-förpliktelser. Oberoende värdar kan servera GLM-5.3-Flash på sin egen hårdvara, finjustera den för vertikaler från juridisk granskning till industriell automation och bädda in den i produkter utan att förhandla om villkor – ett alternativ som stängs av av API-bara gränsmodeller.

Varför stealth-lanseringen fungerade

Den anonyma lanseringen gav Z.ai något som marknadsföringsbudgetar inte kan köpa: varumärkes-agnostisk validering. Utvecklare antog Ox Alpha på dess meriter, utan inramning av ett kinesiskt labb kontra amerikanska etablerade. När Bloomberg bekräftade Z.AI som tillverkaren och Business Insider förklarade att "mysteriet löst" hade modellen redan toppat communityns topplistor på neutral mark.

Konkurrenstrycket är nu tydligt. En multimodal modell med en miljon token-kontext, MIT-licensierade vikter och under-dollar produktionsprissättning tvingar varje sittande företag att motivera sin prislista. Pareto-gränsen för pris-mot-prestanda – som utvecklarna faktiskt känner – har ritats om, som den flitigt följde AI-kommentatorn Andrew Curran uttryckte det på X.

Den öppna frågan är hållbarhet: om benchmark-leads håller i sig under kontradiktorisk användning i den verkliga världen och hur snabbt västerländska labb svarar på priset. Hur som helst, veckan av anonyma spekulationer slutade med en namngiven modell, nedladdningsbara vikter och en serveringsflotta som inte kör något amerikanskt kisel.

---

Stay ahead of AI

Få de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.

Läs mer AI-nyheter →