Modelul misterios care a petrecut o săptămână fermecând dezvoltatorii sub numele anonim Ox Alpha are acum o identitate oficială. Z.AI din China a lansat GLM-5.3-Flash, un model nativ multimodal, deschis, lansat sub licența permisivă MIT – iar compania spune că întreaga rulare de previzualizare stealth a fost oferită pe cipuri AI fabricate în China. Lansarea închide unul dintre cele mai urmărite jocuri de ghicire din industria AI în acest an. Pentru informații despre cum s-a desfășurat povestea, consultați cele mai recente evoluții AI.

Ce a livrat Z.ai de fapt

GLM-5.3-Flash este un model mixt de experți cu 320 de miliarde de parametri totali și 18 miliarde de parametri activi - o scădere notabilă față de cei 32 de miliarde de parametri activi ai predecesorului său GLM-4.5. Este primul model multimodal nativ din familia GLM-5, care acceptă introducerea textului și a imaginii și acceptă o fereastră de context care ajunge la un milion de jetoane, conform anunțului Z.ai.

Modelul a fost antrenat pe un corpus multimodal de 30 de trilioane de jetoane, iar arhitectura sa combină atenția liniară pentru dependențele locale cu atenția redusă pentru contextul global. O componentă pe care Z.ai o numește IndexPool comprimă grupuri de vectori cheie de indexare pentru a limita latența și utilizarea memoriei la lungimi mari de context. Compania raportează de trei ori mai puțină calcul a atenției și o reducere de 4,4 ori a dimensiunii memoriei cache KV în comparație cu GLM-5.3.

Revendicări de referință și prețuri

La Artificial Analysis Intelligence Index v4.1.1, GLM-5.3-Flash a obținut 57 – o cifră care îl plasează în fruntea clasamentelor actuale ale modelelor Artificial Analysis, cu mult peste mediana de comparație de 18. Z.ai spune că depășește GLM-5.2 în ceea ce privește codificarea raportată și testele agentice de codificare și de abordare a agenției la testele antropice. 4.8 pe benchmark-ul său intern de codificare. Pe DeepSWE v1.1, modelul a obținut 63,4 față de 46,2 pentru GLM-5.2; pe AutomationBench a ajuns la 48,8 față de 26,2. După cum a menționat TestingCatalog, diferitele hamuri de evaluare, limite de context și setări de generare înseamnă că comparațiile între teste depind în mare măsură de fiecare configurare.

Prețul poziționează modelul ca fiind agresiv de ieftin: 0,15 USD per milion de jetoane de intrare și 0,50 USD per milion de jetoane de ieșire, cu o reducere de 83% la prompt-cache, conform Artificial Analysis. Z.ai citează un cost redus de 0,045 USD per sarcină Intelligence Index.

Unghiul chipului chinezesc

Cel mai important detaliu strategic este infrastructura, nu inteligența. Înainte de lansare, modelul rula anonim ca „ox-alpha” pe OpenRouter și OpenCode începând cu 20 august, iar Z.ai spune că a devenit cel mai popular model al săptămânii pentru aceste servicii – traficul fiind deservit în întregime de acceleratoarele interne chineze. Pentru a sprijini acest lucru, Z.ai a construit o stivă de servire bazată pe SGLang, care separă codificarea, completarea preliminară și decodificarea, raportând un câștig de trei ori în performanța de servire end-to-end pe zeci de mii de cipuri AI chinezești.

Asta contează dincolo de un singur furnizor. Este o demonstrație publică că un model chinez adiacent frontierei poate fi servit la scară fără hardware-ul Nvidia, un punct de date pe care politicienii și producătorii de cipuri occidentali nu îl vor ignora. New Stack a rezumat lansarea ca fiind ieftină, bună și servită pe chipsuri chinezești - trei calități rar revendicate împreună până acum.

Greutăți deschise, implementare reală

Greutățile sunt disponibile pe Hugging Face sub licența MIT, cu implementarea locală acceptată prin SGLang, vLLM și TokenSpeed. Abonații GLM Coding Plan primesc imediat GLM-5.3-Flash live cu de trei ori mai mult decât cota utilizabilă a GLM-5.3, iar capacitățile sale multimodale sunt expuse în ZCode prin integrări de utilizare a browserului și utilizare a computerului.

Raționamentul vizual este esențial pentru lansare: Z.ai a antrenat modelul să inspecteze interfețele redate, jocul și rezultatele 3D, apoi să-și evalueze și să-și revizuiască propria activitate din feedback-ul vizual. Aceeași abordare se extinde la documente, foi de calcul, prezentări și tablouri de bord - artefactele de bază ale muncii de birou, care este exact locul în care lansarea rivală a lui Qwen în aceeași zi își revendică și cele mai mari câștiguri.

Decizia de pondere deschisă contează pentru ecosistem dincolo de amatori. Licența MIT este cea mai permisivă licență comună în AI: utilizarea comercială, modificarea și redistribuirea nu implică obligații de copyleft. Gazdele independente pot servi GLM-5.3-Flash pe propriul hardware, îl pot ajusta pentru verticale, de la revizuirea juridică la automatizarea industrială și îl pot încorpora în produse fără a negocia termeni - o opțiune închisă de modelele de frontieră numai API.

De ce a funcționat lansarea stealth

Lansarea anonimă a oferit lui Z.ai ceva ce bugetele de marketing nu pot cumpăra: validarea agnostică a mărcii. Dezvoltatorii au adoptat Ox Alpha pe meritele sale, fără încadrarea unui laborator chinez față de operatorii americani. Până la momentul în care Bloomberg a confirmat Z.AI în calitate de producător, iar Business Insider a declarat „misterul rezolvat”, modelul se afla deja pe primul loc în clasamentul comunității pe teren neutru.

Presiunea competitivă este acum explicită. Un model multimodal cu un context de un milion de jetoane, ponderi licențiate de MIT și prețuri de producție mai mici de dolari obligă fiecare operator activ să-și justifice lista de prețuri. Frontiera Pareto pentru preț-vs-performanță – compromisul pe care dezvoltatorii îl simt de fapt – a fost redesenat, așa cum a spus-o pe X, comentatorul AI, pe scară largă, Andrew Curran.

Întrebarea deschisă este durabilitatea: dacă clienții potențiali de referință rezistă în condiții de utilizare adversă în lumea reală și cât de repede laboratoarele occidentale răspund la preț. În orice caz, săptămâna speculațiilor anonime s-a încheiat cu un model numit, greutăți descărcabile și o flotă de servire care nu folosește silicon american.

---

Rămâneți înaintea AI

Obțineți cele mai recente știri, analize și descoperiri despre AI - toate într-un singur loc.

Citește mai multe știri AI →