Il modello misterioso che ha affascinato gli sviluppatori per una settimana sotto il nome anonimo di Ox Alpha ha ora un'identità ufficiale. La cinese Z.AI ha lanciato GLM-5.3-Flash, un modello nativamente multimodale a peso aperto rilasciato sotto la permissiva licenza MIT - e la società afferma che l'intera corsa di anteprima stealth è stata servita su chip AI di fabbricazione cinese. Il lancio chiude uno degli indovinelli più seguiti quest'anno nel settore dell'intelligenza artificiale. Per informazioni sullo svolgimento della storia, consulta i nostri ultimi sviluppi dell'intelligenza artificiale.
Ciò che Z.ai ha effettivamente spedito
GLM-5.3-Flash è un modello misto di esperti con 320 miliardi di parametri totali e 18 miliardi di parametri attivi: un notevole calo rispetto ai 32 miliardi di parametri attivi del suo predecessore GLM-4.5. È il primo modello nativamente multimodale della famiglia GLM-5, che accetta input di testo e immagini e supporta una finestra di contesto che raggiunge un milione di token, secondo l'annuncio di Z.ai.
Il modello è stato addestrato su un corpus multimodale da 30 trilioni di token e la sua architettura mescola un’attenzione lineare per le dipendenze locali con un’attenzione scarsa per il contesto globale. Un componente Z.ai chiamato IndexPool comprime gruppi di vettori chiave dell'indicizzatore per limitare la latenza e l'utilizzo della memoria a lunghe durate di contesto. L'azienda segnala un'attenzione tre volte inferiore e una riduzione di 4,4 volte della dimensione della cache KV rispetto a GLM-5.3.
Affermazioni e prezzi di riferimento
Nell'Artificial Analysis Intelligence Index v4.1.1, GLM-5.3-Flash ha ottenuto 57 punti, una cifra che lo colloca in cima alla classifica attuale dei modelli di Artificial Analysis, ben al di sopra della mediana di confronto di 18. Z.ai afferma che supera GLM-5.2 nei test di codifica e agentici riportati a un decimo del prezzo, e si avvicina a Claude Opus 4.8 di Anthropic nel suo benchmark di codifica interno. Su DeepSWE v1.1, il modello ha ottenuto 63,4 contro 46,2 per GLM-5.2; su AutomationBench ha raggiunto 48,8 contro 26,2. Come osservato da TestingCatalog, i diversi strumenti di valutazione, i limiti di contesto e le impostazioni di generazione fanno sì che i confronti tra test dipendano fortemente da ciascuna configurazione.
I prezzi posizionano il modello come aggressivamente economico: 0,15 dollari per milione di token di input e 0,50 dollari per milione di token di output, con uno sconto prompt-cache dell'83%, secondo Artificial Analysis. Z.ai cita un costo scontato di $ 0,045 per attività dell'Intelligence Index.
L'angolo del chip cinese
Il dettaglio strategicamente più significativo è l’infrastruttura, non l’intelligence. Prima del lancio, il modello funzionava in modo anonimo come "ox-alpha" su OpenRouter e OpenCode a partire dal 20 agosto, e Z.ai afferma che è diventato il modello più popolare della settimana su questi servizi, con il traffico servito interamente su acceleratori nazionali cinesi. Per supportare ciò, Z.ai ha creato uno stack di servizio basato su SGLang che separa codifica, precompilazione e decodifica, segnalando un guadagno triplo nelle prestazioni di servizio end-to-end su decine di migliaia di chip IA cinesi.
Ciò conta al di là di un fornitore. È una dimostrazione pubblica che un modello cinese adiacente alla frontiera può essere servito su larga scala senza l’hardware Nvidia, un dato che i politici e i produttori di chip occidentali non ignoreranno. The New Stack ha riassunto il rilascio come economico, buono e servito con patatine cinesi: tre qualità raramente rivendicate insieme fino ad ora.
Pesi aperti, schieramento reale
I pesi sono disponibili su Hugging Face con la licenza MIT, con la distribuzione locale supportata tramite SGLang, vLLM e TokenSpeed. Gli abbonati al piano di codifica GLM ottengono GLM-5.3-Flash immediatamente attivo con tre volte la quota utilizzabile di GLM-5.3 e le sue capacità multimodali sono esposte in ZCode attraverso le integrazioni di utilizzo del browser e utilizzo del computer.
Il ragionamento visivo è centrale nel rilascio: Z.ai ha addestrato il modello a ispezionare le interfacce renderizzate, il gameplay e l'output 3D, quindi valutare e rivedere il proprio lavoro in base al feedback visivo. Lo stesso approccio si estende a documenti, fogli di calcolo, presentazioni e dashboard: gli artefatti del lavoro d'ufficio, che è esattamente il luogo in cui il rivale di Qwen, rilasciato lo stesso giorno, rivendica i suoi maggiori guadagni.
La decisione sui pesi aperti è importante per l’ecosistema al di là degli hobbisti. La licenza MIT è la licenza comune più permissiva nel campo dell’intelligenza artificiale: l’uso commerciale, la modifica e la ridistribuzione non comportano obblighi di copyleft. Gli host indipendenti possono servire GLM-5.3-Flash sul proprio hardware, ottimizzarlo per i settori verticali, dalla revisione legale all'automazione industriale, e incorporarlo nei prodotti senza negoziare i termini: un'opzione preclusa dai modelli di frontiera solo API.
Perché il lancio invisibile ha funzionato
Il lancio anonimo ha dato a Z.ai qualcosa che i budget di marketing non possono comprare: la convalida indipendente dal marchio. Gli sviluppatori hanno adottato Ox Alpha per i suoi meriti, senza inquadrare un laboratorio cinese rispetto agli operatori storici americani. Quando Bloomberg confermò Z.AI come produttore e Business Insider dichiarò il “mistero risolto”, il modello era già in cima alle classifiche della community su terreno neutrale.
La pressione competitiva è ormai esplicita. Un modello multimodale con un contesto da un milione di token, pesi con licenza MIT e prezzi di produzione inferiori al dollaro costringe ogni operatore storico a giustificare il proprio listino prezzi. La frontiera di Pareto per il rapporto prezzo-prestazioni – il compromesso che gli sviluppatori effettivamente percepiscono – è stata ridisegnata, come ha affermato su X il commentatore di intelligenza artificiale Andrew Curran, ampiamente seguito.
La questione aperta è la durabilità: se i lead di riferimento reggeranno in caso di utilizzo avverso nel mondo reale e quanto velocemente i laboratori occidentali risponderanno sul prezzo. In ogni caso, la settimana di speculazioni anonime si è conclusa con un modello con nome, pesi scaricabili e una flotta di servizio che non utilizza silicio americano.
---
Stai al passo con l'intelligenza artificialeRicevi le ultime notizie, analisi e scoperte sull'intelligenza artificiale, tutto in un unico posto.
Leggi altre notizie sull'AI →