Le modèle mystère qui a passé une semaine à charmer les développeurs sous le nom anonyme Ox Alpha a désormais une identité officielle. La société chinoise Z.AI a lancé GLM-5.3-Flash, un modèle nativement multimodal et à poids ouvert publié sous la licence permissive du MIT – et la société affirme que l'intégralité de l'aperçu furtif a été servie sur des puces d'IA fabriquées en Chine. Ce lancement clôture l’un des jeux de devinettes les plus surveillés de l’industrie de l’IA cette année. Pour en savoir plus sur le déroulement de l'histoire, consultez nos derniers développements en matière d'IA.

Ce que Z.ai a réellement expédié

GLM-5.3-Flash est un modèle mixte d'experts avec 320 milliards de paramètres au total et 18 milliards de paramètres actifs, soit une baisse notable par rapport aux 32 milliards de paramètres actifs de son prédécesseur GLM-4.5. Il s'agit du premier modèle nativement multimodal de la famille GLM-5, acceptant la saisie de texte et d'images, et il prend en charge une fenêtre contextuelle atteignant un million de jetons, selon l'annonce de Z.ai.

Le modèle a été formé sur un corpus multimodal de 30 000 milliards de jetons, et son architecture mêle une attention linéaire pour les dépendances locales avec une attention clairsemée pour le contexte mondial. Un composant que Z.ai appelle IndexPool compresse des groupes de vecteurs clés d'indexeur pour limiter la latence et l'utilisation de la mémoire sur de longues longueurs de contexte. La société rapporte trois fois moins d'attention au calcul et une réduction de 4,4 fois de la taille du cache KV par rapport au GLM-5.3.

Réclamations et tarifications de référence

Sur l'Artificial Analysis Intelligence Index v4.1.1, GLM-5.3-Flash a obtenu un score de 57, un chiffre qui le place en tête du classement actuel des modèles d'Artificial Analysis, bien au-dessus de la médiane de comparaison de 18. Z.ai affirme qu'il surpasse GLM-5.2 dans les tests de codage et d'agent signalés à un dixième du prix, et se rapproche de Claude Opus 4.8 d'Anthropic sur son benchmark de codage interne. Sur DeepSWE v1.1, le modèle a obtenu un score de 63,4 contre 46,2 pour GLM-5.2 ; sur AutomationBench il atteint 48,8 contre 26,2. Comme TestingCatalog l'a noté, les différents harnais d'évaluation, limites de contexte et paramètres de génération signifient que les comparaisons entre tests dépendent fortement de chaque configuration.

Le prix positionne le modèle comme extrêmement bon marché : 0,15 $ par million de jetons d'entrée et 0,50 $ par million de jetons de sortie, avec une remise de cache rapide de 83 %, selon Artificial Analysis. Z.ai cite un coût réduit de 0,045 $ par tâche Intelligence Index.

L'angle des jetons chinois

Le détail le plus stratégiquement important est l’infrastructure, et non le renseignement. Avant son lancement, le modèle fonctionnait de manière anonyme sous le nom de « ox-alpha » sur OpenRouter et OpenCode à partir du 20 août, et Z.ai affirme qu'il est devenu le modèle le plus populaire de la semaine sur ces services – avec un trafic entièrement desservi par des accélérateurs nationaux chinois. Pour prendre en charge cela, Z.ai a construit une pile de service basée sur SGLang qui sépare l'encodage, le pré-remplissage et le décodage, rapportant un triplement des performances de service de bout en bout sur des dizaines de milliers de puces d'IA chinoises.

Cela compte au-delà d’un seul fournisseur. Il s’agit d’une démonstration publique qu’un modèle chinois frontalier peut être exploité à grande échelle sans le matériel Nvidia, un point de données que les décideurs politiques et les fabricants de puces occidentaux n’ignoreront pas. The New Stack a résumé la sortie comme étant bon marché, bonne et servie sur des chips chinoises – trois qualités rarement revendiquées ensemble jusqu'à présent.

Poids ouverts, déploiement réel

Les poids sont disponibles sur Hugging Face sous la licence MIT, avec un déploiement local pris en charge via SGLang, vLLM et TokenSpeed. Les abonnés au plan de codage GLM bénéficient immédiatement de GLM-5.3-Flash avec trois fois le quota utilisable de GLM-5.3, et ses capacités multimodales sont exposées dans ZCode via des intégrations d'utilisation du navigateur et d'utilisation de l'ordinateur.

Le raisonnement visuel est au cœur de cette version : Z.ai a entraîné le modèle à inspecter les interfaces rendues, le gameplay et la sortie 3D, puis à évaluer et réviser son propre travail à partir du retour visuel. La même approche s'étend aux documents, aux feuilles de calcul, aux présentations et aux tableaux de bord – les artefacts essentiels du travail de bureau, et c'est exactement là que le rival de Qwen, publié le même jour, revendique également ses plus gros gains.

La décision d’ouverture des poids est importante pour l’écosystème au-delà des amateurs. La licence MIT est la licence courante la plus permissive en matière d'IA : l'utilisation commerciale, la modification et la redistribution ne comportent aucune obligation de copyleft. Les hôtes indépendants peuvent utiliser GLM-5.3-Flash sur leur propre matériel, l'affiner pour des secteurs verticaux allant de l'examen juridique à l'automatisation industrielle, et l'intégrer dans des produits sans négocier les conditions – une option fermée par les modèles frontières uniquement API.

Pourquoi le lancement furtif a fonctionné

Le déploiement anonyme a donné à Z.ai quelque chose que les budgets marketing ne peuvent pas acheter : une validation indépendante de la marque. Les développeurs ont adopté Ox Alpha pour ses mérites, sans le cadrage d'un laboratoire chinois par rapport aux opérateurs historiques américains. Au moment où Bloomberg a confirmé que Z.AI était le fabricant et que Business Insider a déclaré le « mystère résolu », le modèle était déjà en tête des classements communautaires sur terrain neutre.

La pression concurrentielle est désormais explicite. Un modèle multimodal avec un contexte d'un million de jetons, des pondérations sous licence MIT et une tarification à la production inférieure au dollar oblige chaque opérateur historique à justifier sa liste de prix. La frontière de Pareto entre le prix et la performance – le compromis que ressentent réellement les développeurs – a été redessinée, comme l'a dit le commentateur de l'IA Andrew Curran, largement suivi, sur X.

La question ouverte est celle de la durabilité : si les pistes de référence résistent à une utilisation contradictoire dans le monde réel, et avec quelle rapidité les laboratoires occidentaux réagissent en matière de prix. Quoi qu’il en soit, la semaine de spéculation anonyme s’est terminée avec un modèle nommé, des poids téléchargeables et une flotte de service qui n’utilise aucun silicium américain.

---

Gardez une longueur d'avance sur l'IA

Recevez les dernières actualités, analyses et avancées en matière d'IA, le tout en un seul endroit.

Lire plus d'actualités sur l'IA →