Z.ai, le laboratoire chinois d'IA anciennement connu sous le nom de Zhipu AI, a publié l'intégralité de son modèle GLM-5.3 sur Hugging Face, transformant ainsi l'un des modèles de codage et d'agent les plus puissants disponibles en téléchargement gratuit. La version a été mise en ligne le 28 août, quelques jours seulement après que le laboratoire a confirmé que le modèle furtif viral connu sous le nom de "Ox Alpha" était en fait son propre GLM-5.3-Flash, et qu'il remplit la promesse de poids ouverts que la communauté a surveillée de près toute la semaine.
La page modèle a rapidement collecté plus de 1 100 likes, et le fil de discussion Hacker News annonçant la sortie a dépassé les 600 points alors que les développeurs digéraient ce qui se trouve maintenant dans un référentiel public : 141 fichiers safetensors, livrés dans FP8, comprenant ce qui pourrait être le modèle de codage librement téléchargeable le plus performant à ce jour. Pour plus de contexte sur cette histoire, consultez notre plus d'articles sur l'IA.
Ce que Z.ai a réellement expédié
GLM-5.3 est un modèle mixte d'experts construit sur une architecture que Z.ai appelle glm_moe_dsa. Selon la configuration publiée avec les pondérations, le réseau empile 78 couches avec 256 experts routés, activant 8 experts par jeton plus un expert partagé. La fenêtre contextuelle s'étend sur 1 048 576 jetons (un million complet) et le modèle prend en charge un paramètre « reasoning_effort » avec des paramètres bas, haut et maximum, par défaut au maximum.
La note la plus intéressante de la fiche modèle est peut-être la franchise quant à l'origine des améliorations : GLM-5.3 utilise le même modèle de base que GLM-5.2, et chaque gain provient de la post-formation. Le laboratoire décrit clairement le résultat comme « le modèle à poids ouverts le plus performant en matière de codage ».
Benchmarks : SOTA à poids ouverts sur le codage agent
Le tableau d'évaluation publié est complet et inhabituellement spécifique quant à sa méthodologie, répertoriant les résultats par rapport à Kimi K3, DeepSeek-V4 Pro-0813, Qwen3.8-Max, Opus 4.8 d'Anthropic, Fable 5 de Google et GPT-5.6 Sol d'OpenAI.
Sur Terminal Bench 3.0, GLM-5.3 obtient un score de 28,3 – un état de l'art open source et un bond de 4,6 pour GLM-5.2, bien que toujours derrière la frontière fermée de Fable 5 à 33,7 et GPT-5.6 Sol à 34,6. Sur Terminal Bench 2.1, il affiche 88,2, essentiellement au même niveau que Kimi K3 et GPT-5.6 Sol et devant les 85,0 de l'Opus 4.8. Les résultats de DeepSWE sont passés de 46,2 à 66,9 entre les versions, et GLM-5.3 est en tête du classement sur AutomationBench avec 48,2 et sur GDPval-AA v2 avec 1769, ce dernier évalué par analyse artificielle.
Z.ai rapporte également une amélioration de 50 % par rapport à GLM-5.2 sur son Code Bench interne, ainsi que les meilleurs résultats en termes de pondération ouverte sur des tests de référence tels que Agents' Last Exam.
La question des cybercapacités
La carte modèle est remarquablement directe sur un développement que les chercheurs en sécurité suivent depuis des mois : « À mesure que nous avons progressé après la formation, les cybercapacités se sont développées plus rapidement que prévu », indique la carte. GLM-5.3 est à la pointe de la technologie sur CyberGym pour la découverte de vulnérabilités à 84,5, devançant tous les modèles proposés, y compris GPT-5.6 Sol, et il fait plus que doubler GLM-5.2 sur les benchmarks d'exploitation - 54,4 contre 24,4 sur ExploitBench et 105/130 contre 29/39 sur les deux budgets de temps d'ExploitGym.
AI Buzz Wire a couvert ces fonctionnalités lorsqu'elles sont apparues avec la version API uniquement à la mi-août. Ce qui change maintenant, c'est la distribution : les pondérations sont téléchargeables, les constructions de communauté quantifiées suivront probablement rapidement et toute personne disposant de suffisamment de mémoire peut exécuter le modèle localement. Dans la discussion de Hacker News, certains utilisateurs ont noté que le modèle se sentait moins restrictif en ce qui concerne les tâches adjacentes à la sécurité que les alternatives hébergées aux États-Unis – des impressions de la communauté plutôt qu'une affirmation politique officielle, mais reflétant la raison pour laquelle cette version est autant discutée dans les cercles de sécurité que dans ceux des développeurs.
Une licence destinée aux hyperscalers
Contrairement à GLM-5.3-Flash, livré sous une licence MIT propre, GLM-5.3 est livré avec une « licence GLM-5.3 » personnalisée. Le New Stack l’a caractérisé comme visant les hyperscalers, et le texte le confirme. Pour presque tout le monde, les termes sont effectivement permissifs : utiliser, copier, modifier, fusionner, publier, distribuer, sous-licencier et vendre, avec simplement l'obligation d'inclure la notification.
L’exception cible un modèle économique spécifique. Si un titulaire de licence ou ses sociétés affiliées exploitent une activité de « modèle en tant que service » – offrant à des tiers un accès à des inférences ou à des réglages précis – et que leurs revenus combinés dépassent 10 milliards de dollars sur 12 mois consécutifs, ils doivent passer un examen de sécurité Z.ai avant toute utilisation commerciale du modèle ou de ses dérivés. Cette clause trace un cercle précisément autour des plus grands fournisseurs de cloud, tout en laissant intacts les startups, les chercheurs, les entreprises et les hébergeurs de taille moyenne.
L’approche à deux volets est révélatrice. La variante Flash, maintenant révélée comme le modèle Ox Alpha devenu viral avant que TechCrunch ne découvre ses origines, fonctionne entièrement sur du silicium chinois et porte le drapeau du MIT pour une adoption maximale. Le produit phare obtient une licence sur mesure qui maintient le déploiement hyperscaler – en particulier par les cloud américains – encadré par le propre processus d'examen de Z.ai.
Exécutez-le vous-même
Pour ceux qui sont enclins à essayer, la fiche modèle répertorie la prise en charge du déploiement sur vLLM, SGLang, KTransformers, Unsloth et Hugging Face Transformers, avec des recettes de livres de recettes pour plusieurs d'entre eux. Notamment, le déploiement du NPU Huawei Ascend est documenté via vLLM-Ascend, xLLM et SGLang, poursuivant ainsi les efforts du laboratoire pour prouver que les modèles pionniers fonctionnent sur du matériel non Nvidia. Dans la communauté, DeepInfra a été le premier à proposer un point de terminaison tiers du modèle ouvert sur OpenRouter.
Z.ai a également publié un rapport technique sur arXiv, intitulé « GLM-5 : from Vibe Coding to Agentic Engineering », couvrant le développement de la famille de modèles.
Pourquoi c'est important
La version réduit l’écart entre la frontière fermée et la frontière ouverte à une erreur d’arrondi sur de nombreux tests de codage agent – des semaines et non des années. Combiné avec Kimi K3 et DeepSeek-V4, cela signifie que les développeurs extérieurs aux plus grands laboratoires disposent désormais d'alternatives crédibles qu'ils peuvent posséder, auditer et affiner.
Cela signale également un changement dans la manière dont les versions ouvertes sont régies. La répartition des licences MIT et licences personnalisées au sein d'une seule famille de modèles suggère que les laboratoires chinois apprennent à utiliser les licences comme infrastructure stratégique : ouverture là où elles construisent un écosystème, effet de levier là où elles protègent leur position. Le prochain test sera de savoir si un opérateur MaaS de plus de 10 milliards de dollars se soumet réellement à un examen de sécurité de Z.ai – ou si la clause empêche simplement les plus gros nuages d'entrer pendant que tous les autres s'appuient sur le dessus.
---
Restez à la Pointe de l'IALes dernières actualités, analyses et percées en IA — au même endroit.
Lire plus d'actualités IA →