Z.ai, la société d'intelligence artificielle basée à Pékin, également connue sous le nom de Zhipu, a publié GLM-5.3, une nouvelle itération de son modèle phare qui, selon la société, est son système ouvert le plus performant à ce jour pour l'ingénierie logicielle – et qui a développé de manière inattendue de formidables compétences en matière de cybersécurité. Annoncé le 14 août et détaillé dans un article de blog de l'entreprise, GLM-5.3 est construit sur le même modèle de base d'environ 700 milliards de paramètres que son prédécesseur GLM-5.2, publié en juin. Selon l'entreprise, chaque amélioration vient de la post-formation plutôt que d'une base plus large. Cette version est la dernière d’une vague de modèles chinois ouverts visant à supplanter les systèmes fermés d’Anthropic et d’OpenAI. Pour le tracker de modèle AI Buzz Wire, GLM-5.3 est un signal clair que la frontière des poids ouverts comble l'écart de codage plus rapidement que prévu.
Gains entièrement construits après la formation
Z.ai est direct à propos de son approche avec GLM-5.3 : "La mise à l'échelle post-formation est tout ce que nous avons fait." La société a repris la pile d'apprentissage par renforcement qu'elle avait introduite avec GLM-5.2, notamment IndexShare pour un traitement efficace de contexte long, SAO pour l'apprentissage par renforcement sur des tâches à long terme et un framework open source appelé slime pour une formation asynchrone à grande échelle. Au cours du mois dernier, il a simplement ajouté davantage d'environnements, de tâches plus diversifiées et davantage de calcul dans cette pile.
Le gain apparaît dans tous les tests de codage. Sur Terminal Bench 3.0, GLM-5.3 passe du score de GLM-5.2 de 4,6 à 28,3, soit une amélioration de plus de six fois. Il publie des résultats open source de pointe sur Terminal Bench 3.0 et lors du dernier examen des agents, et améliore de 23,8 à 28,5 la mesure ALE-CLI de la capacité agent. Z.ai rapporte une amélioration de 50 % par rapport à GLM-5.2 sur son Z.ai Code Bench interne, une référence privée conçue pour évaluer les agents de codage dans des environnements de développement réalistes et réduire le risque de contamination par les ensembles de tests publics.
Surtout, les gains s’accompagnent d’une meilleure efficacité des jetons, et pas seulement de meilleurs résultats. Avec un effort élevé, GLM-5.3 atteint un taux d'achèvement de 31,4 % sur le benchmark interne avec environ 50 000 jetons de sortie par tâche, ce qui, selon Z.ai, surpasse Claude Opus 4.8 d'Anthropic à 29,5 % avec 120 000 jetons. GLM-5.3 est toujours à la traîne du Claude Fable 5, plus avancé d'Anthropic, qui atteint 39,5 % à l'effort maximum.
Un bond inattendu dans la cybercapacité
Le résultat le plus frappant de GLM-5.3 n’est pas dans le codage mais dans la sécurité. Au fur et à mesure que Z.ai a évolué après la formation et a introduit des données et des environnements de découverte de vulnérabilités dans le mélange de formation, il s'attendait à ce que le modèle s'améliore dans la recherche et le raisonnement des failles. Ce qui a surpris l’équipe, c’est la rapidité avec laquelle cette capacité s’est développée.
GLM-5.3 n'est pas seulement devenu meilleur dans la détection des bogues isolés ; il a commencé à raisonner sur plusieurs étapes d’exploitation, formant des plans cohérents pour des chaînes d’attaque complètes. Sur CyberGym, un benchmark qui teste si un modèle peut identifier et valider les vulnérabilités du code source en boîte blanche, GLM-5.3 obtient un score de 84,5 %, contre 77,2 % pour GLM-5.2. Il s'agit du meilleur résultat de l'indice de référence, devant Mythos 5 à 83,8 % et GPT-5.6 Sol à 83,6 %. Sur ExploitBench, qui exige un raisonnement plus approfondi sur les vulnérabilités réelles et leur exploitation, GLM-5.3 fait plus que doubler le score de GLM-5.2, atteignant 54,4 %, bien qu'il reste bien derrière Mythos 5 à 78,0 % et GPT-5.6 Sol à 76,5 %.
Z.ai observe un schéma cohérent : plus un indice de référence se situe en haut de la chaîne d'exploitation, plus le gain par rapport au GLM-5.2 est important - et plus l'écart restant par rapport à la frontière fermée est également grand. "La capacité croît le plus rapidement, là où nous sommes le plus en retard", note la société.
Découvertes de vulnérabilités dans le monde réel
Les compétences cyber ne se limitent pas aux benchmarks. Z.ai rapporte que depuis GLM-5.2, il travaille avec plusieurs équipes de sécurité en Chine pour tester ses modèles par rapport à des bases de code du monde réel. Après examen par des experts, sélection et déduplication, le modèle a identifié 2 436 vulnérabilités dans 269 projets, dont 1 097 problèmes de gravité moyenne à élevée. Les résultats couvrent les noyaux système, les systèmes d’exploitation, les moteurs de navigateur, l’infrastructure open source, les applications Web et les protocoles réseau – dont beaucoup sont passés inaperçus depuis des années, voire des décennies, les plus anciens remontant à environ 40 ans.
Ces résultats font écho aux travaux décrits par Anthropic dans sa propre recherche sur la sécurité multiagent, dans laquelle des essaims coordonnés d'agents ont été utilisés pour rechercher à grande échelle les vulnérabilités des logiciels open source.
Poids ouverts — Avec un délai
Z.ai indique qu'il publiera les poids GLM-5.3 dans deux semaines, une fois l'évaluation de la sécurité et le durcissement terminés. Ce retard délibéré reflète une tension qui prévaut dans l’annonce : un modèle qui développe de puissantes capacités cyber-offensives plus rapidement que ne l’avaient prévu ses créateurs est exactement le genre de système qui soulève des questions sur une libération responsable. L'entreprise souligne que la cohérence de sa formation et de son déploiement a été améliorée jusqu'à un haut degré de précision numérique et qu'une grande partie de la difficulté de mise à l'échelle est passée du modèle lui-même à la conception d'environnements de tâches réalistes et vérifiables.
Le tableau de la concurrence est clair. GLM-5.3 réduit la distance par rapport à la frontière fermée en matière de codage et de tâches d'agent tout en revendiquant la première place sur au moins un benchmark majeur de découverte de vulnérabilités. Il le fait sous la forme d'un modèle de pondération ouvert, ce qui signifie qu'une fois publiés, les pondérations seront librement disponibles pour que quiconque puisse les télécharger, les étudier et les utiliser. La question de savoir si cette ouverture accélère les progrès ou soulève de nouveaux problèmes de sécurité est un débat que le GLM-5.3 est pratiquement assuré de relancer.
Gardez une longueur d'avance sur l'IA
Pour les dernières versions de modèles d'IA, les batailles de référence et les analyses du secteur, ajoutez AI Buzz Wire à vos favoris.
Lire plus d'actualités sur l'IA →