Tencent a publié un aperçu open source de Hy4, un nouveau modèle de langage phare de son équipe Hunyuan que la société positionne à la frontière de l'open source. Les poids ont atterri sur Hugging Face, ModelScope, GitCode et CNB le 28 août sous la licence permissive Apache 2.0, aux côtés d'une variante quantifiée FP8 pour une inférence moins chère.
Ce lancement intensifie la concurrence entre les laboratoires chinois qui expédient des modèles frontières à poids ouvert, un domaine qui comprend actuellement la série GLM de Z.AI et les modèles Kimi de Moonshot AI. Bloomberg a rapporté que Tencent affirme que le nouveau modèle surpasse ses deux concurrents lors des tests internes – une affirmation qui, comme toutes les évaluations réalisées par les fournisseurs, mérite un examen minutieux. Pour plus de contexte sur cette histoire, consultez notre plus d'articles sur l'IA.
Les chiffres à la une
L'aperçu Hy4 est un modèle de mélange d'experts (MoE) avec 770 milliards de paramètres au total, dont 49 milliards sont activés par jeton. Selon la carte modèle officielle publiée sur le référentiel GitHub Tencent-Hunyuan, le backbone comporte 78 couches, 256 experts routés plus un expert partagé, et active les 8 meilleurs experts routés pour chaque jeton. Une couche native de prédiction multi-token (MTP) – 10 milliards de paramètres au total, 0,7 milliard activés – est intégrée pour le décodage spéculatif.
La fenêtre contextuelle est l'autre spécification phare : 1 million de jetons, une longueur qui permet au modèle de traiter des bases de code entières, de longs documents juridiques ou des transcriptions de réunions d'une heure en un seul passage.
Architecture empruntée à des rivaux – et construite dessus
Avec un degré de franchise inhabituel pour un lancement phare, la documentation de Tencent indique que le module d'attention a été « inspiré par DeepSeek et GLM ». L'aperçu Hy4 utilise Gated DeepSeek Sparse Attention (Gated DSA) combiné à IndexCache pour la réutilisation d'index clairsemés entre couches, tandis que la voie résiduelle utilise des hyper-connexions d'identité (iHC) pour étendre le flux d'informations inter-couches.
L'ouverture est importante pour les développeurs qui évaluent le modèle : une attention éparse est ce qui rend un contexte de jeton 1M économiquement utilisable, car une attention totale naïve à cette longueur devient d'un coût prohibitif. DeepSeek et Z.AI ont tous deux expédié des variantes de cette conception dans leurs propres modèles phares.
Conçu pour la productivité, optimisé par des experts internes
Tencent affirme avoir collaboré avec des experts au sein de l'entreprise (ingénieurs logiciels, développeurs de jeux, analystes financiers et experts en sécurité) et construit des données de formation autour du travail qu'ils effectuent réellement. La fiche modèle met en évidence quatre domaines d’intervention :
- Ingénierie logicielle : amélioration de la planification, du débogage et de la vérification des tâches de développement à long terme, ainsi que des gains en termes de « goût visuel » front-end.
- Bureau et analyse : conversion d'un contexte multi-fichiers désordonné en documents, feuilles de calcul et présentations partageables, avec une meilleure gestion des équations et des modèles financiers.
- Développement de jeux : générer des prototypes jouables à partir d'une seule invite et travailler couramment avec les moteurs de jeu sur plusieurs tours de raffinement.
- Recherche scientifique : progrès revendiqués dans la recherche sur l'IA, la dynamique moléculaire, la physique de la matière condensée et les problèmes de mathématiques pures.
Tencent indique également que l'aperçu Hy4 a été co-conçu avec ses propres produits, CodeBuddy et WorkBuddy, afin que les gains du modèle se traduisent par des améliorations du produit.
Ce que montrent les propres benchmarks de Tencent
La comparaison la plus concrète des documents de lancement est une évaluation côte à côte aveugle menée par Tencent avec 163 experts internes évaluant les résultats de 203 tâches d'ingénierie. Dans ces tests, Hy4 Preview a obtenu une moyenne de 2,99, légèrement devant les 2,92 de GLM 5.3 (46,8 % de victoires, 12,8 % d'égalités, 40,4 % de défaites) et les 2,94 de Kimi K3 (51,2 % de victoires, 7,9 % d'égalités, 40,9 % de défaites).
Deux mises en garde méritent d’être formulées clairement. Premièrement, il s’agit d’évaluations internes de Tencent, et non de références indépendantes ; la société n'a pas encore publié de résultats vérifiés par un tiers dans les classements publics. Deuxièmement, les marges sont étroites : un écart de 0,05 à 0,07 point sur une échelle subjective d’évaluation d’experts se situe dans une fourchette que différents pools d’évaluation pourraient facilement inverser.
Une vérification indépendante proviendra d'agrégations publiques à mesure que la communauté exécutera le modèle via des suites de codage, de raisonnement et d'agent standardisés dans les semaines à venir.
Expédition anticipée, avec des bugs connus
Tencent précise clairement qu'il s'agit d'un aperçu. La carte modèle répertorie les limitations connues, notamment le fait de passer plus de temps que nécessaire à raisonner sur des tâches complexes et une tendance à sur-vérifier son propre travail. L'équipe affirme qu'elle « préfère expédier tôt et entendre ce qui casse », citant l'approche qui a amélioré sa génération Hy3.
Pour le déploiement, les pondérations sont disponibles dans BF16 et FP8, avec une prise en charge dès le premier jour dans vLLM et SGLang. Tencent publie des images Docker prédéfinies pour les deux, avec des recettes recommandant le parallélisme tensoriel sur 8 GPU et un décodage spéculatif basé sur MTP pour un service sensible à la latence. Un pipeline de réglage fin et la boîte à outils de quantification AngelSlim sont livrés avec le modèle.
Pourquoi c'est important
La course aux poids ouverts en Chine est devenue une guerre sur deux fronts entre la série GLM de Z.AI et les modèles Kimi de Moonshot, avec DeepSeek, Qwen et maintenant une entrée beaucoup plus importante de Hunyuan encombrant le peloton. La combinaison de la licence Apache 2.0 de l'aperçu Hy4, d'une échelle de paramètres de 770 B et d'un contexte de 1 million de jetons élève le plafond de ce que tout le monde peut télécharger et auto-héberger - et la prise en charge initiale de vLLM et SGLang abaisse la barrière pour l'exécuter réellement.
Pour les entreprises qui comparent les modèles ouverts aux API fermées occidentales, la question pratique n’est plus de savoir si un modèle ouvert peut égaler les performances fermées sur papier, mais si les outils qui l’entourent – quantification, service, réglage fin – sont suffisamment matures. Tencent parie que c'est en expédiant tout cela en même temps, sous une licence permissive, que Hunyuan reviendra dans la conversation.
La question de savoir si les affirmations du benchmark interne résistent aux tests indépendants déterminera si l'aperçu Hy4 est retenu comme une véritable version open source de pointe ou comme un autre benchmark du fournisseur dans un domaine encombré. Les pondérations sont désormais publiques, le verdict de la communauté ne devrait donc pas tarder.
---
Restez à la Pointe de l'IALes dernières actualités, analyses et percées en IA — au même endroit.
Lire plus d'actualités IA →