L'équipe Qwen d'Alibaba a publié mercredi Qwen3.8-Flash-Next, un modèle multimodal composé d'experts qui sert également d'aperçu de l'architecture du prochain Qwen4 - et qui donne des résultats qui, selon la société, surpassent son Qwen3.7-Plus, beaucoup plus grand, à environ un neuvième du coût de formation. Reuters, Bloomberg et The Decoder ont tous couvert le lancement, qui met des poids ouverts sur Hugging Face et ModelScope le jour même où Z.ai a expédié son propre modèle ouvert adjacent à la frontière. Suivez les dernières nouvelles sur l'IA alors que la course aux poids ouverts s'accélère.

Une nouvelle architecture en miniature

La spécification principale est l’efficacité. Qwen3.8-Flash-Next possède 125 milliards de paramètres au total mais n'en active que 6 milliards par jeton. À titre de comparaison, Qwen3.7-Plus – le modèle qu'il surpasse dans les benchmarks publiés par Alibaba – compte 397 milliards de paramètres au total, dont 17 milliards activés par jeton, soit près de trois fois le nombre actif de Flash-Next.

La pièce la plus intéressante techniquement est une nouvelle couche d’incorporation de N-grammes contenant 51 milliards de paramètres. La couche stocke les groupes de mots courants sous forme d'entrées autonomes dans ce que Matthias Bastian de The Decoder a décrit comme une sorte de « dictionnaire d'expressions », fournissant des informations au niveau de l'expression au début du réseau. Surtout, il se trouve dans la RAM système standard plutôt que dans la mémoire GPU coûteuse, à ce que l'équipe Qwen appelle un coût supplémentaire relativement faible – une innovation architecturale qui devrait être intégrée à Qwen4.

Le modèle prend en charge nativement une fenêtre contextuelle de 262 144 jetons et s'étend jusqu'à un million de jetons à l'aide de l'extension de contexte long YaRN. Un rapport technique est publié sur GitHub.

Benchmarks : codage et travail de bureau

Les benchmarks d'Alibaba opposent Flash-Next à DeepSeek-V4-Flash (284 milliards de paramètres, 13 milliards actifs) et Claude Opus 4.6 (Max) d'Anthropic. Bien que les deux concurrents soient beaucoup plus grands ou plus chers, Flash-Next est en tête dans la majorité des tâches testées, avec les gains les plus importants en matière de codage et de productivité bureautique.

En codage agent, Flash-Next a obtenu un score de 58,7 sur DeepSWE 1.1 et de 62,5 sur SWE-bench Pro, battant DeepSeek-V4-Flash et Claude Opus 4.6. L'écart sur les tâches bureautiques est encore plus large : 73,9 sur CoWorkBench contre 45,1 pour DeepSeek-V4-Flash et 55,7 sur JobBench, soit près du double des 27,6 de Qwen3.7-Plus. Le raisonnement scientifique est très similaire dans tout le domaine, avec Flash-Next à 91,7 sur GPQA Diamond et 91,9 sur LiveCodeBench v6. Claude Opus 4.6 n'arrive en tête qu'au dernier examen de l'humanité, de 40,0 à 35,9, et il s'agit d'un ancien modèle Anthropic datant de février 2026. Comme toujours, les scores de référence publiés et les performances réelles peuvent différer.

Pression sur les prix sur tous les concurrents

La version de production est livrée sous le nom de Qwen3.8-Flash via QwenCloud, au prix de 0,16 $ par million de jetons d'entrée et de 0,47 $ par million de jetons de sortie. Cela sape même le GLM-5.3-Flash de Z.ai, sorti le même jour à 0,15 $ et 0,50 $ respectivement – ​​soit effectivement la parité au bas du marché.

L'écart avec le produit phare d'Alibaba est flagrant. Qwen3.8-Max, introduit début août pour concurrencer Claude Opus 4.8, Gemini 3.1 Pro et GPT-5.6 Sol, coûte 2,00 $ par million de jetons d'entrée et 6,00 $ par million de jetons de sortie. Flash-Next fonctionne juste en dessous du produit phare, selon les propres chiffres d'Alibaba, à environ un douzième du prix en entrée et en sortie.

Le contexte long ajoute une valeur pratique au-delà de la fiche technique. Avec 262 144 jetons natifs, une seule requête peut contenir plusieurs grands référentiels de codes, un ensemble complet de contrats ou des heures de réunions transcrites ; étendue à un million de jetons avec YaRN, l'analyse de corpus entier devient réalisable sans échafaudage de récupération. Pour les charges de travail de codage agent pour lesquelles Flash-Next affiche ses meilleurs scores (recherche et correction indépendantes de bogues dans des projets logiciels réels), une grande fenêtre signifie moins d'échecs de gestion du contexte en cours de tâche. L'équipe Qwen a également publié le rapport technique sur GitHub, invitant exactement le type d'examen indépendant de l'architecture que les laboratoires propriétaires évitent.

Pourquoi cette version est importante

Qwen3.8-Flash-Next est mieux compris comme une répétition générale publique pour Qwen4. La couche d'intégration N-gram, le rapport agressif des paramètres actifs et le déchargement de la RAM des paramètres volumineux mais rarement nécessaires esquissent une philosophie de conception : déplacer l'intelligence par dollar, et non l'intelligence par GPU. Former un modèle Qwen3.7-Plus pour un neuvième du coût est précisément la capacité qui rend les cycles d'itération rapides abordables - et la vitesse d'itération, plus que n'importe quelle référence unique, est ce qui décide qui se tiendra à la frontière dans un an.

L'arrivée le même jour de deux modèles à poids ouvert adjacents à la frontière en provenance de laboratoires chinois – le GLM-5.3-Flash de Z.ai et le Flash-Next d'Alibaba – marque également un changement de cadence, comme l'a observé FourWeekMBA. Les laboratoires occidentaux détiennent toujours des pics de référence, mais le niveau de poids ouvert expédie désormais chaque semaine une qualité proche de la frontière, à des prix d'un ordre de grandeur inférieur.

Pour les développeurs, la conclusion pratique est simple : le coût d’un modèle multimodal performant, à contexte long, vient de baisser à nouveau, avec des pondérations téléchargeables comme assurance contre n’importe quel fournisseur unique. Pour les concurrents, le message est moins confortable : la frontière de l’efficacité évolue désormais plus rapidement que les prix phares ne peuvent raisonnablement suivre, et Alibaba n’a montré aucun signe de ralentissement.

---

Gardez une longueur d'avance sur l'IA

Recevez les dernières actualités, analyses et avancées en matière d'IA, le tout en un seul endroit.

Lire plus d'actualités sur l'IA →