AMD a publié Instella-MoE-16B-A3B, un modèle de langage Mixture-of-Experts (MoE) entièrement ouvert, formé à partir de zéro sur ses propres GPU Instinct MI300X et MI325X. Cette publication est autant une déclaration sur le silicium que sur les logiciels : en publiant chaque étape de formation, mélange de données et configuration, AMD démontre que ses accélérateurs de centres de données peuvent construire de bout en bout des modèles ouverts de classe frontière – un territoire que Nvidia a longtemps dominé. Il s’agit de l’un des mouvements les plus marquants de la course aux poids ouverts que nous suivons dans nos dernières actualités sur l’IA.

Une conception petite mais large, associant des experts

Selon une analyse détaillée publiée dans MarkTechPost, Instella-MoE-16B-A3B est un modèle MoE uniquement avec décodeur avec 16 milliards de paramètres au total qui n'activent que 2,8 milliards par jeton. Chacune de ses 27 couches utilise 2 experts partagés plus 6 experts routés sélectionnés parmi un pool de 64, avec une taille cachée de 2 048, 16 têtes d'attention et un vocabulaire de 128 896 jetons. Un objectif Multi-Token Prediction est utilisé à la fois pendant la pré-entraînement et à mi-entraînement.

Cette architecture clairsemée – où une infime partie du réseau « se réveille » pour chaque jeton – est la même logique d'efficacité derrière les modèles ouverts peu coûteux à exploiter qui ont remodelé le marché au cours de l'année écoulée. AMD a formé le modèle sur 7 100 milliards de jetons issus de corpus ouverts, notamment Nemotron-CC-v2, MegaMath, FineMath, RefineCode et TxT360, puis a exécuté une étape de formation intermédiaire sur Dolma3 Dolmino 100B sur trois variantes de données qui ont été fusionnées par moyenne de poids. Une étape à contexte long étend la fenêtre de 4 000 à 64 000 jetons à l'aide de YaRN.

Deux innovations au niveau des systèmes

La version comporte deux choix structurels qu'AMD souligne comme des victoires techniques significatives. Le premier est Gated Multi-head Latent Attention (Gated MLA), qui ajoute une porte de sortie apprise légère à Multi-head Latent Attention. Une projection linéaire dédiée dérive une porte conditionnée en entrée qui est appliquée de manière multiplicative avant la projection de sortie.

Le second, FarSkip-Collective, est un schéma de connectivité qui transmet les activations obsolètes et partielles aux couches MoE et d'attention, chevauchant la communication parallèle entre experts et le calcul. AMD rapporte une accélération de 12,7 % avant l'entraînement et jusqu'à une réduction de 39,2 % du temps nécessaire à l'obtention du premier jeton lors de l'utilisation d'un parallélisme expert. Pour une entreprise qui présente son matériel en fonction du rapport qualité-prix, ce sont exactement les chiffres qu'un acheteur souhaite voir.

Des références solides pour un modèle entièrement ouvert

Au point de contrôle de base, Instella-MoE obtient une moyenne de 76,7 dans toutes les évaluations, ce qu'AMD appelle le résultat le plus fort parmi les modèles entièrement ouverts. Cela le place devant Moonlight-16B-A3B (76,2), SmolLM3-3B-Base (70,5), OLMo-3-7B (70,1) et OLMoE-1B-7B (61,9), bien qu'il soit toujours derrière Qwen3.5-4B-Base (79,5). Il est en tête sur WinoGrande avec un score de 86,5 et affiche 65,7 sur HumanEval+. Pour les tâches à contexte long, il est en moyenne de 41,5 sur HELMET et de 79,4 sur RULER.

La post-formation affine davantage le modèle. Les scores moyens grimpent de 71,58 après ajustement supervisé à 72,67 après DPO et 73,22 dans la configuration « Think », battant Olmo3-7B-Think (71,97), Gemma-4-E4B Think (70,47) et Qwen3.5-4B (69,73). En suivant les instructions, IFEval passe de 77,08 à 83,70.

La recette post-formation est elle-même remarquable. Après SFT sur les mélanges Dolci-Think-SFT-7B et Nemotron, AMD exécute DPO avec des mises à jour de polarisation du routeur et la perte d'équilibrage de charge auxiliaire désactivée pour éviter la dégradation. L'apprentissage par renforcement se déroule ensuite dans le framework Miles d'AMD : 1 400 étapes de RLVR suivant les instructions, suivies d'une distillation multi-enseignants sur politique qui réintègre le gain sans sacrifier les performances mathématiques ou du code.

Le piège des licences

Il existe une mise en garde importante pour les utilisateurs commerciaux. Les poids du modèle sont livrés sous une licence ResearchRAIL, qui limite leur utilisation à des fins académiques et de recherche, de sorte qu'Instella-MoE n'est pas un modèle instantané pour les déploiements en production. La base de code de formation, cependant, est sous licence MIT, et c'est sans doute l'actif le plus réutilisable : elle donne à d'autres laboratoires un plan concret pour la formation sur le silicium AMD.

AMD a publié les poids complets de chaque étape de formation, les mélanges de données, les configurations de formation et le code d'inférence dans une collection Hugging Face, un référentiel GitHub et son blog ROCm. Ce niveau d'ouverture – étape par étape de formation, pas seulement un point de contrôle final – est ce qui distingue une version « entièrement ouverte » d'une version à poids ouvert typique.

Pourquoi c'est important au-delà des références

Le sous-texte de cette version est la concurrence matérielle. L'écosystème CUDA de Nvidia et les GPU de classe H100 ont été le substrat par défaut pour la formation des modèles de pointe, et les challengers ont passé des années à essayer de prouver que leurs accélérateurs peuvent gérer l'ensemble de la pile de formation. Instella-MoE est un artefact crédible selon lequel la gamme Instinct d'AMD – déjà déployée à grande échelle par les hyperscalers et les laboratoires nationaux – peut faire plus que des charges de travail d'inférence. Si AMD peut continuer à produire des modèles ouverts compétitifs formés sur son propre matériel, cela renforce les arguments pour les acheteurs cherchant à briser l'emprise de Nvidia sur le marché du calcul de l'IA.

Pour les chercheurs, l’attrait réside dans la transparence. Les versions entièrement ouvertes qui documentent le mélange de données, le mélange à mi-formation, la stratégie de distillation et le programme RL restent rares, et elles permettent à la communauté de vérifier et de reproduire les affirmations plutôt que de croire sur parole un laboratoire. Instella-MoE rejoint une liste restreinte mais croissante – comprenant les premiers modèles denses Instella d'AMD – faisant avancer cette norme.

Gardez une longueur d'avance sur l'IA

Vous voulez ce genre de couverture technique approfondie au fur et à mesure ? Ajoutez notre hub à vos favoris pour connaître les derniers développements de l'IA et ne manquez jamais une version.

Lire plus d'actualités sur l'IA →