AMD heeft Instella-MoE-16B-A3B uitgebracht, een volledig open Mixture-of-Experts (MoE)-taalmodel dat helemaal opnieuw is getraind op zijn eigen Instinct MI300X- en MI325X-GPU's. De release is zowel een statement over silicium als over software: door elke trainingsfase, datamix en configuratie te publiceren, laat AMD zien dat zijn datacenterversnellers end-to-end open modellen van grensklasse kunnen bouwen – een gebied dat Nvidia lange tijd heeft gedomineerd. Het is een van de meer gerichte bewegingen in de open-weight-race die we volgen in ons [breaking AI news] (https://aibuzzwire.news).

Een ontwerp van een kleine maar brede mix van experts

Volgens een gedetailleerd overzicht in MarkTechPost is Instella-MoE-16B-A3B een MoE-model met alleen een decoder met in totaal 16 miljard parameters die slechts 2,8 miljard per token activeren. Elk van de 27 lagen maakt gebruik van 2 gedeelde experts plus 6 gerouteerde experts geselecteerd uit een pool van 64, met een verborgen grootte van 2048, 16 aandachtshoofden en een vocabulaire van 128.896 token. Een Multi-Token Prediction-doelstelling wordt zowel tijdens de pre- als halverwege de training gebruikt.

Die spaarzame architectuur – waarbij voor elk token een klein stukje van het netwerk ‘wakker wordt’ – is dezelfde efficiëntielogica achter de goedkoop te gebruiken open modellen die de markt het afgelopen jaar hebben hervormd. AMD trainde het model op 7,1 biljoen tokens afkomstig uit open corpora, waaronder Nemotron-CC-v2, MegaMath, FineMath, RefineCode en TxT360, en voerde vervolgens een mid-trainingsfase uit op Dolma3 Dolmino 100B over drie datavarianten die werden samengevoegd door middel van gewichtsmiddeling. Een fase met een lange context rekt het venster uit van 4K naar 64K tokens met behulp van YaRN.

Twee innovaties op systeemniveau

De release bevat twee structurele keuzes die AMD benadrukt als betekenisvolle technische overwinningen. De eerste is Gated Multi-head Latent Attention (Gated MLA), die een lichtgewicht aangeleerde uitgangspoort toevoegt aan Multi-head Latent Attention. Een speciale lineaire projectie leidt een ingangsgeconditioneerde poort af die multiplicatief wordt toegepast vóór de uitgangsprojectie.

Het tweede, FarSkip-Collective, is een connectiviteitsschema dat verouderde en gedeeltelijke activeringen doorgeeft aan de MoE- en aandachtslagen, waarbij parallelle communicatie tussen experts en berekeningen wordt overlapt. AMD rapporteert een 12,7% versnelling vóór de training en een tot 39,2% reductie in de tijd tot het eerste token bij het serveren met deskundig parallellisme. Voor een bedrijf dat zijn hardware op prijs-prestatie baseert, zijn dat precies de cijfers die een koper wil zien.

Sterke benchmarks voor een volledig open model

Op het basiscontrolepunt scoort Instella-MoE gemiddeld 76,7 over de evaluaties heen, wat AMD het sterkste resultaat noemt onder de volledig open modellen. Dat geeft hem een ​​voorsprong op Moonlight-16B-A3B (76,2), SmolLM3-3B-Base (70,5), OLMo-3-7B (70,1) en OLMoE-1B-7B (61,9), hoewel hij nog steeds achterloopt op Qwen3.5-4B-Base (79,5). Het leidt op WinoGrande met een score van 86,5 en scoort 65,7 op HumanEval+. Voor taken met een lange context is deze gemiddeld 41,5 op HELM en 79,4 op HEERSER.

Na de training wordt het model verder aangescherpt. De gemiddelde scores stijgen van 71,58 na fijnafstelling onder toezicht naar 72,67 na DPO en 73,22 in de "Think"-configuratie, waarmee ze Olmo3-7B-Think (71,97), Gemma-4-E4B Think (70,47) en Qwen3.5-4B (69,73) verslaan. Bij het volgen van instructies stijgt IFEval van 77,08 naar 83,70.

Het recept na de training is op zichzelf opmerkelijk. Na SFT op Dolci-Think-SFT-7B- en Nemotron-mengsels voert AMD DPO uit met router bias-updates en het hulptaakverdelingsverlies uitgeschakeld om degradatie te voorkomen. Het versterkende leren verloopt vervolgens binnen het Miles-framework van AMD: 1.400 instructiestappen volgens RLVR, gevolgd door Multi-Teacher On-Policy Distillation die de winst weer in zich opneemt zonder dat dit ten koste gaat van de wiskunde- of codeprestaties.

De licentievangst

Er is een voorbehoud dat van belang is voor commerciële gebruikers. De modelgewichten worden verzonden onder een ResearchRAIL-licentie, die het gebruik beperkt tot academische en onderzoeksdoeleinden, dus Instella-MoE is geen drop-in-model voor productie-implementaties. De trainingscodebase heeft echter een MIT-licentie, en dat is misschien wel het meer herbruikbare bezit: het geeft andere laboratoria een concrete blauwdruk voor training op AMD-silicium.

AMD heeft de volledige gewichten van elke trainingsfase, de datamengsels, de trainingsconfiguraties en de gevolgtrekkingscode gepubliceerd in een Hugging Face-collectie, een GitHub-repository en zijn ROCm-blog. Dat niveau van openheid – training per trainingsfase, niet slechts een laatste controlepunt – is wat een ‘volledig open’ release onderscheidt van een typische open-gewicht release.

Waarom dit belangrijker is dan de benchmarks

De subtekst van de release is hardwareconcurrentie. Het CUDA-ecosysteem en de H100-klasse GPU's van Nvidia zijn het standaardsubstraat geweest voor grensverleggende modeltraining, en uitdagers hebben jarenlang geprobeerd te bewijzen dat hun versnellers de volledige trainingsstapel aankunnen. Instella-MoE is een geloofwaardig artefact dat AMD's Instinct-lijn – die al op grote schaal is ingezet door hyperscalers en nationale laboratoria – meer kan doen dan alleen maar werklasten afleiden. Als AMD concurrerende open modellen kan blijven produceren die zijn getraind op zijn eigen hardware, versterkt dit de argumenten voor kopers die de greep van Nvidia op de AI-computermarkt willen doorbreken.

Voor onderzoekers is de aantrekkingskracht de transparantie. Volledig open releases die de datamix, de mid-training blend, de destillatiestrategie en het RL-curriculum documenteren, blijven zeldzaam, en ze laten de gemeenschap claims controleren en reproduceren in plaats van het laboratorium op zijn woord te geloven. Instella-MoE sluit zich aan bij een kleine maar groeiende selectie – inclusief AMD's eigen eerdere Instella-dichte modellen – en duwt die standaard vooruit.

Blijf AI een stap voor

Wilt u dit soort diepgaande technische dekking zodra het gebeurt? Maak een bladwijzer van onze hub voor de nieuwste AI-ontwikkelingen en mis nooit meer een release.

Lees meer AI-nieuws →