AMD har släppt Instella-MoE-16B-A3B, en helt öppen Mixture-of-Experts (MoE) språkmodell tränad från grunden på egen hand Instinct MI300X och MI325X GPU:er. Releasen är lika mycket ett uttalande om kisel som det handlar om mjukvara: genom att publicera varje träningssteg, datablandning och konfiguration, visar AMD att dess datacenteracceleratorer kan bygga gränsklassiga öppna modeller från början - territorium som Nvidia länge har dominerat. Det är ett av de mer tillspetsade dragen i det öppna viktloppet som vi spårar i våra brytande AI-nyheter.

En liten men bred blandning av experter

Enligt en detaljerad uppdelning i MarkTechPost är Instella-MoE-16B-A3B en MoE-modell med endast avkodare med 16 miljarder totala parametrar som aktiverar endast 2,8 miljarder per token. Vart och ett av dess 27 lager använder 2 delade experter plus 6 dirigerade experter utvalda från en pool på 64, med en dold storlek på 2048, 16 uppmärksamhetshuvuden och ett ordförråd på 128 896 token. Ett Multi-Token Prediction-mål används under både förträning och mitt i träningen.

Den glesa arkitekturen – där en liten bit av nätverket "vaknar" för varje token – är samma effektivitetslogik bakom de billiga att köra öppna modeller som har omformat marknaden under det senaste året. AMD tränade modellen på 7,1 biljoner tokens från öppna korpus inklusive Nemotron-CC-v2, MegaMath, FineMath, RefineCode och TxT360, och körde sedan ett mittträningssteg på Dolma3 Dolmino 100B över tre datavarianter som slogs samman genom viktgenomsnitt. Ett långt sammanhang sträcker fönstret från 4K till 64K tokens med YaRN.

Två innovationer på systemnivå

Releasen innehåller två strukturella val som AMD lyfter fram som meningsfulla ingenjörsvinster. Den första är Gated Multi-head Latent Attention (Gated MLA), som lägger till en lätt inlärd utgångsport till Multi-head Latent Attention. En dedikerad linjär projektion härleder en ingångskonditionerad grind som appliceras multiplikativt före utgångsprojektionen.

Den andra, FarSkip-Collective, är ett anslutningsschema som överför föråldrade och partiella aktiveringar till MoE- och uppmärksamhetslagren, och överlappar expertparallell kommunikation med beräkningar. AMD rapporterar en 12,7 % snabbare förträning och upp till en 39,2 % minskning av tiden till första token vid servering med expertparallellism. För ett företag som lägger sin hårdvara på pris-prestanda är det exakt de siffror som en köpare vill se.

Starka riktmärken för en helt öppen modell

På baskontrollpunkten har Instella-MoE i genomsnitt 76,7 över utvärderingar, vilket AMD kallar det starkaste resultatet bland helt öppna modeller. Det placerar den före Moonlight-16B-A3B (76,2), SmolLM3-3B-Base (70,5), OLMo-3-7B (70,1) och OLMoE-1B-7B (61,9), även om den fortfarande ligger efter Qwen3,5-4B-Base (79,5). Det leder på WinoGrande med en poäng på 86,5 och poster 65,7 på HumanEval+. För uppgifter med långa sammanhang är det i genomsnitt 41,5 på HJÄLM och 79,4 på RULER.

Efterträning vässar modellen ytterligare. Medelpoängen stiger från 71,58 efter övervakad finjustering till 72,67 efter DPO och 73,22 i "Think"-konfigurationen, och slog Olmo3-7B-Think (71,97), Gemma-4-E4B Think (70,47) och Qwen3,5-4B (69,73). Vid instruktionsföljande stiger IFEval från 77,08 till 83,70.

Receptet efter träningen är i sig anmärkningsvärt. Efter SFT på blandningar av Dolci-Think-SFT-7B och Nemotron kör AMD DPO med uppdateringar av routerbias och den extra lastbalanserande förlusten inaktiverad för att undvika försämring. Förstärkningsinlärning fortsätter sedan inom AMD:s Miles-ramverk: 1 400 steg av instruktionsföljande RLVR, följt av Multi-Teacher On-Policy Destillation som viker tillbaka vinsten utan att offra matematiska eller kodprestanda.

Licensieringsfångsten

Det finns en varning som är viktig för kommersiella användare. Modellvikterna levereras under en ResearchRAIL-licens, som begränsar användningen till endast akademiska och forskningsändamål, så Instella-MoE är inte en drop-in-modell för produktionsinstallationer. Utbildningskodbasen är dock MIT-licensierad, och det är utan tvekan den mer återanvändbara tillgången - den ger andra laboratorier en konkret plan för utbildning på AMD-kisel.

AMD har publicerat de fullständiga vikterna från varje träningsstadium, datablandningarna, träningskonfigurationerna och slutledningskoden över en Hugging Face-samling, ett GitHub-förråd och dess ROCm-blogg. Den nivån av öppenhet – träningssteg för träningssteg, inte bara en sista kontrollpunkt – är det som skiljer en "helt öppen" frisättning från en typisk öppen vikt.

Varför detta är viktigt bortom riktmärkena

Undertexten till releasen är hårdvarutävling. Nvidias CUDA-ekosystem och H100-klass GPU:er har varit standardsubstratet för gränsmodellträning, och utmanare har ägnat flera år åt att försöka bevisa att deras acceleratorer kan hantera hela träningsstacken. Instella-MoE är en trovärdig artefakt som AMD:s Instinct-linje – redan implementerad i stor skala av hyperskalare och nationella labb – kan göra mer än att sluta sig till arbetsbelastningar. Om AMD kan fortsätta att producera konkurrenskraftiga öppna modeller tränade på sin egen hårdvara, stärker det fallet för köpare som vill bryta Nvidias grepp om AI-datormarknaden.

För forskare är överklagandet transparensen. Helt öppna utgåvor som dokumenterar datamixen, blandningen i mitten av utbildningen, destillationsstrategin och RL-läroplanen är fortfarande sällsynta, och de låter samhället granska och reproducera påståenden snarare än att ta labbets ord för det. Instella-MoE ansluter sig till en liten men växande lista – inklusive AMD:s egna tidigare Instella-täta modeller – som driver den standarden framåt.

Ligg före AI

Vill du ha den här typen av djupgående teknisk täckning när det händer? Bokmärk vårt nav för senaste AI-utvecklingen och missa aldrig en release.

Läs mer AI-nyheter →