AMD a lansat Instella-MoE-16B-A3B, un model de limbaj Mixture-of-Experts (MoE) complet deschis, antrenat de la zero pe propriile GPU-uri Instinct MI300X și MI325X. Lansarea este la fel de mult o declarație despre siliciu, cât și despre software: publicând fiecare etapă de antrenament, amestec de date și configurație, AMD demonstrează că acceleratoarele sale de centre de date pot construi modele deschise de clasă de frontieră cap la cap - teritoriu pe care Nvidia l-a dominat de mult. Este una dintre mișcările mai punctuale din cursa cu greutate deschisă pe care o urmărim în știrile noastre de ultimă oră.

Un design mic, dar lat, cu un amestec de experți

Conform unei defalcări detaliate din MarkTechPost, Instella-MoE-16B-A3B este un model MoE numai pentru decodor, cu 16 miliarde de parametri totali, care activează doar 2,8 miliarde pe token. Fiecare dintre cele 27 de straturi ale sale folosește 2 experți partajați plus 6 experți direcționați selectați dintr-un grup de 64, cu o dimensiune ascunsă de 2048, 16 capete de atenție și un vocabular de 128.896 de jetoane. Un obiectiv Multi-Token Prediction este utilizat atât în ​​timpul antrenamentului prealabil, cât și la mijlocul antrenamentului.

Acea arhitectură rară – în care o mică parte a rețelei „se trezește” pentru fiecare token – este aceeași logică de eficiență din spatele modelelor deschise ieftine de rulat care au remodelat piața în ultimul an. AMD a antrenat modelul pe 7,1 trilioane de jetoane extrase din corpuri deschise, inclusiv Nemotron-CC-v2, MegaMath, FineMath, RefineCode și TxT360, apoi a efectuat o etapă de antrenament la mijloc pe Dolma3 Dolmino 100B în trei variante de date care au fost îmbinate prin medierea greutății. O etapă de context lung întinde fereastra de la 4K la 64K tokens folosind YaRN.

Două inovații la nivel de sistem

Lansarea include două opțiuni structurale pe care AMD le evidențiază drept victorii semnificative în inginerie. Primul este Gated Multi-head Latent Attention (Gated MLA), care adaugă o poartă ușoară de ieșire învățată la Multi-head Latent Attention. O proiecție liniară dedicată derivă o poartă condiționată de intrare care este aplicată multiplicativ înainte de proiecția de ieșire.

Al doilea, FarSkip-Collective, este o schemă de conectivitate care trece activări învechite și parțiale în straturile MoE și atenție, suprapunând comunicarea paralelă expert cu calcul. AMD raportează o accelerare înainte de antrenament de 12,7% și o reducere de până la 39,2% a timpului până la primul simbol** atunci când servește cu paralelism expert. Pentru o companie care își propune hardware-ul în funcție de preț-performanță, acestea sunt exact cifrele pe care un cumpărător vrea să le vadă.

Puncte de referință puternice pentru un model complet deschis

La punctul de control de bază, Instella-MoE are o medie de 76,7 în cadrul evaluărilor, ceea ce AMD îl numește cel mai puternic rezultat dintre modelele complet deschise. Asta îl pune înaintea Moonlight-16B-A3B (76,2), SmolLM3-3B-Base (70,5), OLMo-3-7B (70,1) și OLMoE-1B-7B (61,9), deși încă urmează Qwen3.5-4B-Base (79,5). Conduce pe WinoGrande cu un scor de 86,5 și postează 65,7 pe HumanEval+. Pentru sarcinile cu context lung, are o medie de 41,5 pe CASĂ și 79,4 pe RULER.

Post-antrenamentul mărește și mai mult modelul. Scorurile medii urcă de la 71,58 după reglarea fină supravegheată la 72,67 după DPO și 73,22 în configurația „Think”, învingând Olmo3-7B-Think (71,97), Gemma-4-E4B Think (70,47) și Qwen3,5-4B (69,73). În urma instrucțiunilor, IFEval crește de la 77,08 la 83,70.

Rețeta post-antrenament este ea însăși notabilă. După SFT pe amestecurile Dolci-Think-SFT-7B și Nemotron, AMD rulează DPO cu actualizări de polarizare a routerului și pierderea de echilibrare a sarcinii auxiliare dezactivată pentru a evita degradarea. Învățarea prin consolidare continuă apoi în cadrul cadru Miles de la AMD: 1.400 de pași de RLVR în urma instrucțiunilor, urmate de Distilarea la politică cu mai mulți profesori care retrage câștigul fără a sacrifica performanța la matematică sau cod.

Captura de licențiere

Există o avertizare care contează pentru utilizatorii comerciali. Greutățile modelului sunt livrate sub o licență ResearchRAIL, care restricționează utilizarea numai în scopuri academice și de cercetare, astfel încât Instella-MoE nu este un model drop-in pentru implementări de producție. Baza de cod de antrenament, totuși, este licențiată MIT și, fără îndoială, acesta este activul mai reutilizabil - oferă altor laboratoare un model concret pentru formarea pe siliciu AMD.

AMD a publicat ponderile complete din fiecare etapă de antrenament, amestecurile de date, configurațiile de antrenament și codul de inferență într-o colecție Hugging Face, un depozit GitHub și blogul său ROCm. Acel nivel de deschidere – antrenament-etapă cu antrenament, nu doar un punct de control final – este ceea ce distinge o lansare „complet deschisă” de una tipică deschisă.

De ce contează acest lucru dincolo de punctele de referință

Subtextul lansării este competiția hardware. Ecosistemul CUDA de la Nvidia și GPU-urile de clasa H100 au fost substratul implicit pentru antrenamentul modelelor de frontieră, iar competitorii au petrecut ani de zile încercând să demonstreze că acceleratoarele lor pot face față întregului pachet de antrenament. Instella-MoE este un artefact credibil conform căruia linia AMD Instinct - deja implementată la scară de către hyperscalers și laboratoarele naționale - poate face mai mult decât sarcini de lucru de inferență. Dacă AMD poate continua să producă modele competitive deschise antrenate pe propriul hardware, aceasta întărește cazul pentru cumpărătorii care doresc să rupă stăpânirea Nvidia pe piața de calcul AI.

Pentru cercetători, atracția este transparența. Versiunile complet deschise care documentează mixul de date, amestecul de formare intermediară, strategia de distilare și curriculum-ul RL rămân rare și permit comunității să auditeze și să reproducă afirmațiile, mai degrabă decât să ia cuvântul unui laborator. Instella-MoE se alătură unei liste mici, dar în creștere – inclusiv modelele dense Instella anterioare ale AMD – împingând acest standard înainte.

Rămâi înaintea AI

Doriți acest tip de acoperire tehnică profundă așa cum se întâmplă? Marcați hub-ul nostru pentru cele mai recente evoluții AI și nu pierdeți niciodată o lansare.

Citiți mai multe știri AI →