Un design piccolo ma ampio con un mix di esperti
Secondo un'analisi dettagliata pubblicata su MarkTechPost, Instella-MoE-16B-A3B è un modello MoE solo decoder con 16 miliardi di parametri totali che ne attivano solo 2,8 miliardi per token. Ciascuno dei suoi 27 livelli utilizza 2 esperti condivisi più 6 esperti instradati selezionati da un pool di 64, con una dimensione nascosta di 2048, 16 teste di attenzione e un vocabolario di 128.896 token. Un obiettivo di Previsione multi-token viene utilizzato sia durante il pre-allenamento che durante l'allenamento.
Quell’architettura sparsa – in cui una piccola fetta della rete “si risveglia” per ogni token – è la stessa logica di efficienza alla base dei modelli aperti a basso costo che hanno rimodellato il mercato nell’ultimo anno. AMD ha addestrato il modello su 7,1 trilioni di token estratti da corpora aperti tra cui Nemotron-CC-v2, MegaMath, FineMath, RefineCode e TxT360, quindi ha eseguito una fase di addestramento intermedia su Dolma3 Dolmino 100B su tre varianti di dati che sono state unite in base alla media del peso. Una fase di contesto lungo estende la finestra da 4K a 64K token utilizzando YaRN.
Due innovazioni a livello di sistema
La versione prevede due scelte strutturali che AMD evidenzia come significative vittorie ingegneristiche. Il primo è Gated Multi-head Latent Attention (Gated MLA), che aggiunge un leggero gate di output appreso all'attenzione latente multi-head. Una proiezione lineare dedicata deriva un gate condizionato dall'input che viene applicato moltiplicativamente prima della proiezione dell'output.
Il secondo, FarSkip-Collective, è uno schema di connettività che trasferisce attivazioni obsolete e parziali ai livelli MoE e di attenzione, sovrapponendo la comunicazione parallela esperto con il calcolo. AMD segnala un aumento di velocità pre-addestramento del 12,7% e una riduzione fino al 39,2% del tempo per il primo token quando si serve con parallelismo esperto. Per un'azienda che punta il proprio hardware sul rapporto prezzo-prestazioni, questi sono esattamente i numeri che un acquirente vuole vedere.
Solidi benchmark per un modello completamente aperto
Sul checkpoint di base, Instella-MoE ha una media di 76,7 in tutte le valutazioni, che AMD definisce il risultato più forte tra i modelli completamente aperti. Ciò lo pone davanti a Moonlight-16B-A3B (76,2), SmolLM3-3B-Base (70,5), OLMo-3-7B (70,1) e OLMoE-1B-7B (61,9), sebbene sia ancora dietro a Qwen3.5-4B-Base (79,5). È in testa su WinoGrande con un punteggio di 86,5 e pubblica 65,7 su HumanEval+. Per compiti a lungo contesto, la media è 41,5 su CASCO e 79,4 su RIGHELLO.
Il post-addestramento affina ulteriormente il modello. I punteggi medi salgono da 71,58 dopo la messa a punto supervisionata a 72,67 dopo DPO e 73,22 nella configurazione "Think", battendo Olmo3-7B-Think (71,97), Gemma-4-E4B Think (70,47) e Qwen3.5-4B (69,73). Seguendo le istruzioni, IFEval aumenta da 77,08 a 83,70.
La ricetta post-allenamento è di per sé notevole. Dopo l'SFT sulle miscele Dolci-Think-SFT-7B e Nemotron, AMD esegue il DPO con aggiornamenti del bias del router e la perdita di bilanciamento del carico ausiliario disabilitata per evitare il degrado. L'apprendimento per rinforzo procede quindi all'interno del framework Miles di AMD: 1.400 passaggi di RLVR che seguono le istruzioni, seguiti da Distillazione su policy multi-insegnante che ripristina il guadagno senza sacrificare le prestazioni matematiche o di codice.
La cattura della licenza
C'è un avvertimento che è importante per gli utenti commerciali. I pesi del modello vengono spediti con una licenza ResearchRAIL, che ne limita l'uso ai soli scopi accademici e di ricerca, quindi Instella-MoE non è un modello drop-in per le distribuzioni di produzione. Il codice di addestramento, tuttavia, è concesso in licenza dal MIT, e questa è probabilmente la risorsa più riutilizzabile: fornisce ad altri laboratori un modello concreto per l'addestramento sul silicio AMD.
AMD ha pubblicato i pesi completi di ogni fase di training, le combinazioni di dati, le configurazioni di training e il codice di inferenza attraverso una raccolta Hugging Face, un repository GitHub e il suo blog ROCm. Questo livello di apertura - fase di allenamento per fase, non solo un punto di controllo finale - è ciò che distingue un rilascio "completamente aperto" da un tipico rilascio a peso aperto.
Perché questo è importante oltre i benchmark
Il sottotesto del comunicato è la competizione hardware. L'ecosistema CUDA di Nvidia e le GPU di classe H100 sono stati il substrato predefinito per l'addestramento dei modelli di frontiera e gli sfidanti hanno trascorso anni cercando di dimostrare che i loro acceleratori sono in grado di gestire l'intero stack di addestramento. Instella-MoE dimostra in modo credibile che la linea Instinct di AMD, già implementata su larga scala da hyperscaler e laboratori nazionali, può fare di più che semplici carichi di lavoro di inferenza. Se AMD riuscisse a continuare a produrre modelli aperti competitivi basati sul proprio hardware, ciò rafforzerebbe le ragioni per gli acquirenti che cercano di spezzare la presa di Nvidia sul mercato dei computer basati sull'intelligenza artificiale.
Per i ricercatori l’attrattiva è la trasparenza. I rilasci completamente aperti che documentano il mix di dati, la miscela a metà formazione, la strategia di distillazione e il curriculum RL rimangono rari e consentono alla comunità di verificare e riprodurre le affermazioni piuttosto che fidarsi della parola di un laboratorio. Instella-MoE si unisce a un elenco piccolo ma in crescita, inclusi i precedenti modelli densi Instella di AMD, spingendo avanti questo standard.
Stai al passo con l'intelligenza artificiale
Desideri questo tipo di copertura tecnica approfondita in tempo reale? Aggiungi ai segnalibri il nostro hub per gli ultimi sviluppi dell'intelligenza artificiale e non perderti mai una versione.
Leggi altre notizie sull'AI →

