AMD vydala Instella-MoE-16B-A3B, plně otevřený jazykový model Mixture-of-Experts (MoE) trénovaný od nuly na vlastních Instinct MI300X a MI325X GPU. Vydání je prohlášením o křemíku stejně jako o softwaru: zveřejněním každé školicí fáze, datové směsi a konfigurace AMD demonstruje, že její akcelerátory datových center dokážou vytvářet otevřené modely hraniční třídy od začátku do konce – území, kterému Nvidia dlouho dominuje. Je to jeden z nejvýraznějších kroků v závodě s otevřenou váhou, který sledujeme v našich převratných zprávách o AI.

Malá, ale široká směs expertů

Podle podrobného rozpisu v MarkTechPost je Instella-MoE-16B-A3B model MoE pouze s dekodérem s 16 miliardami celkových parametrů, které aktivují pouze 2,8 miliardy na token. Každá z jeho 27 vrstev využívá 2 sdílené odborníky plus 6 směrovaných expertů vybraných ze skupiny 64, se skrytou velikostí 2048, 16 hlavičkami pozornosti a slovní zásobou 128 896 tokenů. Objekt Předpověď více žetonů se používá jak během předtréninku, tak během tréninku.

Tato řídká architektura – kde se pro každý token „probudí“ malý kousek sítě – je stejnou logikou efektivity, za kterou stojí levné otevřené modely, které za poslední rok přetvořily trh. AMD trénovalo model na 7,1 bilionu tokenů získaných z otevřených korpusů včetně Nemotron-CC-v2, MegaMath, FineMath, RefineCode a TxT360, poté provedlo střední fázi tréninku na Dolma3 Dolmino 100B ve třech variantách dat, které byly sloučeny průměrováním hmotnosti. Fáze dlouhého kontextu roztáhne okno ze 4K na 64K tokenů pomocí YaRN.

Dvě inovace na systémové úrovni

Vydání přináší dvě strukturální volby, které AMD vyzdvihuje jako smysluplné technické výhry. První je Gated Multi-head Latent Attention (Gated MLA), která přidává k Multi-head Latent Attention lehkou naučenou výstupní bránu. Vyhrazená lineární projekce odvozuje vstupně podmíněné hradlo, které se aplikuje multiplikativně před výstupní projekcí.

Druhý, FarSkip-Collective, je schéma konektivity, které předává zastaralé a částečné aktivace do vrstvy MŽP a pozornosti a překrývá paralelní komunikaci mezi experty a výpočty. AMD hlásí 12,7% zrychlení před trénováním a až 39,2% zkrácení času do prvního tokenu při poskytování s expertním paralelismem. Pro společnost, která staví svůj hardware na poměr cena/výkon, jsou to přesně čísla, která kupující chce vidět.

Silné benchmarky pro plně otevřený model

V základním kontrolním bodě má Instella-MoE průměr 76,7 napříč hodnoceními, což AMD označuje za nejsilnější výsledek mezi plně otevřenými modely. To jej staví před Moonlight-16B-A3B (76,2), SmolLM3-3B-Base (70,5), OLMo-3-7B (70,1) a OLMoE-1B-7B (61,9), i když stále zaostává za Qwen3,5-4B-Base (79,5). Vede na WinoGrande se skóre 86,5 a 65,7 na HumanEval+. U úloh s dlouhým kontextem je to v průměru 41,5 na HELMĚ a 79,4 na PRAVIDLE.

Po tréninku se model dále vyostřuje. Průměrné skóre se vyšplhalo z 71,58 po jemném doladění pod dohledem na 72,67 po DPO a 73,22 v konfiguraci „Think“, čímž porazilo Olmo3-7B-Think (71,97), Gemma-4-E4B Think (70,47) a Qwen3,5-4B (69,73). Na základě pokynů vzroste IFEval ze 77,08 na 83,70.

Potréninkový recept je sám o sobě pozoruhodný. Po SFT na směsích Dolci-Think-SFT-7B a Nemotron AMD spustí DPO s aktualizacemi zkreslení routeru a deaktivovanou ztrátou vyrovnávání zátěže, aby se zabránilo degradaci. Posílení učení pak pokračuje v rámci Miles od AMD: 1 400 kroků instrukcí po RLVR, po nichž následuje Multi-Teacher On-Policy Destilation, která přeloží zisk zpět, aniž by obětovala matematický nebo kódový výkon.

Licenční úlovek

Pro komerční uživatele je důležité upozornění. Modelové závaží jsou dodávány pod licencí ResearchRAIL, která omezuje použití pouze na akademické a výzkumné účely, takže Instella-MoE není zásuvný model pro produkční nasazení. Tréninková kódová základna je však licencována MIT, a to je pravděpodobně tím více znovupoužitelným aktivem – poskytuje ostatním laboratořím konkrétní plán pro školení na křemíku AMD.

AMD zveřejnilo plné váhy z každé tréninkové fáze, datové směsi, tréninkové konfigurace a odvozený kód napříč sbírkou Hugging Face, repozitářem GitHub a jejím ROCm blogem. Tato úroveň otevřenosti – trénink po jednotlivých fázích tréninku, nejen poslední kontrolní bod – je to, co odlišuje „plně otevřené“ uvolnění od typického uvolnění s otevřenou váhou.

Proč na tom nezáleží

Podtextem vydání je hardwarová konkurence. Ekosystém CUDA společnosti Nvidia a GPU třídy H100 byly výchozím substrátem pro trénink hraničních modelů a vyzyvatelé se roky snažili dokázat, že jejich akcelerátory zvládnou celý tréninkový balík. Instella-MoE je věrohodný artefakt, že řada Instinct od AMD – již ve velkém měřítku nasazena hyperscalery a národními laboratořemi – dokáže více než jen odvodit zátěž. Pokud AMD dokáže i nadále vyrábět konkurenceschopné otevřené modely trénované na vlastním hardwaru, posiluje to argumenty pro kupující, kteří chtějí prolomit sevření Nvidie na výpočetním trhu AI.

Pro výzkumníky je přitažlivost transparentnost. Plně otevřené verze, které dokumentují datový mix, směs středního tréninku, strategii destilace a kurikulum RL, zůstávají vzácné a umožňují komunitě auditovat a reprodukovat tvrzení, než aby se za to stavěli v laboratoři. Instella-MoE se připojuje k malému, ale rostoucímu seznamu – včetně vlastních dřívějších modelů Instella hustých od AMD – a posouvá tento standard vpřed.

Udržujte si náskok před umělou inteligencí

Chcete tento druh hlubokého technického pokrytí, jak se to stane? Uložte si naše centrum do záložek pro nejnovější vývoj AI a nikdy nezmeškejte žádné vydání.

Přečtěte si další zprávy o AI →