Mały, ale szeroki projekt złożony z mieszanki ekspertów
Według szczegółowego zestawienia w MarkTechPost, Instella-MoE-16B-A3B to model MoE przeznaczony wyłącznie do dekodera z 16 miliardami całkowitych parametrów, które aktywują tylko 2,8 miliarda na token. Każda z 27 warstw korzysta z 2 współdzielonych ekspertów i 6 przekierowanych ekspertów wybranych z puli 64, z ukrytym rozmiarem 2048, 16 głowami uwagi i słownictwem zawierającym 128 896 tokenów. Cel Przewidywanie wielu tokenów jest używany zarówno przed treningiem, jak i w jego trakcie.
Ta rzadka architektura — w której niewielki wycinek sieci „budzi się” dla każdego tokena — wynika z tej samej logiki wydajności, która kryje się za tanimi w eksploatacji modelami otwartymi, które zmieniły rynek w ciągu ostatniego roku. Firma AMD przeszkoliła model na 7,1 biliona tokenów pobranych z otwartych korpusów, w tym Nemotron-CC-v2, MegaMath, FineMath, RefineCode i TxT360, a następnie przeprowadziła etap środkowego szkolenia na Dolma3 Dolmino 100B w trzech wariantach danych, które zostały połączone przez uśrednienie wagi. Etap o długim kontekście rozciąga okno z 4 tys. do 64 tys. tokenów przy użyciu YaRN.
Dwie innowacje na poziomie systemu
W tej wersji dostępne są dwie opcje konstrukcyjne, które AMD podkreśla jako znaczące zwycięstwa inżynieryjne. Pierwszą z nich jest Gated Multi-head Latent Attention (Gated MLA), która dodaje lekką wyuczoną bramkę wyjściową do Multi-head Latent Attention. Dedykowana projekcja liniowa wyprowadza bramkę z uwarunkowaniem wejściowym, która jest stosowana multiplikatywnie przed projekcją wyjściową.
Drugi, FarSkip-Collective, to schemat łączności, który przekazuje przestarzałe i częściowe aktywacje do warstw MoE i uwagi, nakładając komunikację równoległą ekspercką z obliczeniami. AMD zgłasza 12,7% przyspieszenia przed treningiem i aż do 39,2% skrócenia czasu do pierwszego tokena w przypadku obsługi z profesjonalną równoległością. W przypadku firmy, która stawia swój sprzęt na stosunek ceny do wydajności, są to dokładnie liczby, które kupujący chce zobaczyć.
Silne punkty odniesienia dla w pełni otwartego modelu
W podstawowym punkcie kontrolnym Instella-MoE osiąga średnio 76,7 we wszystkich ocenach, co AMD nazywa najlepszym wynikiem wśród w pełni otwartych modeli. To stawia go przed Moonlight-16B-A3B (76,2), SmolLM3-3B-Base (70,5), OLMo-3-7B (70,1) i OLMoE-1B-7B (61,9), choć nadal wyprzedza Qwen3.5-4B-Base (79,5). Prowadzi na WinoGrande z notą 86,5 i notuje 65,7 na HumanEval+. W przypadku zadań o długim kontekście średnio 41,5 w przypadku HELMET i 79,4 w przypadku RULER.
Po treningu następuje dalsze wyostrzenie modelu. Średnie wyniki wzrosły z 71,58 po nadzorowanym dostrajaniu do 72,67 po DPO i 73,22 w konfiguracji „Think”, pokonując Olmo3-7B-Think (71,97), Gemma-4-E4B Think (70,47) i Qwen3.5-4B (69,73). Zgodnie z instrukcją IFEval wzrasta z 77,08 do 83,70.
Godny uwagi jest sam przepis potreningowy. Po SFT na mieszankach Dolci-Think-SFT-7B i Nemotron, AMD uruchamia DPO z aktualizacjami stronniczości routera i wyłączoną utratą równoważenia obciążenia pomocniczego, aby uniknąć degradacji. Uczenie się przez wzmacnianie odbywa się następnie w ramie Milesa firmy AMD: 1400 kroków RLVR zgodnego z instrukcjami, po których następuje destylacja na podstawie zasad dla wielu nauczycieli, która ponownie składa wzmocnienie bez poświęcania wydajności matematycznej lub kodu.
Haczyk związany z licencją
Istnieje zastrzeżenie, które ma znaczenie dla użytkowników komercyjnych. Modele są dostarczane na podstawie licencji ResearchRAIL, która ogranicza wykorzystanie wyłącznie do celów akademickich i badawczych, zatem Instella-MoE nie jest modelem typu drop-in do wdrożeń produkcyjnych. Baza kodu szkoleniowego jest jednak licencjonowana przez MIT i jest to prawdopodobnie zasób, który można ponownie wykorzystać — daje innym laboratoriom konkretny plan szkoleń na krzemie AMD.
Firma AMD opublikowała pełne wagi z każdego etapu treningu, mieszaniny danych, konfiguracje treningowe i kod wnioskowania w kolekcji Hugging Face, repozytorium GitHub i na swoim blogu ROCm. Ten poziom otwartości – etap szkolenia, a nie tylko końcowy punkt kontrolny – jest tym, co odróżnia „w pełni otwarte” wydawnictwo od typowego treningu z ciężarem otwartym.
Dlaczego to ma znaczenie poza wzorcami
Podtekstem wydania jest konkurencja sprzętowa. Ekosystem CUDA firmy Nvidia i procesory graficzne klasy H100 stały się domyślnym podłożem do szkolenia pionierskich modeli, a pretendenci spędzili lata próbując udowodnić, że ich akceleratory poradzą sobie z pełnym stosem szkoleniowym. Instella-MoE to wiarygodny dowód na to, że linia AMD Instinct — wdrożona już na dużą skalę przez hiperskalowarki i laboratoria krajowe — może zrobić więcej niż tylko wnioskowanie. Jeśli AMD będzie w stanie w dalszym ciągu produkować konkurencyjne, otwarte modele wytrenowane na własnym sprzęcie, wzmocni to argumenty dla kupujących, którzy chcą przełamać kontrolę Nvidii na rynku obliczeń AI.
Dla badaczy atrakcyjnością jest przejrzystość. W pełni otwarte wersje dokumentujące miks danych, mieszankę w połowie szkolenia, strategię destylacji i program nauczania RL są nadal rzadkie i pozwalają społeczności na audyt i reprodukcję twierdzeń, zamiast wierzyć na słowo laboratorium. Instella-MoE dołącza do małej, ale rosnącej listy — obejmującej wcześniejsze, gęste modele AMD Instella — popychając ten standard do przodu.
Wyprzedź sztuczną inteligencję
Chcesz tego rodzaju głębokiego przeglądu technicznego na bieżąco? Dodaj do zakładek nasze centrum z najnowszymi osiągnięciami AI i nigdy nie przegap żadnej wersji.
Przeczytaj więcej aktualności o sztucznej inteligencji →

