Невелика, але широка комбінація експертів
Згідно з детальною розбивкою в MarkTechPost, Instella-MoE-16B-A3B — це модель MoE лише з декодером із загалом 16 мільярдів параметрів, яка активує лише 2,8 мільярда на токен. Кожен із 27 рівнів використовує 2 спільних експертів плюс 6 маршрутизованих експертів, вибраних із пулу з 64, із прихованим розміром 2048, 16 заголовками уваги та словниковим запасом із 128 896 токенів. Ціль Multi-Token Prediction використовується як під час попереднього, так і в середині навчання.
Ця розріджена архітектура — де крихітний шматочок мережі «прокидається» для кожного токена — є тією ж логікою ефективності, що стоїть за дешевими відкритими моделями, які змінили ринок за останній рік. AMD навчила модель на 7,1 трильйонах токенів, взятих із відкритих корпусів, включаючи Nemotron-CC-v2, MegaMath, FineMath, RefineCode і TxT360, а потім запустила проміжний етап навчання на Dolma3 Dolmino 100B для трьох варіантів даних, які були об’єднані шляхом усереднення ваги. Етап довгого контексту розширює вікно від 4K до 64K токенів за допомогою YaRN.
Дві інновації на системному рівні
У випуску є два структурних варіанти, які AMD виділяє як важливі інженерні переваги. Перший — це Gated Multi-head Latent Attention (Gated MLA), який додає полегшений вихідний шлюз до Multi-head Latent Attention. Спеціальна лінійна проекція виводить обумовлений вхідний вентиль, який застосовується мультиплікативно перед вихідною проекцією.
Другий, FarSkip-Collective, — це схема зв’язку, яка передає застарілі та часткові активації на рівні MoE та увагу, перекриваючи паралельне спілкування експерта з обчисленнями. AMD повідомляє про прискорення попереднього навчання на 12,7% і до зменшення часу до першого токена на 39,2% при обслуговуванні з експертним паралелізмом. Для компанії, яка орієнтує своє обладнання на співвідношення ціна-якість, це саме ті цифри, які хоче бачити покупець.
Сильні тести для повністю відкритої моделі
За базовою контрольною точкою середня оцінка Instella-MoE становить 76,7, що AMD називає найсильнішим результатом серед повністю відкритих моделей. Це випереджає Moonlight-16B-A3B (76,2), SmolLM3-3B-Base (70,5), OLMo-3-7B (70,1) і OLMoE-1B-7B (61,9), хоча він все ще поступається Qwen3.5-4B-Base (79,5). Він лідирує на WinoGrande з результатом 86,5 і має 65,7 на HumanEval+. Для довгоконтекстних завдань це в середньому 41,5 на HELMET і 79,4 на RULER.
Посттренінг ще більше загострює модель. Середні показники зросли з 71,58 після контрольованого тонкого налаштування до 72,67 після DPO та 73,22 у конфігурації «Think», перевершивши Olmo3-7B-Think (71,97), Gemma-4-E4B Think (70,47) і Qwen3,5-4B (69,73). Після виконання інструкцій IFEval підвищується з 77,08 до 83,70.
Рецепт після тренування сам по собі примітний. Після SFT на сумішах Dolci-Think-SFT-7B і Nemotron AMD запускає DPO з оновленнями зміщення маршрутизатора та вимкненням допоміжних втрат балансування навантаження, щоб уникнути погіршення. Потім навчання з підкріпленням відбувається в рамках Miles від AMD: 1400 кроків RLVR із дотриманням інструкцій, а потім Дистилляція за правилами для кількох викладачів, яка повертає виграш без шкоди для математики чи продуктивності коду.
Заковика ліцензування
Є застереження, яке має значення для комерційних користувачів. Ваги моделі постачаються згідно з ліцензією ResearchRAIL, яка обмежує використання лише в академічних і дослідницьких цілях, тому Instella-MoE не є моделлю, що встановлюється для виробництва. Навчальна кодова база, однак, має ліцензію MIT, і це, мабуть, актив, який можна використовувати багаторазово — він дає іншим лабораторіям конкретний план навчання на кремнієвому процесорі AMD.
AMD опублікувала повні ваги з кожного етапу навчання, суміші даних, конфігурації навчання та код висновку в колекції Hugging Face, репозиторії GitHub і своєму блозі ROCm. Цей рівень відкритості — тренування етап за етапом тренування, а не лише остаточний контрольний пункт — ось що відрізняє «повністю відкритий» випуск від типового випуску з відкритою вагою.
Чому це має значення за межами контрольних показників
Підтекст релізу – апаратна конкуренція. Екосистема CUDA від Nvidia та графічні процесори класу H100 були основою за замовчуванням для навчання на передовій моделі, і суперники витратили роки, намагаючись довести, що їхні прискорювачі можуть впоратися з усім пакетом навчання. Instella-MoE є надійним артефактом, що лінія Instinct від AMD, яка вже розгорнута в масштабах гіперскейлерами та національними лабораторіями, може зробити більше, ніж просто обґрунтувати навантаження. Якщо AMD зможе продовжувати виробляти конкурентоспроможні відкриті моделі, навчені на її власному апаратному забезпеченні, це посилить аргументи для покупців, які прагнуть позбутися контролю Nvidia на ринку обчислень штучного інтелекту.
Для дослідників привабливість – це прозорість. Повністю відкриті випуски, в яких документується змішування даних, змішування в середині навчання, стратегія дистиляції та навчальна програма RL, залишаються рідкістю, і вони дозволяють спільноті перевіряти та відтворювати претензії, а не вірити на слово лабораторії. Instella-MoE приєднується до невеликого, але зростаючого реєстру, включно з попередніми щільними моделями Instella від AMD, які просувають цей стандарт вперед.
Будьте попереду ШІ
Хочете такого глибокого технічного покриття, як це відбувається? Додайте в закладки наш центр для останніх розробок штучного інтелекту і ніколи не пропускайте випуск.
Читати більше новин AI →

