AMD выпустила Instella-MoE-16B-A3B, полностью открытую языковую модель Mixture-of-Experts (MoE), обученную с нуля на собственных графических процессорах Instinct MI300X и MI325X. Этот релиз является в такой же степени заявлением о кремнии, как и о программном обеспечении: публикуя каждый этап обучения, сочетание данных и конфигурацию, AMD демонстрирует, что ее ускорители для центров обработки данных могут создавать сквозные открытые модели передового класса — территория, на которой Nvidia уже давно доминирует. Это один из наиболее ярких моментов в гонке в открытом весе, которую мы отслеживаем в наших [последних новостях искусственного интеллекта] (https://aibuzzwire.news).

Маленький, но широкий дизайн, созданный смесью экспертов

Согласно подробному описанию MarkTechPost, Instella-MoE-16B-A3B представляет собой модель MoE только для декодера с 16 миллиардами общих параметров, которая активирует только 2,8 миллиарда на токен. Каждый из 27 слоев использует 2 общих эксперта плюс 6 маршрутизируемых экспертов, выбранных из пула из 64, со скрытым размером 2048, 16 заголовками внимания и словарем из 128 896 токенов. Цель Многотокенового прогнозирования используется как во время предварительного, так и в середине обучения.

Эта разреженная архитектура, в которой крошечный кусочек сети «просыпается» для каждого токена, является той же самой логикой эффективности, лежащей в основе недорогих в эксплуатации открытых моделей, которые изменили рынок за последний год. AMD обучила модель на 7,1 триллионе токенов, взятых из открытых корпусов, включая Nemotron-CC-v2, MegaMath, FineMath, RefineCode и TxT360, а затем провела промежуточный этап обучения на Dolma3 Dolmino 100B с использованием трех вариантов данных, которые были объединены путем усреднения веса. На этапе длинного контекста окно расширяется с 4 КБ до 64 КБ с помощью YaRN.

Две инновации системного уровня

В выпуске представлены два конструктивных решения, которые AMD называет значимыми инженерными победами. Первый — Gated Multi-head Latet Attention (Gated MLA), который добавляет облегченный обучаемый выходной вентиль к Multi-head Latent Attention. Специальная линейная проекция создает вентиль с входными условиями, который мультипликативно применяется перед выходной проекцией.

Второй, FarSkip-Collective, представляет собой схему подключения, которая передает устаревшие и частичные активации на уровни MoE и внимания, перекрывая параллельное экспертное общение с вычислениями. AMD сообщает об ускорении ускорения перед обучением на 12,7% и сокращении времени получения первого токена до 39,2% при использовании экспертного параллелизма. Для компании, предлагающей свое оборудование по соотношению цена-качество, это именно те цифры, которые хочет видеть покупатель.

Надежные тесты для полностью открытой модели

По базовой контрольной точке средний показатель Instella-MoE 76,7 по всем оценкам, что AMD называет самым сильным результатом среди полностью открытых моделей. Это опережает Moonlight-16B-A3B (76,2), SmolLM3-3B-Base (70,5), OLMo-3-7B (70,1) и OLMoE-1B-7B (61,9), хотя и уступает Qwen3.5-4B-Base (79,5). Он лидирует на WinoGrande с результатом 86,5 и имеет рейтинг 65,7 на HumanEval+. Для задач с длинным контекстом он составляет в среднем 41,5 на ШЛЕМЕ и 79,4 на ЛИНЕЙКЕ.

Пост-обучение еще больше повышает точность модели. Средние баллы выросли с 71,58 после контролируемой тонкой настройки до 72,67 после DPO и 73,22 в конфигурации «Think», опередив Olmo3-7B-Think (71,97), Gemma-4-E4B Think (70,47) и Qwen3.5-4B (69,73). По следующей инструкции IFEval повышается с 77,08 до 83,70.

Рецепт после тренировки сам по себе примечателен. После SFT на смесях Dolci-Think-SFT-7B и Nemotron AMD запускает DPO с обновлениями смещения маршрутизатора и отключенными вспомогательными потерями балансировки нагрузки, чтобы избежать деградации. Затем обучение с подкреплением продолжается в рамках структуры Miles от AMD: 1400 шагов RLVR по инструкциям, за которыми следует мультипреподавательская дистилляция на основе политики, которая возвращает результат без ущерба для математических вычислений или производительности кода.

Проблема с лицензированием

Есть одно предостережение, которое важно для коммерческих пользователей. Веса модели поставляются под лицензией ResearchRAIL, которая ограничивает использование только академическими и исследовательскими целями, поэтому Instella-MoE не является моделью, доступной для промышленного развертывания. Однако учебная кодовая база имеет лицензию MIT, и это, возможно, более многоразовый ресурс — она дает другим лабораториям конкретный план обучения на процессорах AMD.

AMD опубликовала полные веса каждого этапа обучения, смеси данных, конфигурации обучения и код вывода в коллекции Hugging Face, репозитории GitHub и своем блоге ROCm. Этот уровень открытости – этап за этапом обучения, а не просто финальная контрольная точка – это то, что отличает «полностью открытый» релиз от типичного релиза с открытым весом.

Почему это важно помимо тестов

Подтекст релиза — аппаратное соревнование. Экосистема CUDA от Nvidia и графические процессоры класса H100 были основой по умолчанию для обучения передовых моделей, и претенденты потратили годы, пытаясь доказать, что их ускорители могут справиться с полным стеком обучения. Instella-MoE — это заслуживающий доверия свидетельство того, что линейка AMD Instinct, уже развернутая в масштабе гиперскейлерами и национальными лабораториями, может делать больше, чем просто рабочие нагрузки. Если AMD сможет продолжать выпускать конкурентоспособные открытые модели, обученные на собственном оборудовании, это усилит аргументы для покупателей, желающих ослабить контроль Nvidia на рынке вычислений с искусственным интеллектом.

Для исследователей привлекательностью является прозрачность. Полностью открытые выпуски, документирующие набор данных, смесь промежуточного обучения, стратегию дистилляции и учебную программу RL, остаются редкими, и они позволяют сообществу проверять и воспроизводить утверждения, а не верить лаборатории на слово. Instella-MoE присоединяется к небольшому, но растущему списку, включающему более ранние модели AMD Instella с высокой плотностью размещения, продвигая этот стандарт вперед.

Будьте впереди ИИ

Хотите такого глубокого технического освещения того, как это происходит? Добавьте в закладки наш центр последних разработок в области искусственного интеллекта и никогда не пропустите ни одной новости.

Читать больше новостей об искусственном интеллекте →