Um design pequeno, mas amplo, com mistura de especialistas
De acordo com uma análise detalhada no MarkTechPost, Instella-MoE-16B-A3B é um modelo MoE somente decodificador com 16 bilhões de parâmetros totais que ativam apenas 2,8 bilhões por token. Cada uma de suas 27 camadas usa 2 especialistas compartilhados mais 6 especialistas roteados selecionados de um conjunto de 64, com um tamanho oculto de 2.048, 16 cabeças de atenção e um vocabulário de 128.896 tokens. Um objetivo de Predição de vários tokens é usado durante o pré-treinamento e no meio do treinamento.
Essa arquitetura esparsa – onde uma pequena fatia da rede “acorda” para cada token – é a mesma lógica de eficiência por trás dos modelos abertos baratos de operar que remodelaram o mercado no ano passado. A AMD treinou o modelo em 7,1 trilhões de tokens extraídos de corpora abertos, incluindo Nemotron-CC-v2, MegaMath, FineMath, RefineCode e TxT360, e depois executou um estágio intermediário de treinamento no Dolma3 Dolmino 100B em três variantes de dados que foram mescladas pela média de peso. Um estágio de contexto longo amplia a janela de 4K para 64K tokens usando YaRN.
Duas inovações em nível de sistema
O lançamento traz duas opções estruturais que a AMD destaca como vitórias significativas em engenharia. O primeiro é Gated Multi-head Latent Attention (Gated MLA), que adiciona uma porta de saída aprendida leve à Multi-head Latent Attention. Uma projeção linear dedicada deriva uma porta condicionada de entrada que é aplicada multiplicativamente antes da projeção de saída.
O segundo, FarSkip-Collective, é um esquema de conectividade que transfere ativações desatualizadas e parciais para o MoE e as camadas de atenção, sobrepondo a comunicação paralela entre especialistas e a computação. A AMD relata uma aceleração de pré-treinamento de 12,7% e uma redução de até 39,2% no tempo para o primeiro token ao servir com paralelismo especializado. Para uma empresa que aposta seu hardware em relação preço-desempenho, esses são exatamente os números que um comprador deseja ver.
Benchmarks fortes para um modelo totalmente aberto
No ponto de verificação básico, a média do Instella-MoE é de 76,7 em todas as avaliações, o que a AMD chama de o resultado mais forte entre os modelos totalmente abertos. Isso o coloca à frente de Moonlight-16B-A3B (76,2), SmolLM3-3B-Base (70,5), OLMo-3-7B (70,1) e OLMoE-1B-7B (61,9), embora ainda esteja atrás de Qwen3.5-4B-Base (79,5). Ele lidera no WinoGrande com pontuação de 86,5 e registra 65,7 no HumanEval +. Para tarefas de contexto longo, a média é de 41,5 no CAPACETE e 79,4 na RÉGUA.
O pós-treinamento aprimora ainda mais o modelo. As pontuações médias sobem de 71,58 após o ajuste fino supervisionado para 72,67 após DPO e 73,22 na configuração "Think", superando Olmo3-7B-Think (71,97), Gemma-4-E4B Think (70,47) e Qwen3,5-4B (69,73). No seguimento de instruções, o IFEval sobe de 77,08 para 83,70.
A receita pós-treino é notável. Após o SFT nas misturas Dolci-Think-SFT-7B e Nemotron, a AMD executa o DPO com atualizações de polarização do roteador e a perda de balanceamento de carga auxiliar desativada para evitar degradação. O aprendizado por reforço prossegue dentro da estrutura Miles da AMD: 1.400 etapas de RLVR seguindo instruções, seguido por Destilação sob política multiprofessor que dobra o ganho de volta sem sacrificar a matemática ou o desempenho do código.
O problema do licenciamento
Há uma ressalva que é importante para usuários comerciais. Os pesos do modelo são fornecidos sob uma licença ResearchRAIL, que restringe o uso apenas para fins acadêmicos e de pesquisa, portanto, o Instella-MoE não é um modelo imediato para implantações de produção. A base de código de treinamento, no entanto, é licenciada pelo MIT, e esse é sem dúvida o ativo mais reutilizável — fornece a outros laboratórios um plano concreto para treinamento em silício AMD.
A AMD publicou os pesos completos de cada estágio de treinamento, as misturas de dados, as configurações de treinamento e o código de inferência em uma coleção Hugging Face, um repositório GitHub e seu blog ROCm. Esse nível de abertura – estágio por estágio de treinamento, não apenas um ponto de verificação final – é o que distingue um lançamento “totalmente aberto” de um lançamento típico de peso aberto.
Por que isso é importante além dos benchmarks
O subtexto do lançamento é a competição de hardware. O ecossistema CUDA da Nvidia e as GPUs da classe H100 têm sido o substrato padrão para o treinamento de modelos de fronteira, e os desafiantes passaram anos tentando provar que seus aceleradores podem lidar com toda a pilha de treinamento. Instella-MoE é um artefato confiável que a linha Instinct da AMD – já implantada em escala por hiperscaladores e laboratórios nacionais – pode fazer mais do que inferir cargas de trabalho. Se a AMD conseguir continuar produzindo modelos abertos competitivos treinados em seu próprio hardware, isso fortalecerá o argumento para os compradores que buscam quebrar o controle da Nvidia no mercado de computação de IA.
Para os pesquisadores, o apelo é a transparência. Lançamentos totalmente abertos que documentam o mix de dados, a mistura de treinamento intermediário, a estratégia de destilação e o currículo de RL permanecem raros e permitem que a comunidade audite e reproduza afirmações em vez de acreditar na palavra do laboratório. Instella-MoE se junta a uma lista pequena, mas crescente – incluindo os modelos densos Instella anteriores da própria AMD – impulsionando esse padrão.
Fique à frente da IA
Quer esse tipo de cobertura técnica profunda no momento em que acontece? Marque nosso hub para os últimos desenvolvimentos de IA e nunca perca um lançamento.
Leia mais notícias sobre IA →

