AMD lançou Instella-MoE-16B-A3B, um modelo de linguagem Mixture-of-Experts (MoE) totalmente aberto, treinado do zero em suas próprias GPUs Instinct MI300X e MI325X. O lançamento é tanto uma declaração sobre silício quanto sobre software: ao publicar cada estágio de treinamento, mistura de dados e configuração, a AMD está demonstrando que seus aceleradores de data center podem construir modelos abertos de ponta a ponta – território que a Nvidia domina há muito tempo. É um dos movimentos mais contundentes na corrida do peso aberto que acompanhamos em nossas notícias de última hora sobre IA.

Um design pequeno, mas amplo, com mistura de especialistas

De acordo com uma análise detalhada no MarkTechPost, Instella-MoE-16B-A3B é um modelo MoE somente decodificador com 16 bilhões de parâmetros totais que ativam apenas 2,8 bilhões por token. Cada uma de suas 27 camadas usa 2 especialistas compartilhados mais 6 especialistas roteados selecionados de um conjunto de 64, com um tamanho oculto de 2.048, 16 cabeças de atenção e um vocabulário de 128.896 tokens. Um objetivo de Predição de vários tokens é usado durante o pré-treinamento e no meio do treinamento.

Essa arquitetura esparsa – onde uma pequena fatia da rede “acorda” para cada token – é a mesma lógica de eficiência por trás dos modelos abertos baratos de operar que remodelaram o mercado no ano passado. A AMD treinou o modelo em 7,1 trilhões de tokens extraídos de corpora abertos, incluindo Nemotron-CC-v2, MegaMath, FineMath, RefineCode e TxT360, e depois executou um estágio intermediário de treinamento no Dolma3 Dolmino 100B em três variantes de dados que foram mescladas pela média de peso. Um estágio de contexto longo amplia a janela de 4K para 64K tokens usando YaRN.

Duas inovações em nível de sistema

O lançamento traz duas opções estruturais que a AMD destaca como vitórias significativas em engenharia. O primeiro é Gated Multi-head Latent Attention (Gated MLA), que adiciona uma porta de saída aprendida leve à Multi-head Latent Attention. Uma projeção linear dedicada deriva uma porta condicionada de entrada que é aplicada multiplicativamente antes da projeção de saída.

O segundo, FarSkip-Collective, é um esquema de conectividade que transfere ativações desatualizadas e parciais para o MoE e as camadas de atenção, sobrepondo a comunicação paralela entre especialistas e a computação. A AMD relata uma aceleração de pré-treinamento de 12,7% e uma redução de até 39,2% no tempo para o primeiro token ao servir com paralelismo especializado. Para uma empresa que aposta seu hardware em relação preço-desempenho, esses são exatamente os números que um comprador deseja ver.

Benchmarks fortes para um modelo totalmente aberto

No ponto de verificação básico, a média do Instella-MoE é de 76,7 em todas as avaliações, o que a AMD chama de o resultado mais forte entre os modelos totalmente abertos. Isso o coloca à frente de Moonlight-16B-A3B (76,2), SmolLM3-3B-Base (70,5), OLMo-3-7B (70,1) e OLMoE-1B-7B (61,9), embora ainda esteja atrás de Qwen3.5-4B-Base (79,5). Ele lidera no WinoGrande com pontuação de 86,5 e registra 65,7 no HumanEval +. Para tarefas de contexto longo, a média é de 41,5 no CAPACETE e 79,4 na RÉGUA.

O pós-treinamento aprimora ainda mais o modelo. As pontuações médias sobem de 71,58 após o ajuste fino supervisionado para 72,67 após DPO e 73,22 na configuração "Think", superando Olmo3-7B-Think (71,97), Gemma-4-E4B Think (70,47) e Qwen3,5-4B (69,73). No seguimento de instruções, o IFEval sobe de 77,08 para 83,70.

A receita pós-treino é notável. Após o SFT nas misturas Dolci-Think-SFT-7B e Nemotron, a AMD executa o DPO com atualizações de polarização do roteador e a perda de balanceamento de carga auxiliar desativada para evitar degradação. O aprendizado por reforço prossegue dentro da estrutura Miles da AMD: 1.400 etapas de RLVR seguindo instruções, seguido por Destilação sob política multiprofessor que dobra o ganho de volta sem sacrificar a matemática ou o desempenho do código.

O problema do licenciamento

Há uma ressalva que é importante para usuários comerciais. Os pesos do modelo são fornecidos sob uma licença ResearchRAIL, que restringe o uso apenas para fins acadêmicos e de pesquisa, portanto, o Instella-MoE não é um modelo imediato para implantações de produção. A base de código de treinamento, no entanto, é licenciada pelo MIT, e esse é sem dúvida o ativo mais reutilizável — fornece a outros laboratórios um plano concreto para treinamento em silício AMD.

A AMD publicou os pesos completos de cada estágio de treinamento, as misturas de dados, as configurações de treinamento e o código de inferência em uma coleção Hugging Face, um repositório GitHub e seu blog ROCm. Esse nível de abertura – estágio por estágio de treinamento, não apenas um ponto de verificação final – é o que distingue um lançamento “totalmente aberto” de um lançamento típico de peso aberto.

Por que isso é importante além dos benchmarks

O subtexto do lançamento é a competição de hardware. O ecossistema CUDA da Nvidia e as GPUs da classe H100 têm sido o substrato padrão para o treinamento de modelos de fronteira, e os desafiantes passaram anos tentando provar que seus aceleradores podem lidar com toda a pilha de treinamento. Instella-MoE é um artefato confiável que a linha Instinct da AMD – já implantada em escala por hiperscaladores e laboratórios nacionais – pode fazer mais do que inferir cargas de trabalho. Se a AMD conseguir continuar produzindo modelos abertos competitivos treinados em seu próprio hardware, isso fortalecerá o argumento para os compradores que buscam quebrar o controle da Nvidia no mercado de computação de IA.

Para os pesquisadores, o apelo é a transparência. Lançamentos totalmente abertos que documentam o mix de dados, a mistura de treinamento intermediário, a estratégia de destilação e o currículo de RL permanecem raros e permitem que a comunidade audite e reproduza afirmações em vez de acreditar na palavra do laboratório. Instella-MoE se junta a uma lista pequena, mas crescente – incluindo os modelos densos Instella anteriores da própria AMD – impulsionando esse padrão.

Fique à frente da IA

Quer esse tipo de cobertura técnica profunda no momento em que acontece? Marque nosso hub para os últimos desenvolvimentos de IA e nunca perca um lançamento.

Leia mais notícias sobre IA →