A equipe Qwen do Alibaba lançou o Qwen3.8-Flash-Next na quarta-feira, um modelo multimodal de mistura de especialistas que funciona como uma prévia da arquitetura do próximo Qwen4 - e que fornece resultados que a empresa diz superar seu Qwen3.7-Plus, muito maior, por cerca de um nono do custo de treinamento. Reuters, Bloomberg e The Decoder cobriram o lançamento, que coloca pesos abertos em Hugging Face e ModelScope no mesmo dia em que Z.ai lançou seu próprio modelo aberto adjacente à fronteira. Acompanhe as notícias de última hora sobre IA enquanto a corrida do peso aberto acelera.
Uma nova arquitetura em miniatura
A especificação principal é eficiência. Qwen3.8-Flash-Next tem 125 bilhões de parâmetros totais, mas ativa apenas 6 bilhões por token. Para efeito de comparação, o Qwen3.7-Plus – o modelo que supera nos benchmarks publicados do Alibaba – tem 397 bilhões de parâmetros totais com 17 bilhões ativados por token, quase três vezes a contagem ativa do Flash-Next.
A peça tecnicamente mais interessante é uma nova camada de incorporação de N-gramas que transporta 51 bilhões de parâmetros. A camada armazena grupos de palavras comuns como entradas independentes no que Matthias Bastian, do The Decoder, descreveu como uma espécie de “dicionário de frases”, alimentando informações em nível de frase no início da rede. Crucialmente, ele fica na RAM normal do sistema, e não na cara memória da GPU, com o que a equipe do Qwen chama de custo adicional relativamente baixo – uma inovação arquitetônica programada para ser transportada para o Qwen4.
O modelo oferece suporte nativo a uma janela de contexto de 262.144 tokens e é dimensionado para um milhão de tokens usando a extensão de contexto longo do YaRN. Um relatório técnico é publicado no GitHub.
Benchmarks: codificação e trabalho de escritório
Os benchmarks do Alibaba comparam o Flash-Next ao DeepSeek-V4-Flash (284 bilhões de parâmetros, 13 bilhões de ativos) e ao Claude Opus 4.6 (Max) da Anthropic. Apesar de ambos os rivais serem muito maiores ou mais caros, o Flash-Next lidera na maioria das tarefas testadas, com os maiores ganhos em codificação e produtividade de escritório.
Na codificação agentic, Flash-Next obteve pontuação de 58,7 no DeepSWE 1.1 e 62,5 no SWE-bench Pro, superando DeepSeek-V4-Flash e Claude Opus 4.6. A diferença nas tarefas de escritório é ainda maior: 73,9 no CoWorkBench contra 45,1 para DeepSeek-V4-Flash e 55,7 no JobBench – quase o dobro dos 27,6 do Qwen3.7-Plus. O raciocínio científico é semelhante em todo o campo, com Flash-Next em 91,7 no GPQA Diamond e 91,9 no LiveCodeBench v6. Claude Opus 4.6 só sai na frente no Último Exame da Humanidade, 40,0 a 35,9, e é um modelo antrópico mais antigo de fevereiro de 2026. Como sempre, as pontuações de benchmark publicadas e o desempenho no mundo real podem diferir.
Pressão de preços sobre todos os rivais
A versão de produção é enviada como Qwen3.8-Flash por meio do QwenCloud, ao preço de US$ 0,16 por milhão de tokens de entrada e US$ 0,47 por milhão de tokens de saída. Isso prejudica até mesmo o GLM-5.3-Flash da Z.ai, lançado no mesmo dia por US$ 0,15 e US$ 0,50, respectivamente – efetivamente paridade na parte inferior do mercado.
A diferença em relação ao carro-chefe do Alibaba é gritante. Qwen3.8-Max, lançado no início de agosto para competir com Claude Opus 4.8, Gemini 3.1 Pro e GPT-5.6 Sol, custa US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída. O Flash-Next tem um desempenho logo abaixo do carro-chefe, de acordo com os números do próprio Alibaba, a cerca de um doze avos do preço de entrada e saída.
O longo contexto agrega valor prático além da folha de especificações. Com 262.144 tokens nativos, uma única solicitação pode conter vários repositórios de código grandes, um conjunto completo de contratos ou horas de reuniões transcritas; estendida para um milhão de tokens com YaRN, a análise de todo o corpus torna-se viável sem estrutura de recuperação. Para as cargas de trabalho de codificação de agente em que o Flash-Next publica suas pontuações mais fortes – encontrando e corrigindo bugs de forma independente em projetos de software reais – uma janela grande significa menos falhas de gerenciamento de contexto no meio da tarefa. A equipe Qwen também publicou o relatório técnico no GitHub, convidando exatamente o tipo de escrutínio de arquitetura independente que os laboratórios proprietários evitam.
Por que este lançamento é importante
Qwen3.8-Flash-Next é melhor entendido como um ensaio geral público para Qwen4. A camada de incorporação de N-gramas, a agressiva proporção de parâmetros ativos e o descarregamento de RAM de parâmetros volumosos, mas raramente necessários, esboçam uma filosofia de design: mova inteligência por dólar, não inteligência por GPU. Treinar um modelo que supera o Qwen3.7-Plus por um nono do custo é precisamente a capacidade que torna os ciclos de iteração rápidos acessíveis - e a velocidade de iteração, mais do que qualquer benchmark, é o que decide quem estará na fronteira daqui a um ano.
A chegada no mesmo dia de dois modelos de peso aberto adjacentes à fronteira de laboratórios chineses – GLM-5.3-Flash da Z.ai e Flash-Next do Alibaba – também marca uma mudança de cadência, como observou FourWeekMBA. Os laboratórios ocidentais ainda mantêm picos de referência, mas o nível de peso aberto agora envia semanalmente qualidade quase-fronteira, a preços uma ordem de magnitude mais baixa.
Para os desenvolvedores, a conclusão prática é simples: o custo de um modelo multimodal capaz, de longo contexto, caiu novamente, com pesos para download como seguro contra qualquer provedor único. Para os concorrentes, a mensagem é menos confortável – a fronteira da eficiência está agora a mover-se mais rapidamente do que os preços emblemáticos podem realisticamente seguir, e a Alibaba não deu sinais de abrandamento.
---
Fique à frente da IAReceba as últimas notícias, análises e avanços sobre IA — tudo em um só lugar.
Leia mais notícias sobre IA →