O modelo misterioso que passou uma semana encantando desenvolvedores sob o nome anônimo de Ox Alpha agora tem identidade oficial. A Z.AI da China lançou o GLM-5.3-Flash, um modelo nativo multimodal e de peso aberto lançado sob a licença permissiva do MIT – e a empresa diz que toda a execução de pré-visualização furtiva foi servida em chips de IA fabricados na China. O lançamento encerra um dos jogos de adivinhação mais assistidos na indústria de IA este ano. Para saber mais sobre como a história se desenrolou, consulte nossos últimos desenvolvimentos de IA.

O que Z.ai realmente enviou

O GLM-5.3-Flash é um modelo misto de especialistas com 320 bilhões de parâmetros totais e 18 bilhões de parâmetros ativos – uma queda notável em relação aos 32 bilhões de parâmetros ativos de seu antecessor GLM-4.5. É o primeiro modelo nativamente multimodal da família GLM-5, aceitando entrada de texto e imagem, e suporta uma janela de contexto que chega a um milhão de tokens, segundo anúncio de Z.ai.

O modelo foi treinado em um corpus multimodal de 30 trilhões de tokens e sua arquitetura mistura atenção linear para dependências locais com atenção esparsa para contexto global. Um componente que Z.ai chama IndexPool compacta grupos de vetores-chave do indexador para limitar a latência e o uso de memória em longos comprimentos de contexto. A empresa relata três vezes menos atenção computacional e uma redução de 4,4 vezes no tamanho do cache KV em comparação com o GLM-5.3.

Reivindicações e preços de referência

No Índice de Inteligência de Análise Artificial v4.1.1, GLM-5.3-Flash obteve 57 – um número que o coloca no topo das classificações de modelos atuais de Análise Artificial, bem acima da mediana de comparação de 18. Z.ai diz que supera o GLM-5.2 em codificação relatada e testes de agente por um décimo do preço, e se aproxima de Claude Opus 4.8 da Antrópico em seu benchmark de codificação interno. No DeepSWE v1.1, o modelo pontuou 63,4 contra 46,2 para GLM-5.2; no AutomationBench atingiu 48,8 contra 26,2. Como observou o TestingCatalog, diferentes sistemas de avaliação, limites de contexto e configurações de geração significam que as comparações de testes cruzados dependem muito de cada configuração.

O preço posiciona o modelo como agressivamente barato: US$ 0,15 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída, com um desconto de 83% no prompt-cache, de acordo com a Artificial Analysis. Z.ai cita um custo com desconto de US$ 0,045 por tarefa do Índice de Inteligência.

O ângulo do chip chinês

O detalhe estrategicamente mais significativo é a infraestrutura, não a inteligência. Antes do lançamento, o modelo funcionava anonimamente como `ox-alpha` no OpenRouter e OpenCode a partir de 20 de agosto, e Z.ai diz que se tornou o modelo mais popular da semana nesses serviços – com tráfego servido inteiramente em aceleradores domésticos chineses. Para apoiar isso, Z.ai construiu uma pilha de serviços baseada em SGLang que separa codificação, pré-preenchimento e decodificação, relatando um ganho triplo no desempenho de serviço ponta a ponta em dezenas de milhares de chips de IA chineses.

Isso importa além de um fornecedor. É uma demonstração pública de que um modelo chinês adjacente à fronteira pode ser servido em escala sem hardware Nvidia, um dado que os legisladores e fabricantes de chips ocidentais não irão ignorar. O New Stack resumiu o lançamento como barato, bom e servido com chips chineses – três qualidades raramente reivindicadas juntas até agora.

Pesos abertos, implantação real

Os pesos estão disponíveis no Hugging Face sob a licença MIT, com implantação local suportada por SGLang, vLLM e TokenSpeed. Os assinantes do Plano de Codificação GLM obtêm o GLM-5.3-Flash ao vivo imediatamente com três vezes a cota utilizável do GLM-5.3, e seus recursos multimodais são expostos no ZCode por meio de integrações de uso de navegador e uso de computador.

O raciocínio visual é fundamental para o lançamento: Z.ai treinou o modelo para inspecionar interfaces renderizadas, jogabilidade e saída 3D e, em seguida, avaliar e revisar seu próprio trabalho a partir do feedback visual. A mesma abordagem se estende a documentos, planilhas, apresentações e painéis – os artefatos básicos do trabalho de escritório, que é exatamente onde o lançamento rival de Qwen no mesmo dia também reivindica seus maiores ganhos.

A decisão dos pesos abertos é importante para o ecossistema, além dos amadores. O licenciamento do MIT é a licença comum mais permissiva em IA: o uso comercial, a modificação e a redistribuição não acarretam obrigações de copyleft. Hosts independentes podem servir o GLM-5.3-Flash em seu próprio hardware, ajustá-lo para setores verticais, desde revisão jurídica até automação industrial, e incorporá-lo em produtos sem negociação de termos – uma opção fechada por modelos de fronteira somente API.

Por que o lançamento furtivo funcionou

O lançamento anônimo deu à Z.ai algo que os orçamentos de marketing não podem comprar: validação independente da marca. Os desenvolvedores adotaram o Ox Alpha por seus méritos, sem a estrutura de um laboratório chinês versus os titulares americanos. No momento em que a Bloomberg confirmou o Z.AI como criador e o Business Insider declarou o “mistério resolvido”, o modelo já havia liderado as tabelas de classificação da comunidade em terreno neutro.

A pressão competitiva é agora explícita. Um modelo multimodal com um contexto de um milhão de tokens, pesos licenciados pelo MIT e preços de produção abaixo do dólar força cada operador estabelecido a justificar a sua lista de preços. A fronteira de Pareto para preço versus desempenho – o trade-off que os desenvolvedores realmente sentem – foi redesenhada, como disse o amplamente respeitado comentarista de IA Andrew Curran no X.

A questão em aberto é a durabilidade: se os líderes de benchmark se mantêm sob uso adversário no mundo real e com que rapidez os laboratórios ocidentais respondem em termos de preço. De qualquer forma, a semana de especulação anônima terminou com um modelo nomeado, pesos para download e uma frota de serviços que não utiliza silício americano.

---

Fique à frente da IA

Receba as últimas notícias, análises e avanços sobre IA — tudo em um só lugar.

Leia mais notícias sobre IA →