Z.ai, o laboratório chinês de IA anteriormente conhecido como Zhipu AI, lançou todos os pesos de seu modelo GLM-5.3 no Hugging Face, transformando um dos modelos de codificação e agente mais fortes disponíveis em um download gratuito. O lançamento foi ao ar em 28 de agosto, poucos dias depois de o laboratório confirmar que o modelo viral furtivo conhecido como “Ox Alpha” era na verdade seu próprio GLM-5.3-Flash e cumpre a promessa de peso aberto que fez a comunidade observar de perto durante toda a semana.

A página do modelo rapidamente coletou mais de 1.100 curtidas, e o tópico do Hacker News anunciando o lançamento ultrapassou 600 pontos enquanto os desenvolvedores digeriam o que agora está em um repositório público: 141 arquivos safetensors, enviados no FP8, compreendendo o que pode ser o modelo de codificação mais capaz para download aberto até o momento. Para mais contexto sobre esta história, confira nossa últimos desenvolvimentos em IA.

O que Z.ai realmente enviou

GLM-5.3 é um modelo de mistura de especialistas construído em uma arquitetura que Z.ai chama de glm_moe_dsa. De acordo com a configuração publicada junto com os pesos, a rede empilha 78 camadas com 256 especialistas roteados, ativando 8 especialistas por token mais um especialista compartilhado. A janela de contexto abrange 1.048.576 tokens — um milhão inteiro — e o modelo suporta um parâmetro "reasoning_effort" com configurações baixas, altas e máximas, com padrão máximo.

Talvez a observação mais interessante no cartão de modelo seja a franqueza sobre a origem das melhorias: o GLM-5.3 usa o mesmo modelo básico do GLM-5.2 e todo ganho vem do pós-treinamento. O laboratório descreve claramente o resultado como “o modelo de pesos abertos mais capaz para codificação”.

Benchmarks: SOTA de pesos abertos na codificação Agentic

A tabela de avaliação publicada é extensa e incomumente específica sobre sua metodologia, listando resultados contra Kimi K3, DeepSeek-V4 Pro-0813, Qwen3.8-Max, Opus 4.8 da Anthropic, Fable 5 do Google e GPT-5.6 Sol da OpenAI.

No Terminal Bench 3.0, GLM-5.3 pontua 28,3 – estado da arte de código aberto, e um salto de 4,6 para GLM-5.2, embora ainda atrás da fronteira fechada de Fable 5 em 33,7 e GPT-5.6 Sol em 34,6. No Terminal Bench 2.1 ele registra 88,2, essencialmente empatado com Kimi K3 e GPT-5.6 Sol e à frente dos 85,0 do Opus 4.8. Os resultados do DeepSWE saltaram de 46,2 para 66,9 entre as versões, e o GLM-5.3 está no topo da tabela no AutomationBench com 48,2 e no GDPval-AA v2 com 1769, este último avaliado por Análise Artificial.

Z.ai também relata uma melhoria de 50% em relação ao GLM-5.2 em seu Code Bench interno, juntamente com os melhores resultados de pesos abertos em benchmarks como o Último Exame dos Agentes.

A questão da capacidade cibernética

O cartão modelo é extremamente contundente sobre um desenvolvimento que os pesquisadores de segurança vêm acompanhando há meses: “À medida que ampliamos o pós-treinamento, a capacidade cibernética se desenvolveu mais rápido do que esperávamos”, afirma o cartão. GLM-5.3 é o que há de mais moderno no CyberGym para descoberta de vulnerabilidades em 84,5, superando todos os modelos disponíveis, incluindo GPT-5.6 Sol, e mais que dobra o GLM-5.2 em benchmarks de exploração – 54,4 versus 24,4 no ExploitBench e 105/130 versus 29/39 nos dois orçamentos de tempo do ExploitGym.

AI Buzz Wire cobriu esses recursos quando eles surgiram com o lançamento somente de API em meados de agosto. O que muda agora é a distribuição: os pesos podem ser baixados, as construções de comunidades quantizadas provavelmente ocorrerão rapidamente e qualquer pessoa com memória suficiente pode executar o modelo localmente. Na discussão do Hacker News, alguns usuários notaram que o modelo parecia menos restritivo em relação às tarefas adjacentes à segurança do que as alternativas hospedadas nos EUA – impressões da comunidade em vez de uma reivindicação de política oficial, mas refletindo o motivo pelo qual esta versão está sendo discutida tanto nos círculos de segurança quanto nos de desenvolvedores.

Uma licença voltada para hiperscaladores

Ao contrário do GLM-5.3-Flash, fornecido sob uma licença limpa do MIT, o GLM-5.3 chega com uma "Licença GLM-5.3" personalizada. O New Stack caracterizou-o como direcionado a hiperescaladores, e o texto confirma isso. Para quase todos, os termos são efetivamente permissivos: usar, copiar, modificar, mesclar, publicar, distribuir, sublicenciar e vender, com apenas a exigência de incluir o aviso.

A exceção visa um modelo de negócios específico. Se um licenciado ou suas afiliadas operarem um negócio de "Modelo como Serviço" - oferecendo inferência de terceiros ou acesso de ajuste fino - e sua receita combinada exceder US$ 10 bilhões em 12 meses consecutivos, eles deverão passar por uma revisão de segurança Z.ai antes de qualquer uso comercial do modelo ou seus derivados. Essa cláusula traça um círculo precisamente em torno dos maiores provedores de nuvem, deixando intocadas startups, pesquisadores, empresas e hosts de médio porte.

A abordagem de duas vias é reveladora. A variante Flash, agora revelada como o modelo Ox Alpha que se tornou viral antes do TechCrunch descobrir suas origens, funciona inteiramente em silício chinês e carrega a bandeira do MIT para adoção máxima. O carro-chefe obtém uma licença personalizada que mantém a implantação do hiperescalador – especialmente por nuvens americanas – restrita ao próprio processo de revisão da Z.ai.

Executando você mesmo

Para aqueles que desejam tentar, o cartão modelo lista suporte de implantação em vLLM, SGLang, KTransformers, Unsloth e Hugging Face Transformers, com receitas de livros de receitas para vários deles. Notavelmente, a implantação do Huawei Ascend NPU é documentada por meio de vLLM-Ascend, xLLM e SGLang – continuando o esforço do laboratório para provar que modelos de fronteira são executados em hardware que não seja da Nvidia. Na comunidade, a DeepInfra foi a primeira a oferecer um endpoint de terceiros do modelo aberto no OpenRouter.

Z.ai também publicou um relatório técnico sobre arXiv, intitulado “GLM-5: from Vibe Coding to Agentic Engineering”, cobrindo o desenvolvimento da família de modelos.

Por que é importante

O lançamento comprime a lacuna entre a fronteira fechada e a fronteira aberta para um erro de arredondamento em muitos benchmarks de codificação de agentes – semanas, não anos. Combinado com Kimi K3 e DeepSeek-V4, significa que os desenvolvedores fora dos maiores laboratórios agora têm alternativas confiáveis ​​que podem possuir, auditar e ajustar.

Também sinaliza uma mudança na forma como as versões abertas são governadas. A divisão MIT versus licença personalizada dentro de uma única família de modelos sugere que os laboratórios chineses estão aprendendo a usar o licenciamento como infraestrutura estratégica: abertura onde constrói um ecossistema, alavancagem onde protege posição. O próximo teste será se qualquer operadora de MaaS com mais de US$ 10 bilhões realmente se submete a uma revisão de segurança Z.ai – ou se a cláusula simplesmente mantém as maiores nuvens de fora enquanto todos os outros constroem no topo.

---

Fique à Frente da IA

As últimas notícias, análises e avanços em inteligência artificial — tudo em um só lugar.

Ler mais notícias de IA →