A Tencent lançou uma prévia do Hy4 de código aberto, um novo modelo de linguagem grande carro-chefe de sua equipe Hunyuan que a empresa está posicionando na fronteira do código aberto. Os pesos chegaram a Hugging Face, ModelScope, GitCode e CNB em 28 de agosto sob a licença permissiva Apache 2.0, junto com uma variante quantizada em FP8 para inferência mais barata.

O lançamento intensifica a competição entre os laboratórios chineses que enviam modelos de fronteira de peso aberto, um campo que atualmente inclui a série GLM da Z.AI e os modelos Kimi da Moonshot AI. A Bloomberg informou que a Tencent afirma que o novo modelo supera ambos os rivais em testes internos – uma afirmação que, como todas as avaliações realizadas por fornecedores, merece escrutínio. Para mais contexto sobre esta história, confira nossa cobertura da indústria de IA.

Os números do título

A visualização Hy4 é um modelo Mixture-of-Experts (MoE) com 770 bilhões de parâmetros totais, dos quais 49 bilhões são ativados por token. De acordo com o modelo oficial publicado no repositório Tencent-Hunyuan GitHub, o backbone tem 78 camadas, 256 especialistas roteados mais um especialista compartilhado e ativa os 8 principais especialistas roteados para cada token. Uma camada nativa de previsão multitoken (MTP) — 10 bilhões de parâmetros totais, 0,7 bilhão ativados — é integrada para decodificação especulativa.

A janela de contexto é a outra especificação marcante: 1 milhão de tokens, um comprimento que permite ao modelo processar bases de código inteiras, documentos legais longos ou transcrições de reuniões de uma hora em uma única passagem.

Arquitetura emprestada de rivais — e construída sobre ela

Em um grau incomum de franqueza para um lançamento principal, a documentação da Tencent afirma que o módulo de atenção foi “inspirado em DeepSeek e GLM”. A visualização Hy4 usa Gated DeepSeek Sparse Attention (Gated DSA) combinada com IndexCache para reutilização de índice esparso entre camadas, enquanto o caminho residual emprega hiperconexões de identidade (iHC) para expandir o fluxo de informações entre camadas.

A abertura é importante para os desenvolvedores que avaliam o modelo: a atenção escassa é o que torna um contexto de token de 1 milhão economicamente utilizável, uma vez que a atenção total e ingênua nessa extensão se torna proibitivamente cara. Tanto DeepSeek quanto Z.AI enviaram variantes desse design em seus próprios modelos principais.

Construído para produtividade, sintonizado com especialistas internos

A Tencent diz que fez parceria com especialistas dentro da empresa – engenheiros de software, desenvolvedores de jogos, analistas financeiros e especialistas em segurança – e construiu dados de treinamento em torno do trabalho que eles realmente realizam. O cartão modelo destaca quatro áreas de foco:

  • Engenharia de software: planejamento, depuração e verificação aprimorados em tarefas de desenvolvimento de longo horizonte, além de ganhos no "gosto visual" do front-end.
  • Escritório e análise: conversão de contexto confuso de vários arquivos em documentos, planilhas e apresentações compartilháveis, com melhor gerenciamento de equações e modelos financeiros.
  • Desenvolvimento de jogos: geração de protótipos jogáveis ​​a partir de um único prompt e trabalho fluente com motores de jogo em vários turnos de refinamento.
  • Pesquisa científica: progresso declarado em pesquisa de IA, dinâmica molecular, física da matéria condensada e problemas de matemática pura.

A Tencent também afirma que a pré-visualização do Hy4 foi projetada em conjunto com seus próprios produtos, CodeBuddy e WorkBuddy, para que os ganhos do modelo se traduzam em melhorias do produto.

O que mostram os próprios benchmarks da Tencent

A comparação mais concreta nos materiais de lançamento é uma avaliação cega lado a lado que a Tencent realizou com 163 especialistas internos avaliando os resultados em 203 tarefas de engenharia. Nesses testes, a visualização do Hy4 obteve uma média de 2,99, um pouco à frente dos 2,92 do GLM 5.3 (46,8 por cento de vitórias, 12,8 por cento de empates, 40,4 por cento de derrotas) e dos 2,94 de Kimi K3 (51,2 por cento de vitórias, 7,9 por cento de empates, 40,9 por cento de derrotas).

Duas advertências merecem ser feitas claramente. Primeiro, estas são avaliações internas da Tencent, não benchmarks independentes; a empresa ainda não publicou resultados verificados por terceiros em tabelas de classificação públicas. Em segundo lugar, as margens são estreitas – uma diferença de 0,05 a 0,07 pontos numa escala subjetiva de classificação de peritos está dentro do intervalo que diferentes conjuntos de classificações poderiam facilmente inverter.

A verificação independente virá de agregações públicas à medida que a comunidade executa o modelo por meio de codificação padronizada, raciocínio e suítes de agentes nas próximas semanas.

Envio antecipado, com bugs conhecidos

A Tencent deixa explícito que esta é uma prévia. O cartão modelo lista limitações conhecidas, incluindo gastar mais tempo do que o necessário para raciocinar em tarefas complexas e uma tendência a verificar excessivamente o seu próprio trabalho. A equipe diz que “preferia enviar cedo e ouvir o que acontece”, citando a abordagem que melhorou sua geração Hy3.

Para implantação, os pesos estão disponíveis em BF16 e FP8, com suporte no primeiro dia em vLLM e SGLang. A Tencent publica imagens Docker pré-construídas para ambos, com receitas recomendando paralelismo de tensor em 8 GPUs e decodificação especulativa baseada em MTP para veiculação sensível à latência. Um pipeline de ajuste fino e o kit de ferramentas de quantização AngelSlim são fornecidos junto com o modelo.

Por que é importante

A corrida de peso aberto na China se tornou uma guerra de duas frentes entre a série GLM da Z.AI e os modelos Kimi da Moonshot, com DeepSeek, Qwen e agora uma entrada Hunyuan muito maior lotando o campo. A combinação da visualização Hy4 de licenciamento Apache 2.0, uma escala de parâmetros de 770B e um contexto de token de 1 milhão aumenta o limite do que qualquer um pode baixar e auto-hospedar - e o suporte vLLM e SGLang do primeiro dia reduz a barreira para realmente executá-lo.

Para as empresas que avaliam modelos abertos em comparação com APIs fechadas ocidentais, a questão prática já não é se um modelo aberto pode igualar o desempenho fechado no papel, mas se as ferramentas circundantes – quantização, serviço, ajuste fino – estão suficientemente maduras. A Tencent aposta que enviar tudo de uma vez, sob uma licença permissiva, é como Hunyuan volta à conversa.

Se as afirmações de benchmark interno se sustentarem em testes independentes determinará se a visualização do Hy4 será lembrada como um lançamento de código aberto de fronteira genuíno ou outro benchmark de fornecedor em um campo lotado. Os pesos são públicos agora, então o veredicto da comunidade não deve demorar muito.

---

Fique à Frente da IA

As últimas notícias, análises e avanços em inteligência artificial — tudo em um só lugar.

Ler mais notícias de IA →