A empresa de benchmarking Artificial Analysis lançou a versão 4.2 de seu Índice de Inteligência em 4 de setembro de 2026, uma atualização provisória que reformula a forma como os modelos de IA de fronteira são medidos – e, de acordo com a nova tabela de classificação, Claude Fable 5.1 da Anthropic ocupa o primeiro lugar, com o GPT-6 Astra da OpenAI em segundo lugar após um ganho de quatro pontos sobre o GPT-5.6 Sol.
A atualização ocorre apenas oito meses após o lançamento do Index v4 em janeiro, uma reviravolta invulgarmente rápida que a empresa atribui ao ritmo dos recentes lançamentos de fronteira. “Com a fronteira avançando tão rapidamente nas últimas semanas, sentimos que é importante entregar uma atualização provisória imediata para garantir que nosso índice permaneça tão relevante e útil como sempre”, escreveu a empresa em seu anúncio.
As classificações dos títulos
De acordo com os resultados publicados, Claude Fable 5.1 da Anthropic lidera o índice, seguido pelo GPT-6 Astra da OpenAI, que melhorou quatro pontos em relação ao GPT-5.6 Sol. Meta é classificado como o terceiro laboratório mais forte na tabela de classificação, seguido por SpaceXAI, Moonshot/Kimi, Z.AI e Google.
A Anthropic e a OpenAI também compartilham o quadro atualizado de relação custo-eficiência: as duas empresas, juntamente com a Meta e a Z.AI, ocupam a fronteira de Pareto "Custo por tarefa" do índice, o que significa que nenhum outro laboratório oferece atualmente inteligência estritamente melhor pelo mesmo preço por tarefa concluída.
Sobre a eficiência do token, a Artificial Analysis descobriu que o GPT-6 Astra é “mais eficiente em termos de token do que quase todos os outros modelos próximos à fronteira de inteligência”, com Claude Fable 5.1, Grok 4.5 e Gemini 3.5 Flash-Lite em cada extremidade da curva. A empresa observou, no entanto, numa análise complementar, que a menor utilização de tokens da Astra é compensada pelos seus preços mais elevados – um lembrete de que a eficiência bruta e o custo total nem sempre caminham juntos.
O que mudou na v4.2
A mudança estrutural mais significativa é um impulso deliberado contra os jogos de referência. Quarenta por cento da ponderação do Índice agora vem de conjuntos de testes privados e mantidos — o dobro da participação na v4.1 — incluindo AA-Briefcase, AA-Omniscience e soluções para CritPt. A empresa disse que esse número aumentará ainda mais no Índice v5.
Duas novas avaliações fundamentam a atualização:
- AA-Briefcase, um benchmark de trabalho de conhecimento de agente interno com um conjunto de testes mantidos privados. Os modelos são avaliados em projetos profissionais de várias semanas, cada um com muitas tarefas vinculadas e milhares de arquivos de origem de entrada, e classificados por meio de uma combinação de pontuação de rubrica e comparação de pares, cobrindo o sucesso verificável da tarefa, a qualidade analítica e a qualidade da apresentação.
- GDP.pdf, criado pela Surge AI, que testa o raciocínio único em documentos profissionais: 100 PDFs abrangendo dez domínios, com evidências distribuídas em 4.592 páginas de texto, tabelas, gráficos e notas de rodapé. As respostas são avaliadas de acordo com 1.275 critérios atômicos de autoria de especialistas, e o título All-pass Rate credita uma tarefa apenas quando todos os critérios são satisfeitos.
Um padrão de referência de longa data está em vias de extinção: o GPQA Diamond, o teste de raciocínio científico de pós-graduação, foi removido porque foi efetivamente saturado por modelos de fronteira.
A empresa também atualizou sua infraestrutura de classificação, lançando o AA-LCR v1.1 com um novo prompt do sistema de classificação e teclas de resposta corrigidas, reancorando a escala Elo para GDPval-AA v2 e AA-Briefcase para que as classificações permaneçam estáveis à medida que novos modelos chegam, e fortalecendo as sandboxes de classificação do SciCode para que o código lento, mas correto, não seja mais considerado uma falha.
O que os novos testes revelam
Os resultados das novas avaliações oferecem uma imagem mais granular da situação real dos laboratórios de fronteira.
No AA-Briefcase, Claude Fable 5.1 e Opus 5 da Anthropic lideram, seguido pelo GPT-6 Astra da OpenAI e Muse Spark 1.3 da Meta. GPT-6 Astra pontua cerca de 85 pontos Elo acima do GPT-5.6 Sol na mesma avaliação – um salto substancial entre gerações sucessivas de OpenAI.
No GDP.pdf, a imagem muda: OpenAI lidera com GPT-6 Astra com taxa de aprovação total de 33,2%, seguido por GPT-5.6 Sol com 28,2% e Claude Fable 5,1 com 26,2%. A divergência sugere que a síntese de documentos longos em contextos muito grandes continua a ser uma força relativa para o modelo mais recente da OpenAI, mesmo que os modelos da Antrópico liderem o índice geral e as tarefas de trabalho dos agentes.
Por que conjuntos de testes privados são importantes
A mudança para uma avaliação sustentada reflecte um problema de credibilidade mais amplo na avaliação comparativa da IA. À medida que os modelos absorveram mais dados de testes públicos, os laboratórios e os observadores independentes ficaram cada vez mais preocupados com o facto de as pontuações principais em benchmarks bem conhecidos reflectirem a memorização ou a formação direccionada, em vez de uma capacidade genuína. Ao manter uma parcela crescente de seus conjuntos de testes privados e ponderá-los mais fortemente, a Artificial Analysis está tentando preservar o sinal de que as tabelas de classificação públicas estão perdendo.
A empresa disse que vem construindo elementos do Índice v5 “há meses” e reteve deliberadamente as atualizações para manter o Índice estável durante a recente onda de lançamentos de grandes modelos. Além da versão provisória v4.2, ela planeja mais atualizações incrementais em um futuro próximo, à medida que conclui a transição v5.
Para os compradores que escolhem entre modelos de fronteira, a conclusão prática da v4.2 é que o topo do mercado continua a ser uma corrida de dois cavalos entre Anthropic e OpenAI, com Meta a fechar a lacuna – e que as avaliações concebidas para serem resistentes aos jogos estão agora a fazer mais trabalho de classificação. Os usuários que rastreiam as decisões de seleção de modelos podem acompanhar os desenvolvimentos mais recentes de IA à medida que a implementação da v5 se aproxima.
Fique à frente da IA
Atualizações de benchmark como esta remodelam a forma como a indústria avalia o progresso. Leia mais notícias sobre IA e fique à frente de cada lançamento de modelo.
Leia mais notícias sobre IA →