A xAI lançou o Grok 4.7, o modelo mais capaz da empresa para codificação e trabalho de conhecimento até o momento, após semanas de provocações públicas e pelo menos um atraso. Anunciado no site da empresa no domingo, o modelo chega ao mesmo preço e velocidade de serviço de seu antecessor Grok 4.6: US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída, aproximadamente metade do preço de lista do GPT-5.6 Sol Max da OpenAI (US$ 4/US$ 20) e bem abaixo do Fable 5.1 Max da Antrópico (US$ 10/US$ 50).
Para obter as últimas notícias e análises sobre IA, visite AI Buzz Wire.
Um modelo base maior, treinado para tarefas longas
De acordo com o anúncio da xAI, o Grok 4.7 usa um modelo base novo e maior em comparação com o Grok 4.6 e foi treinado com um aprendizado de reforço mais longo em uma combinação mais difícil de tarefas, voltadas para problemas que levam muitas horas para serem concluídos. A empresa afirma que o modelo é melhor na verificação de seu próprio trabalho e no gerenciamento de contextos mais longos, e que foi treinado para compreender nativamente o equipamento do Grok Bot, melhorando as tarefas de conversação e o trabalho de conhecimento geral.
O lançamento segue uma corrida barulhenta. Elon Musk disse pela primeira vez no início de setembro que o Grok 4.7 chegaria dentro de dez dias, depois reconheceu em meados de setembro que o modelo precisava de mais alguns dias de refinamento, de acordo com TeslaNorth.com. Agora está sendo enviado e o GitHub confirmou no mesmo dia que o Grok 4.7 está disponível no GitHub Copilot.
A imagem de referência: forte, não abrangente
Os dados de benchmark publicados pela xAI mostram um modelo que lidera em várias categorias de longo horizonte, enquanto permanece atrás da configuração mais cara da Anthropic em outras:
- CursorBench 4.0, que enfatiza tarefas de codificação de longa duração: Grok 4.7 pontua 46,3%, à frente de GPT-5.6 Sol Max (41,7%) e Grok 4.6 High (40,4%), mas atrás de Fable 5.1 Max (51,8%).
- Terminal-Bench 4.0, trabalho terminal multi-horas: 38,0%, um aumento acentuado em relação aos 20,3% do Grok 4.6 e um pouco à frente do GPT-5.6 Sol Max (37,3%), embora o Fable 5.1 Max lidere com 57,9%.
- EEBench, um benchmark de engenharia elétrica: 64,0%, um grande salto em relação aos 53,0% do Grok 4.6 e o mais alto dos modelos listados.
- DeepSWE v1.1: 71,0% em alto esforço, contra 65,2% para Grok 4.6 e 72,7% para GPT-5.6 Sol Max.
- AA Briefcase v1.1, trabalho de escritório de várias horas: 1.657, acima de 1.546, e logo atrás de Fable 5.1 Max com 1.678.
- Harvey Legal Agent Benchmark: 19,6%, à frente de Grok 4.6 (15,8%) e muito à frente de GPT-5.6 Sol Max (2,5%) e Fable 5.1 Max (6,7%) nesta medida.
- HealthBench Professional: 56,7%, melhorando os 48,5% do Grok 4.6, mas atrás do GPT-5.6 Sol Max (60,5%) e do Fable 5.1 Max (62,1%).
No GDPval, um benchmark de trabalho de conhecimento profissional avaliado por Elo, o gráfico do xAI coloca Grok 4.7 em xhigh raciocínio em 1.695 – acima de 1.605 para Grok 4.6, atrás de Fable 5.1 Max (1.735) e à frente de GPT-6 Astra Max (1.542).
Preço é a história
A afirmação mais agressiva no anúncio é económica e não técnica: xAI descreve o Grok 4.7 como duas vezes mais rápido pela metade do preço de modelos comparáveis, e a tabela de preços publicada apoia a comparação do título com as configurações de topo dos seus dois principais rivais. O preço do token de US$ 2/US$ 6 do Grok 4.7 permanece inalterado em relação ao Grok 4.6, o que significa que os compradores obtêm a melhoria geração após geração sem aumento de preço.
Esse posicionamento estende uma estratégia que a xAI seguiu em toda a linha Grok 4.x: igualar ou aproximar-se da qualidade de fronteira enquanto reduz os níveis de preços premium de OpenAI e Anthropic e, em seguida, distribuir agressivamente por meio de parceiros, incluindo GitHub, Cursor e OpenRouter.
O que assistir
A ressalva honesta é que a xAI publicou o próprio gráfico de comparação e a verificação independente dos agregadores de benchmarking levará dias. Nos números que a xAI escolheu destacar, o Grok 4.7 é um avanço genuíno em relação ao Grok 4.6 – mais visivelmente no Terminal-Bench 4.0 e EEBench – mas não supera o Fable 5.1 Max, que mantém a liderança em benchmarks de codificação e saúde, ao mesmo tempo que custa cinco vezes mais por token de saída.
Para desenvolvedores que executam cargas de trabalho de agente longas e de várias horas, a matemática preço-desempenho pode ser mais importante do que a posição bruta na tabela de classificação. Grok 4.7 já está disponível por meio da API do xAI e no GitHub Copilot.
Fique à frente da IA
Para cobertura contínua dos desenvolvimentos mais importantes da indústria de IA, marque AI Buzz Wire e nunca perca uma notícia de última hora.
Leia mais notícias sobre IA