A OpenAI lançou o GPT-6.1 Sol em 29 de setembro, aposentando o GPT-6 Sol apenas sete dias após a estreia do modelo, de acordo com a empresa independente de benchmarking Artificial Analysis. A troca coincidiu com a conferência de desenvolvedores DevDay da empresa, onde a CNET informou que os participantes poderiam começar a usar o GPT-6.1 Sol imediatamente junto com os agentes Dots recém-lançados e um conjunto de alterações de assinatura.
Uma substituição de carro-chefe em sete dias é incomum, mesmo para os padrões acelerados de 2026, e os benchmarks sugerem por que a OpenAI avançou rapidamente. Para cobertura contínua de lançamentos de modelos, disputas de benchmark e a guerra de preços subjacente a eles, AI Buzz Wire acompanha os desenvolvimentos importantes à medida que acontecem.
Um salto mensurável em sete dias
A Análise Artificial relata que o GPT-6.1 Sol ganha 4 pontos no Índice de Inteligência da empresa sobre o GPT-6 Sol e 5 pontos sobre o GPT-5.6 Sol, ficando apenas 1 ponto abaixo do GPT-6 Astra, o modelo mais capaz da OpenAI. A avaliação da empresa combina raciocínio, trabalho de conhecimento, matemática e tarefas de agente em uma única pontuação comparativa.
As subpontuações mostram onde se concentram os ganhos. GPT-6.1 Sol melhorou 4 pontos no AA-Briefcase v1.1 e 5 pontos no GDPval-AA v2.1, ambos testando o trabalho de conhecimento do agente. Um salto de 12 pontos no Terminal-Bench 4.0 aponta para um desempenho materialmente melhor em ambientes terminais reais, enquanto o Último Exame da Humanidade subiu 5 pontos e o GDP.pdf subiu 6.
Um número se destaca para quem usa modelos para pesquisa: a precisão da Onisciência AA subiu 8 pontos, enquanto a taxa de alucinações caiu de 60% para 54%. Ambos os números permanecem elevados em termos absolutos, mas a direção da viagem é importante para os fluxos de trabalho onde uma resposta errada e confiante é pior do que nenhuma resposta.
Mesmo preço de etiqueta, mais barato na prática
Quanto aos preços, o GPT-6.1 Sol mantém a tabela de preços do GPT-6 Sol de US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída, mas o desconto de leitura de cache aumenta de 90% para 95%. A Artificial Analysis observa que o preço combinado do GPT-6.1 Sol para cargas de trabalho de agente é, portanto, ligeiramente inferior ao do GPT-6 Sol, estendendo uma série de cortes de preços efetivos que começou quando o GPT-6 Sol foi lançado com um desconto de 50% em relação ao GPT-5.6 Sol.
A trajetória de preços é a verdadeira história aqui. No período de dois lançamentos, a OpenAI reduziu aproximadamente pela metade o custo efetivo de sua linha de fronteira intermediária duas vezes, ao mesmo tempo em que aumentou a qualidade a cada vez.
Custo por tarefa: US$ 0,72 versus US$ 3,26
O custo por tarefa é onde a lacuna com o GPT-6 Astra se torna acentuada. No esforço máximo, a Análise Artificial fixa o GPT-6.1 Sol em US$ 0,72 por tarefa do Índice de Inteligência, menos de um quarto dos US$ 3,26 do GPT-6 Astra. Em relação ao seu antecessor, a economia é de 31% (US$ 1,05 para o GPT-6 Sol), e em relação ao GPT-5.6 Sol chega a 64% (US$ 1,99).
De acordo com a empresa, cada nível de esforço do GPT-6.1 Sol ultrapassa a fronteira de Pareto de custo-benefício – o que significa que, para um determinado nível de inteligência, não existe opção mais barata entre os modelos que ele rastreia. O quadro de eficiência de token é mais misto: GPT-6.1 Sol consome cerca de 10 a 30 por cento mais tokens de saída do que GPT-6 Sol em todos os níveis de esforço, embora suas configurações de esforço baixo e médio permaneçam Pareto ideais para eficiência de token, uma vez que a inteligência superior é levada em consideração. Na codificação, o modelo ganhou 3 pontos sobre GPT-6 Sol com esforço máximo no Índice de Agente de Codificação da empresa.
Por que o prazo de sete dias é importante
A lista mais ampla do DevDay reforça a mesma imagem. O relatório da CNET enquadrou a conferência em torno de três coisas que os desenvolvedores poderiam usar imediatamente – GPT-6.1 Sol, os agentes Dots e planos de assinatura reformulados – em vez de uma prévia de pesquisa distante. A mensagem para os desenvolvedores foi a disponibilidade hoje, e não a possibilidade amanhã.
Flagship cadência este breve sinal de que a pressão competitiva mudou das corridas de treinamento para o refinamento pós-treinamento e a infraestrutura de serviço. Uma atualização de nível pontual enviada em uma semana parece mais um ponto de verificação otimizado e uma nova tabela de preços do que um modelo básico do zero, e os rivais estão se comportando da mesma maneira: o Google anunciou o Gemini 4 Argon em 30 de setembro, um modelo de fronteira que está inicialmente alcançando defensores cibernéticos confiáveis por meio de seu programa Fairwind à mesma taxa de US$ 2/US$ 10 por milhão de tokens.
Para os desenvolvedores, três conclusões práticas decorrem dos números verificados. Primeiro, as cargas de trabalho de agente com grande reutilização de cache se beneficiam imediatamente do desconto de 95% no cache. Em segundo lugar, os orçamentos devem modelar o maior consumo de tokens de produção antes da migração, uma vez que o preço por token permanece inalterado mesmo que o modelo pense mais tempo. Terceiro, o Astra continua sendo o teto para tarefas em que o último ponto de inteligência vale um custo adicional de 4x – o caso do GPT-6.1 Sol é que, para a maioria dos trabalhos, não vale.
Vale a pena repetir a advertência: estes números provêm de um único avaliador independente, por mais rigorosa que seja a sua metodologia, e as pontuações do índice recompensam combinações específicas de cargas de trabalho. As equipes com cargas de trabalho exigentes devem reexecutar suas próprias avaliações antes de redirecionar o tráfego de produção.
---
Fique à frente da IAReceba as últimas notícias, análises e avanços sobre IA — tudo em um só lugar.
Leia mais notícias sobre IA →