O que mudou
De acordo com a tabela de preços publicada pela OpenAI e o changelog da API, os preços padrão por milhão de tokens agora são:
- GPT-5.6 Luna: entrada de 20 centavos e saída de US$ 1,20, abaixo dos US$ 1 e US$ 6 — uma redução de 80%
- GPT-5.6 Terra: US$ 2 e US$ 12, abaixo dos US$ 2,50 e US$ 15 — um corte de 20%
- GPT-5.6 Sol (o carro-chefe): US$ 5 e US$ 30, inalterados
Todos os três níveis foram lançados para disponibilidade geral em 9 de julho de 2026 com taxas mais altas, colocando a redefinição de preços apenas 21 dias após o início da vida comercial da família. A Reuters e a CNBC confirmaram os cortes, e a Axios informou que a redução mais acentuada recaiu sobre o modelo Luna.
Reduz o fluxo em todas as camadas de serviço
As reduções não se limitam aos preços principais. Eles fluem por todas as opções da tabela de preços:
- Processamento em lote e Flex, ambos pela metade do preço padrão, colocam o Luna com entrada de 10 centavos e saída de 60 centavos por milhão de tokens.
- Leituras de entrada armazenadas em cache, com desconto de 90%, caem para dois centavos por milhão de tokens no Luna e 20 centavos no Terra.
- Solicitações de contexto longo, cobradas pelo dobro da taxa de entrada e 1,5 vezes a saída, chegam a 40 centavos e US$ 1,80 para Luna.
Para as equipes que já roteiam classificação em massa, extração ou longos loops de agentes através dos níveis mais baratos, as mesmas chamadas agora custam uma fração do que custavam no dia anterior.
Como os cortes se comparam ao Antrópico
Com entrada de 20 centavos e saída de US$ 1,20, Luna agora supera o modelo publicado mais barato da Anthropic, o Haiku 4.5, em cerca de cinco vezes na entrada e quatro vezes na produção, de acordo com a página de preços da Anthropic. A nova taxa da Terra fica abaixo dos US$ 3 e US$ 15 que Claude Sonnet 5 está programado para cobrar assim que seu preço inicial expirar em 31 de agosto de 2026.
No topo de ambas as linhas, o Sol ainda custa mais na produção do que o Opus 5 da Anthropic, que custa US$ 5 e US$ 25.
O processamento prioritário se torna o modo rápido
A mesma entrada do changelog retirou o “Processamento Prioritário” e o substituiu pelo “Modo Rápido”. Para o modelo Sol principal, a OpenAI diz que o modo Rápido funciona até 2,5 vezes a velocidade padrão pelo dobro do preço, e o switch é compatível com versões anteriores – solicitações já marcadas para rota prioritária para o modo Rápido sem alteração de código.
As tarifas do modo rápido são de US$ 10 e US$ 60 para Sol, US$ 4 e US$ 24 para Terra e 40 centavos e US$ 2,40 para Luna. Notavelmente, a Anthropic vende o mesmo produto com o mesmo nome e os mesmos termos, e as duas tabelas de preços agora também convergem para a inferência fixada por região: a OpenAI cobra um aumento de 10% em modelos lançados em ou após 5 de março de 2026, quando um cliente exige residência de dados, enquanto a Anthropic cobra a inferência apenas nos EUA a 1,1 vezes sua taxa padrão.
Por que os níveis mais baratos ficaram mais baratos
Um dia antes do corte, a OpenAI publicou um post de engenharia descrevendo otimizações em sua pilha de inferência. Cinco membros da equipe técnica da empresa escreveram que Sol, rodando dentro de sua ferramenta de codificação Codex, reescreveu os kernels de GPU de produção – trabalho que a OpenAI diz que reduziu os custos de serviço ponta a ponta em 20%. O modelo também redesenhou seu próprio modelo preliminar de decodificação especulativa em centenas de experimentos, uma mudança que foi creditada por aumentar a eficiência de geração de tokens em mais de 15%.
Esses são os números da própria OpenAI para sua própria pilha, mas apontam para o mesmo centro de custo que o corte de preço aborda: o agente por trás do Codex e do ChatGPT. O OpenAI limita a saída da ferramenta em 10.000 tokens por padrão e mantém o histórico visível apenas para o modelo, de modo que um loop de agente que reenvia suas instruções a cada etapa atinge o cache de prompt em vez de pagar taxas de entrada completas. A empresa encerrou a postagem com o compromisso de repassar “melhorias ocultas aos nossos usuários na forma de inteligência mais amplamente disponível e econômica”. A tabela de preços foi lançada um dia depois.
Parceiros de nuvem e cobrança
A OpenAI observou que os compradores que direcionam o tráfego por meio do Amazon Bedrock são cobrados pela AWS e essas taxas podem diferir de seu próprio cartão publicado. À medida que mais empresas centralizam o acesso ao modelo através de um único fornecedor de nuvem, a diferença entre o preço direto da OpenAI e o que os clientes realmente pagam através de intermediários será tão importante quanto os próprios números das manchetes.
Um mercado contando cada token
Os cortes ocorrem à medida que os compradores empresariais auditam os gastos com mais precisão do que nunca. No início da semana, relatórios documentaram como a era do “tokenmaxxing” desenfreado – aumentando o volume sem observar os custos – está desaparecendo à medida que as contas corporativas de IA aumentam nas principais plataformas. A decisão da OpenAI de transferir as suas poupanças de custos internos para os clientes, em vez de depositar a margem, é um sinal claro de onde acredita que a batalha competitiva está agora a ser travada: não na fronteira, onde a Sol ainda comanda preços premium, mas nos níveis baratos e de alto volume, onde realmente reside a maior parte do tráfego de produção.
Com o preço do Sol inalterado, a decisão ao vivo para os desenvolvedores permanece exatamente onde a OpenAI a colocou desde o lançamento da família: qual nível cada solicitação exige. A diferença é que o custo de tomar essa decisão caiu drasticamente.
---
Fique à frente da IAReceba as últimas notícias, análises e avanços sobre IA — tudo em um só lugar.
Leia mais notícias sobre IA →