A DeepSeek atualizou sua linha de APIs com um novo modelo principal, V4 Pro, enquanto aumentava drasticamente os preços em sua plataforma – um afastamento decisivo da estratégia de preços baixíssima que tornou o laboratório chinês famoso e forçou os rivais a uma guerra de preços. Para uma indústria que acompanhou cada corte de preços do DeepSeek como um evento que mudou o mercado, a reversão é igualmente significativa. Siga nossa cobertura de notícias sobre IA para saber as novidades do mercado de modelos.

A documentação oficial da API da empresa, atualizada esta semana, agora lista dois modelos: deepseek-v4-flash, executando a versão DeepSeek-V4-Flash-0731, e deepseek-v4-pro, executando a nova versão DeepSeek-V4-Pro-0813. Ambos oferecem uma janela de contexto de 1 milhão de tokens, até 384.000 tokens de saída máxima e modos duplos de pensamento e não pensamento, e ambos podem ser usados ​​como modelos de back-end dentro de ferramentas de agente como Claude Code, GitHub Copilot e OpenCode. DeepSeek também está lançando uma prévia do “DeepSeek Harness”, um kit de ferramentas para desenvolvedores de agentes. Para mais contexto sobre esta história, confira nossa tendências de IA.

Quanto custa o V4 Pro

O novo carro-chefe tem exatamente três vezes o preço do Flash em todos os níveis, de acordo com os preços publicados da DeepSeek. Por 1 milhão de tokens, o V4 Pro lista US$ 0,022 para tokens de entrada em cache e US$ 0,66 para entrada não armazenada em cache fora dos horários de pico, e US$ 1,98 por 1 milhão de tokens de saída. No pico, esses números dobram para US$ 0,044, US$ 1,32 e US$ 3,96. O Flash V4, em comparação, lista US$ 0,007/US$ 0,014 para ocorrências de cache, US$ 0,22/US$ 0,44 para falhas de cache e US$ 0,66/US$ 1,32 para saída.

Os horários de pico são definidos como 01h00 às 04h00 e 06h00 às 10h00 UTC, com taxas fora de pico definidas exatamente na metade do pico. A simultaneidade também é escalonada: os clientes Flash recebem 2.500 solicitações simultâneas, enquanto as contas Pro são limitadas a 500.

Os preços sobem até dez vezes

O lançamento encerra uma semana em que a transformação de preços do DeepSeek se tornou impossível de perder. O Wall Street Journal informou em 14 de agosto que o DeepSeek aumentou os preços dos modelos de IA em cerca de quatro vezes. A InfoWorld informou no mesmo dia que alguns preços do V4 aumentaram mais de 10 vezes, citando a demanda por IA que estava sobrecarregando a capacidade da empresa. O Engadget disse aos leitores que os modelos estavam “prestes a custar quatro vezes mais”.

Em 17 de agosto, o Tech Times informou que os preços da API V4 agora quadruplicam nos horários de pico, enquanto o Seoul Economic Daily da Coreia do Sul estimou os aumentos mais acentuados em até 12 vezes e enquadrou o movimento como a corrida da IA ​​da China rumo ao lucro. O Global Times, afiliado ao Estado chinês, descreveu os aumentos como parte de um impulso para uma “comercialização mais saudável” – um sinal de que Pequim vê a economia unitária sustentável, e não apenas a quota de mercado, como a prioridade para os seus defensores da IA.

Da arma de guerra de preços ao produto premium

A mudança de estratégia é radical. A DeepSeek construiu sua reputação global com base em preços agressivos: no final de julho, seu modelo V4 Flash recém-lançado foi comparado com o GPT-5.6 Luna da OpenAI a um custo 60% menor, acelerando uma corrida para o fundo do poço que espremeu todos os provedores de API. Agora, o mesmo laboratório está cobrando taxas premium – o preço máximo de produção do V4 Pro de US$ 3,96 por milhão de tokens está bem acima do que os clientes da era Flash estavam acostumados a pagar.

A introdução de janelas de pico e fora de pico é em si uma ferramenta de gestão de capacidade. Cobrar o dobro durante os horários de maior movimento – e reduzir a simultaneidade para o modelo premium – permite que o DeepSeek racione a computação para cargas de trabalho com margens mais altas, um manual conhecido dos provedores de nuvem e dos mercados de eletricidade.

Um portfólio de duas camadas para a era do agente

A divisão entre os dois modelos foi projetada para compradores diferentes. O Flash, com seu limite de simultaneidade de 2.500 solicitações e preço mínimo de acerto de cache, está posicionado para tráfego de produção de alto volume e aplicativos sensíveis a custos. O Pro, com 500 solicitações simultâneas e o triplo do preço, tem como alvo cargas de trabalho com uso intenso de raciocínio, onde a janela de contexto de 1 milhão de tokens e o teto de saída de 384.000 tokens são importantes – sessões de agente longas, grande análise de base de código e pipelines com muitos documentos.

DeepSeek também está cortejando desenvolvedores onde eles já trabalham. Ambos os modelos podem ser usados ​​diretamente como back-ends dentro de Claude Code, GitHub Copilot e OpenCode, e a API fala formatos compatíveis com OpenAI e Anthropic – o que significa que migrações de provedores ocidentais podem ser uma mudança de configuração de uma linha. A nova prévia do desenvolvedor “DeepSeek Harness” estende essa estratégia para construtores de agentes.

O que isso significa para os desenvolvedores

Para os desenvolvedores que construíram aplicativos sensíveis ao custo partindo do pressuposto de que o DeepSeek sempre seria uma opção de barganha, a mensagem é que a era da queda incessante dos preços dos tokens acabou, pelo menos no laboratório chinês. As arquiteturas compatíveis com cache agora pagam uma taxa de entrada 30 vezes menor do que as chamadas cache-miss em ambos os modelos, tornando a disciplina de cache imediato muito mais valiosa do que a escolha do modelo. E para o mercado mais amplo, o pivô do DeepSeek remove o definidor de preços mais agressivo do mercado – um presente silencioso para OpenAI, Anthropic e Google, que têm competido tanto em custo quanto em capacidade durante todo o ano.

Se os benchmarks do V4 Pro justificam o prêmio ainda será testado por avaliadores independentes. O que já está claro é a lógica de negócios: depois de dois anos subsidiando o uso mundial de IA, a DeepSeek quer ser paga por isso.

---

Fique à Frente da IA

As últimas notícias, análises e avanços em inteligência artificial — tudo em um só lugar.

Ler mais notícias de IA →