O laboratório chinês de IA DeepSeek lançou silenciosamente deepseek-v4-flash-vision-exp, uma versão experimental de seu modelo V4-Flash que pode aceitar imagens junto com texto, fechando uma das lacunas mais gritantes em sua família de modelos carro-chefe. O lançamento, documentado nas páginas oficiais da API da empresa, chega poucas semanas após as atualizações V4-Flash-0731 e V4-Pro-0813 e oferece aos desenvolvedores uma maneira há muito solicitada de alimentar capturas de tela, gráficos e fotos diretamente em um dos modelos de fronteira mais baratos do setor. Para as equipes que acompanham os mais recentes desenvolvimentos de IA, é outro sinal de que a DeepSeek pretende igualar os rivais ocidentais, recurso por recurso, ao mesmo tempo em que os reduz agressivamente no preço.

O que o novo modelo faz

De acordo com a documentação da API do DeepSeek, `deepseek-v4-flash-vision-exp` permite aos usuários “pedir ao modelo para descrever imagens, ler texto de capturas de tela, analisar gráficos e muito mais”. O modelo aceita arquivos JPEG, PNG, GIF e WebP, com o formato detectado a partir do conteúdo real do arquivo, em vez do nome do arquivo ou do tipo MIME declarado – um detalhe pequeno, mas cuidadoso, que evita bugs de extensões incompatíveis.

Os desenvolvedores podem transmitir imagens de três maneiras: URLs de dados em linha codificados em base64 (sujeitos a um limite de corpo de solicitação de 48 MiB), URLs externos acessíveis publicamente (até 8.192 caracteres, 32 MiB por imagem, com uma janela de download de 60 segundos) ou por meio da API de arquivos. Tudo usa o formato padrão de conclusão de bate-papo compatível com OpenAI, e o modelo também pode ser acessado por meio do endpoint compatível com Anthropic do DeepSeek – o que significa que o código Claude SDK existente pode alternar back-ends com alterações mínimas.

Preços: visão de fronteira em taxas de commodities

O modelo experimental herda a tabela de preços agressiva do V4-Flash. Os tokens de entrada custam US$ 0,22 por milhão fora do horário de pico e US$ 0,44 no pico para falhas de cache, caindo para apenas US$ 0,007 por milhão em acessos de cache fora dos horários de pico. Os tokens de saída custam US$ 0,66 por milhão fora do pico e US$ 1,32 no pico. As imagens são convertidas em tokens com base em suas dimensões e cobradas juntamente com tokens de texto.

Esse preço é importante porque prejudica drasticamente as ofertas multimodais comparáveis ​​dos principais fornecedores dos EUA, continuando a guerra de preços que a DeepSeek travou durante todo o ano. O modelo também carrega as principais especificações da família: uma janela de contexto de 1 milhão de tokens, até 384 mil tokens de saída máxima, suporte para modos de pensamento e não pensamento, saída JSON, chamadas de ferramentas e um limite de simultaneidade de 2.500 – especificações que o posicionam como um verdadeiro burro de carga para cargas de trabalho de produção de alto volume, em vez de um brinquedo de pesquisa.

Por que os desenvolvedores estavam desesperados por isso

O lançamento chegou ao Hacker News, onde rapidamente acumulou mais de 450 pontos — e o entusiasmo tem uma história de origem específica. O V4-Flash-0731 somente texto do DeepSeek desenvolveu uma reputação de acreditar que podia ver. Vários desenvolvedores relataram que o modelo presumiria que tinha recursos de visão e, em seguida, improvisaria soluções alternativas elaboradas quando descobrisse que não era possível – incluindo a invenção de ferramentas de análise de imagens baseadas em texto e a extração de capturas de tela de dispositivos conectados antes de perceber que não havia como visualizá-los.

“Ouvi dizer que o DeepSeek v4 Flash 0731 frequentemente assume que possui capacidades de visão e então recorre à invenção de ferramentas de análise de imagens baseadas em texto quando descobre que na verdade não consegue ver”, escreveu um comentarista, ecoando relatórios de vários outros. Para qualquer pessoa que use o modelo como agente em pipelines de codificação ou automação, a nova variante de visão deve eliminar toda uma categoria de falhas causadas por confusão.

A captura de 800x800

O lançamento tem limitações, e as críticas mais contundentes ao Hacker News visaram um número: resolução da imagem. A documentação afirma que antes da inferência, cada imagem é redimensionada automaticamente para que sua contagem total de pixels corresponda aproximadamente a uma imagem de 800x800, preservando a proporção.

“É útil, mas para OCR e muitos outros aplicativos precisa ser um pouco maior (por exemplo: colocar uma página inteira de tamanho A4/Carta)”, argumentou um desenvolvedor, com outro respondendo sem rodeios que o limite de 800x800 “mata muitos casos de uso”. Para documentos densos, digitalizações de página inteira ou depuração refinada da interface do usuário, o teto de resolução pode levar os desenvolvedores a alternativas de resolução mais alta – e mais caras. Uma solução alternativa popular sugerida no tópico: divida páginas grandes em blocos e alimente-as separadamente.

A outra questão em aberto é a abertura. A DeepSeek construiu sua reputação lançando pesos abertos, mas a empresa não disse se a variante de visão seguirá. Os comentaristas especularam que isso pode derivar da recente pesquisa da empresa “Pensando com Primitivos Visuais”, para a qual foram prometidos pesos, mas nada foi confirmado. Notavelmente, o modelo é listado como experimental – o sufixo “-exp” – sinalizando que o DeepSeek espera iterar.

Um lançamento tranquilo, mas estratégico

A queda na visão continua um período movimentado para o laboratório com sede em Hangzhou, que passou agosto enviando atualizações constantes: V4-Flash-0731, a estrutura DeepSeek Harness orientada a agentes, a atualização V4-Pro-0813 e agora entrada multimodal. Em vez de um único lançamento de grande sucesso, o DeepSeek está executando uma cadência de lançamentos rápidos e incrementais que mantêm seus modelos dentro de cadeias de ferramentas de desenvolvedor – a mesma estratégia de apropriação de terras que os laboratórios ocidentais estão adotando com agentes de codificação.

Para a indústria de IA em geral, a mensagem é familiar, mas ainda desconfortável para os operadores históricos: capacidades que antes justificavam preços premium – compreensão de imagem num contexto de um milhão de tokens – estão agora a chegar a alguns cêntimos por milhão de tokens. O rótulo experimental dá ao DeepSeek espaço para refinar o modelo, mas os desenvolvedores já começaram a conectá-lo a fluxos de trabalho baseados em capturas de tela. A questão não é mais se o DeepSeek pode igualar o conjunto de recursos multimodais de seus rivais, mas com que rapidez o resto do mercado se ajusta aos seus preços.

Fique à frente da IA

Para os últimos lançamentos de modelos de IA, batalhas de benchmark e análises do setor, marque AI Buzz Wire.

Leia mais notícias sobre IA →