El laboratorio chino de inteligencia artificial DeepSeek ha lanzado silenciosamente deepseek-v4-flash-vision-exp, una versión experimental de su modelo V4-Flash que puede aceptar imágenes junto con texto, cerrando una de las brechas más evidentes en su familia de modelos insignia. El lanzamiento, documentado en las páginas API oficiales de la compañía, llega apenas unas semanas después de que se actualicen V4-Flash-0731 y V4-Pro-0813 y ofrece a los desarrolladores una forma largamente solicitada de introducir capturas de pantalla, gráficos y fotografías directamente en uno de los modelos más baratos de la industria. Para los equipos que siguen los últimos desarrollos de IA, es otra señal de que DeepSeek pretende igualar característica por característica a sus rivales occidentales mientras los rebaja agresivamente en precio.

Qué hace el nuevo modelo

Según la documentación API de DeepSeek, `deepseek-v4-flash-vision-exp` permite a los usuarios "pedirle al modelo que describa imágenes, lea texto de capturas de pantalla, analice gráficos y más". El modelo acepta archivos JPEG, PNG, GIF y WebP, y el formato se detecta a partir del contenido real del archivo en lugar del nombre del archivo o el tipo MIME declarado, un detalle pequeño pero cuidadoso que evita errores de extensiones no coincidentes.

Los desarrolladores pueden pasar imágenes de tres maneras: URL de datos en línea codificados en base64 (sujetas a un límite de cuerpo de solicitud de 48 MiB), URL externas de acceso público (hasta 8192 caracteres, 32 MiB por imagen, con una ventana de descarga de 60 segundos) o a través de la API de archivos. Todo utiliza el formato estándar de finalización de chat compatible con OpenAI, y también se puede acceder al modelo a través del punto final compatible con Anthropic de DeepSeek, lo que significa que el código Claude SDK existente puede cambiar de backend con cambios mínimos.

Precios: visión de frontera a precios de materias primas

El modelo experimental hereda el agresivo precio del V4-Flash. Los tokens de entrada cuestan $0,22 por millón fuera de las horas pico y $0,44 en las horas pico por errores de caché, cayendo a tan solo $0,007 por millón en aciertos de caché durante las horas de menor actividad. Los tokens de producción tienen un precio de 0,66 dólares por millón en horas valle y 1,32 dólares en horas pico. Las imágenes se convierten en tokens según sus dimensiones y se facturan junto con los tokens de texto.

Ese precio es importante porque socava drásticamente las ofertas multimodales comparables de los principales proveedores estadounidenses, continuando la guerra de precios que DeepSeek ha librado durante todo el año. El modelo también incluye las especificaciones principales de la familia: una ventana de contexto de 1 millón de tokens, hasta 384 000 tokens de salida máxima, soporte para modos de pensamiento y no pensamiento, salida JSON, llamadas de herramientas y un límite de concurrencia de 2500: especificaciones que lo posicionan como un verdadero caballo de batalla para cargas de trabajo de producción de alto volumen en lugar de un juguete de investigación.

Por qué los desarrolladores estaban desesperados por esto

El lanzamiento llegó a Hacker News, donde rápidamente acumuló más de 450 puntos, y el entusiasmo tiene una historia de origen específica. El V4-Flash-0731 de solo texto de DeepSeek se había ganado la reputación de creer que podía ver. Varios desarrolladores informaron que el modelo asumiría que tenía capacidades de visión y luego improvisarían elaboradas soluciones cuando descubrieran que no podía, incluida la invención de herramientas de análisis de imágenes basadas en texto y la extracción de capturas de pantalla de los dispositivos conectados antes de darse cuenta de que no tenía forma de verlas.

"He oído que DeepSeek v4 Flash 0731 ha asumido con frecuencia que tiene capacidades de visión y luego recurre a inventar herramientas de análisis de imágenes basadas en texto cuando descubre que en realidad no puede ver", escribió un comentarista, haciéndose eco de informes de varios otros. Para cualquiera que utilice el modelo como agente en procesos de codificación o automatización, la nueva variante de visión debería eliminar toda una categoría de fallas impulsadas por la confusión.

La captura de 800x800

La publicación no está exenta de limitaciones y las críticas más duras a Hacker News se dirigieron a un tema: la resolución de la imagen. La documentación indica que antes de la inferencia, cada imagen cambia de tamaño automáticamente para que su recuento total de píxeles coincida aproximadamente con una imagen de 800x800, preservando la relación de aspecto.

"Es útil, pero para OCR y muchas otras aplicaciones necesita ser un poco más alto (por ejemplo, colocar una página completa de tamaño A4/Carta)", argumentó un desarrollador, y otro respondió sin rodeos que el límite de 800x800 "mata muchos casos de uso". Para documentos densos, escaneos de página completa o depuración detallada de la interfaz de usuario, el límite de resolución podría empujar a los desarrolladores hacia alternativas de mayor resolución y más costosas. Una solución alternativa popular sugerida en el hilo: dividir las páginas grandes en mosaicos y alimentarlas por separado.

La otra cuestión abierta es la apertura. DeepSeek construyó su reputación lanzando pesos abiertos, pero la compañía no ha dicho si le seguirá la variante de visión. Los comentaristas especularon que podría derivar de la reciente investigación de la compañía "Pensando con primitivos visuales", para la cual supuestamente se prometieron pesos, pero no se ha confirmado nada. En particular, el modelo figura como experimental (el sufijo "-exp") indica que DeepSeek espera iterar.

Un lanzamiento silencioso pero estratégico

La caída de la visión continúa un tramo ajetreado para el laboratorio con sede en Hangzhou, que pasó agosto enviando actualizaciones constantes: V4-Flash-0731, el marco DeepSeek Harness orientado a agentes, la actualización V4-Pro-0813 y ahora entrada multimodal. En lugar de un único lanzamiento exitoso, DeepSeek está ejecutando una cadencia de lanzamientos rápidos e incrementales que mantienen sus modelos dentro de las cadenas de herramientas de los desarrolladores: la misma estrategia de apropiación de tierras que los laboratorios occidentales están siguiendo con los agentes de codificación.

Para la industria de la IA en general, el mensaje es familiar, pero sigue siendo incómodo para los titulares: capacidades que alguna vez justificaron precios superiores (comprensión de imágenes en un contexto de un millón de tokens) ahora están llegando a unos pocos centavos por millón de tokens. La etiqueta experimental le da a DeepSeek espacio para refinar el modelo, pero los desarrolladores ya han comenzado a conectarlo a flujos de trabajo basados ​​en capturas de pantalla. La pregunta ya no es si DeepSeek puede igualar el conjunto de características multimodales de sus rivales, sino qué tan rápido se ajusta el resto del mercado a sus precios.

Manténgase por delante de la IA

Para conocer los últimos lanzamientos de modelos de IA, batallas comparativas y análisis de la industria, marque AI Buzz Wire.

Leer más noticias sobre IA →