El laboratorio chino de inteligencia artificial DeepSeek ha lanzado V4.1-Flash, un modelo multimodal de peso abierto que combina una columna vertebral de 552 mil millones de parámetros con una de las compresiones de memoria más agresivas jamás entregadas en un sistema de primera línea. El modelo entró en funcionamiento el miércoles con una licencia del MIT para Hugging Face y un informe técnico adjunto, informó Reuters, culminando una serie de titulares para el laboratorio con sede en Hangzhou.

El lanzamiento es más que un aumento de versión de rutina. DeepSeek ha retirado simultáneamente su nivel insignia V4 Pro, y TechNode informó que las solicitudes a V4 Pro ahora se están dirigiendo a V4.1-Flash, una sorprendente declaración de confianza en un modelo que lleva el nombre "Flash" pero que publica números de referencia iguales o superiores al modelo que reemplaza. Para más contexto sobre esta historia, consulta nuestra noticias de IA.

Un "flash" más grande con una factura de memoria más pequeña

Según la tarjeta modelo oficial, DeepSeek-V4.1-Flash es un modelo de Mezcla de Expertos (MoE) con 552 mil millones de parámetros de red troncal más un componente de memoria condicional "Engram" de 196 mil millones de parámetros al que se accede escasamente a través de búsqueda basada en tokens. A pesar de su gran tamaño, el modelo activa sólo 8 mil millones de parámetros por token durante el llenado previo y 16 mil millones durante la decodificación: menos parámetros activos que su predecesor de 284B de parámetros, que ejecutaba 13 mil millones constantes.

La pieza central arquitectónica es lo que DeepSeek llama un diseño de Codificador-Decodificador Causal (CED): un transformador de 40 capas dividido en un codificador causal de 20 capas seguido de un decodificador de 20 capas. Debido a que la caché KV global del decodificador se proyecta desde los estados ocultos del codificador final en lugar de acumularse capa por capa, la memoria necesaria para mantener largas conversaciones se reduce drásticamente.

Las cifras de compresión son el titular. Con el almacenamiento en caché de KV principal de FP4 en formato E2M1, la huella de caché de KV global se reduce a 890 bytes por token, aproximadamente una cuarta parte de DeepSeek-V4-Flash. Una técnica llamada SWA Bounded Replay reconstruye los estados de atención faltantes reproduciendo solo la ventana de tokens más reciente, reduciendo el caché KV persistente a aproximadamente una octava parte del modelo Flash anterior. Según el modelo de tarjeta, la reducción es aproximadamente cuatro veces mayor que la del V4-Flash y 437 veces mayor que la del DeepSeek-V1. Los componentes adicionales incluyen Compressed Sparse Attention 2 (CSA2), que asigna a cada capa de atención uno de tres modos estáticos, y decodificación especulativa DSpark para una generación más rápida.

Debajo del capó, cada capa de MoE combina un experto compartido con 384 expertos enrutados, activando seis expertos enrutados por token.

Puntos de referencia: por delante del buque insignia retirado

En las evaluaciones del modelo base en el informe técnico, V4.1-Flash supera al V4 Pro, mucho más grande, en varias pruebas clave: 74,1 en MMLU-Pro frente a 73,5, 79,4 en HumanEval frente a 76,8, 60,6 en BigCodeBench y 93,0 en GSM8K. El South China Morning Post informó que DeepSeek dice que el nuevo modelo supera a Kimi K3 en puntos de referencia cibernéticos y de codificación, una afirmación notable en un campo de modelos abiertos chinos que también incluye el GLM-5.3 de Z.ai y la línea Qwen de Alibaba.

Con el máximo esfuerzo de razonamiento, el modelo de instrucción obtiene una puntuación de 90,9 en GPQA Diamond: impresionante, aunque todavía por detrás de los principales sistemas de frontera a los que se hace referencia en la propia tabla comparativa de DeepSeek, GPT-5.6 Sol con 94,1 y Claude Opus 5.0 con 93,4. Kimi K3 se sitúa en 92,9. La lectura honesta: este es un modelo adyacente a la frontera a precios abiertos, no una barrida limpia de los laboratorios cerrados.

V4.1-Flash también es genuinamente multimodal. Un codificador de visión DeepSeek-ViT, entrenado desde cero, alimenta imágenes a través de un proyector de dos capas, y el modelo se entrenó en texto e imágenes de forma conjunta desde el inicio del entrenamiento previo. Obtiene una puntuación de 56,5 en MMMU-Pro y 95,6 en DocVQA.

Creado para agentes, con precio por volumen

Las opciones de diseño dejan claro el público objetivo: cargas de trabajo agentes, donde los modelos leen contextos enormes y actúan en largos horizontes. El modelo admite ventanas de contexto de hasta un millón de tokens, se entrenó en un corpus multimodal de 45 billones de tokens y ofrece un dial de esfuerzo de razonamiento continuamente controlable de 1 a 100 que intercambia el costo de inferencia con la precisión. La cobertura de Decoder enfatizó que los ahorros de memoria reducen específicamente lo que cuesta ejecutar agentes de IA: cargas de trabajo que dedican mucho más tiempo a leer entradas que a generar salidas.

La reacción de la comunidad ha sido enfática. El hilo de lanzamiento en Hacker News obtuvo más de 650 puntos, y un hilo anterior titulado "DeepSeek lanza v4.1 flash más barato y más capaz que v4 pro" recopiló casi 400 más. Los comentaristas que ejecutan modelos localmente señalaron que los parámetros de Engram pueden incluso descargarse a SSD rápidos, abriendo un camino a la inferencia cercana a la frontera en el hardware de consumo.

Buscando Alpha enmarcó los riesgos comerciales sin rodeos, calificándolo de modelo de costo ultrabajo que presenta desafíos para los laboratorios fronterizos de EE. UU., un recordatorio de que la guerra de precios en la inferencia de IA no muestra signos de enfriarse.

Un momento deliberado para el anuncio

El momento es revelador. Un día antes del lanzamiento, Reuters informó que DeepSeek había recurrido a CITIC Securities para organizar una oferta pública inicial en el mercado STAR de Shanghai, luego de informar anteriormente que los ingresos del laboratorio se habían multiplicado por diez antes de una posible cotización. Enviar un modelo abierto que acapare los titulares días después mantiene ese impulso.

El lanzamiento también se produce en medio de un mayor escrutinio de las empresas chinas de inteligencia artificial. A principios de esta semana, agencias estadounidenses, incluidas la NSA, CISA y el FBI, nombraron a seis empresas chinas de inteligencia artificial en un aviso sobre la destilación de modelos a escala industrial, un recordatorio de que las victorias técnicas de DeepSeek ahora llegan junto con el bagaje geopolítico.

Nada de eso oscurece la historia de la ingeniería. Con V4 Pro retirado y su tráfico dirigido a un modelo más barato y potente, DeepSeek ha presentado el argumento más claro posible de que en 2026 la frontera interesante de la IA puede no ser solo quién construye el modelo más grande, sino quién ofrece la mayor capacidad por gigabyte de memoria.

---

Mantente al Día con la IA

Las últimas noticias, análisis y avances de inteligencia artificial, en un solo lugar.

Leer más noticias de IA →