El equipo Qwen de Alibaba lanzó Qwen3.8-Flash-Next el miércoles, un modelo multimodal de combinación de expertos que funciona como una vista previa de la arquitectura del próximo Qwen4, y que ofrece resultados que, según la compañía, superan a su mucho más grande Qwen3.7-Plus con aproximadamente una novena parte del costo de capacitación. Reuters, Bloomberg y The Decoder cubrieron el lanzamiento, que pone peso abierto en Hugging Face y ModelScope el mismo día que Z.ai lanzó su propio modelo abierto adyacente a la frontera. Siga las últimas noticias sobre IA a medida que se acelera la carrera de peso abierto.

Una nueva arquitectura en miniatura

La especificación principal es la eficiencia. Qwen3.8-Flash-Next tiene 125 mil millones de parámetros totales pero activa solo 6 mil millones por token. A modo de comparación, Qwen3.7-Plus, el modelo al que supera en los puntos de referencia publicados por Alibaba, tiene 397 mil millones de parámetros totales con 17 mil millones activados por token, casi tres veces el recuento activo de Flash-Next.

La pieza técnicamente más interesante es una novedosa capa de incrustación de N-gramas que contiene 51 mil millones de parámetros. La capa almacena grupos de palabras comunes como entradas independientes en lo que Matthias Bastian de The Decoder describió como una especie de "diccionario de frases", que introduce información a nivel de frase al inicio de la red. Fundamentalmente, se encuentra en la RAM normal del sistema en lugar de en la costosa memoria de la GPU, a lo que el equipo de Qwen llama un costo adicional relativamente bajo: una innovación arquitectónica que se prevé incorporar a Qwen4.

El modelo admite de forma nativa una ventana de contexto de 262,144 tokens y escala a un millón de tokens usando la extensión de contexto largo de YaRN. Se publica un informe técnico en GitHub.

Puntos de referencia: codificación y trabajo de oficina

Los puntos de referencia de Alibaba comparan Flash-Next con DeepSeek-V4-Flash (284 mil millones de parámetros, 13 mil millones activos) y Claude Opus 4.6 (Max) de Anthropic. A pesar de que ambos rivales son mucho más grandes o más caros, Flash-Next lidera la mayoría de las tareas probadas, con las mayores ganancias en codificación y productividad de oficina.

En codificación agente, Flash-Next obtuvo una puntuación de 58,7 en DeepSWE 1.1 y 62,5 en SWE-bench Pro, superando a DeepSeek-V4-Flash y Claude Opus 4.6. La brecha en las tareas de oficina es aún mayor: 73,9 en CoWorkBench frente a 45,1 de DeepSeek-V4-Flash y 55,7 en JobBench, casi el doble que los 27,6 de Qwen3.7-Plus. El razonamiento científico coincide estrechamente en todo el campo, con Flash-Next en 91,7 en GPQA Diamond y 91,9 en LiveCodeBench v6. Claude Opus 4.6 solo sale adelante en Humanity's Last Exam, 40.0 a 35.9, y es un modelo Anthropic más antiguo de febrero de 2026. Como siempre, las puntuaciones de referencia publicadas y el rendimiento en el mundo real pueden diferir.

Presión de precios sobre cada rival

La versión de producción se envía como Qwen3.8-Flash a través de QwenCloud, con un precio de 0,16 dólares por millón de tokens de entrada y 0,47 dólares por millón de tokens de salida. Eso socava incluso el GLM-5.3-Flash de Z.ai, lanzado el mismo día a 0,15 dólares y 0,50 dólares respectivamente, lo que efectivamente es la paridad en la parte inferior del mercado.

La brecha con el propio buque insignia de Alibaba es marcada. Qwen3.8-Max, presentado a principios de agosto para competir con Claude Opus 4.8, Gemini 3.1 Pro y GPT-5.6 Sol, cuesta $2,00 por millón de tokens de entrada y $6,00 por millón de tokens de salida. Flash-Next tiene un rendimiento justo por debajo del buque insignia, según las propias cifras de Alibaba, a aproximadamente una doceava parte del precio tanto en entrada como en producción.

El contexto extenso agrega valor práctico más allá de la hoja de especificaciones. Con 262,144 tokens nativos, una sola solicitud puede contener varios repositorios de códigos grandes, un conjunto de contratos completo u horas de reuniones transcritas; ampliado a un millón de tokens con YaRN, el análisis de todo el corpus se vuelve factible sin andamios de recuperación. Para las cargas de trabajo de codificación agente en las que Flash-Next publica sus puntuaciones más altas (buscar y corregir errores de forma independiente en proyectos de software reales), una ventana grande significa menos fallas de gestión del contexto a mitad de la tarea. El equipo de Qwen también publicó el informe técnico en GitHub, invitando exactamente al tipo de escrutinio de arquitectura independiente que evitan los laboratorios propietarios.

Por qué es importante esta versión

Qwen3.8-Flash-Next se entiende mejor como un ensayo general público para Qwen4. La capa de incrustación de N-gram, la agresiva relación de parámetros activos y la descarga de RAM de parámetros voluminosos pero raramente necesarios esbozan una filosofía de diseño: mover inteligencia por dólar, no inteligencia por GPU. Entrenar un modelo que supere a Qwen3.7-Plus por una novena parte del costo es precisamente la capacidad que hace que los ciclos de iteración rápidos sean asequibles, y la velocidad de iteración, más que cualquier punto de referencia, es lo que decide quién estará en la frontera dentro de un año.

La llegada el mismo día de dos modelos de peso abierto adyacentes a la frontera de los laboratorios chinos (GLM-5.3-Flash de Z.ai y Flash-Next de Alibaba) también marca un cambio de cadencia, como observó FourWeekMBA. Los laboratorios occidentales todavía mantienen picos de referencia, pero el nivel de peso abierto ahora envía semanalmente una calidad cercana a la frontera, a precios un orden de magnitud más bajos.

Para los desarrolladores, la conclusión práctica es simple: el costo de un modelo multimodal capaz y de contexto largo acaba de caer nuevamente, con pesos descargables como seguro contra cualquier proveedor único. Para los competidores, el mensaje es menos cómodo: la frontera de la eficiencia ahora se está moviendo más rápido de lo que los precios emblemáticos pueden seguir de manera realista, y Alibaba no ha mostrado signos de desaceleración.

---

Manténgase a la vanguardia de la IA

Obtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.

Leer más noticias sobre IA →