Black Forest Labs ha lanzado FLUX 3, un modelo básico multimodal que, según la compañía, aprende conjuntamente de imágenes, videos y audio para construir una representación única del mundo físico. Anunciado el 23 de julio de 2026 y ahora disponible en acceso anticipado, FLUX 3 representa un cambio arquitectónico significativo con respecto al enfoque de modelo por modalidad que ha dominado la IA generativa, la creación de imágenes colapsadas, la generación de videos con sonido nativo e incluso el control de robots en un sistema unificado.

El lanzamiento llega en un momento de intensificación de la competencia en el espacio de los medios generativos, donde jugadores como Runway, Sora de OpenAI y Veo de Google han estado compitiendo para producir modelos de video más capaces y de mayor calidad. FLUX 3 entra en este concurso con una premisa fundamentalmente diferente: que los modelos separados para cada tipo de medio son una limitación artificial. Su progreso está siendo monitoreado como parte de nuestra cobertura de la industria de la IA continua del panorama de los medios generativos.

Un modelo unificado de la realidad

En una publicación de blog que acompaña al lanzamiento, Black Forest Labs expuso la motivación teórica para entrenar un modelo único en múltiples modalidades. La empresa argumentó que ninguna modalidad (ya sea imagen, video o audio) proporciona una descripción completa de la realidad. Cada uno es una proyección del mismo mundo físico subyacente, capturado por diferentes sensores, y cada uno pierde información en el proceso.

Las imágenes capturan estructuras espaciales en un momento específico. Los vídeos restauran la dimensión del tiempo y revelan dinámicas temporales y leyes físicas. El audio revela relaciones causales entre fenómenos mecánicos y acústicos que la visión por sí sola no puede detectar. El lenguaje vincula estas percepciones con objetivos, abstracciones e instrucciones, escribió la empresa.

Al aprender de todos ellos simultáneamente, las restricciones mutuas del modelo proporcionan más información que cualquier modalidad por sí sola. El sonido tiene que coincidir con el impacto, el movimiento tiene que obedecer a la masa, el futuro tiene que surgir del pasado. Las modalidades dejan de estar separadas y pasan a ser evidencia de una realidad subyacente.

FLUX 3 es el primer modelo de la compañía construido enteramente sobre este principio, que Black Forest Labs llama Self-Flow, un enfoque para alinear eficientemente la generación y la comprensión multimodal dentro de la misma arquitectura subyacente.

Generación de vídeo con audio nativo

La capacidad más llamativa de FLUX 3 es su capacidad de generar vídeos de hasta 20 segundos de duración con audio nativo sincronizado en una sola generación. Esto lo distingue de la mayoría de los modelos de vídeo existentes, que producen imágenes mudas que deben combinarse con audio generado por separado.

Según la empresa, la salida de vídeo de FLUX 3 es particularmente potente a la hora de capturar expresiones faciales humanas, asociar sonidos con eventos físicos y admitir capacidades multilingües. Estas capacidades se pueden combinar para crear secuencias que duren varios minutos, donde las referencias visuales ayudan a garantizar que los personajes permanezcan consistentes en todas las escenas.

En una evaluación humana preliminar realizada durante el entrenamiento, se prefirió FLUX 3 a Runway Gen-4.5 en el 77 % de las comparaciones y a Luma Ray 3.2 en el 93 % de las comparaciones. Frente a competidores más nuevos, fue preferido sobre Grok Imagine Video en hasta un 69% de las comparaciones, Kling v3 Pro en un 60% y Seedance 2.0 y Gemini Omni Flash en un 52%.

La empresa advirtió que estos resultados son preliminares y que se esperan mayores mejoras durante la fase de acceso temprano.

Representación de imágenes y texto

Más allá del vídeo, FLUX 3 puede sintetizar y editar imágenes en una amplia variedad de estilos, relaciones de aspecto y resoluciones. Black Forest Labs informó mejoras significativas con respecto a versiones anteriores de FLUX en el manejo de indicaciones complejas y la generación de texto preciso dentro de las imágenes, un desafío persistente para los modelos de imágenes generativas.

Se abrirá una fase de acceso temprano para las capacidades de imagen de FLUX 3 en las semanas posteriores al lanzamiento del video, dijo la compañía.

Un puente hacia la IA física

Quizás el aspecto menos convencional de FLUX 3 es su extensión a la robótica. La comprensión del mundo del modelo se extiende a la predicción de acciones, explicó la compañía, tomando dos rutas hacia la IA física: integrar la predicción de acciones nativas directamente en FLUX 3 y usar la columna vertebral de video previamente entrenada como base para modelos de acción especializados ajustados con datos limitados de tareas específicas.

Black Forest Labs se asoció con Mimic Robotics, que fue una de las primeras empresas en obtener acceso temprano a FLUX 3. Juntos desarrollaron FLUX-mimic, un modelo de video-acción que combina la columna vertebral de FLUX 3 con la experiencia de Mimic en el aprendizaje de robots para una manipulación diestra. Según la empresa, el sistema ya se está probando en tareas reales de producción en Audi.

Esto representa una convergencia notable: la misma tecnología subyacente utilizada para generar contenido de entretenimiento se está aplicando para controlar robots físicos en entornos de fabricación. La tesis de la compañía es que la IA física y la creación de contenido se basan en la misma base, porque ambas requieren un modelo que comprenda cómo se mantienen unidos los objetos, cómo se mueven las cosas y cómo los eventos físicos producen sonido.

Competencia y posición en el mercado

El lanzamiento posiciona a Black Forest Labs, la startup con sede en Berlín detrás de los modelos de generación de imágenes FLUX ampliamente utilizados, como un competidor más ambicioso en el espacio de la IA generativa. Mientras que empresas como Runway se han centrado exclusivamente en vídeo y OpenAI en texto y chatbots multimodales, Black Forest Labs apuesta a que un modelo verdaderamente unificado en los dominios visual, auditivo y físico resultará más capaz que las alternativas especializadas.

La compañía dijo que ya está trabajando en la próxima generación de modelos, con el objetivo de unificar la predicción de percepción, acción y lenguaje en el mismo modelo. En las próximas semanas y meses, implementará capacidades adicionales creadas a partir de la misma arquitectura subyacente de coincidencia de flujo multimodal, cada una de las cuales seguirá una fase de acceso temprano para comentarios y pruebas de seguridad.

FLUX 3 ya está disponible en acceso temprano para generación de video, con imágenes y capacidades adicionales implementándose de manera incremental.

Manténgase a la vanguardia de la IA

El enfoque unificado de FLUX 3 para imágenes, video, audio y robótica marca un cambio notable en la forma en que se diseñan los modelos de IA generativa. Para obtener más información sobre la carrera de los medios generativos y los últimos desarrollos en inteligencia artificial, siga nuestra cobertura de últimas noticias sobre IA.

Leer más noticias sobre IA →