Black Forest Labs a publié FLUX 3, un modèle de base multimodal qui, selon la société, apprend conjointement des images, de la vidéo et de l'audio pour construire une représentation unique du monde physique. Annoncé le 23 juillet 2026 et désormais disponible en accès anticipé, FLUX 3 représente une rupture architecturale significative par rapport à l'approche modèle par modalité qui a dominé l'IA générative, en regroupant la création d'images, la génération de vidéos avec son natif et même le contrôle des robots en un seul système unifié.

Le lancement arrive à un moment d'intensification de la concurrence dans l'espace des médias génératifs, où des acteurs tels que Runway, Sora d'OpenAI et Veo de Google se sont battus pour produire des modèles vidéo de meilleure qualité et plus performants. FLUX 3 participe à ce concours avec un principe fondamentalement différent : que des modèles distincts pour chaque type de média constituent une limitation artificielle. Ses progrès sont surveillés dans le cadre de notre couverture continue de l'industrie de l'IA du paysage médiatique génératif.

Un modèle de réalité unifié

Dans un article de blog accompagnant la publication, Black Forest Labs a exposé la motivation théorique pour former un modèle unique selon plusieurs modalités. La société a fait valoir qu’aucune modalité – qu’elle soit image, vidéo ou audio – ne fournit une description complète de la réalité. Chacun est une projection du même monde physique sous-jacent, capturé par différents capteurs, chacun perdant des informations au cours du processus.

Les images capturent des structures spatiales à un moment précis. Les vidéos restituent la dimension du temps et révèlent les dynamiques temporelles et les lois physiques. L'audio révèle des relations causales entre les phénomènes mécaniques et l'acoustique que la vision seule ne peut pas détecter. Le langage relie ces perceptions à des objectifs, des abstractions et des instructions, a écrit l'entreprise.

En apprenant de tous ces éléments simultanément, les contraintes mutuelles du modèle fournissent plus d'informations que n'importe quelle modalité seule. Le son doit être à la hauteur de l'impact, le mouvement doit obéir à la masse, le futur doit découler du passé. Les modalités cessent d’être séparées et commencent à témoigner d’une réalité sous-jacente.

FLUX 3 est le premier modèle de l'entreprise entièrement construit sur ce principe, que Black Forest Labs appelle Self-Flow – une approche permettant d'aligner efficacement la génération et la compréhension multimodales au sein de la même architecture sous-jacente.

Génération vidéo avec audio natif

La capacité la plus frappante de FLUX 3 est sa capacité à générer des vidéos d'une durée maximale de 20 secondes avec un audio natif synchronisé en une seule génération. Cela le distingue de la plupart des modèles vidéo existants, qui produisent des images silencieuses qui doivent être associées à un son généré séparément.

Selon la société, la sortie vidéo de FLUX 3 est particulièrement performante pour capturer les expressions faciales humaines, associer les sons à des événements physiques et prendre en charge les capacités multilingues. Ces capacités peuvent être combinées pour créer des séquences de plusieurs minutes, où les références visuelles contribuent à garantir la cohérence des personnages dans toutes les scènes.

Lors d'une évaluation humaine préliminaire menée pendant l'entraînement, FLUX 3 a été préféré à Runway Gen-4.5 dans 77 % des comparaisons et à Luma Ray 3.2 dans 93 % des comparaisons. Face à des concurrents plus récents, il a été préféré à Grok Imagine Video dans 69 % des comparaisons, à Kling v3 Pro dans 60 % et à Seedance 2.0 et Gemini Omni Flash dans 52 %.

La société a averti que ces résultats sont préliminaires et que de nouvelles améliorations sont attendues au cours de la phase d'accès anticipé.

Rendu des images et du texte

Au-delà de la vidéo, FLUX 3 peut synthétiser et éditer des images dans une grande variété de styles, de formats et de résolutions. Black Forest Labs a signalé des améliorations significatives par rapport aux versions précédentes de FLUX dans la gestion des invites complexes et la génération de texte précis dans les images – un défi persistant pour les modèles d'images génératifs.

Une phase d'accès anticipé aux capacités de FLUX 3 Image s'ouvrira dans les semaines suivant la sortie de la vidéo, a indiqué la société.

Un pont vers l'IA physique

L’aspect le moins conventionnel de FLUX 3 est peut-être son extension à la robotique. La compréhension du monde du modèle s'étend à la prédiction d'action, a expliqué la société, en empruntant deux voies vers l'IA physique : intégrer la prédiction d'action native directement dans FLUX 3 et utiliser le squelette vidéo pré-entraîné comme base pour des modèles d'action spécialisés affinés avec des données limitées spécifiques aux tâches.

Black Forest Labs s'est associé à mimic robotics, qui a été l'une des premières entreprises à accéder rapidement à FLUX 3. Ensemble, ils ont développé FLUX-mimic, un modèle d'action vidéo combinant l'épine dorsale de FLUX 3 avec l'expertise de mimic en matière d'apprentissage robotique pour une manipulation adroite. Selon l'entreprise, le système est déjà testé sur des tâches de production réelles chez Audi.

Cela représente une convergence notable : la même technologie sous-jacente utilisée pour générer du contenu de divertissement est appliquée pour contrôler des robots physiques dans les environnements de fabrication. La thèse de l'entreprise est que l'IA physique et la création de contenu reposent sur les mêmes bases, car toutes deux nécessitent un modèle qui comprend comment les objets tiennent ensemble, comment les choses bougent et comment les événements physiques produisent du son.

Concurrence et position sur le marché

Ce lancement positionne Black Forest Labs – la startup berlinoise à l’origine des modèles de génération d’images FLUX largement utilisés – comme un concurrent plus ambitieux dans le domaine de l’IA générative. Alors que des entreprises comme Runway se sont concentrées étroitement sur la vidéo et OpenAI sur les chatbots textuels et multimodaux, Black Forest Labs parie qu'un modèle véritablement unifié dans les domaines visuel, auditif et physique s'avérera plus performant que les alternatives spécialisées.

La société a déclaré qu'elle travaillait déjà sur la prochaine génération de modèles, dans le but d'unifier la prédiction de la perception, de l'action et du langage dans le même modèle. Au cours des semaines et des mois à venir, il déploiera des fonctionnalités supplémentaires construites à partir de la même architecture sous-jacente de correspondance de flux multimodal, chacune après une phase d'accès anticipé pour les commentaires et les tests de sécurité.

FLUX 3 est désormais disponible en accès anticipé pour la génération vidéo, avec des images et des fonctionnalités supplémentaires déployées progressivement.

Gardez une longueur d'avance sur l'IA

L'approche unifiée de FLUX 3 en matière d'images, de vidéo, d'audio et de robotique marque un changement notable dans la manière dont les modèles d'IA génératifs sont conçus. Pour en savoir plus sur la course aux médias génératifs et les derniers développements en matière d'intelligence artificielle, suivez notre couverture des dernières actualités sur l'IA.

Lire plus d'actualités sur l'IA →