O Black Forest Labs lançou o FLUX 3, um modelo de base multimodal que, segundo a empresa, aprende em conjunto com imagens, vídeo e áudio para construir uma representação única do mundo físico. Anunciado em 23 de julho de 2026 e agora disponível em acesso antecipado, o FLUX 3 representa um afastamento arquitetônico significativo da abordagem modelo por modalidade que dominou a IA generativa, reunindo a criação de imagens, a geração de vídeo com som nativo e até mesmo o controle de robôs em um sistema unificado.

O lançamento chega em um momento de intensificação da competição no espaço de mídia generativa, onde players como Runway, Sora da OpenAI e Veo do Google têm competido para produzir modelos de vídeo de maior qualidade e maior capacidade. O FLUX 3 entra nesta competição com uma premissa fundamentalmente diferente: que modelos separados para cada tipo de mídia são uma limitação artificial. Seu progresso está sendo monitorado como parte de nossa cobertura da indústria de IA contínua do cenário de mídia generativa.

Um modelo unificado de realidade

Em uma postagem no blog que acompanha o lançamento, o Black Forest Labs expôs a motivação teórica para treinar um único modelo em múltiplas modalidades. A empresa argumentou que nenhuma modalidade única – seja imagem, vídeo ou áudio – fornece uma descrição completa da realidade. Cada um é uma projeção do mesmo mundo físico subjacente, capturado por diferentes sensores, cada um perdendo informações no processo.

As imagens capturam estruturas espaciais em um momento específico. Os vídeos restauram a dimensão do tempo e revelam dinâmicas temporais e leis físicas. O áudio revela relações causais entre fenômenos mecânicos e acústicos que a visão por si só não consegue detectar. A linguagem vincula essas percepções a objetivos, abstrações e instruções, escreveu a empresa.

Ao aprender com tudo isso simultaneamente, as restrições mútuas do modelo fornecem mais informações do que qualquer modalidade isoladamente. O som tem que corresponder ao impacto, o movimento tem que obedecer à massa, o futuro tem que seguir o passado. As modalidades deixam de ser separadas e passam a ser evidências sobre uma realidade subjacente.

FLUX 3 é o primeiro modelo da empresa construído inteiramente com base neste princípio, que o Black Forest Labs chama de Self-Flow – uma abordagem para alinhar eficientemente a geração e compreensão multimodal dentro da mesma arquitetura subjacente.

Geração de vídeo com áudio nativo

A capacidade mais imediatamente impressionante do FLUX 3 é a capacidade de gerar vídeos de até 20 segundos de duração com áudio nativo sincronizado em uma única passagem de geração. Isto o distingue da maioria dos modelos de vídeo existentes, que produzem imagens silenciosas que devem ser combinadas com áudio gerado separadamente.

Segundo a empresa, a saída de vídeo do FLUX 3 é particularmente forte na captura de expressões faciais humanas, na associação de sons a eventos físicos e no suporte a recursos multilíngues. Esses recursos podem ser combinados para criar sequências que duram vários minutos, onde as referências visuais ajudam a garantir que os personagens permaneçam consistentes em todas as cenas.

Na avaliação humana preliminar realizada durante o treinamento, o FLUX 3 foi preferido ao Runway Gen-4.5 em 77% das comparações e ao Luma Ray 3.2 em 93% das comparações. Contra concorrentes mais novos, foi preferido ao Grok Imagine Video em até 69% das comparações, Kling v3 Pro em 60% e Seedance 2.0 e Gemini Omni Flash em 52%.

A empresa alertou que estes resultados são preliminares e que mais melhorias são esperadas durante a fase de acesso antecipado.

Imagens e renderização de texto

Além do vídeo, o FLUX 3 pode sintetizar e editar imagens em uma ampla variedade de estilos, proporções e resoluções. O Black Forest Labs relatou melhorias significativas em relação às versões anteriores do FLUX no tratamento de prompts complexos e na geração de texto preciso em imagens – um desafio persistente para modelos de imagem generativos.

Uma fase de acesso antecipado para os recursos do FLUX 3 Image será aberta nas semanas seguintes ao lançamento do vídeo, disse a empresa.

Uma ponte para a IA física

Talvez o aspecto menos convencional do FLUX 3 seja a sua extensão para a robótica. A compreensão mundial do modelo se estende à previsão de ações, explicou a empresa, seguindo dois caminhos para a IA física: integrando a previsão de ações nativas diretamente no FLUX 3 e usando o backbone de vídeo pré-treinado como base para modelos de ações especializados ajustados com dados limitados de tarefas específicas.

O Black Forest Labs fez parceria com a mimic robotics, que foi uma das primeiras empresas a obter acesso antecipado ao FLUX 3. Juntos, eles desenvolveram o FLUX-mimic, um modelo de vídeo-ação que combina a espinha dorsal do FLUX 3 com a experiência da mimic em aprendizagem de robôs para manipulação hábil. Segundo a empresa, o sistema já está sendo testado em tarefas reais de produção na Audi.

Isto representa uma convergência notável: a mesma tecnologia subjacente utilizada para gerar conteúdo de entretenimento está a ser aplicada para controlar robôs físicos em ambientes de produção. A tese da empresa é que a IA física e a criação de conteúdo funcionam na mesma base, porque ambas exigem um modelo que entenda como os objetos se mantêm unidos, como as coisas se movem e como os eventos físicos produzem som.

Concorrência e posição no mercado

O lançamento posiciona o Black Forest Labs – a startup sediada em Berlim por trás dos amplamente utilizados modelos de geração de imagens FLUX – como um concorrente mais ambicioso no espaço de IA generativa. Embora empresas como a Runway tenham se concentrado estritamente em vídeo e a OpenAI em texto e chatbots multimodais, a Black Forest Labs aposta que um modelo verdadeiramente unificado nos domínios visual, auditivo e físico se mostrará mais capaz do que alternativas especializadas.

A empresa disse que já está trabalhando na próxima geração de modelos, com o objetivo de unificar a previsão perceptual, de ação e de linguagem no mesmo modelo. Nas próximas semanas e meses, serão implementadas capacidades adicionais construídas a partir da mesma arquitetura subjacente de correspondência de fluxo multimodal, cada uma seguindo uma fase de acesso antecipado para feedback e testes de segurança.

O FLUX 3 já está disponível em acesso antecipado para geração de vídeo, com imagem e recursos adicionais sendo implementados de forma incremental.

Fique à frente da IA

A abordagem unificada do FLUX 3 para imagens, vídeo, áudio e robótica marca uma mudança notável na forma como os modelos generativos de IA estão sendo projetados. Para saber mais sobre a corrida da mídia generativa e os desenvolvimentos mais recentes em inteligência artificial, siga nossa cobertura notícias de última hora sobre IA.

Leia mais notícias sobre IA →