Black Forest Labs wypuściło FLUX 3, multimodalny model podstawowy, który według firmy wspólnie uczy się na podstawie obrazów, wideo i audio, aby zbudować pojedynczą reprezentację świata fizycznego. Ogłoszony 23 lipca 2026 r. i dostępny już we wczesnym dostępie, FLUX 3 stanowi znaczące odejście architektoniczne od podejścia opartego na modelu, które zdominowało generatywną sztuczną inteligencję, łączenie tworzenia obrazów, generowania wideo z natywnym dźwiękiem, a nawet sterowania robotami w jeden zunifikowany system.

Premiera następuje w momencie nasilającej się konkurencji w generatywnej przestrzeni medialnej, gdzie gracze, w tym Runway, Sora z OpenAI i Veo z Google, ścigają się, aby stworzyć wyższej jakości i bardziej wydajne modele wideo. FLUX 3 przystępuje do tego konkursu z zasadniczo innym założeniem: osobne modele dla każdego rodzaju nośnika stanowią sztuczne ograniczenie. Postępy w tej dziedzinie są monitorowane w ramach naszych bieżących relacjonowań branży sztucznej inteligencji na temat krajobrazu mediów generatywnych.

Ujednolicony model rzeczywistości

W poście na blogu towarzyszącym publikacji Black Forest Labs przedstawiło teoretyczną motywację do trenowania jednego modelu w wielu modalnościach. Firma argumentowała, że ​​żadna pojedyncza modalność – obraz, wideo czy dźwięk – nie zapewnia pełnego opisu rzeczywistości. Każdy z nich jest projekcją tego samego podstawowego świata fizycznego, przechwyconą przez różne czujniki, przy czym każdy z nich traci informacje.

Obrazy rejestrują struktury przestrzenne w określonym momencie. Filmy przywracają wymiar czasu i ukazują dynamikę czasową oraz prawa fizyczne. Dźwięk ujawnia związki przyczynowe pomiędzy zjawiskami mechanicznymi i akustyką, których nie jest w stanie wykryć sam wzrok. Język łączy te spostrzeżenia z celami, abstrakcjami i instrukcjami – napisała firma.

Ucząc się na wszystkich jednocześnie, wzajemne ograniczenia modelu dostarczają więcej informacji niż jakakolwiek pojedyncza modalność. Dźwięk musi pasować do uderzenia, ruch musi być posłuszny masie, przyszłość musi wynikać z przeszłości. Modalność przestaje być odrębna i zaczyna być dowodem na jedną leżącą u jej podstaw rzeczywistość.

FLUX 3 to pierwszy model firmy zbudowany w całości na tej zasadzie, którą Black Forest Labs nazywa Self-Flow — podejściem do skutecznego dostosowania generacji multimodalnej i zrozumienia w ramach tej samej podstawowej architektury.

Generowanie wideo z natywnym dźwiękiem

Najbardziej rzucającą się w oczy funkcją FLUX 3 jest możliwość generowania filmów o długości do 20 sekund ze zsynchronizowanym natywnym dźwiękiem w ramach jednej generacji. To odróżnia go od większości istniejących modeli wideo, które wytwarzają cichy materiał, który należy sparować z oddzielnie generowanym dźwiękiem.

Według firmy sygnał wideo FLUX 3 szczególnie dobrze radzi sobie z rejestrowaniem ludzkiej mimiki, kojarzeniem dźwięków ze zdarzeniami fizycznymi i obsługą wielu języków. Możliwości te można połączyć, tworząc sekwencje trwające kilka minut, w których odniesienia wizualne pomagają zapewnić spójność postaci we wszystkich scenach.

We wstępnej ocenie przeprowadzonej na ludziach podczas szkolenia, FLUX 3 był lepszy od Runway Gen-4.5 w 77% porównań i od Luma Ray 3.2 w 93% porównań. W porównaniu z nowszymi konkurentami aż w 69% porównań był lepszy od Grok Imagine Video, w 60% od Kling v3 Pro, a w 52% od Seedance 2.0 i Gemini Omni Flash.

Firma przestrzegła, że ​​wyniki te mają charakter wstępny i że w fazie wczesnego dostępu należy spodziewać się dalszych ulepszeń.

Renderowanie obrazów i tekstu

Oprócz wideo, FLUX 3 może syntetyzować i edytować obrazy w szerokiej gamie stylów, proporcji i rozdzielczości. Laboratoria Black Forest Labs zgłosiły znaczną poprawę w porównaniu z wcześniejszymi wersjami FLUX w zakresie obsługi złożonych komunikatów i generowania dokładnego tekstu w obrazach — co stanowi ciągłe wyzwanie dla generatywnych modeli obrazów.

Jak podała firma, faza wczesnego dostępu do możliwości FLUX 3 Image rozpocznie się w ciągu kilku tygodni po premierze wideo.

Most do fizycznej sztucznej inteligencji

Być może najbardziej niekonwencjonalnym aspektem FLUX 3 jest jego rozszerzenie na robotykę. Zrozumienie świata przez model rozciąga się na przewidywanie działań, wyjaśniła firma, wybierając dwie drogi do fizycznej sztucznej inteligencji: integrując natywne przewidywanie działań bezpośrednio z FLUX 3 i wykorzystując wstępnie wytrenowany szkielet wideo jako podstawę dla wyspecjalizowanych modeli działania dostrojonych przy użyciu ograniczonych danych dotyczących konkretnego zadania.

Black Forest Labs nawiązało współpracę z firmą Mimic Robotics, która była jedną z pierwszych firm, które uzyskały wcześniejszy dostęp do FLUX 3. Wspólnie opracowali FLUX-mimic, model akcji wideo łączący szkielet FLUX 3 z doświadczeniem mimika w uczeniu się robotów w celu zręcznej manipulacji. Według firmy system jest już testowany w Audi na rzeczywistych zadaniach produkcyjnych.

Stanowi to zauważalną zbieżność: ta sama technologia wykorzystywana do generowania treści rozrywkowych jest stosowana do sterowania robotami fizycznymi w środowiskach produkcyjnych. Teza firmy jest taka, że ​​fizyczna sztuczna inteligencja i tworzenie treści opierają się na tym samym fundamencie, ponieważ oba wymagają modelu, który rozumie, w jaki sposób obiekty trzymają się razem, jak się poruszają i w jaki sposób zdarzenia fizyczne wytwarzają dźwięk.

Konkurencja i pozycja rynkowa

Wprowadzenie na rynek pozycjonuje Black Forest Labs — berliński start-up stojący za szeroko stosowanymi modelami generowania obrazów FLUX — jako bardziej ambitnego konkurenta w obszarze generatywnej sztucznej inteligencji. Podczas gdy firmy takie jak Runway wąsko skupiły się na wideo, a OpenAI na chatbotach tekstowych i multimodalnych, Black Forest Labs obstawia, że ​​prawdziwie ujednolicony model obejmujący domeny wizualne, słuchowe i fizyczne okaże się skuteczniejszy niż wyspecjalizowane alternatywy.

Firma podała, że ​​pracuje już nad następną generacją modeli, których celem jest ujednolicenie przewidywania percepcji, działania i języka w tym samym modelu. W nadchodzących tygodniach i miesiącach wdrożone zostaną dodatkowe funkcje zbudowane na tej samej podstawowej architekturze dopasowywania przepływu multimodalnego, po fazie wczesnego dostępu w celu uzyskania informacji zwrotnej i testów bezpieczeństwa.

FLUX 3 jest już dostępny we wczesnym dostępie do generowania wideo, a obraz i dodatkowe funkcje są udostępniane stopniowo.

Wyprzedź sztuczną inteligencję

Ujednolicone podejście FLUX 3 do obrazów, wideo, audio i robotyki oznacza wyraźną zmianę w sposobie projektowania generatywnych modeli sztucznej inteligencji. Więcej informacji na temat wyścigu mediów generatywnych i najnowszych osiągnięć w dziedzinie sztucznej inteligencji znajdziesz w naszych najnowszych wiadomościach o sztucznej inteligencji.

Przeczytaj więcej aktualności o sztucznej inteligencji →