Black Forest Labs vydaly FLUX 3, multimodální základní model, který se podle společnosti společně učí z obrázků, videa a zvuku, aby vytvořil jedinou reprezentaci fyzického světa. FLUX 3, který byl ohlášen 23. července 2026 a nyní je k dispozici v předběžném přístupu, představuje významný architektonický odklon od přístupu založeného na jednotlivých modalitách, který dominuje generativní umělé inteligenci, srážející se vytváření obrázků, generování videa s nativním zvukem a dokonce i ovládání robotů do jednoho jednotného systému.
Uvedení na trh přichází v okamžiku zintenzivnění konkurence v generativním mediálním prostoru, kde hráči včetně Runway, OpenAI's Sora a Google's Veo závodí o produkci kvalitnějších a schopnějších video modelů. FLUX 3 vstupuje do této soutěže se zásadně odlišným předpokladem: že samostatné modely pro každý typ média jsou umělým omezením. Jeho pokrok je monitorován v rámci našeho probíhajícího pokrytí AI průmyslu o generativním mediálním prostředí.
Jednotný model reality
V blogovém příspěvku doprovázejícím vydání, Black Forest Labs položily teoretickou motivaci pro trénování jednoho modelu napříč více modalitami. Společnost tvrdila, že žádná jednotlivá modalita – ať už obraz, video nebo zvuk – neposkytuje úplný popis reality. Každý z nich je projekcí stejného základního fyzického světa, zachyceného různými senzory, z nichž každý v procesu ztrácí informace.
Obrázky zachycují prostorové struktury v určitém časovém okamžiku. Videa obnovují dimenzi času a odhalují časovou dynamiku a fyzikální zákony. Zvuk odhaluje kauzální vztahy mezi mechanickými jevy a akustikou, které zrak sám o sobě nedokáže detekovat. Jazyk spojuje tyto vjemy s cíli, abstrakcemi a pokyny, napsala společnost.
Tím, že se učí ze všech těchto současně, poskytnou vzájemná omezení modelu více informací než kterákoli jednotlivá modalita samotná. Zvuk musí odpovídat dopadu, pohyb se musí podřídit hmotě, budoucnost musí vyplývat z minulosti. Modality přestávají být oddělené a začínají být důkazem o jedné základní realitě.
FLUX 3 je první model společnosti postavený výhradně na tomto principu, který Black Forest Labs nazývá Self-Flow – přístup pro efektivní sladění multimodální generace a porozumění v rámci stejné základní architektury.
Generování videa s nativním zvukem
Nejpozoruhodnější schopností FLUX 3 je jeho schopnost generovat videa o délce až 20 sekund se synchronizovaným nativním zvukem v jediném generačním průchodu. To jej odlišuje od většiny existujících video modelů, které produkují tiché záběry, které je nutné spárovat se samostatně generovaným zvukem.
Podle společnosti je video výstup FLUX 3 obzvláště silný při zachycování výrazů lidské tváře, přiřazování zvuků k fyzickým událostem a podpoře vícejazyčných schopností. Tyto schopnosti lze kombinovat a vytvářet sekvence trvající několik minut, kde vizuální reference pomáhají zajistit, aby postavy zůstaly konzistentní ve všech scénách.
V předběžném lidském hodnocení provedeném během tréninku byl FLUX 3 upřednostněn před Runway Gen-4.5 v 77 % srovnání a před Luma Ray 3.2 v 93 % srovnání. Proti novějším konkurentům byl upřednostněn před Grok Imagine Video až v 69 % srovnání, Kling v3 Pro v 60 % a Seedance 2.0 a Gemini Omni Flash v 52 %.
Společnost varovala, že tyto výsledky jsou předběžné a že se během fáze včasného přístupu očekávají další zlepšení.
Obrázky a vykreslování textu
Kromě videa dokáže FLUX 3 syntetizovat a upravovat obrázky v široké škále stylů, poměrů stran a rozlišení. Black Forest Labs oznámila významná zlepšení oproti dřívějším verzím FLUX ve zpracování složitých výzev a generování přesného textu v obrázcích – což je trvalý problém pro generativní obrazové modely.
Fáze raného přístupu k funkcím FLUX 3 Image bude zahájena v týdnech po vydání videa, uvedla společnost.
Most k fyzické umělé inteligenci
Snad nejvíce nekonvenčním aspektem FLUX 3 je jeho rozšíření do robotiky. Pochopení světa tohoto modelu se rozšiřuje i na predikci akcí, vysvětlila společnost, přičemž se k fyzické umělé inteligenci ubírá dvěma cestami: integrací nativní predikce akcí přímo do FLUX 3 a použití předem připravené video páteře jako základu pro specializované akční modely vyladěné s omezenými daty pro konkrétní úkoly.
Black Forest Labs se spojily s mimic robotics, která byla mezi prvními společnostmi, které získaly včasný přístup k FLUX 3. Společně vyvinuli FLUX-mimic, video-akční model kombinující páteř FLUX 3 s odbornými znalostmi mimiků v učení robotů pro obratnou manipulaci. Podle společnosti se systém již testuje na reálných výrobních úkolech u Audi.
To představuje pozoruhodnou konvergenci: stejná základní technologie, která se používá k vytváření zábavního obsahu, se používá k ovládání fyzických robotů ve výrobních prostředích. Teze společnosti je, že fyzická umělá inteligence a tvorba obsahu běží na stejném základě, protože obojí vyžaduje model, který rozumí tomu, jak předměty drží pohromadě, jak se věci pohybují a jak fyzické události vytvářejí zvuk.
Konkurence a postavení na trhu
Uvedení na trh staví Black Forest Labs – berlínský startup stojící za široce používanými modely generování obrázků FLUX – jako ambicióznějšího konkurenta v prostoru generativní umělé inteligence. Zatímco společnosti jako Runway se zaměřily úzce na video a OpenAI na textové a multimodální chatboty, Black Forest Labs sází na to, že skutečně jednotný model napříč vizuálními, zvukovými a fyzickými doménami se ukáže schopnější než specializované alternativy.
Společnost uvedla, že již pracuje na nové generaci modelů s cílem sjednotit predikci vnímání, akce a jazyka ve stejném modelu. V nadcházejících týdnech a měsících zavede další funkce postavené na stejné základní multimodální architektuře přizpůsobení toku, z nichž každá bude následovat fázi včasného přístupu pro zpětnou vazbu a testování bezpečnosti.
FLUX 3 je nyní k dispozici v předběžném přístupu pro generování videa, s postupným zaváděním obrazu a dalších funkcí.
Stay Ahead of AI
Jednotný přístup FLUX 3 k obrázkům, videu, zvuku a robotice představuje významný posun v tom, jak jsou navrhovány generativní modely umělé inteligence. Chcete-li se dozvědět více o generativním mediálním závodě a nejnovějším vývoji v oblasti umělé inteligence, sledujte naše nejnovější zprávy o AI.
Přečtěte si další zprávy o AI →
