Black Forest Labs a lansat FLUX 3, un model de fundație multimodal despre care compania spune că învață împreună din imagini, video și audio pentru a construi o singură reprezentare a lumii fizice. Anunțat pe 23 iulie 2026 și acum disponibil în acces anticipat, FLUX 3 reprezintă o abatere arhitecturală semnificativă de la abordarea model-cu-modalitate care a dominat AI generativă, crearea de imagini prăbușită, generarea video cu sunet nativ și chiar controlul robotului într-un singur sistem unificat.
Lansarea vine într-un moment de intensificare a concurenței în spațiul media generativ, în care jucători precum Runway, Sora de la OpenAI și Veo de la Google s-au întrecut pentru a produce modele video de calitate superioară și mai capabile. FLUX 3 intră în acest concurs cu o premisă fundamental diferită: că modelele separate pentru fiecare tip de media reprezintă o limitare artificială. Progresul său este monitorizat ca parte a [acoperirii industriei AI] (https://aibuzzwire.news) în curs de desfășurare a peisajului media generativ.
Un model unificat al realității
Într-o postare pe blog care însoțește lansarea, Black Forest Labs a prezentat motivația teoretică pentru formarea unui singur model în mai multe modalități. Compania a susținut că nicio modalitate unică – fie imagine, video sau audio – nu oferă o descriere completă a realității. Fiecare este o proiecție a aceleiași lumi fizice subiacente, capturată de diferiți senzori, fiecare pierzând informații în acest proces.
Imaginile captează structuri spațiale la un anumit moment în timp. Videoclipurile restaurează dimensiunea timpului și dezvăluie dinamica temporală și legile fizice. Audio dezvăluie relații cauzale între fenomenele mecanice și acustică pe care vederea singură nu le poate detecta. Limbajul leagă aceste percepții de obiective, abstractizări și instrucțiuni, a scris compania.
Învățând din toate acestea simultan, constrângerile reciproce ale modelului oferă mai multe informații decât orice modalitate singură. Sunetul trebuie să se potrivească cu impactul, mișcarea trebuie să se supună masei, viitorul trebuie să urmeze din trecut. Modalitățile nu mai sunt separate și încep să fie dovezi despre o realitate subiacentă.
FLUX 3 este primul model al companiei construit în întregime pe acest principiu, pe care Black Forest Labs îl numește Self-Flow - o abordare pentru alinierea eficientă a generației și înțelegerii multimodale în cadrul aceleiași arhitecturi subiacente.
Generare video cu audio nativ
Cea mai uimitoare capacitate a FLUX 3 este capacitatea sa de a genera videoclipuri de până la 20 de secunde cu audio nativ sincronizat într-o singură trecere de generație. Acest lucru îl deosebește de majoritatea modelelor video existente, care produc imagini silențioase care trebuie asociate cu sunetul generat separat.
Potrivit companiei, ieșirea video a lui FLUX 3 este deosebit de puternică în capturarea expresiilor faciale umane, asocierea sunetelor cu evenimente fizice și susținerea capacităților multilingve. Aceste capabilități pot fi combinate pentru a crea secvențe care durează câteva minute, în care referințele vizuale ajută la asigurarea faptului că personajele rămân consistente în toate scenele.
În evaluarea umană preliminară efectuată în timpul antrenamentului, FLUX 3 a fost preferat față de Runway Gen-4.5 în 77% din comparații și față de Luma Ray 3.2 în 93% din comparații. Față de concurenții mai noi, a fost preferat față de Grok Imagine Video în până la 69% din comparații, Kling v3 Pro în 60% și Seedance 2.0 și Gemini Omni Flash în 52%.
Compania a avertizat că aceste rezultate sunt preliminare și că sunt așteptate îmbunătățiri suplimentare în faza de acces timpuriu.
Redare imagini și text
Dincolo de videoclipuri, FLUX 3 poate sintetiza și edita imagini într-o mare varietate de stiluri, raporturi de aspect și rezoluții. Black Forest Labs a raportat îmbunătățiri semnificative față de versiunile anterioare FLUX în gestionarea solicitărilor complexe și generarea de text precis în imagini - o provocare persistentă pentru modelele de imagini generative.
O fază de acces timpuriu pentru capabilitățile FLUX 3 Image se va deschide în săptămânile următoare lansării video, a spus compania.
O punte către IA fizică
Poate cel mai neconvențional aspect al FLUX 3 este extinderea sa în robotică. Înțelegerea lumii a modelului se extinde la predicția acțiunii, a explicat compania, urmând două căi către IA fizică: integrarea predicției native a acțiunii direct în FLUX 3 și utilizarea coloanei vertebrale video preantrenate ca bază pentru modele de acțiune specializate ajustate cu date limitate specifice sarcinii.
Black Forest Labs a colaborat cu robotica mimic, care a fost printre primele companii care au obținut acces timpuriu la FLUX 3. Împreună au dezvoltat FLUX-mimic, un model de acțiune video care combină coloana vertebrală FLUX 3 cu experiența mimic în învățarea robotilor pentru manipulare cu dibăcie. Potrivit companiei, sistemul este deja testat pe sarcini reale de producție la Audi.
Aceasta reprezintă o convergență notabilă: aceeași tehnologie de bază folosită pentru a genera conținut de divertisment este aplicată pentru a controla roboții fizici în mediile de producție. Teza companiei este că inteligența artificială fizică și crearea de conținut rulează pe aceeași bază, deoarece ambele necesită un model care să înțeleagă cum obiectele țin împreună, cum se mișcă lucrurile și cum evenimentele fizice produc sunet.
Concurență și poziție pe piață
Lansarea poziționează Black Forest Labs – startup-ul cu sediul în Berlin, care se află în spatele modelelor de generare de imagini FLUX utilizate pe scară largă – ca un concurent mai ambițios în spațiul AI generativ. În timp ce companii precum Runway s-au concentrat îndeaproape pe video și OpenAI pe text și chatbot multimodali, Black Forest Labs pariază că un model cu adevărat unificat în domenii vizuale, auditive și fizice se va dovedi mai capabil decât alternativele specializate.
Compania a spus că lucrează deja la următoarea generație de modele, cu scopul de a unifica predicția perceptivă, acțiunii și limbajului în același model. În următoarele săptămâni și luni, va lansa capabilități suplimentare construite din aceeași arhitectură subiacentă de potrivire a fluxului multimodal, fiecare urmând o fază de acces timpuriu pentru feedback și testare de siguranță.
FLUX 3 este disponibil acum în acces timpuriu pentru generarea video, cu imagini și capabilități suplimentare care se lansează progresiv.
Stai înaintea AI
Abordarea unificată a FLUX 3 asupra imaginilor, video, audio și robotică marchează o schimbare notabilă în modul în care sunt proiectate modelele AI generative. Pentru mai multe despre cursa media generativă și despre cele mai recente evoluții în domeniul inteligenței artificiale, urmăriți știrile de ultimă oră AI.
Citiți mai multe știri AI →
