Black Forest Labs heeft FLUX 3 uitgebracht, een multimodaal basismodel dat volgens het bedrijf gezamenlijk leert van afbeeldingen, video en audio om een ​​enkele representatie van de fysieke wereld te bouwen. FLUX 3, aangekondigd op 23 juli 2026 en nu beschikbaar in vroege toegang, vertegenwoordigt een significante architectonische afwijking van de model-voor-modaliteitsbenadering die generatieve AI, de ineenstorting van beeldcreatie, videogeneratie met native geluid en zelfs robotbesturing in één verenigd systeem heeft gedomineerd.

De lancering komt op een moment van toenemende concurrentie in de generatieve mediaruimte, waar spelers als Runway, OpenAI's Sora en Google's Veo racen om videomodellen van hogere kwaliteit en capabeler te produceren. FLUX 3 doet mee aan deze wedstrijd met een fundamenteel ander uitgangspunt: dat afzonderlijke modellen voor elk mediatype een kunstmatige beperking zijn. De voortgang ervan wordt gemonitord als onderdeel van onze voortdurende [AI-industrieverslaggeving] (https://aibuzzwire.new) over het generatieve medialandschap.

Een verenigd werkelijkheidsmodel

In een blogpost bij de release legde Black Forest Labs de theoretische motivatie uiteen voor het trainen van één enkel model over meerdere modaliteiten. Het bedrijf voerde aan dat geen enkele modaliteit – of het nu beeld, video of audio is – een volledige beschrijving van de werkelijkheid biedt. Elk is een projectie van dezelfde onderliggende fysieke wereld, vastgelegd door verschillende sensoren, waarbij elke sensor informatie verliest.

Afbeeldingen leggen ruimtelijke structuren op een specifiek tijdstip vast. Video's herstellen de dimensie van tijd en onthullen temporele dynamiek en natuurwetten. Audio onthult causale relaties tussen mechanische verschijnselen en akoestiek die het gezichtsvermogen alleen niet kan detecteren. Taal koppelt deze percepties aan doelen, abstracties en instructies, schreef het bedrijf.

Door van al deze factoren tegelijkertijd te leren, bieden de wederzijdse beperkingen van het model meer informatie dan welke afzonderlijke modaliteit dan ook. Het geluid moet de impact evenaren, de beweging moet de massa gehoorzamen, de toekomst moet uit het verleden volgen. De modaliteiten zijn niet langer gescheiden, maar beginnen een bewijs te zijn van één onderliggende realiteit.

FLUX 3 is het eerste model van het bedrijf dat volledig op dit principe is gebouwd, dat Black Forest Labs Self-Flow noemt – een aanpak voor het efficiënt afstemmen van multimodale opwekking en begrip binnen dezelfde onderliggende architectuur.

Videogeneratie met native audio

Het meest opvallende kenmerk van FLUX 3 is de mogelijkheid om in één generatie video's van maximaal 20 seconden met gesynchroniseerde native audio te genereren. Dit onderscheidt het van de meeste bestaande videomodellen, die stille beelden produceren die moeten worden gecombineerd met afzonderlijk gegenereerde audio.

Volgens het bedrijf is de video-uitvoer van FLUX 3 bijzonder sterk in het vastleggen van menselijke gezichtsuitdrukkingen, het associëren van geluiden met fysieke gebeurtenissen en het ondersteunen van meertalige mogelijkheden. Deze mogelijkheden kunnen worden gecombineerd om reeksen van meerdere minuten te creëren, waarbij visuele referenties ervoor zorgen dat de personages consistent blijven in alle scènes.

Bij voorlopige menselijke evaluatie tijdens de training kreeg FLUX 3 de voorkeur boven Runway Gen-4.5 in 77% van de vergelijkingen en boven Luma Ray 3.2 in 93% van de vergelijkingen. Ten opzichte van nieuwere concurrenten kreeg het de voorkeur boven Grok Imagine Video in maximaal 69% van de vergelijkingen, Kling v3 Pro in 60% en Seedance 2.0 en Gemini Omni Flash in 52%.

Het bedrijf waarschuwde dat deze resultaten voorlopig zijn en dat verdere verbeteringen worden verwacht tijdens de vroege toegangsfase.

Afbeeldingen en tekstweergave

Naast video kan FLUX 3 ook afbeeldingen synthetiseren en bewerken in een grote verscheidenheid aan stijlen, beeldverhoudingen en resoluties. Black Forest Labs rapporteerde aanzienlijke verbeteringen ten opzichte van eerdere FLUX-versies bij het verwerken van complexe aanwijzingen en het genereren van nauwkeurige tekst in afbeeldingen – een aanhoudende uitdaging voor generatieve beeldmodellen.

Een vroege toegangsfase voor FLUX 3 Image-mogelijkheden zal ingaan in de weken na de videorelease, aldus het bedrijf.

Een brug naar fysieke AI

Misschien wel het meest onconventionele aspect van FLUX 3 is de uitbreiding ervan naar robotica. Het wereldbegrip van het model strekt zich uit tot actievoorspelling, legde het bedrijf uit, waarbij twee routes naar fysieke AI worden gevolgd: het integreren van native actievoorspelling rechtstreeks in FLUX 3, en het gebruiken van de vooraf getrainde video-backbone als basis voor gespecialiseerde actiemodellen die zijn verfijnd met beperkte taakspecifieke gegevens.

Black Forest Labs werkte samen met mimic robotics, een van de eerste bedrijven die vroege toegang kreeg tot FLUX 3. Samen ontwikkelden ze FLUX-mimic, een video-actiemodel dat de FLUX 3-backbone combineert met de expertise van mimic op het gebied van robotleren voor behendige manipulatie. Volgens het bedrijf wordt het systeem bij Audi al getest op echte productietaken.

Dit vertegenwoordigt een opmerkelijke convergentie: dezelfde onderliggende technologie die wordt gebruikt om entertainmentinhoud te genereren, wordt toegepast om fysieke robots in productieomgevingen te besturen. De stelling van het bedrijf is dat fysieke AI en contentcreatie op dezelfde basis draaien, omdat beide een model vereisen dat begrijpt hoe objecten bij elkaar blijven, hoe dingen bewegen en hoe fysieke gebeurtenissen geluid produceren.

Concurrentie en marktpositie

De lancering positioneert Black Forest Labs – de in Berlijn gevestigde startup achter de veelgebruikte FLUX-beeldgeneratiemodellen – als een ambitieuzere concurrent in de generatieve AI-ruimte. Terwijl bedrijven als Runway zich uitsluitend hebben gericht op video en OpenAI op tekst en multimodale chatbots, gokt Black Forest Labs erop dat een werkelijk uniform model over visuele, auditieve en fysieke domeinen capabeler zal blijken te zijn dan gespecialiseerde alternatieven.

Het bedrijf zei dat het al werkt aan de volgende generatie modellen, met als doel perceptuele, actie- en taalvoorspellingen in hetzelfde model te verenigen. In de komende weken en maanden zal het aanvullende mogelijkheden uitrollen die zijn opgebouwd uit dezelfde onderliggende multimodale flow matching-architectuur, elk na een vroege toegangsfase voor feedback en veiligheidstests.

FLUX 3 is nu beschikbaar in vroege toegang voor het genereren van video, waarbij beeld- en aanvullende mogelijkheden stapsgewijs worden uitgerold.

Blijf AI een stap voor

De uniforme benadering van FLUX 3 van afbeeldingen, video, audio en robotica markeert een opmerkelijke verschuiving in de manier waarop generatieve AI-modellen worden ontworpen. Voor meer informatie over de generatieve mediarace en de nieuwste ontwikkelingen op het gebied van kunstmatige intelligentie kunt u ons breaking AI news volgen.

Lees meer AI-nieuws →