Black Forest Labs har släppt FLUX 3, en multimodal grundmodell som företaget säger gemensamt lär sig från bilder, video och ljud för att bygga en enda representation av den fysiska världen. Tillkännagav den 23 juli 2026, och nu tillgänglig i tidig åtkomst, representerar FLUX 3 en betydande arkitektonisk avvikelse från den modell för modalitet som har dominerat generativ AI, kollapsande bildskapande, videogenerering med inbyggt ljud och till och med robotstyrning i ett enhetligt system.
Lanseringen kommer i ett ögonblick av hårdnande konkurrens inom det generativa mediautrymmet, där spelare inklusive Runway, OpenAIs Sora och Googles Veo har tävlat om att producera videomodeller med högre kvalitet och mer kapabla. FLUX 3 enters this contest with a fundamentally different premise: that separate models for each media type are an artificial limitation. Its progress is being monitored as part of our ongoing AI industry coverage of the generative media landscape.
En enhetlig modell av verkligheten
I ett blogginlägg som åtföljer releasen, presenterade Black Forest Labs den teoretiska motivationen för att träna en enda modell över flera modaliteter. The company argued that no single modality — whether image, video, or audio — provides a complete description of reality. Each is a projection of the same underlying physical world, captured by different sensors, each losing information in the process.
Images capture spatial structures at a specific point in time. Videos restore the dimension of time and reveal temporal dynamics and physical laws. Audio reveals causal relationships between mechanical phenomena and acoustics that vision alone cannot detect. Language links these perceptions to goals, abstractions, and instructions, the company wrote.
By learning from all of these simultaneously, the model's mutual constraints provide more information than any single modality alone. The sound has to match the impact, the motion has to obey the mass, the future has to follow from the past. The modalities stop being separate and start being evidence about one underlying reality.
FLUX 3 är företagets första modell byggd helt på denna princip, som Black Forest Labs kallar Self-Flow – ett tillvägagångssätt för att effektivt anpassa multimodal generation och förståelse inom samma underliggande arkitektur.
Videogenerering med inbyggt ljud
Den mest omedelbart slående förmågan hos FLUX 3 är dess förmåga att generera videor på upp till 20 sekunder med synkroniserat inbyggt ljud i ett enda generationspass. This distinguishes it from most existing video models, which produce silent footage that must be paired with separately generated audio.
Enligt företaget är FLUX 3:s videoutgång särskilt stark när det gäller att fånga mänskliga ansiktsuttryck, associera ljud med fysiska händelser och stödja flerspråkig kapacitet. Dessa funktioner kan kombineras för att skapa sekvenser som varar i flera minuter, där visuella referenser hjälper till att säkerställa att karaktärerna förblir konsekventa i alla scener.
I den preliminära mänskliga utvärderingen som genomfördes under träningen föredrogs FLUX 3 framför Runway Gen-4.5 i 77 % av jämförelserna och framför Luma Ray 3.2 i 93 % av jämförelserna. Mot nyare konkurrenter föredrogs den framför Grok Imagine Video i upp till 69 % av jämförelserna, Kling v3 Pro i 60 % och Seedance 2.0 och Gemini Omni Flash i 52 %.
The company cautioned that these results are preliminary and that further improvements are expected during the early access phase.
Bilder och textåtergivning
Beyond video, FLUX 3 can synthesize and edit images across a wide variety of styles, aspect ratios, and resolutions. Black Forest Labs rapporterade betydande förbättringar jämfört med tidigare FLUX-versioner när det gäller att hantera komplexa uppmaningar och generera korrekt text i bilder - en ihållande utmaning för generativa bildmodeller.
An early access phase for FLUX 3 Image capabilities will open in the weeks following the video release, the company said.
En bro till fysisk AI
Perhaps the most unconventional aspect of FLUX 3 is its extension into robotics. Modellens världsförståelse sträcker sig till handlingsförutsägelse, förklarade företaget, och tog två vägar till fysisk AI: att integrera inbyggd handlingsförutsägelse direkt i FLUX 3 och att använda den förtränade videoryggraden som en grund för specialiserade handlingsmodeller finjusterade med begränsad uppgiftsspecifik data.
Black Forest Labs samarbetade med mimic robotics, som var bland de första företagen att få tidig tillgång till FLUX 3. Tillsammans utvecklade de FLUX-mimic, en videoactionmodell som kombinerar FLUX 3-ryggraden med mimics expertis inom robotinlärning för skicklig manipulation. Enligt företaget testas systemet redan på riktiga produktionsuppgifter hos Audi.
Detta representerar en anmärkningsvärd konvergens: samma underliggande teknik som används för att generera underhållningsinnehåll används för att styra fysiska robotar i tillverkningsmiljöer. Företagets tes är att fysisk AI och innehållsskapande körs på samma grund, eftersom båda kräver en modell som förstår hur objekt håller ihop, hur saker rör sig och hur fysiska händelser producerar ljud.
Konkurrens och marknadsposition
Lanseringen positionerar Black Forest Labs – den Berlin-baserade startupen bakom de mycket använda FLUX-bildgenereringsmodellerna – som en mer ambitiös konkurrent i det generativa AI-området. Medan företag som Runway har fokuserat snävt på video och OpenAI på text och multimodala chatbots, satsar Black Forest Labs på att en verkligt enhetlig modell över visuella, auditiva och fysiska domäner kommer att visa sig mer kapabel än specialiserade alternativ.
Företaget sa att det redan arbetar med nästa generations modeller, med ett mål att förena perceptuell, handling och språkförutsägelse i samma modell. Under de kommande veckorna och månaderna kommer det att rulla ut ytterligare funktioner byggda från samma underliggande multimodala flödesmatchningsarkitektur, var och en efter en tidig åtkomstfas för feedback och säkerhetstestning.
FLUX 3 är tillgänglig nu i tidig tillgång för videogenerering, med bild och ytterligare funktioner som rullas ut stegvis.
Stay ahead of AI
FLUX 3:s enhetliga inställning till bilder, video, ljud och robotteknik markerar en anmärkningsvärd förändring i hur generativa AI-modeller utformas. För mer om det generativa medieloppet och den senaste utvecklingen inom artificiell intelligens, följ vår brytande AI-nyheter bevakning.
Läs mer AI-nyheter →
