Black Forest Labs imetoa FLUX 3, muundo wa msingi wa multimodal ambao kampuni inasema kwa pamoja hujifunza kutoka kwa picha, video, na sauti ili kujenga uwakilishi mmoja wa ulimwengu wa kimwili. Ilitangazwa mnamo Julai 23, 2026, na sasa inapatikana katika ufikiaji wa mapema, FLUX 3 inawakilisha uondoaji muhimu wa usanifu kutoka kwa mbinu ya muundo-kwa-moduli ambayo imetawala AI generative, uundaji wa picha zinazoporomoka, uundaji wa video kwa sauti asilia, na hata udhibiti wa roboti kwenye mfumo mmoja uliounganishwa.
Uzinduzi huo unakuja wakati wa ushindani unaozidi kuongezeka katika anga ya vyombo vya habari generative, ambapo wachezaji ikiwa ni pamoja na Runway, OpenAI's Sora, na Veo ya Google wamekuwa mbio kuzalisha ubora wa juu na uwezo zaidi mifano video. FLUX 3 inaingia kwenye shindano hili ikiwa na dhana tofauti kimsingi: kwamba miundo tofauti kwa kila aina ya media ni kizuizi bandia. Maendeleo yake yanafuatiliwa kama sehemu ya matangazo yetu ya tasnia ya AI ya mandhari ya media wasilianifu.
Mfano Umoja wa Ukweli
Katika chapisho la blogi linaloandamana na toleo hilo, Maabara ya Msitu Nyeusi yaliweka motisha ya kinadharia ya kufunza mtindo mmoja katika njia nyingi. Kampuni ilisema kuwa hakuna mtindo mmoja - iwe picha, video, au sauti - hutoa maelezo kamili ya ukweli. Kila moja ni makadirio ya ulimwengu sawa wa kimwili, unaonaswa na vitambuzi tofauti, kila moja ikipoteza taarifa katika mchakato.
Picha hunasa miundo ya anga kwa wakati maalum. Video hurejesha ukubwa wa wakati na kufichua mienendo ya muda na sheria za asili. Sauti hufichua uhusiano wa sababu kati ya matukio ya kimitambo na acoustics ambayo maono pekee hayawezi kutambua. Lugha inaunganisha mitazamo hii na malengo, vifupisho, na maagizo, kampuni iliandika.
Kwa kujifunza kutoka kwa haya yote kwa wakati mmoja, vizuizi vya kuheshimiana vya mfano hutoa habari zaidi kuliko muundo wowote pekee. Sauti inapaswa kufanana na athari, mwendo unapaswa kutii wingi, siku zijazo zinapaswa kufuata kutoka zamani. Mitindo inaacha kuwa tofauti na kuanza kuwa ushahidi juu ya ukweli mmoja wa msingi.
FLUX 3 ndio muundo wa kwanza wa kampuni uliojengwa kwa msingi kabisa juu ya kanuni hii, ambayo Maabara ya Misitu Nyeusi huiita Self-Flow - mbinu ya kupangilia kwa ufanisi uundaji wa miundo mingi na uelewa ndani ya usanifu sawa wa msingi.
Uzalishaji wa Video Kwa Sauti Asilia
Uwezo unaovutia zaidi wa FLUX 3 ni uwezo wake wa kutoa video hadi sekunde 20 kwa urefu na sauti asili iliyosawazishwa katika pasi ya kizazi kimoja. Hii inaitofautisha na miundo mingi ya video iliyopo, ambayo hutoa picha za kimya ambazo lazima zioanishwe na sauti zinazotolewa kando.
Kulingana na kampuni hiyo, matokeo ya video ya FLUX 3 yana nguvu zaidi katika kunasa sura za uso wa binadamu, kuhusisha sauti na matukio ya kimwili, na kusaidia uwezo wa lugha nyingi. Uwezo huu unaweza kuunganishwa ili kuunda mfuatano unaochukua dakika kadhaa, ambapo marejeleo ya kuona husaidia kuhakikisha kuwa wahusika wanasalia sawa katika matukio yote.
Katika tathmini ya awali ya kibinadamu iliyofanywa wakati wa mafunzo, FLUX 3 ilipendelewa zaidi ya Runway Gen-4.5 katika 77% ya ulinganisho na zaidi ya Luma Ray 3.2 katika 93% ya ulinganisho. Dhidi ya washindani wapya zaidi, ilipendelewa zaidi ya Grok Imagine Video katika hadi 69% ya ulinganisho, Kling v3 Pro katika 60%, na Seedance 2.0 na Gemini Omni Flash katika 52%.
Kampuni ilitahadharisha kuwa matokeo haya ni ya awali na kwamba maboresho zaidi yanatarajiwa wakati wa awamu ya kufikia mapema.
Picha na Utoaji wa Maandishi
Zaidi ya video, FLUX 3 inaweza kuunganisha na kuhariri picha katika aina mbalimbali za mitindo, uwiano wa vipengele na maazimio. Black Forest Labs iliripoti maboresho makubwa zaidi ya matoleo ya awali ya FLUX katika kushughulikia vishawishi changamano na kutoa maandishi sahihi ndani ya picha - changamoto inayoendelea kwa miundo ya picha zinazozalishwa.
Awamu ya ufikiaji wa mapema ya uwezo wa Picha ya FLUX 3 itafunguliwa katika wiki zifuatazo kutolewa kwa video, kampuni hiyo ilisema.
Daraja kwa AI ya Kimwili
Labda kipengele kisicho cha kawaida cha FLUX 3 ni ugani wake katika robotiki. Uelewa wa ulimwengu wa mtindo huo unaenea hadi kwa utabiri wa hatua, kampuni ilielezea, kuchukua njia mbili kwa AI halisi: kuunganisha utabiri wa vitendo vya asili moja kwa moja kwenye FLUX 3, na kutumia uti wa mgongo wa video uliofunzwa kama msingi wa mifano maalum ya vitendo iliyopangwa vizuri na data ndogo maalum ya kazi.
Black Forest Labs ilishirikiana na roboti zinazoiga, ambayo ilikuwa miongoni mwa kampuni za kwanza kupata ufikiaji wa mapema kwa FLUX 3. Kwa pamoja walitengeneza FLUX-mimic, kielelezo cha vitendo vya video kinachochanganya uti wa mgongo wa FLUX 3 na utaalamu wa mimic katika kujifunza roboti kwa udanganyifu wa ustadi. Kulingana na kampuni hiyo, mfumo huo tayari unajaribiwa kwa kazi halisi za uzalishaji huko Audi.
Hii inawakilisha muunganiko mkubwa: teknolojia ile ile ya msingi inayotumiwa kuzalisha maudhui ya burudani inatumika kudhibiti roboti halisi katika mazingira ya utengenezaji. Nadharia ya kampuni ni kwamba AI halisi na uundaji wa yaliyomo huendeshwa kwa msingi sawa, kwa sababu zote zinahitaji kielelezo kinachoelewa jinsi vitu hushikana, jinsi mambo yanavyosonga, na jinsi matukio ya kimwili hutoa sauti.
Ushindani na Nafasi ya Soko
Uzinduzi huweka Maabara ya Misitu Nyeusi - uanzishaji wa msingi wa Berlin nyuma ya mifano ya utengenezaji wa picha za FLUX - kama mshindani anayetamani zaidi katika nafasi ya uzalishaji ya AI. Ingawa kampuni kama Runway zimeangazia video na OpenAI kwa maandishi na chatbots za aina nyingi, Black Forest Labs inaweka dau kuwa kielelezo kilichounganishwa kikweli katika vikoa vinavyoonekana, vya kusikia na vinavyoonekana vitathibitisha uwezo zaidi kuliko njia mbadala maalum.
Kampuni hiyo ilisema tayari inafanyia kazi kizazi kijacho cha wanamitindo, kwa lengo la kuunganisha mitazamo, hatua, na utabiri wa lugha katika mtindo huo huo. Katika wiki na miezi ijayo, itazindua uwezo wa ziada uliojengwa kutoka kwa usanifu sawa wa ulinganishaji wa mtiririko wa aina nyingi, kila moja ikifuata hatua ya mapema ya ufikiaji wa maoni na majaribio ya usalama.
FLUX 3 inapatikana sasa katika ufikiaji wa mapema kwa utengenezaji wa video, na picha na uwezo wa ziada unaendelea kwa kasi.
Kaa Mbele ya AI
Mbinu ya umoja ya FLUX 3 ya picha, video, sauti na roboti inaashiria mabadiliko makubwa katika jinsi miundo genereshi ya AI inavyoundwa. Kwa zaidi kuhusu mbio za vyombo vya habari wasilianifu na matukio mapya zaidi katika akili bandia, fuata habari zetu zinazochipuka za AI](https://aibuzzwire.news).
Soma habari zaidi za AI →
