Black Forest Labs telah mengeluarkan FLUX 3, model asas multimodal yang dikatakan syarikat itu belajar bersama daripada imej, video dan audio untuk membina satu perwakilan dunia fizikal. Diumumkan pada 23 Julai 2026, dan kini tersedia dalam akses awal, FLUX 3 mewakili perubahan seni bina yang ketara daripada pendekatan model demi mod yang telah mendominasi AI generatif, penciptaan imej yang runtuh, penjanaan video dengan bunyi asli dan juga kawalan robot ke dalam satu sistem bersatu.
Pelancaran tiba pada saat persaingan yang semakin sengit dalam ruang media generatif, di mana pemain termasuk Runway, OpenAI's Sora, dan Google's Veo telah berlumba-lumba untuk menghasilkan model video yang lebih berkualiti dan lebih berkebolehan. FLUX 3 menyertai peraduan ini dengan premis yang berbeza secara asasnya: bahawa model berasingan untuk setiap jenis media adalah had buatan. Kemajuannya sedang dipantau sebagai sebahagian daripada [liputan industri AI] kami yang berterusan (https://aibuzzwire.news) bagi landskap media generatif.
Model Realiti Bersatu
Dalam catatan blog yang mengiringi keluaran itu, Black Forest Labs membentangkan motivasi teori untuk melatih satu model merentasi pelbagai modaliti. Syarikat itu berhujah bahawa tiada modaliti tunggal - sama ada imej, video atau audio - memberikan penerangan lengkap tentang realiti. Setiap satu adalah unjuran dunia fizikal asas yang sama, ditangkap oleh penderia yang berbeza, setiap satu kehilangan maklumat dalam proses.
Imej menangkap struktur spatial pada masa tertentu. Video memulihkan dimensi masa dan mendedahkan dinamik temporal dan undang-undang fizikal. Audio mendedahkan hubungan sebab akibat antara fenomena mekanikal dan akustik yang tidak dapat dikesan oleh penglihatan sahaja. Bahasa menghubungkan persepsi ini kepada matlamat, abstraksi, dan arahan, tulis syarikat itu.
Dengan belajar daripada semua ini secara serentak, kekangan bersama model memberikan lebih banyak maklumat daripada mana-mana modaliti sahaja. Bunyi perlu sepadan dengan kesan, gerakan perlu mematuhi jisim, masa depan harus mengikuti dari masa lalu. Modaliti berhenti menjadi berasingan dan mula menjadi bukti tentang satu realiti asas.
FLUX 3 ialah model pertama syarikat yang dibina sepenuhnya berdasarkan prinsip ini, yang dinamakan oleh Black Forest Labs Self-Flow — pendekatan untuk menjajarkan penjanaan dan pemahaman pelbagai mod dengan cekap dalam seni bina asas yang sama.
Penjanaan Video Dengan Audio Asli
Keupayaan FLUX 3 yang paling ketara serta-merta ialah keupayaannya untuk menjana video sepanjang 20 saat dengan audio asli yang disegerakkan dalam pas generasi tunggal. Ini membezakannya daripada kebanyakan model video sedia ada, yang menghasilkan rakaman senyap yang mesti dipasangkan dengan audio yang dijana secara berasingan.
Menurut syarikat itu, output video FLUX 3 sangat kuat dalam menangkap ekspresi muka manusia, mengaitkan bunyi dengan peristiwa fizikal dan menyokong keupayaan berbilang bahasa. Keupayaan ini boleh digabungkan untuk mencipta urutan yang berlangsung beberapa minit, di mana rujukan visual membantu memastikan watak kekal konsisten merentas semua adegan.
Dalam penilaian awal manusia yang dijalankan semasa latihan, FLUX 3 diutamakan berbanding Runway Gen-4.5 dalam 77% perbandingan dan mengatasi Luma Ray 3.2 dalam 93% perbandingan. Berbanding pesaing baharu, ia diutamakan berbanding Grok Imagine Video dalam sehingga 69% perbandingan, Kling v3 Pro dalam 60% dan Seedance 2.0 dan Gemini Omni Flash dalam 52%.
Syarikat itu memberi amaran bahawa keputusan ini adalah awal dan penambahbaikan selanjutnya dijangka semasa fasa akses awal.
Imej dan Penyampaian Teks
Di luar video, FLUX 3 boleh mensintesis dan mengedit imej merentas pelbagai gaya, nisbah bidang dan peleraian. Black Forest Labs melaporkan peningkatan ketara berbanding versi FLUX terdahulu dalam mengendalikan gesaan kompleks dan menjana teks yang tepat dalam imej — cabaran berterusan untuk model imej generatif.
Fasa akses awal untuk keupayaan Imej FLUX 3 akan dibuka dalam beberapa minggu selepas keluaran video, kata syarikat itu.
Jambatan ke AI Fizikal
Mungkin aspek FLUX 3 yang paling tidak konvensional ialah lanjutannya kepada robotik. Pemahaman dunia model itu meluas kepada ramalan tindakan, jelas syarikat itu, mengambil dua laluan ke AI fizikal: menyepadukan ramalan tindakan asli terus ke FLUX 3, dan menggunakan tulang belakang video terlatih sebagai asas untuk model tindakan khusus yang diperhalusi dengan data khusus tugasan terhad.
Black Forest Labs bekerjasama dengan robotik meniru, yang merupakan antara syarikat pertama yang mendapat akses awal kepada FLUX 3. Bersama-sama mereka membangunkan FLUX-mimic, model tindakan video yang menggabungkan tulang belakang FLUX 3 dengan kepakaran mimic dalam pembelajaran robot untuk manipulasi yang cekap. Menurut syarikat itu, sistem itu sudah diuji pada tugas pengeluaran sebenar di Audi.
Ini mewakili penumpuan yang ketara: teknologi asas yang sama digunakan untuk menjana kandungan hiburan sedang digunakan untuk mengawal robot fizikal dalam persekitaran pembuatan. Tesis syarikat ialah AI fizikal dan penciptaan kandungan berjalan di atas asas yang sama, kerana kedua-duanya memerlukan model yang memahami cara objek bersatu, cara benda bergerak dan cara peristiwa fizikal menghasilkan bunyi.
Persaingan dan Kedudukan Pasaran
Pelancaran itu meletakkan Black Forest Labs — syarikat permulaan yang berpangkalan di Berlin di belakang model penjanaan imej FLUX yang digunakan secara meluas — sebagai pesaing yang lebih bercita-cita tinggi dalam ruang AI generatif. Walaupun syarikat seperti Runway telah memfokuskan secara sempit pada video dan OpenAI pada teks dan chatbot berbilang mod, Black Forest Labs bertaruh bahawa model yang benar-benar bersatu merentas domain visual, pendengaran dan fizikal akan terbukti lebih berkemampuan daripada alternatif khusus.
Syarikat itu berkata ia sedang mengusahakan model generasi akan datang, dengan matlamat untuk menyatukan persepsi, tindakan dan ramalan bahasa dalam model yang sama. Sepanjang minggu dan bulan akan datang, ia akan melancarkan keupayaan tambahan yang dibina daripada seni bina padanan aliran multimodal asas yang sama, setiap satu mengikuti fasa akses awal untuk maklum balas dan ujian keselamatan.
FLUX 3 kini tersedia dalam akses awal untuk penjanaan video, dengan imej dan keupayaan tambahan dilancarkan secara berperingkat.
Kekal Mendahului AI
Pendekatan bersepadu FLUX 3 terhadap imej, video, audio dan robotik menandakan perubahan ketara dalam cara model AI generatif direka bentuk. Untuk mendapatkan maklumat lanjut tentang perlumbaan media generatif dan perkembangan terkini merentas kecerdasan buatan, ikuti liputan berita terkini AI kami.
Baca lebih banyak berita AI →
