Black Forest Labs, şirketin fiziksel dünyanın tek bir temsilini oluşturmak için görüntülerden, videolardan ve seslerden ortaklaşa öğrendiğini söylediği çok modlu bir temel modeli olan FLUX 3'ü piyasaya sürdü. 23 Temmuz 2026'da duyurulan ve şu anda erken erişime sunulan FLUX 3, üretken yapay zekaya hakim olan, görüntü oluşturmayı, yerel sesle video oluşturmayı ve hatta robot kontrolünü tek bir birleşik sistemde çökerten model bazında yaklaşımdan önemli bir mimari farklılığı temsil ediyor.

Lansman, Runway, OpenAI'den Sora ve Google'dan Veo gibi oyuncuların daha yüksek kaliteli ve daha yetenekli video modelleri üretmek için yarıştığı, üretken medya alanındaki rekabetin yoğunlaştığı bir zamanda gerçekleşti. FLUX 3 bu yarışmaya temelde farklı bir önermeyle katılıyor: her medya türü için ayrı modellerin yapay bir sınırlama olduğu. Gelişimi, üretken medya ortamına ilişkin devam eden Yapay Zeka sektörü haberimizin bir parçası olarak izleniyor.

Birleşik Bir Gerçeklik Modeli

Sürüme eşlik eden bir blog yazısında Black Forest Labs, tek bir modeli birden fazla yöntemde eğitmeye yönelik teorik motivasyonu ortaya koydu. Şirket, görüntü, video veya ses gibi hiçbir yöntemin gerçekliğin tam bir tanımını sağlamadığını savundu. Her biri, farklı sensörler tarafından yakalanan, aynı temel fiziksel dünyanın bir yansımasıdır ve her biri süreç içinde bilgi kaybeder.

Görüntüler, zamanın belirli bir noktasındaki mekansal yapıları yakalar. Videolar zamanın boyutunu yeniden canlandırıyor ve zamansal dinamikleri ve fiziksel yasaları ortaya çıkarıyor. Ses, mekanik olaylar ile akustik arasındaki, görmenin tek başına tespit edemeyeceği nedensel ilişkileri ortaya çıkarır. Şirket, dilin bu algıları hedeflere, soyutlamalara ve talimatlara bağladığını yazdı.

Bunların hepsinden aynı anda öğrenerek, modelin karşılıklı kısıtlamaları tek başına herhangi bir modaliteden daha fazla bilgi sağlar. Sesin darbeye uyması, hareketin kütleye uyması, geleceğin geçmişten takip etmesi gerekiyor. Modaliteler ayrı olmayı bırakır ve altta yatan tek bir gerçekliğe dair kanıt olmaya başlar.

FLUX 3, şirketin tamamıyla Black Forest Labs'ın Self-Flow olarak adlandırdığı bu prensip üzerine inşa edilmiş ilk modelidir; multimodal üretimi ve anlayışı aynı temel mimari içinde verimli bir şekilde hizalamaya yönelik bir yaklaşım.

Yerel Sesle Video Oluşturma

FLUX 3'ün en göze çarpan özelliği, tek nesil geçişte senkronize doğal ses ile 20 saniyeye kadar uzunlukta videolar oluşturma yeteneğidir. Bu, onu, ayrı olarak oluşturulan sesle eşleştirilmesi gereken sessiz görüntüler üreten mevcut video modellerinin çoğundan ayırır.

Şirkete göre FLUX 3'ün video çıkışı özellikle insan yüz ifadelerini yakalama, sesleri fiziksel olaylarla ilişkilendirme ve çok dilli yetenekleri destekleme konusunda güçlü. Bu yetenekler, görsel referansların karakterlerin tüm sahnelerde tutarlı kalmasını sağlamaya yardımcı olduğu, birkaç dakika süren sekanslar oluşturmak için birleştirilebilir.

Eğitim sırasında yapılan ön insan değerlendirmesinde, karşılaştırmaların %77'sinde Runway Gen-4.5'e ve %93'ünde Luma Ray 3.2'ye göre FLUX 3 tercih edildi. Daha yeni rakiplere karşı karşılaştırmalarda %69'a varan oranlarda Grok Imagine Video'ya, %60'a varan oranlarda Kling v3 Pro'ya ve %52'ye varan oranda Sedance 2.0 ve Gemini Omni Flash'a tercih edildi.

Şirket, bu sonuçların ön hazırlık olduğunu ve erken erişim aşamasında daha fazla iyileştirme beklendiği konusunda uyardı.

Görüntüler ve Metin Oluşturma

FLUX 3, videonun ötesinde çok çeşitli stillerde, en boy oranlarında ve çözünürlüklerde görüntüleri sentezleyebilir ve düzenleyebilir. Black Forest Labs, karmaşık istemleri işleme ve görüntüler içinde doğru metin oluşturma konusunda önceki FLUX sürümlerine göre önemli gelişmeler olduğunu bildirdi; bu, üretken görüntü modelleri için kalıcı bir zorluktur.

Şirket, FLUX 3 Image yetenekleri için erken erişim aşamasının videonun yayınlanmasını takip eden haftalarda açılacağını söyledi.

Fiziksel Yapay Zekaya Bir Köprü

Belki de FLUX 3'ün en alışılmadık yönü robot bilimine yayılmasıdır. Şirket, modelin dünya anlayışının eylem tahminine kadar uzandığını ve fiziksel yapay zekaya iki yol izlediğini açıkladı: yerel eylem tahminini doğrudan FLUX 3'e entegre etmek ve önceden eğitilmiş video omurgasını, sınırlı göreve özel verilerle ince ayar yapılmış özel eylem modelleri için bir temel olarak kullanmak.

Black Forest Labs, FLUX 3'e erken erişim sağlayan ilk şirketler arasında yer alan mimic robotics ile ortaklık kurdu. Birlikte, FLUX 3 omurgasını mimic'in hünerli manipülasyon için robot öğrenimindeki uzmanlığıyla birleştiren bir video aksiyon modeli olan FLUX-mimic'i geliştirdiler. Şirkete göre sistem halihazırda Audi'deki gerçek üretim görevlerinde test ediliyor.

Bu, kayda değer bir yakınlaşmayı temsil ediyor: Eğlence içeriği oluşturmak için kullanılan temel teknolojinin aynısı, üretim ortamlarındaki fiziksel robotların kontrolünde de kullanılıyor. Şirketin tezi, fiziksel yapay zeka ve içerik oluşturmanın aynı temel üzerinde çalıştığı yönünde; çünkü her ikisi de nesnelerin nasıl bir arada tutulduğunu, nesnelerin nasıl hareket ettiğini ve fiziksel olayların nasıl ses ürettiğini anlayan bir model gerektiriyor.

Rekabet ve Pazar Konumu

Lansman, yaygın olarak kullanılan FLUX görüntü oluşturma modellerinin arkasındaki Berlin merkezli girişim olan Black Forest Labs'ı, üretken yapay zeka alanında daha iddialı bir rakip olarak konumlandırıyor. Runway gibi şirketler dar anlamda videoya, OpenAI ise metin ve çok modlu sohbet robotlarına odaklanırken, Black Forest Labs görsel, işitsel ve fiziksel alanlarda gerçek anlamda birleşik bir modelin özel alternatiflerden daha yetenekli olacağına inanıyor.

Şirket, algı, eylem ve dil tahminini aynı modelde birleştirme hedefiyle halihazırda yeni nesil modeller üzerinde çalıştığını söyledi. Önümüzdeki haftalar ve aylarda, her biri geri bildirim ve güvenlik testi için erken erişim aşamasını takip eden aynı temel çok modlu akış eşleştirme mimarisinden oluşturulan ek yetenekleri kullanıma sunacak.

FLUX 3, görüntü ve ek özelliklerin aşamalı olarak kullanıma sunulmasıyla birlikte artık video üretimi için erken erişimde mevcuttur.

Yapay Zekanın Önünde Olun

FLUX 3'ün görüntü, video, ses ve robot teknolojisine yönelik birleşik yaklaşımı, üretken yapay zeka modellerinin tasarlanma biçiminde dikkate değer bir değişime işaret ediyor. Üretken medya yarışı ve yapay zekadaki en son gelişmeler hakkında daha fazla bilgi için son dakika yapay zeka haberlerini haberimizi takip edin.

Daha fazla AI haberini okuyun →