Videoyu, dil modellerinin metni anladığı gibi anlayabilen yapay zeka geliştiren bir girişim olan Twelve Labs, yapay zekanın bir sonraki sınırının kelimelerden ziyade harekette yattığına bahse girerek B Serisi finansman turunda 100 milyon dolar topladı.

Şirket, finansmanı 1 Temmuz 2026'da blogunda duyurdu. Tur, Radical Ventures, Korea Investment Partners, Index Ventures, Quadrille Capital ve Red Bull Ventures'ın yanı sıra Amazon'un da katılımıyla NEA ve NAVER Ventures tarafından yönetildi. Risk sermayesinin akışının daha geniş AI sektörü kapsamı takibi için bu anlaşma, yatırımcılar arasında videonun yapay zekanın ustalaşması gereken bir sonraki büyük veri türü olduğuna dair giderek artan inancın altını çiziyor.

'Dünya Metinlerle Olmaz'

Kurucu ortak ve CEO Jae Lee, şirketin misyonunu net bir şekilde çerçeveledi. Duyuruda "Beş yıl önce basit bir gözlemle başladık: Dünya metinlerle olmuyor. Hareket halinde oluyor" diye yazdı.

Bloomberg News'e verdiği bir röportajda Lee, videonun "insanlar olarak dünyayı öğrenmek için aldığımız en benzer sinyal verisi olduğunu" öne sürerek bu fikri daha da genişletti. Bunu, o anın baskın yapay zeka mimarileriyle karşılaştırdı ve "bunun, hâlâ dil modelleri olan Fable 5 ve Mythos gibi en yeni öncü modellerden bile farklı olduğunu" belirtti.

Tartışma, yapay zekanın şu anda nasıl çalıştığına ilişkin bir boşluğa dayanıyor. Lee, yapay zeka gelişiminin son on yılında "metni programlanabilir hale getirdi" diye yazdı, ancak video henüz aynı muameleyi görmedi. Dünyanın videosunu "çoğunlukla makineler için karanlık madde" olarak tanımladı; arşivlerde, dronlarda ve uydu yayınlarında yer alıyor ve hâlâ büyük ölçüde "dosya adları, klasörler, altyazılar, transkriptler ve insan hafızası yoluyla" erişiliyor.

Videoyu Temsilciler Tarafından Kullanılabilir Hale Getirme

Twelve Labs'ın belirttiği hedef bu açığı kapatmaktır. Lee, talebin temel itici gücü olarak akıl yürütebilen ve harekete geçebilen otonom sistemler olan yapay zeka aracılarının yükselişine işaret ederek, "Amacımız videonun her saniyesini temsilciler tarafından adreslenebilir, aranabilir ve kullanılabilir hale getirmektir" diye yazdı.

Dil modelleri belgeleri aranabilir hale getirdiyse ve kod oluşturucular yazılımın daha hızlı oluşturulmasını sağladıysa, bir video anlama modeli, devasa ve büyük oranda kullanılmamış kayıtlı video arşivini otomatik sistemler için erişilebilir hale getirebilir. Bunun medya, güvenlik, otonom araçlar ve kuruluşlarda, kararların video akışında olup bitenlerin anlaşılmasına bağlı olduğu herhangi bir alanda uygulamaları vardır.

Kalabalık Ama Farklı Bir Kategori

Twelve Labs, yapay zekada en görünür iki kategori arasında yer alan bir nişte yer alıyor. Bir tarafta video oluşturucular, metin istemlerinden yeni videolar oluşturan araçlar bulunur. Diğer tarafta metni işleyen büyük dil modelleri var. Twelve Labs bunun yerine videoyu anlamaya, mevcut videoyu yorumlamaya, böylece makinelerin arama yapmasına, özetlemesine ve üzerinde işlem yapmasına odaklanıyor.

PYMNTS, video oluşturucuların, AI yardımcıları, konuşmalı arama ve istem tabanlı kodlama araçlarının yanı sıra, AI etrafında şekillenen yeni nesil tüketici yazılım kategorilerinin bir parçası olduğunu belirtti. Twelve Labs'ın yaklaşımı, bu eğilimin arz yönünü hedef alıyor ve bunun üzerine inşa edilen aracılar ve uygulamalar için videoyu birinci sınıf bir veri türü haline getirebilecek temel modelleri oluşturuyor.

Yatırımcılar Neden Video Yapay Zekayı Destekliyor?

Turdaki destekçilerin listesi, stratejik ilgi alanı video AI komutlarına işaret ediyor. Şirketin AWS bulut bölümünün büyük bir yapay zeka altyapısı sağlayıcısı olduğu ve video ve medya hizmetlerine yaptığı yatırımlar dikkate alındığında Amazon'un katılımı dikkate değer. Güney Koreli internet devinin yatırım kolu NAVER Ventures ve yapay zekaya odaklanan bir firma olan Radical Ventures, kategoriye küresel ilginin sinyalini veriyor.

Bu tur aynı zamanda yatırımcıların sermayeyi metnin ötesinde veri yöntemlerini takip eden yeni girişimlere yönlendirdiği 2026 ortasına kadar yapay zeka finansmanında daha geniş bir modeli yansıtıyor. Metin tabanlı modeller dikkat ve yatırımdan aslan payını alırken, video ve diğer zengin, gerçek dünya verileri biçimleri, anlamlı atılımların ve geri dönüşlerin bulunabileceği bir sonraki alan olarak görülüyor.

Finansman Neleri Sağlar?

Twelve Labs spesifik harcama planlarını detaylandırmadı, ancak tek turda 100 milyon dolarlık artış ölçeği, bilgi işlem, yetenek ve model geliştirmeye önemli yatırım yapıldığını gösteriyor. Video dosyalarının boyutu göz önüne alındığında, ilerleme maliyetini artıran video anlama modellerinin eğitimi, metin modellerinin eğitiminden çok daha fazla hesaplama gerektirir.

Lee'ye göre kazanç, bu maliyeti haklı çıkarıyor. Kendi ifadesiyle, "Gerçekliğin en zengin kaydı hala büyük ölçüde modern yapay zeka sistemlerinin kullandığı anlamsal katmanın dışındadır." Twelve Labs'ın yeni finansmanı, videoyu bu katmana getirmenin önümüzdeki yıllarda belirleyici yapay zeka ilerlemelerinden biri olacağına dair bir iddia.

Kaynaklar: PYMNTS, Bloomberg News, Twelve Labs şirket blogu.

---

Yapay Zekanın Önünde Olun

En son yapay zeka haberlerini, analizlerini ve buluşlarını tek bir yerden alın.

Daha fazla AI haberini okuyun →