Twelve Labs, sebuah permulaan membina kecerdasan buatan yang boleh memahami video seperti cara model bahasa memahami teks, telah mengumpulkan $100 juta dalam pusingan pembiayaan Siri B kerana ia mempertaruhkan bahawa sempadan AI seterusnya terletak pada gerakan dan bukannya perkataan.
Syarikat itu mengumumkan pembiayaan di blognya pada 1 Julai 2026. Pusingan itu diketuai oleh NEA dan NAVER Ventures, dengan penyertaan dari Amazon bersama Radical Ventures, Rakan Kongsi Pelaburan Korea, Index Ventures, Quadrille Capital dan Red Bull Ventures. Untuk penjejakan liputan industri AI yang lebih luas di mana modal teroka mengalir, perjanjian itu menekankan keyakinan yang semakin meningkat dalam kalangan pelabur bahawa video ialah jenis data utama seterusnya yang mesti dikuasai oleh AI.
'Dunia Tidak Terjadi dalam Teks'
Pengasas bersama dan ketua eksekutif Jae Lee merangka misi syarikat dengan jelas. "Lima tahun lalu, kami bermula dengan pemerhatian mudah: Dunia tidak berlaku dalam teks. Ia berlaku dalam gerakan," tulisnya dalam pengumuman itu.
Dalam temu bual dengan Bloomberg News, Lee mengembangkan idea itu, dengan alasan bahawa video "adalah data isyarat paling serupa yang kita terima sebagai manusia untuk belajar tentang dunia." Dia membezakannya dengan seni bina AI yang dominan pada masa ini, dengan menyatakan bahawa "itu berbeza daripada model sempadan terkini seperti Fable 5 dan Mythos, yang masih merupakan model bahasa."
Hujah terletak pada jurang dalam cara AI berfungsi pada masa ini. Dekad terakhir pembangunan AI, Lee menulis, "membuat teks boleh diprogramkan," tetapi video masih belum menerima layanan yang sama. Dia menyifatkan video dunia sebagai "kebanyakan jirim gelap kepada mesin," duduk dalam arkib, pada dron, dan dalam suapan satelit, masih diakses sebahagian besarnya "melalui nama fail, folder, kapsyen, transkrip dan ingatan manusia."
Membuat Video Boleh Digunakan oleh Ejen
Matlamat yang dinyatakan oleh Twelve Labs adalah untuk merapatkan jurang itu. "Matlamat kami adalah untuk menjadikan setiap detik video boleh ditangani, dicari dan boleh digunakan oleh ejen," tulis Lee sambil menunjuk kepada kebangkitan ejen AI, sistem autonomi yang boleh membuat alasan dan mengambil tindakan, sebagai pemacu utama permintaan.
Jika model bahasa menjadikan dokumen boleh dicari dan penjana kod menjadikan perisian lebih pantas untuk dibina, model pemahaman video boleh menjadikan arkib video yang dirakam yang besar dan sebahagian besarnya belum diterokai boleh diakses oleh sistem automatik. Itu mempunyai aplikasi merentas media, keselamatan, kenderaan autonomi dan perusahaan, mana-mana bidang yang membuat keputusan bergantung pada pemahaman perkara yang berlaku dalam strim video.
Kategori Sesak tetapi Berbeza
Twelve Labs menduduki niche yang terletak di antara dua kategori yang paling ketara dalam AI. Di satu pihak ialah penjana video, alat yang mencipta video baharu daripada gesaan teks. Di sisi lain ialah model bahasa besar yang memproses teks. Twelve Labs sebaliknya memfokuskan pada pemahaman video, mentafsir video sedia ada supaya mesin boleh mencarinya, meringkaskannya dan bertindak ke atasnya.
PYMNTS menyatakan bahawa penjana video telah menjadi sebahagian daripada generasi baharu kategori perisian pengguna yang terbentuk di sekitar AI, bersama rakan AI, carian perbualan dan alat pengekodan berasaskan segera. Pendekatan Twelve Labs menyasarkan bahagian bekalan arah aliran itu, membina model asas yang boleh menjadikan video jenis data kelas pertama untuk ejen dan aplikasi yang dibina di atasnya.
Mengapa Pelabur Menyokong Video AI
Senarai penyokong dalam pusingan menunjukkan arahan AI video minat strategik. Penyertaan Amazon adalah ketara memandangkan bahagian awan AWS syarikat adalah penyedia utama infrastruktur AI dan pelaburannya sendiri dalam perkhidmatan video dan media. NAVER Ventures, cabang pelaburan gergasi internet Korea Selatan, dan Radical Ventures, firma yang memberi tumpuan kepada AI, menandakan minat global dalam kategori tersebut.
Pusingan itu juga mencerminkan corak yang lebih luas dalam pembiayaan AI hingga pertengahan 2026, di mana pelabur mengarahkan modal ke arah syarikat pemula yang mengejar modaliti data melangkaui teks. Walaupun model berasaskan teks telah menyerap bahagian terbesar perhatian dan pelaburan, video dan lain-lain bentuk data dunia nyata yang kaya dilihat sebagai arena seterusnya di mana penemuan dan pulangan yang bermakna boleh ditemui.
Perkara yang Didayakan oleh Pembiayaan
Twelve Labs tidak memperincikan rancangan perbelanjaan khusus, tetapi skala kenaikan, $100 juta dalam satu pusingan, mencadangkan pelaburan yang besar dalam pengiraan, bakat dan pembangunan model. Melatih model pemahaman video jauh lebih memerlukan pengiraan daripada model teks latihan, memandangkan saiz fail video yang besar, yang meningkatkan kos kemajuan.
Bagi Lee, pertaruhan adalah bahawa bayaran itu membenarkan kos itu. Seperti yang dikatakannya, "rekod realiti terkaya masih sebahagian besarnya di luar lapisan semantik yang digunakan oleh sistem AI moden." Pembiayaan baharu Twelve Labs ialah pertaruhan yang membawa video ke dalam lapisan itu akan menjadi salah satu kemajuan AI yang menentukan pada tahun-tahun mendatang.
Sumber: PYMNTS, Bloomberg News, blog syarikat Twelve Labs.
---
Kekal Mendahului AIDapatkan berita, analisis dan penemuan terkini AI — semuanya di satu tempat.
Baca lebih banyak berita AI →

