Twelve Labs, startup tworzący sztuczną inteligencję, która potrafi rozumieć wideo w taki sam sposób, w jaki modele językowe rozumieją tekst, zebrał 100 milionów dolarów w rundzie finansowania serii B, obstawiając, że kolejna granica sztucznej inteligencji leży w ruchu, a nie w słowach.

Firma ogłosiła finansowanie na swoim blogu 1 lipca 2026 r. Rundę poprowadziły NEA i NAVER Ventures, przy udziale Amazona, Radical Ventures, Korea Investment Partners, Index Ventures, Quadrille Capital i Red Bull Ventures. Jeśli chodzi o szersze [zasięg branży sztucznej inteligencji] (https://aibuzzwire.news) śledzenie przepływu kapitału wysokiego ryzyka, umowa podkreśla rosnące przekonanie wśród inwestorów, że wideo to kolejny ważny typ danych, jaki sztuczna inteligencja musi opanować.

„Świat nie dzieje się w tekście”

Współzałożyciel i dyrektor generalny Jae Lee określił misję firmy w surowy sposób. „Pięć lat temu zaczęliśmy od prostej obserwacji: świat nie dzieje się w tekście. Dzieje się w ruchu” – napisał w ogłoszeniu.

W wywiadzie dla Bloomberg News Lee rozwinął ten pomysł, argumentując, że wideo „to najbardziej podobne dane sygnałowe, jakie otrzymujemy jako ludzie, aby dowiedzieć się o świecie”. Porównał to z dominującymi obecnie architekturami sztucznej inteligencji, zauważając, że „różni się to nawet od najnowszych, pionierskich modeli, takich jak Fable 5 i Mythos, które nadal są modelami językowymi”.

Argument opiera się na luce w obecnym działaniu sztucznej inteligencji. Lee napisał, że ostatnia dekada rozwoju sztucznej inteligencji „umożliwiła programowanie tekstu”, ale wideo nie zostało jeszcze potraktowane w ten sam sposób. Opisał światowe nagrania wideo jako „w większości ciemną materię dla maszyn”, przechowywane w archiwach, na dronach i w kanałach satelitarnych, do których wciąż można uzyskać dostęp głównie „poprzez nazwy plików, foldery, podpisy, transkrypcje i ludzką pamięć”.

Udostępnianie wideo agentom

Deklarowanym celem Twelve Labs jest zamknięcie tej luki. „Naszym celem jest umożliwienie agentom adresowania, przeszukiwania i wykorzystania każdej sekundy filmu” – napisał Lee, wskazując na rozwój agentów AI – autonomicznych systemów, które potrafią rozumować i podejmować działania, jako kluczowego czynnika napędzającego popyt.

Jeśli modele językowe umożliwiłyby przeszukiwanie dokumentów, a generatory kodu przyspieszyłyby tworzenie oprogramowania, model rozumienia wideo mógłby udostępnić zautomatyzowanym systemom ogromne i w dużej mierze niewykorzystane archiwum nagrań wideo. Ma to zastosowanie w mediach, bezpieczeństwie, pojazdach autonomicznych i przedsiębiorstwach, w każdej dziedzinie, w której decyzje zależą od zrozumienia tego, co dzieje się w strumieniu wideo.

Zatłoczona, ale wyróżniająca się kategoria

Twelve Labs zajmuje niszę plasującą się pomiędzy dwiema najbardziej widocznymi kategoriami sztucznej inteligencji. Z jednej strony znajdują się generatory wideo, narzędzia tworzące nowy film na podstawie podpowiedzi tekstowych. Z drugiej strony są duże modele językowe przetwarzające tekst. Zamiast tego Twelve Labs koncentruje się na rozumieniu wideo, interpretowaniu istniejącego wideo, aby maszyny mogły je przeszukiwać, podsumowywać i na nim działać.

PYMNTS zauważył, że generatory wideo stanowią część nowej generacji kategorii oprogramowania konsumenckiego, które tworzą się wokół sztucznej inteligencji, obok towarzyszących jej rozwiązań, wyszukiwania konwersacyjnego i narzędzi do kodowania opartego na podpowiedziach. Podejście Twelve Labs koncentruje się na podażowej stronie tego trendu, budując podstawowe modele, dzięki którym wideo może stać się pierwszorzędnym typem danych dla agentów i aplikacji budowanych na jego podstawie.

Dlaczego inwestorzy wspierają wideo AI

Lista wspierających w rundzie wskazuje na strategiczne polecenia wideo AI. Udział Amazona jest znaczący, biorąc pod uwagę, że dział chmury AWS firmy jest głównym dostawcą infrastruktury sztucznej inteligencji oraz własnymi inwestycjami w usługi wideo i medialne. NAVER Ventures, ramię inwestycyjne południowokoreańskiego giganta internetowego, oraz Radical Ventures, firma skupiona na sztucznej inteligencji, sygnalizują globalne zainteresowanie tą kategorią.

Runda odzwierciedla również szerszy schemat finansowania sztucznej inteligencji do połowy 2026 r., w ramach którego inwestorzy kierują kapitał do start-upów korzystających z metod przetwarzania danych poza tekstem. Podczas gdy modele tekstowe pochłonęły lwią część uwagi i inwestycji, wideo i inne formy bogatych, rzeczywistych danych są postrzegane jako kolejna arena, na której można znaleźć znaczące przełomy i zyski.

Co umożliwia finansowanie

Twelve Labs nie podało szczegółowych planów wydatków, ale skala podwyżki, wynosząca 100 milionów dolarów w jednej rundzie, sugeruje znaczne inwestycje w zasoby obliczeniowe, talenty i rozwój modeli. Uczenie modeli rozumienia wideo wymaga znacznie więcej obliczeń niż uczenie modeli tekstowych, biorąc pod uwagę sam rozmiar plików wideo, który podnosi koszt postępu.

Dla Lee zakład jest taki, że wypłata uzasadnia ten koszt. Jak to ujął, „najbogatszy zapis rzeczywistości nadal w dużej mierze znajduje się poza warstwą semantyczną, z której korzystają współczesne systemy AI”. Nowe fundusze Twelve Labs zakładają, że wprowadzenie wideo do tej warstwy będzie jednym z najważniejszych osiągnięć sztucznej inteligencji w nadchodzących latach.

Źródła: PYMNTS, Bloomberg News, blog firmowy Twelve Labs.

---

Wyprzedź sztuczną inteligencję

Otrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.

Przeczytaj więcej aktualności o sztucznej inteligencji →