Twelve Labs, startup vytvářející umělou inteligenci, který dokáže porozumět videu tak, jak jazykové modely chápou text, získal 100 milionů dolarů v kole financování série B, protože sází na to, že další hranice umělé inteligence leží spíše v pohybu než ve slovech.
Společnost oznámila financování na svém blogu 1. července 2026. Kolo vedly NEA a NAVER Ventures, za účasti Amazonu spolu s Radical Ventures, Korea Investment Partners, Index Ventures, Quadrille Capital a Red Bull Ventures. Pro širší pokrytí odvětví AI sledování, kam proudí rizikový kapitál, dohoda podtrhuje rostoucí přesvědčení mezi investory, že video je dalším velkým datovým typem, který musí umělá inteligence zvládnout.
„Svět se neděje v textu“
Spoluzakladatel a generální ředitel Jae Lee nastínil poslání společnosti přísně. "Před pěti lety jsme začali jednoduchým pozorováním: Svět se neděje v textu. Děje se v pohybu," napsal v oznámení.
V rozhovoru pro Bloomberg News Lee tuto myšlenku rozšířil a tvrdil, že video „je nejpodobnější signálová data, která jako lidé dostáváme, abychom se dozvěděli o světě“. Postavil to do kontrastu s dominantními architekturami AI současnosti a poznamenal, že „to se liší i od nejnovějších hraničních modelů, jako jsou Fable 5 a Mythos, které jsou stále jazykovými modely“.
Argument se opírá o mezeru v tom, jak AI v současnosti funguje. Poslední dekáda vývoje umělé inteligence, napsal Lee, „učinila text programovatelným“, ale video dosud nedostalo stejné zacházení. Světové video popsal jako „převážně temnou hmotu pro stroje“, sedící v archivech, na dronech a v satelitních kanálech, stále přístupných převážně „přes názvy souborů, složky, titulky, přepisy a lidskou paměť“.
Zajištění použitelnosti videa pro agenty
Deklarovaným cílem Twelve Labs je tuto mezeru zacelit. „Naším cílem je zajistit, aby každá sekunda videa byla adresovatelná, prohledávatelná a použitelná pro agenty,“ napsal Lee a poukázal na vzestup agentů AI, autonomních systémů, které dokážou uvažovat a jednat, jako klíčového hybatele poptávky.
Pokud by jazykové modely umožnily prohledávat dokumenty a generátory kódu zrychlily vytváření softwaru, model porozumění videu by mohl zpřístupnit obrovský a do značné míry nevyužitý archiv nahraného videa automatizovaným systémům. To má aplikace napříč médii, zabezpečením, autonomními vozidly a podniky, v jakékoli oblasti, kde rozhodnutí závisí na pochopení toho, co se děje uvnitř video streamu.
Přeplněná, ale odlišná kategorie
Twelve Labs zaujímá výklenek, který se nachází mezi dvěma nejviditelnějšími kategoriemi v AI. Na jedné straně jsou generátory videa, nástroje, které vytvářejí nové video z textových výzev. Na druhé straně jsou velké jazykové modely, které zpracovávají text. Twelve Labs se místo toho zaměřuje na porozumění videu, interpretaci existujícího videa tak, aby v něm stroje mohly vyhledávat, shrnout je a jednat podle nich.
PYMNTS poznamenal, že video generátory byly součástí nové generace kategorií spotřebitelského softwaru, které se kolem AI tvoří, spolu s AI společníky, konverzačním vyhledáváním a nástroji pro kódování založené na výzvě. Přístup společnosti Twelve Labs se zaměřuje na stranu nabídky tohoto trendu a vytváří základní modely, které by mohly z videa učinit prvotřídní datový typ pro agenty a aplikace, které jsou na něm stavěny.
Proč investoři podporují video AI
Seznam podporovatelů v kole ukazuje na strategické zájmové video příkazy AI. Účast Amazonu je pozoruhodná vzhledem k tomu, že cloudová divize společnosti AWS je významným poskytovatelem infrastruktury umělé inteligence a vlastní investice do video a mediálních služeb. NAVER Ventures, investiční odnož jihokorejského internetového gigantu, a Radical Ventures, firma zaměřená na AI, signalizují globální zájem o tuto kategorii.
Kolo také odráží širší vzorec financování AI do poloviny roku 2026, kdy investoři směřují kapitál do startupů, které sledují datové modality mimo text. Zatímco textové modely absorbovaly lví podíl pozornosti a investic, video a další formy bohatých, reálných dat jsou považovány za další arénu, kde lze nalézt smysluplné průlomy a výnosy.
Co financování umožňuje
Společnost Twelve Labs neuvedla podrobnosti o konkrétních plánech výdajů, ale rozsah navýšení, 100 milionů dolarů v jediném kole, naznačuje značné investice do vývoje výpočetní techniky, talentů a modelů. Trénink modelů porozumění videu je mnohem náročnější na výpočetní výkon než trénování textových modelů, vzhledem k samotné velikosti souborů videa, což zvyšuje náklady na pokrok.
Pro Lee je sázka na to, že výplata ospravedlní tyto náklady. Jak uvedl, „nejbohatší záznam reality je stále z velké části mimo sémantickou vrstvu, kterou moderní systémy AI používají“. Nové financování Twelve Labs je sázkou, že zavedení videa do této vrstvy bude jedním z určujících pokroků AI v nadcházejících letech.
Zdroje: PYMNTS, Bloomberg News, firemní blog Twelve Labs.
---
Stay Ahead of AIZískejte nejnovější zprávy, analýzy a průlomové informace o umělé inteligenci – vše na jednom místě.
Přečtěte si další zprávy o AI →

