Twelve Labs, o startup care construiește inteligență artificială care poate înțelege video-ul așa cum modelele lingvistice înțeleg textul, a strâns 100 de milioane de dolari într-o rundă de finanțare din seria B, pentru că pariază că următoarea frontieră a inteligenței artificiale se află în mișcare și nu în cuvinte.
Compania a anunțat finanțarea pe blogul său pe 1 iulie 2026. Runda a fost condusă de NEA și NAVER Ventures, cu participarea Amazon alături de Radical Ventures, Korea Investment Partners, Index Ventures, Quadrille Capital și Red Bull Ventures. Pentru o acoperire mai largă a industriei AI unde curge capitalul de risc, acordul subliniază o convingere din ce în ce mai mare în rândul investitorilor că videoclipul este următorul tip de date major pe care AI trebuie să-l stăpânească.
„Lumea nu se întâmplă în text”
Cofondatorul și directorul executiv Jae Lee a formulat misiunea companiei în termeni dubii. "Acum cinci ani, am început cu o observație simplă: lumea nu se întâmplă în text. Se întâmplă în mișcare", a scris el în anunț.
Într-un interviu pentru Bloomberg News, Lee a extins ideea, argumentând că videoclipul „sunt cele mai asemănătoare date de semnal pe care le primim ca oameni pentru a afla despre lume”. El a contrastat asta cu arhitecturile AI dominante ale momentului, remarcând că „acesta este diferit chiar și de cele mai recente modele de frontieră, cum ar fi Fable 5 și Mythos, care sunt încă modele de limbaj”.
Argumentul se bazează pe o lacună în modul în care funcționează AI în prezent. Ultimul deceniu de dezvoltare a inteligenței artificiale, a scris Lee, „a făcut textul programabil”, dar videoclipul nu a primit încă același tratament. El a descris videoclipul lumii ca fiind „în mare parte materie întunecată pentru mașini”, aflat în arhive, pe drone și în fluxuri prin satelit, accesat încă în mare parte „prin nume de fișiere, foldere, subtitrări, transcrieri și memorie umană”.
Faceți video utilizabil de către agenți
Scopul declarat al Twelve Labs este de a reduce acest decalaj. „Scopul nostru este să facem fiecare secundă de videoclip adresabilă, căutată și utilizabilă de către agenți”, a scris Lee, subliniind creșterea agenților AI, sisteme autonome care pot raționa și acționa, ca motor cheie al cererii.
Dacă modelele lingvistice ar face documentele căutabile, iar generatoarele de coduri ar face software-ul mai rapid de construit, un model de înțelegere video ar putea face arhiva enormă și în mare parte neexploatată de videoclipuri înregistrate să fie accesibilă sistemelor automate. Aceasta are aplicații în media, securitate, vehicule autonome și întreprinderi, în orice domeniu în care deciziile depind de înțelegerea a ceea ce se întâmplă în interiorul unui flux video.
O categorie aglomerată, dar distinctă
Twelve Labs ocupă o nișă care se află între două dintre cele mai vizibile categorii din AI. Pe de o parte sunt generatoare de video, instrumente care creează videoclipuri noi din solicitările text. Pe de altă parte sunt modele mari de limbaj care procesează text. Twelve Labs se concentrează în schimb pe înțelegerea videoclipurilor, interpretând videoclipurile existente, astfel încât mașinile să le poată căuta, să-l rezuma și să acționeze în baza lui.
PYMNTS a remarcat că generatoarele video au făcut parte dintr-o nouă generație de categorii de software de consum care se formează în jurul AI, alături de însoțitorii AI, de căutare conversațională și de instrumente de codare bazate pe prompt. Abordarea Twelve Labs vizează partea de ofertă a acestei tendințe, construind modelele de bază care ar putea face din video un tip de date de primă clasă pentru agenții și aplicațiile construite pe deasupra.
De ce investitorii susțin AI video
Lista susținătorilor din rundă indică comenzile AI video de interes strategic. Participarea Amazon este notabilă, având în vedere că divizia cloud AWS a companiei este un furnizor major de infrastructură AI și propriile investiții în servicii video și media. NAVER Ventures, brațul de investiții al gigantului sud-coreean al internetului, și Radical Ventures, o firmă axată pe AI, semnalează interesul global pentru această categorie.
Runda reflectă, de asemenea, un model mai larg în finanțarea AI până la jumătatea anului 2026, în care investitorii direcționează capitalul către startup-uri care urmăresc modalități de date dincolo de text. În timp ce modelele bazate pe text au absorbit cea mai mare parte a atenției și a investițiilor, videoclipurile și alte forme de date bogate, din lumea reală sunt văzute ca următoarea arenă în care pot fi găsite progrese semnificative și profituri.
Ce permite finanțarea
Twelve Labs nu a detaliat planuri specifice de cheltuieli, dar amploarea strângerii, 100 de milioane de dolari într-o singură rundă, sugerează investiții semnificative în calcul, talent și dezvoltare de modele. Antrenarea modelelor de înțelegere video este mult mai solicitantă din punct de vedere computațional decât modelele text de antrenament, având în vedere dimensiunea mare a fișierelor video, ceea ce crește costul progresului.
Pentru Lee, pariul este că câștigul justifică acest cost. După cum a spus el, „cea mai bogată înregistrare a realității se află încă în mare parte în afara stratului semantic pe care îl folosesc sistemele moderne de inteligență artificială”. Noua finanțare a Twelve Labs este un pariu că aducerea de videoclipuri în acel nivel va fi unul dintre progresele definitorii ale AI din următorii ani.
Surse: PYMNTS, Bloomberg News, blogul companiei Twelve Labs.
---
Rămâneți înaintea AIObțineți cele mai recente știri, analize și descoperiri despre AI - toate într-un singur loc.
Citește mai multe știri AI →

