Twelve Labs, en startup som bygger artificiell intelligens som kan förstå video på det sätt som språkmodeller förstår text, har samlat in 100 miljoner dollar i en serie B-finansieringsrunda eftersom det satsar på att nästa gräns för AI ligger i rörelse snarare än ord.

Företaget tillkännagav finansieringen på sin blogg den 1 juli 2026. Omgången leddes av NEA och NAVER Ventures, med deltagande från Amazon tillsammans med Radical Ventures, Korea Investment Partners, Index Ventures, Quadrille Capital och Red Bull Ventures. För den bredare AI-branschens täckning spårning där riskkapital flödar, understryker affären en växande övertygelse bland investerare att video är nästa stora datatyp som AI måste bemästra.

'Världen händer inte i text'

Medgrundare och vd Jae Lee formulerade företagets uppdrag i skarpa termer. "För fem år sedan började vi med en enkel observation: Världen händer inte i text. Den händer i rörelse", skrev han i tillkännagivandet.

I en intervju med Bloomberg News utökade Lee idén och hävdade att video "är den mest liknande signaldata som vi får som människor för att lära oss om världen." Han kontrasterade det med de dominerande AI-arkitekturerna för tillfället och noterade att "det skiljer sig från till och med de senaste frontiermodellerna som Fable 5 och Mythos, som fortfarande är språkmodeller."

Argumentet vilar på en lucka i hur AI för närvarande fungerar. Det senaste decenniet av AI-utveckling, skrev Lee, "gjorde text programmerbar", men video har ännu inte fått samma behandling. Han beskrev världens video som "mest mörk materia för maskiner", som sitter i arkiv, på drönare och i satellitflöden, fortfarande till stor del "genom filnamn, mappar, bildtexter, avskrifter och mänskligt minne."

Gör videon användbar av agenter

Twelve Labs uttalade mål är att minska det gapet. "Vårt mål är att göra varje sekund av video adresserbar, sökbar och användbar av agenter", skrev Lee och pekade på framväxten av AI-agenter, autonoma system som kan resonera och vidta åtgärder, som den viktigaste drivkraften för efterfrågan.

Om språkmodeller gjorde dokument sökbara och kodgeneratorer gjorde mjukvara snabbare att bygga, skulle en videoförståelsemodell kunna göra det enorma och i stort sett outnyttjade arkivet av inspelad video tillgängligt för automatiserade system. Det har applikationer för media, säkerhet, autonoma fordon och företag, alla områden där beslut beror på att förstå vad som händer i en videoström.

En trång men distinkt kategori

Twelve Labs upptar en nisch som ligger mellan två av de mest synliga kategorierna inom AI. På ena sidan finns videogeneratorer, verktyg som skapar ny video från textuppmaningar. På den andra finns stora språkmodeller som bearbetar text. Twelve Labs fokuserar istället på att förstå video, tolka befintlig video så att maskiner kan söka i den, sammanfatta den och agera utifrån den.

PYMNTS noterade att videogeneratorer har varit en del av en ny generation av konsumentprogramvarukategorier som bildats kring AI, tillsammans med AI-kompanjoner, konversationssökning och promptbaserade kodningsverktyg. Twelve Labs tillvägagångssätt riktar sig mot utbudssidan av den trenden och bygger de underliggande modellerna som kan göra video till en förstklassig datatyp för agenterna och applikationerna som byggs ovanpå den.

Varför investerare stödjer Video AI

Listan över stödpersoner i omgången pekar på video AI-kommandon för strategiskt intresse. Amazons deltagande är anmärkningsvärt med tanke på att företagets AWS molndivision är en stor leverantör av AI-infrastruktur och sina egna investeringar i video- och medietjänster. NAVER Ventures, den sydkoreanska internetjättens investeringsgren, och Radical Ventures, ett företag fokuserat på AI, signalerar globalt intresse för kategorin.

Omgången återspeglar också ett bredare mönster i AI-finansiering till och med mitten av 2026, där investerare riktar kapital mot startups som strävar efter datamodaliteter bortom text. Medan textbaserade modeller har absorberat lejonparten av uppmärksamhet och investeringar, ses video och andra former av rik, verklig data som nästa arena där meningsfulla genombrott och avkastning kan hittas.

Vad finansieringen möjliggör

Twelve Labs specificerade inte specifika utgiftsplaner, men omfattningen av höjningen, 100 miljoner dollar i en enda omgång, tyder på betydande investeringar i dator-, talang- och modellutveckling. Att träna videoförståelsemodeller är mycket mer beräkningskrävande än att träna textmodeller, med tanke på den stora storleken på videofiler, vilket ökar kostnaden för framsteg.

För Lee är vadet att utdelningen motiverar den kostnaden. Som han uttryckte det, "verklighetens rikaste rekord ligger fortfarande till stor del utanför det semantiska lagret som moderna AI-system använder." Twelve Labs nya finansiering är en satsning på att att föra in video i det lagret kommer att vara ett av de avgörande framstegen inom AI under de kommande åren.

Källor: PYMNTS, Bloomberg News, Twelve Labs företagsblogg.

---

Stay ahead of AI

Få de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.

Läs mer AI-nyheter →