Twelve Labs, een startup die kunstmatige intelligentie bouwt die video kan begrijpen zoals taalmodellen tekst begrijpen, heeft $100 miljoen opgehaald in een Series B-financieringsronde omdat het gokt dat de volgende grens van AI in beweging ligt in plaats van in woorden.
Het bedrijf maakte de financiering op 1 juli 2026 bekend op zijn blog. De ronde werd geleid door NEA en NAVER Ventures, met deelname van Amazon naast Radical Ventures, Korea Investment Partners, Index Ventures, Quadrille Capital en Red Bull Ventures. Voor een bredere AI-industriedekking die volgt waar durfkapitaal stroomt, onderstreept de deal een groeiende overtuiging onder investeerders dat video het volgende belangrijke datatype is dat AI moet beheersen.
'De wereld gebeurt niet in tekst'
Medeoprichter en CEO Jae Lee formuleerde de missie van het bedrijf in grimmige bewoordingen. "Vijf jaar geleden begonnen we met een simpele observatie: de wereld gebeurt niet in tekst. Het gebeurt in beweging", schreef hij in de aankondiging.
In een interview met Bloomberg News ging Lee dieper in op het idee, met het argument dat video "de meest vergelijkbare signaalgegevens zijn die we als mensen ontvangen om over de wereld te leren." Hij contrasteerde dat met de dominante AI-architecturen van het moment en merkte op dat “dat anders is dan zelfs de nieuwste grensmodellen zoals Fable 5 en Mythos, die nog steeds taalmodellen zijn.”
Het argument berust op een leemte in de manier waarop AI momenteel werkt. De afgelopen tien jaar van AI-ontwikkeling, zo schreef Lee, 'maakte tekst programmeerbaar', maar video moet nog dezelfde behandeling krijgen. Hij beschreef de video van de wereld als ‘grotendeels donkere materie voor machines’, die zich in archieven, op drones en in satellietfeeds bevindt, en nog steeds grotendeels toegankelijk is ‘via bestandsnamen, mappen, bijschriften, transcripties en menselijk geheugen’.
Video bruikbaar maken voor agenten
Het doel van Twelve Labs is om die kloof te dichten. “Ons doel is om elke seconde video adresseerbaar, doorzoekbaar en bruikbaar te maken voor agenten”, schreef Lee, wijzend op de opkomst van AI-agenten, autonome systemen die kunnen redeneren en actie ondernemen, als de belangrijkste motor van de vraag.
Als taalmodellen documenten doorzoekbaar zouden maken en codegeneratoren ervoor zouden zorgen dat software sneller kon worden gebouwd, zou een video-begripmodel het enorme en grotendeels onaangeboorde archief van opgenomen video toegankelijk kunnen maken voor geautomatiseerde systemen. Dat heeft toepassingen in de media, beveiliging, autonome voertuigen en ondernemingen, op elk gebied waar beslissingen afhangen van het begrijpen van wat er in een videostream gebeurt.
Een drukke maar duidelijke categorie
Twelve Labs bevindt zich in een niche die zich tussen twee van de meest zichtbare categorieën in AI bevindt. Aan de ene kant zijn er videogeneratoren, tools die nieuwe video maken op basis van tekstprompts. Aan de andere kant staan grote taalmodellen die tekst verwerken. Twelve Labs richt zich in plaats daarvan op het begrijpen van video, het interpreteren van bestaande video zodat machines deze kunnen doorzoeken, samenvatten en ernaar kunnen handelen.
PYMNTS merkte op dat videogeneratoren deel uitmaken van een nieuwe generatie consumentensoftwarecategorieën die zich rond AI vormen, naast AI-metgezellen, conversatiezoekopdrachten en op prompts gebaseerde coderingstools. De aanpak van Twelve Labs richt zich op de aanbodkant van die trend en bouwt de onderliggende modellen die van video een eersteklas datatype kunnen maken voor de agenten en applicaties die er bovenop worden gebouwd.
Waarom investeerders video-AI steunen
De lijst met geldschieters in de ronde verwijst naar de video-AI-opdrachten van strategisch belang. De deelname van Amazon is opmerkelijk aangezien de AWS-clouddivisie van het bedrijf een belangrijke leverancier is van AI-infrastructuur en eigen investeringen in video- en mediadiensten. NAVER Ventures, de investeringstak van de Zuid-Koreaanse internetgigant, en Radical Ventures, een bedrijf dat zich richt op AI, signaleren wereldwijde belangstelling voor deze categorie.
De ronde weerspiegelt ook een breder patroon in de AI-financiering tot medio 2026, waarbij investeerders kapitaal richten op startups die datamodaliteiten nastreven die verder gaan dan alleen tekst. Terwijl op tekst gebaseerde modellen het leeuwendeel van de aandacht en investeringen hebben geabsorbeerd, worden video en andere vormen van rijke, real-world data gezien als de volgende arena waar betekenisvolle doorbraken en rendementen kunnen worden gevonden.
Wat de financiering mogelijk maakt
Twelve Labs heeft geen specifieke bestedingsplannen bekendgemaakt, maar de omvang van de verhoging, $100 miljoen in één ronde, duidt op aanzienlijke investeringen in computer-, talent- en modelontwikkeling. Het trainen van modellen voor het begrijpen van video's is qua rekenkracht veel veeleisender dan het trainen van tekstmodellen, gezien de enorme omvang van videobestanden, waardoor de kosten van vooruitgang toenemen.
Voor Lee is de weddenschap dat de uitbetaling die kosten rechtvaardigt. Zoals hij het verwoordde: “de rijkste weergave van de werkelijkheid bevindt zich nog steeds grotendeels buiten de semantische laag die moderne AI-systemen gebruiken.” De nieuwe financiering van Twelve Labs is een weddenschap dat het brengen van video in die laag een van de bepalende AI-vooruitgangen van de komende jaren zal zijn.
Bronnen: PYMNTS, Bloomberg News, bedrijfsblog van Twelve Labs.
---
Blijf AI een stap voorOntvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.
Lees meer AI-nieuws →
