Twelve Labs, une startup développant une intelligence artificielle capable de comprendre la vidéo de la même manière que les modèles linguistiques comprennent le texte, a levé 100 millions de dollars lors d'un cycle de financement de série B, car elle parie que la prochaine frontière de l'IA réside dans le mouvement plutôt que dans les mots.
La société a annoncé le financement sur son blog le 1er juillet 2026. Le cycle a été mené par NEA et NAVER Ventures, avec la participation d'Amazon aux côtés de Radical Ventures, Korea Investment Partners, Index Ventures, Quadrille Capital et Red Bull Ventures. Pour le suivi plus large de la couverture de l'industrie de l'IA des flux de capital-risque, l'accord souligne une conviction croissante parmi les investisseurs selon laquelle la vidéo est le prochain type de données majeur que l'IA doit maîtriser.
'Le monde ne se passe pas dans le texte'
Le cofondateur et directeur général, Jae Lee, a défini la mission de l'entreprise en termes clairs. "Il y a cinq ans, nous sommes partis d'une observation simple : le monde ne se produit pas dans le texte. Il se produit en mouvement", a-t-il écrit dans le communiqué.
Dans une interview avec Bloomberg News, Lee a développé l'idée, affirmant que la vidéo "est le signal de données le plus similaire que nous recevons en tant qu'humains pour en apprendre davantage sur le monde". Il a comparé cela aux architectures d'IA dominantes du moment, notant que "c'est différent même des derniers modèles frontières tels que Fable 5 et Mythos, qui sont toujours des modèles de langage".
L’argument repose sur une lacune dans le fonctionnement actuel de l’IA. Selon Lee, la dernière décennie de développement de l'IA a « rendu le texte programmable », mais la vidéo n'a pas encore reçu le même traitement. Il a décrit les vidéos du monde comme « essentiellement de la matière noire pour les machines », stockées dans des archives, sur des drones et dans des flux satellites, toujours accessibles en grande partie « via les noms de fichiers, les dossiers, les légendes, les transcriptions et la mémoire humaine ».
Rendre la vidéo utilisable par les agents
L’objectif déclaré de Twelve Labs est de combler cet écart. "Notre objectif est de rendre chaque seconde de vidéo adressable, consultable et utilisable par les agents", a écrit Lee, soulignant la montée en puissance des agents IA, des systèmes autonomes capables de raisonner et d'agir, comme le principal moteur de la demande.
Si les modèles linguistiques rendaient les documents consultables et les générateurs de code rendaient la création de logiciels plus rapide, un modèle de compréhension vidéo pourrait rendre accessible aux systèmes automatisés les énormes archives largement inexploitées de vidéos enregistrées. Cela a des applications dans les médias, la sécurité, les véhicules autonomes et les entreprises, tous les domaines où les décisions dépendent de la compréhension de ce qui se passe dans un flux vidéo.
Une catégorie bondée mais distincte
Twelve Labs occupe une niche qui se situe entre deux des catégories les plus visibles de l'IA. D'un côté se trouvent les générateurs vidéo, des outils qui créent une nouvelle vidéo à partir d'invites textuelles. De l’autre, de grands modèles de langage qui traitent le texte. Twelve Labs se concentre plutôt sur la compréhension de la vidéo, en interprétant la vidéo existante afin que les machines puissent la rechercher, la résumer et agir en conséquence.
PYMNTS a noté que les générateurs vidéo font partie d'une nouvelle génération de catégories de logiciels grand public qui se forment autour de l'IA, aux côtés des compagnons d'IA, de la recherche conversationnelle et des outils de codage basés sur des invites. L'approche de Twelve Labs cible le côté offre de cette tendance, en créant les modèles sous-jacents qui pourraient faire de la vidéo un type de données de premier ordre pour les agents et les applications construits dessus.
Pourquoi les investisseurs soutiennent l'IA vidéo
La liste des bailleurs de fonds dans le tour indique les commandes vidéo d’intérêt stratégique de l’IA. La participation d'Amazon est remarquable étant donné que la division cloud AWS de la société est un fournisseur majeur d'infrastructure d'IA et ses propres investissements dans les services vidéo et multimédias. NAVER Ventures, la branche d'investissement du géant sud-coréen de l'Internet, et Radical Ventures, une société axée sur l'IA, signalent un intérêt mondial pour cette catégorie.
Le cycle reflète également une tendance plus large en matière de financement de l’IA jusqu’à la mi-2026, où les investisseurs orientent leurs capitaux vers des startups qui recherchent des modalités de données au-delà du texte. Alors que les modèles textuels ont absorbé la part du lion de l'attention et des investissements, la vidéo et d'autres formes de données riches et réelles sont considérées comme le prochain domaine où des avancées et des rendements significatifs peuvent être trouvés.
Ce que le financement permet
Twelve Labs n'a pas détaillé de plans de dépenses spécifiques, mais l'ampleur de l'augmentation, 100 millions de dollars en un seul tour, suggère un investissement important dans le calcul, les talents et le développement de modèles. La formation de modèles de compréhension vidéo est beaucoup plus exigeante en termes de calcul que la formation de modèles de texte, étant donné la taille même des fichiers vidéo, ce qui augmente le coût du progrès.
Pour Lee, le pari est que le gain justifie ce coût. Comme il l’a dit, « l’enregistrement le plus riche de la réalité se situe encore largement en dehors de la couche sémantique utilisée par les systèmes d’IA modernes ». Le nouveau financement de Twelve Labs est un pari que l'intégration de la vidéo à l'intérieur de cette couche sera l'une des avancées déterminantes de l'IA dans les années à venir.
Sources : PYMNTS, Bloomberg News, blog de la société Twelve Labs.
---
Gardez une longueur d'avance sur l'IARecevez les dernières actualités, analyses et avancées en matière d'IA, le tout en un seul endroit.
Lire plus d'actualités sur l'IA →

