Twelve Labs, una startup que construye inteligencia artificial que puede entender videos de la misma manera que los modelos de lenguaje entienden texto, ha recaudado 100 millones de dólares en una ronda de financiación Serie B, ya que apuesta a que la próxima frontera de la IA está en el movimiento y no en las palabras.
La compañía anunció la financiación en su blog el 1 de julio de 2026. La ronda fue liderada por NEA y NAVER Ventures, con la participación de Amazon junto con Radical Ventures, Korea Investment Partners, Index Ventures, Quadrille Capital y Red Bull Ventures. Para un seguimiento más amplio de la cobertura de la industria de la IA hacia dónde fluye el capital de riesgo, el acuerdo subraya una creciente convicción entre los inversores de que el vídeo es el siguiente tipo de datos importante que la IA debe dominar.
'El mundo no sucede en el texto'
El cofundador y director ejecutivo, Jae Lee, planteó la misión de la empresa en términos claros. "Hace cinco años, comenzamos con una simple observación: el mundo no ocurre en el texto. Ocurre en movimiento", escribió en el anuncio.
En una entrevista con Bloomberg News, Lee amplió la idea, argumentando que el vídeo "es la señal de datos más similar que recibimos como humanos para aprender sobre el mundo". Lo comparó con las arquitecturas de IA dominantes del momento, señalando que "eso es diferente incluso de los últimos modelos de vanguardia como Fable 5 y Mythos, que siguen siendo modelos de lenguaje".
El argumento se basa en una brecha en el funcionamiento actual de la IA. La última década de desarrollo de la IA, escribió Lee, "hizo que el texto fuera programable", pero el vídeo aún no ha recibido el mismo tratamiento. Describió los vídeos del mundo como "principalmente materia oscura para las máquinas", almacenados en archivos, drones y transmisiones satelitales, a los que todavía se accede en gran medida "a través de nombres de archivos, carpetas, subtítulos, transcripciones y memoria humana".
Cómo hacer que los agentes puedan utilizar el vídeo
El objetivo declarado de Twelve Labs es cerrar esa brecha. "Nuestro objetivo es hacer que cada segundo de vídeo sea direccionable, buscable y utilizable por los agentes", escribió Lee, señalando el aumento de los agentes de IA, sistemas autónomos que pueden razonar y actuar, como el principal impulsor de la demanda.
Si los modelos de lenguaje hicieran que los documentos pudieran buscarse y los generadores de códigos hicieran que el software fuera más rápido de construir, un modelo de comprensión de video podría hacer que el enorme y en gran parte sin explotar archivo de video grabado fuera accesible a los sistemas automatizados. Esto tiene aplicaciones en medios, seguridad, vehículos autónomos y empresas, cualquier campo donde las decisiones dependan de comprender lo que sucede dentro de una transmisión de video.
Una categoría concurrida pero distinta
Twelve Labs ocupa un nicho que se encuentra entre dos de las categorías más visibles de la IA. Por un lado están los generadores de vídeo, herramientas que crean nuevos vídeos a partir de indicaciones de texto. Por el otro, están los grandes modelos de lenguaje que procesan texto. Twelve Labs se centra más bien en la comprensión del vídeo, interpretando el vídeo existente para que las máquinas puedan buscarlo, resumirlo y actuar en consecuencia.
PYMNTS señaló que los generadores de video han sido parte de una nueva generación de categorías de software de consumo que se están formando en torno a la IA, junto con compañeros de IA, búsqueda conversacional y herramientas de codificación basadas en indicaciones. El enfoque de Twelve Labs apunta al lado de la oferta de esa tendencia, construyendo los modelos subyacentes que podrían hacer del video un tipo de datos de primera clase para los agentes y aplicaciones que se construyen sobre él.
Por qué los inversores respaldan la vídeo-IA
La lista de patrocinadores en la ronda apunta a los comandos de IA en video de interés estratégico. La participación de Amazon es notable dado que la división de nube AWS de la compañía es un importante proveedor de infraestructura de inteligencia artificial y sus propias inversiones en servicios de video y medios. NAVER Ventures, el brazo inversor del gigante de Internet de Corea del Sur, y Radical Ventures, una empresa centrada en la inteligencia artificial, señalan el interés global en la categoría.
La ronda también refleja un patrón más amplio en la financiación de la IA hasta mediados de 2026, donde los inversores están dirigiendo capital hacia nuevas empresas que buscan modalidades de datos más allá del texto. Si bien los modelos basados en texto han absorbido la mayor parte de la atención y la inversión, el vídeo y otras formas de datos ricos del mundo real se consideran el próximo campo donde se pueden encontrar avances y beneficios significativos.
Lo que permite la financiación
Twelve Labs no detalló planes de gasto específicos, pero la escala del aumento, 100 millones de dólares en una sola ronda, sugiere una inversión significativa en computación, talento y desarrollo de modelos. Entrenar modelos de comprensión de video es mucho más exigente desde el punto de vista computacional que entrenar modelos de texto, dado el gran tamaño de los archivos de video, lo que aumenta el costo del progreso.
Para Lee, la apuesta es que la recompensa justifique ese costo. Como él mismo dijo, "el registro más rico de la realidad todavía se encuentra en gran medida fuera de la capa semántica que utilizan los sistemas modernos de IA". La nueva financiación de Twelve Labs es una apuesta a que llevar vídeo dentro de esa capa será uno de los avances de IA definitorios de los próximos años.
Fuentes: PYMNTS, Bloomberg News, blog de la empresa Twelve Labs.
---
Manténgase a la vanguardia de la IAObtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.
Leer más noticias sobre IA →

