Twelve Labs 是一家构建人工智能的初创公司,可以像语言模型理解文本一样理解视频,该公司在 B 轮融资中筹集了 1 亿美元,因为它押注人工智能的下一个前沿在于运动而不是文字。

该公司于 2026 年 7 月 1 日在其博客上宣布了此次融资。该轮融资由 NEA 和 NAVER Ventures 领投,亚马逊以及 Radical Ventures、Korea Investment Partners、Index Ventures、Quadrille Capital 和 Red Bull Ventures 参与。为了更广泛地跟踪风险资本的流向,这笔交易凸显了投资者越来越相信视频是人工智能必须掌握的下一个主要数据类型。

“世界不会发生在文本中”

联合创始人兼首席执行官 Jae Lee 以鲜明的措辞阐述了公司的使命。 “五年前,我们从一个简单的观察开始:世界不是在文本中发生的。它是在运动中发生的,”他在公告中写道。

在接受彭博新闻社采访时,李扩展了这个想法,认为视频“是我们作为人类了解世界时收到的最相似的信号数据”。他将其与当前占主导地位的人工智能架构进行了对比,并指出“这甚至不同于 Fable 5 和 Mythos 等最新的前沿模型,它们仍然是语言模型。”

争论的焦点在于人工智能目前的运作方式存在差距。李写道,人工智能发展的最后十年“使文本变得可编程”,但视频尚未得到同样的待遇。他将世界上的视频描述为“对机器来说主要是暗物质”,存在于档案馆、无人机和卫星馈送中,仍然主要“通过文件名、文件夹、字幕、文字记录和人类记忆”进行访问。

使视频可供特工使用

十二实验室的既定目标是缩小这一差距。李写道:“我们的目标是让视频的每一秒都可供代理寻址、搜索和使用。”他指出,人工智能代理、能够推理和采取行动的自主系统的兴起是需求的关键驱动力。

如果语言模型使文档可搜索,代码生成器使软件构建速度更快,那么视频理解模型可以使自动化系统可以访问大量且大部分未开发的录制视频档案。它的应用遍及媒体、安全、自动驾驶汽车和企业,以及任何决策依赖于了解视频流内部发生情况的领域。

一个拥挤但独特的类别

十二实验室占据了人工智能领域两个最引人注目的类别之间的利基市场。一方面是视频生成器,这是根据文本提示创建新视频的工具。另一方面是处理文本的大型语言模型。十二实验室专注于视频理解,解释现有视频,以便机器可以搜索它、总结它并对其采取行动。

PYMNTS 指出,视频生成器已成为围绕人工智能形成的新一代消费软件类别的一部分,其他软件还有人工智能伴侣、对话式搜索和基于提示的编码工具。十二实验室的方法瞄准了这一趋势的供应方,构建了底层模型,使视频成为构建在其之上的代理和应用程序的一流数据类型。

为什么投资者支持视频人工智能

本轮支持者名单指向视频 AI 命令的战略利益。亚马逊的参与值得注意,因为该公司的 AWS 云部门是人工智能基础设施的主要提供商,并且自己在视频和媒体服务方面进行了投资。韩国互联网巨头的投资部门 NAVER Ventures 和专注于人工智能的公司 Radical Ventures 表明了全球对该领域的兴趣。

此轮融资还反映了到 2026 年中期人工智能融资的更广泛模式,投资者将资金投向追求文本以外的数据模式的初创公司。虽然基于文本的模型吸引了大部分的注意力和投资,但视频和其他形式的丰富的现实世界数据被视为下一个可能找到有意义的突破和回报的领域。

资金的用途

十二实验室没有详细说明具体的支出计划,但单轮融资规模为 1 亿美元,表明在计算、人才和模型开发方面进行了大量投资。考虑到视频文件的庞大规模,训练视频理解模型的计算要求远高于训练文本模型,这会增加进展成本。

对于李来说,赌注是回报证明了成本的合理性。正如他所说,“最丰富的现实记录仍然很大程度上位于现代人工智能系统使用的语义层之外。”十二实验室的新资金押注于将视频引入该层将成为未来几年人工智能的决定性进步之一。

资料来源:PYMNTS、彭博新闻、十二实验室公司博客。

---

保持人工智能领先地位

获取最新的人工智能新闻、分析和突破——尽在一个地方。

阅读更多人工智能新闻 →