Twelve Labs, стартап, создающий искусственный интеллект, который может понимать видео так же, как языковые модели понимают текст, собрал 100 миллионов долларов в раунде финансирования серии B, поскольку он делает ставку на то, что следующий рубеж развития ИИ лежит в движении, а не в словах.
Компания объявила о финансировании в своем блоге 1 июля 2026 года. Раунд возглавили NEA и NAVER Ventures при участии Amazon, а также Radical Ventures, Korea Investment Partners, Index Ventures, Quadrille Capital и Red Bull Ventures. Для более широкого охвата индустрии ИИ отслеживания потоков венчурного капитала сделка подчеркивает растущую уверенность среди инвесторов в том, что видео — это следующий основной тип данных, который должен освоить ИИ.
«Мир не случается в тексте»
Соучредитель и генеральный директор Джей Ли четко сформулировал миссию компании. «Пять лет назад мы начали с простого наблюдения: мир не случается в тексте. Он случается в движении», — написал он в объявлении.
В интервью Bloomberg News Ли подробно остановился на этой идее, заявив, что видео «является наиболее похожим сигналом, который мы, люди, получаем для познания мира». Он сравнил это с доминирующими на данный момент архитектурами ИИ, отметив, что «это отличается даже от новейших передовых моделей, таких как Fable 5 и Mythos, которые все еще являются языковыми моделями».
Аргумент основан на пробеле в том, как в настоящее время работает ИИ. Последнее десятилетие развития ИИ, как писал Ли, «сделало текст программируемым», но видео еще не получило такой же обработки. Он описал мировое видео как «в основном темную материю для машин», хранящуюся в архивах, на дронах и на спутниковых каналах, доступ к которым до сих пор осуществляется в основном «через имена файлов, папки, подписи, стенограммы и человеческую память».
Обеспечение возможности использования видео агентами
Заявленная цель Twelve Labs — ликвидировать этот разрыв. «Наша цель — сделать каждую секунду видео доступной, доступной для поиска и использования агентами», — написал Ли, указав на рост агентов искусственного интеллекта, автономных систем, которые могут рассуждать и предпринимать действия, как на ключевой фактор спроса.
Если бы языковые модели сделали документы доступными для поиска, а генераторы кода ускорили бы создание программного обеспечения, то модель понимания видео могла бы сделать огромный и практически неиспользованный архив записанного видео доступным для автоматизированных систем. Это находит применение в средствах массовой информации, безопасности, беспилотных транспортных средствах и на предприятии — в любой области, где решения зависят от понимания того, что происходит внутри видеопотока.
Многолюдная, но отдельная категория
Twelve Labs занимает нишу, которая находится между двумя наиболее заметными категориями в области искусственного интеллекта. С одной стороны находятся видеогенераторы — инструменты, создающие новое видео из текстовых подсказок. С другой стороны, это большие языковые модели, обрабатывающие текст. Вместо этого Twelve Labs сосредоточена на понимании видео, интерпретации существующего видео, чтобы машины могли его искать, суммировать и действовать на основе него.
PYMNTS отметил, что видеогенераторы являются частью нового поколения категорий потребительского программного обеспечения, формирующихся вокруг ИИ, наряду с ИИ-компаньонами, диалоговым поиском и инструментами кодирования на основе подсказок. Подход Twelve Labs ориентирован на сторону предложения этой тенденции, создавая базовые модели, которые могут сделать видео первоклассным типом данных для агентов и приложений, создаваемых на его основе.
Почему инвесторы поддерживают видеоИИ
Список сторонников раунда указывает на стратегический интерес команд видеоИИ. Участие Amazon примечательно, поскольку облачное подразделение AWS компании является крупным поставщиком инфраструктуры искусственного интеллекта и имеет собственные инвестиции в видео- и медиа-сервисы. NAVER Ventures, инвестиционное подразделение южнокорейского интернет-гиганта, и Radical Ventures, фирма, специализирующаяся на искусственном интеллекте, сигнализируют о глобальном интересе к этой категории.
Этот раунд также отражает более широкую модель финансирования ИИ до середины 2026 года, когда инвесторы направляют капитал в стартапы, стремящиеся использовать не только текстовые методы обработки данных. В то время как текстовые модели поглотили львиную долю внимания и инвестиций, видео и другие формы богатых реальных данных рассматриваются как следующая арена, где могут быть найдены значимые прорывы и отдача.
Что дает финансирование
Twelve Labs не уточнила конкретные планы расходов, но масштаб привлечения средств (100 миллионов долларов за один раунд) предполагает значительные инвестиции в вычисления, таланты и разработку моделей. Обучение моделей, понимающих видео, требует гораздо больше вычислений, чем обучение текстовых моделей, учитывая огромный размер видеофайлов, что увеличивает стоимость прогресса.
Для Ли ставка заключается в том, что выигрыш оправдает эти затраты. По его словам, «самая богатая информация о реальности все еще находится за пределами семантического слоя, который используют современные системы искусственного интеллекта». Новое финансирование Twelve Labs — это ставка на то, что внедрение видео внутри этого слоя станет одним из определяющих достижений в области искусственного интеллекта в ближайшие годы.
Источники: PYMNTS, Bloomberg News, блог компании Twelve Labs.
---
Будьте впереди ИИПолучайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.
Подробнее новости AI →

