Twelve Labs, стартап, що розробляє штучний інтелект, який може розуміти відео так, як мовні моделі розуміють текст, залучив 100 мільйонів доларів у раунді фінансування серії B, роблячи ставку на те, що наступний рубіж ШІ лежить у русі, а не в словах.
Компанія оголосила про фінансування у своєму блозі 1 липня 2026 року. Раунд очолили NEA та NAVER Ventures за участю Amazon разом із Radical Ventures, Korea Investment Partners, Index Ventures, Quadrille Capital та Red Bull Ventures. Для ширшого [охоплення індустрії штучного інтелекту] (https://aibuzzwire.news) відстеження потоків венчурного капіталу угода підкреслює зростаюче переконання серед інвесторів у тому, що відео є наступним основним типом даних, яким ШІ повинен опанувати.
«Світ не буває в тексті»
Співзасновник і виконавчий директор Дже Лі чітко сформулював місію компанії. «П’ять років тому ми почали з простого спостереження: світ не виникає в тексті. Він відбувається в русі», — написав він в анонсі.
В інтерв’ю Bloomberg News Лі розширив цю ідею, стверджуючи, що відео «є найбільш схожими сигнальними даними, які ми отримуємо як люди, щоб пізнавати світ». Він порівняв це з домінуючою на даний момент архітектурою штучного інтелекту, зазначивши, що «це відрізняється навіть від останніх передових моделей, таких як Fable 5 і Mythos, які все ще є мовними моделями».
Аргумент базується на прогалині в тому, як зараз працює ШІ. Останнє десятиліття розвитку штучного інтелекту, писав Лі, «зробило текст програмованим», але відео ще не отримало такого ж ставлення. Він описав світове відео як «здебільшого темну матерію для машин», що зберігається в архівах, на дронах і в супутникових каналах, доступ до якого все ще здійснюється переважно «через імена файлів, папки, підписи, стенограми та людську пам’ять».
Зробити відео придатним для використання агентами
Заявлена мета Twelve Labs — закрити цю прогалину. «Наша мета — зробити кожну секунду відео доступною для адресації, пошуку та використання агентами», — написав Лі, вказавши на зростання агентів штучного інтелекту, автономних систем, які можуть міркувати та діяти, як на ключовий фактор попиту.
Якби мовні моделі робили документи доступними для пошуку, а генератори коду прискорювали створення програмного забезпечення, модель розуміння відео могла б зробити величезний і майже невикористаний архів записаного відео доступним для автоматизованих систем. Це має застосування в медіа, безпеці, автономних транспортних засобах і підприємствах, у будь-якій сфері, де рішення залежать від розуміння того, що відбувається всередині відеопотоку.
Багатолюдна, але відмінна категорія
Twelve Labs займає нішу, яка знаходиться між двома найпомітнішими категоріями штучного інтелекту. З одного боку знаходяться відеогенератори, інструменти, які створюють нове відео з текстових підказок. З іншого — великі мовні моделі, які обробляють текст. Натомість Twelve Labs зосереджено на розумінні відео, інтерпретації існуючого відео, щоб машини могли шукати його, узагальнювати та діяти на основі нього.
PYMNTS зазначив, що відеогенератори є частиною нового покоління категорій споживчого програмного забезпечення, яке формується навколо штучного інтелекту, поряд із компаньйонами штучного інтелекту, розмовним пошуком та інструментами кодування на основі підказок. Підхід Twelve Labs націлений на сторону пропозиції цієї тенденції, створюючи базові моделі, які можуть зробити відео першокласним типом даних для агентів і додатків, створених на його основі.
Чому інвестори підтримують Video AI
Список спонсорів у раунді вказує на стратегічно цікаві відеокоманди ШІ. Участь Amazon помітна, враховуючи, що хмарний підрозділ компанії AWS є основним постачальником інфраструктури штучного інтелекту та її власних інвестицій у відео- та медіа-сервіси. NAVER Ventures, інвестиційний підрозділ південнокорейського інтернет-гіганта, і Radical Ventures, фірма, що спеціалізується на штучному інтелекті, свідчать про глобальний інтерес до цієї категорії.
Раунд також відображає ширшу структуру фінансування штучного інтелекту до середини 2026 року, коли інвестори спрямовують капітал на стартапи, які переслідують модальності даних, крім тексту. У той час як текстові моделі поглинули левову частку уваги та інвестицій, відео та інші форми насичених реальних даних розглядаються як наступна арена, де можна знайти значні прориви та віддачу.
Що дає можливість фінансування
Дванадцять лабораторій не розповіли про конкретні плани витрат, але масштаб підвищення, 100 мільйонів доларів за один раунд, свідчить про значні інвестиції в обчислення, таланти та розробку моделей. Навчання моделей розуміння відео потребує набагато більше обчислень, ніж навчання текстових моделей, враховуючи величезний розмір відеофайлів, що підвищує вартість прогресу.
Для Лі ставка полягає в тому, що виграш виправдовує ці витрати. За його словами, «найбагатший запис реальності все ще значною мірою знаходиться за межами семантичного шару, який використовують сучасні системи ШІ». Нове фінансування Twelve Labs полягає в закладі на те, що впровадження відео в цей рівень стане одним із визначальних досягнень ШІ найближчих років.
Джерела: PYMNTS, Bloomberg News, блог компанії Twelve Labs.
---
Будьте попереду ШІОтримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.
Читати більше новин AI →

