Twelve Labs، یک استارتآپ سازنده هوش مصنوعی که میتواند ویدیو را به روشی که مدلهای زبانی متن را درک میکنند، درک کند، ۱۰۰ میلیون دلار در دور سرمایهگذاری سری B جمعآوری کرده است زیرا شرط میبندد که مرز بعدی هوش مصنوعی به جای کلمات در حرکت است.
این شرکت در تاریخ 1 ژوئیه 2026 بودجه خود را در وبلاگ خود اعلام کرد. این دور توسط NEA و NAVER Ventures، با مشارکت آمازون در کنار Radical Ventures، Korea Investment Partners، Index Ventures، Quadrille Capital و Red Bull Ventures هدایت شد. برای ردیابی گستردهتر [پوشش صنعت هوش مصنوعی] (https://aibuzzwire.news) جایی که سرمایههای مخاطرهآمیز جریان دارد، این معامله بر اعتقاد رو به رشد سرمایهگذاران تاکید میکند که ویدئو نوع داده اصلی بعدی است که هوش مصنوعی باید تسلط یابد.
"جهان در متن اتفاق نمی افتد"
جائه لی، یکی از بنیانگذاران و مدیر اجرایی، ماموریت شرکت را با عبارات واضح بیان کرد. او در این اطلاعیه نوشت: "پنج سال پیش، ما با یک مشاهده ساده شروع کردیم: جهان در متن اتفاق نمی افتد، بلکه در حرکت اتفاق می افتد."
در مصاحبه ای با بلومبرگ نیوز، لی این ایده را گسترش داد و استدلال کرد که ویدئو "مشابه ترین داده سیگنالی است که ما به عنوان انسان برای یادگیری در مورد جهان دریافت می کنیم." او آن را با معماریهای AI غالب در حال حاضر مقایسه کرد و خاطرنشان کرد که «این حتی با آخرین مدلهای مرزی مانند Fable 5 و Mythos که هنوز هم مدلهای زبانی هستند، متفاوت است».
استدلال بر اساس شکافی در نحوه عملکرد هوش مصنوعی در حال حاضر است. لی نوشت: دهه آخر توسعه هوش مصنوعی «متن را قابل برنامهریزی کرد» اما ویدیو هنوز با همان رفتار مواجه نشده است. او ویدئوی جهان را به عنوان "ماده تاریکی برای ماشینها" توصیف کرد که در بایگانیها، پهپادها و فیدهای ماهوارهای قرار دارد و هنوز عمدتاً از طریق نام فایلها، پوشهها، زیرنویسها، رونوشتها و حافظه انسانی قابل دسترسی است.
ساخت ویدیو قابل استفاده توسط نمایندگان
هدف اعلام شده دوازده آزمایشگاه این است که این شکاف را از بین ببرد. لی با اشاره به ظهور عوامل هوش مصنوعی، سیستمهای مستقلی که میتوانند استدلال کنند و اقدام کنند، بهعنوان محرک اصلی تقاضا، نوشت: «هدف ما این است که هر ثانیه ویدیو را آدرسپذیر، قابل جستجو و قابل استفاده توسط نمایندگان کنیم».
اگر مدلهای زبانی اسناد را قابل جستجو میکردند و تولیدکنندههای کد نرمافزار را سریعتر میساختند، یک مدل درک ویدیویی میتوانست آرشیو عظیم و تا حد زیادی دستنخورده ویدیوهای ضبطشده را در دسترس سیستمهای خودکار قرار دهد. این برنامه در رسانه ها، امنیت، وسایل نقلیه خودمختار، و شرکت ها، هر زمینه ای که تصمیم گیری ها به درک آنچه در یک جریان ویدیویی اتفاق می افتد بستگی دارد، کاربرد دارد.
یک دسته شلوغ اما متمایز
Twelve Labs جایگاهی را اشغال می کند که بین دو دسته از قابل مشاهده ترین دسته ها در هوش مصنوعی قرار دارد. در یک طرف مولدهای ویدیو قرار دارند، ابزارهایی که ویدیوی جدید را از پیام های متنی ایجاد می کنند. از سوی دیگر، مدل های زبان بزرگی هستند که متن را پردازش می کنند. Twelve Labs به جای آن بر درک ویدیو، تفسیر ویدیوی موجود متمرکز است تا ماشین ها بتوانند آن را جستجو، خلاصه کنند و بر اساس آن عمل کنند.
PYMNTS خاطرنشان کرد که تولیدکنندههای ویدیو بخشی از نسل جدیدی از دستهبندیهای نرمافزار مصرفکننده هستند که در کنار هوش مصنوعی، جستجوی مکالمه و ابزارهای کدگذاری مبتنی بر سریع شکل میگیرند. رویکرد دوازده آزمایشگاه، سمت عرضه این روند را هدف قرار میدهد، و مدلهای زیربنایی را ایجاد میکند که میتواند ویدئو را به نوع داده درجه یک برای عوامل و برنامههای کاربردی در بالای آن تبدیل کند.
چرا سرمایه گذاران از هوش مصنوعی ویدیویی حمایت می کنند
فهرست حامیان در دور به دستورات هوش مصنوعی ویدیویی با منافع استراتژیک اشاره دارد. مشارکت آمازون با توجه به اینکه بخش ابری AWS این شرکت ارائه دهنده اصلی زیرساخت های هوش مصنوعی و سرمایه گذاری های خود در خدمات ویدئویی و رسانه ای است، قابل توجه است. NAVER Ventures، بازوی سرمایه گذاری غول اینترنتی کره جنوبی، و Radical Ventures، یک شرکت متمرکز بر هوش مصنوعی، نشان دهنده علاقه جهانی به این دسته است.
این دور همچنین نشان دهنده الگوی گسترده تری در تأمین مالی هوش مصنوعی تا اواسط سال 2026 است، جایی که سرمایه گذاران سرمایه را به سمت استارتاپ هایی هدایت می کنند که روش های داده فراتر از متن را دنبال می کنند. در حالی که مدلهای مبتنی بر متن سهم عمدهای از توجه و سرمایهگذاری را به خود اختصاص دادهاند، ویدئو و سایر اشکال دادههای غنی و واقعی بهعنوان عرصه بعدی در نظر گرفته میشوند که ممکن است پیشرفتها و بازدههای معناداری پیدا شود.
آنچه که بودجه امکان پذیر می کند
دوازده آزمایشگاه جزئیات برنامههای هزینههای خاصی را ارائه نکردند، اما مقیاس افزایش، 100 میلیون دلار در یک دور، نشاندهنده سرمایهگذاری قابل توجه در محاسبات، استعدادها و توسعه مدل است. آموزش مدلهای درک ویدیویی از نظر محاسباتی بسیار بیشتر از مدلهای متنی آموزشی است، با توجه به حجم زیاد فایلهای ویدیویی، که هزینه پیشرفت را افزایش میدهد.
برای لی، شرط این است که بازده آن هزینه را توجیه کند. همانطور که او بیان کرد، "غنی ترین رکورد واقعیت هنوز تا حد زیادی خارج از لایه معنایی است که سیستم های هوش مصنوعی مدرن استفاده می کنند." بودجه جدید Twelve Labs شرطی است که آوردن ویدیو به داخل آن لایه یکی از پیشرفت های تعیین کننده هوش مصنوعی در سال های آینده خواهد بود.
منابع: PYMNTS، Bloomberg News، وبلاگ شرکت Twelve Labs.
---
از هوش مصنوعی جلوتر بمانیدآخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →

