Twelve Labs، یک استارت‌آپ سازنده هوش مصنوعی که می‌تواند ویدیو را به روشی که مدل‌های زبانی متن را درک می‌کنند، درک کند، ۱۰۰ میلیون دلار در دور سرمایه‌گذاری سری B جمع‌آوری کرده است زیرا شرط می‌بندد که مرز بعدی هوش مصنوعی به جای کلمات در حرکت است.

این شرکت در تاریخ 1 ژوئیه 2026 بودجه خود را در وبلاگ خود اعلام کرد. این دور توسط NEA و NAVER Ventures، با مشارکت آمازون در کنار Radical Ventures، Korea Investment Partners، Index Ventures، Quadrille Capital و Red Bull Ventures هدایت شد. برای ردیابی گسترده‌تر [پوشش صنعت هوش مصنوعی] (https://aibuzzwire.news) جایی که سرمایه‌های مخاطره‌آمیز جریان دارد، این معامله بر اعتقاد رو به رشد سرمایه‌گذاران تاکید می‌کند که ویدئو نوع داده اصلی بعدی است که هوش مصنوعی باید تسلط یابد.

"جهان در متن اتفاق نمی افتد"

جائه لی، یکی از بنیانگذاران و مدیر اجرایی، ماموریت شرکت را با عبارات واضح بیان کرد. او در این اطلاعیه نوشت: "پنج سال پیش، ما با یک مشاهده ساده شروع کردیم: جهان در متن اتفاق نمی افتد، بلکه در حرکت اتفاق می افتد."

در مصاحبه ای با بلومبرگ نیوز، لی این ایده را گسترش داد و استدلال کرد که ویدئو "مشابه ترین داده سیگنالی است که ما به عنوان انسان برای یادگیری در مورد جهان دریافت می کنیم." او آن را با معماری‌های AI غالب در حال حاضر مقایسه کرد و خاطرنشان کرد که «این حتی با آخرین مدل‌های مرزی مانند Fable 5 و Mythos که هنوز هم مدل‌های زبانی هستند، متفاوت است».

استدلال بر اساس شکافی در نحوه عملکرد هوش مصنوعی در حال حاضر است. لی نوشت: دهه آخر توسعه هوش مصنوعی «متن را قابل برنامه‌ریزی کرد» اما ویدیو هنوز با همان رفتار مواجه نشده است. او ویدئوی جهان را به عنوان "ماده تاریکی برای ماشین‌ها" توصیف کرد که در بایگانی‌ها، پهپادها و فیدهای ماهواره‌ای قرار دارد و هنوز عمدتاً از طریق نام فایل‌ها، پوشه‌ها، زیرنویس‌ها، رونوشت‌ها و حافظه انسانی قابل دسترسی است.

ساخت ویدیو قابل استفاده توسط نمایندگان

هدف اعلام شده دوازده آزمایشگاه این است که این شکاف را از بین ببرد. لی با اشاره به ظهور عوامل هوش مصنوعی، سیستم‌های مستقلی که می‌توانند استدلال کنند و اقدام کنند، به‌عنوان محرک اصلی تقاضا، نوشت: «هدف ما این است که هر ثانیه ویدیو را آدرس‌پذیر، قابل جستجو و قابل استفاده توسط نمایندگان کنیم».

اگر مدل‌های زبانی اسناد را قابل جستجو می‌کردند و تولیدکننده‌های کد نرم‌افزار را سریع‌تر می‌ساختند، یک مدل درک ویدیویی می‌توانست آرشیو عظیم و تا حد زیادی دست‌نخورده ویدیوهای ضبط‌شده را در دسترس سیستم‌های خودکار قرار دهد. این برنامه در رسانه ها، امنیت، وسایل نقلیه خودمختار، و شرکت ها، هر زمینه ای که تصمیم گیری ها به درک آنچه در یک جریان ویدیویی اتفاق می افتد بستگی دارد، کاربرد دارد.

یک دسته شلوغ اما متمایز

Twelve Labs جایگاهی را اشغال می کند که بین دو دسته از قابل مشاهده ترین دسته ها در هوش مصنوعی قرار دارد. در یک طرف مولدهای ویدیو قرار دارند، ابزارهایی که ویدیوی جدید را از پیام های متنی ایجاد می کنند. از سوی دیگر، مدل های زبان بزرگی هستند که متن را پردازش می کنند. Twelve Labs به جای آن بر درک ویدیو، تفسیر ویدیوی موجود متمرکز است تا ماشین ها بتوانند آن را جستجو، خلاصه کنند و بر اساس آن عمل کنند.

PYMNTS خاطرنشان کرد که تولیدکننده‌های ویدیو بخشی از نسل جدیدی از دسته‌بندی‌های نرم‌افزار مصرف‌کننده هستند که در کنار هوش مصنوعی، جستجوی مکالمه و ابزارهای کدگذاری مبتنی بر سریع شکل می‌گیرند. رویکرد دوازده آزمایشگاه، سمت عرضه این روند را هدف قرار می‌دهد، و مدل‌های زیربنایی را ایجاد می‌کند که می‌تواند ویدئو را به نوع داده درجه یک برای عوامل و برنامه‌های کاربردی در بالای آن تبدیل کند.

چرا سرمایه گذاران از هوش مصنوعی ویدیویی حمایت می کنند

فهرست حامیان در دور به دستورات هوش مصنوعی ویدیویی با منافع استراتژیک اشاره دارد. مشارکت آمازون با توجه به اینکه بخش ابری AWS این شرکت ارائه دهنده اصلی زیرساخت های هوش مصنوعی و سرمایه گذاری های خود در خدمات ویدئویی و رسانه ای است، قابل توجه است. NAVER Ventures، بازوی سرمایه گذاری غول اینترنتی کره جنوبی، و Radical Ventures، یک شرکت متمرکز بر هوش مصنوعی، نشان دهنده علاقه جهانی به این دسته است.

این دور همچنین نشان دهنده الگوی گسترده تری در تأمین مالی هوش مصنوعی تا اواسط سال 2026 است، جایی که سرمایه گذاران سرمایه را به سمت استارتاپ هایی هدایت می کنند که روش های داده فراتر از متن را دنبال می کنند. در حالی که مدل‌های مبتنی بر متن سهم عمده‌ای از توجه و سرمایه‌گذاری را به خود اختصاص داده‌اند، ویدئو و سایر اشکال داده‌های غنی و واقعی به‌عنوان عرصه بعدی در نظر گرفته می‌شوند که ممکن است پیشرفت‌ها و بازده‌های معناداری پیدا شود.

آنچه که بودجه امکان پذیر می کند

دوازده آزمایشگاه جزئیات برنامه‌های هزینه‌های خاصی را ارائه نکردند، اما مقیاس افزایش، 100 میلیون دلار در یک دور، نشان‌دهنده سرمایه‌گذاری قابل توجه در محاسبات، استعدادها و توسعه مدل است. آموزش مدل‌های درک ویدیویی از نظر محاسباتی بسیار بیشتر از مدل‌های متنی آموزشی است، با توجه به حجم زیاد فایل‌های ویدیویی، که هزینه پیشرفت را افزایش می‌دهد.

برای لی، شرط این است که بازده آن هزینه را توجیه کند. همانطور که او بیان کرد، "غنی ترین رکورد واقعیت هنوز تا حد زیادی خارج از لایه معنایی است که سیستم های هوش مصنوعی مدرن استفاده می کنند." بودجه جدید Twelve Labs شرطی است که آوردن ویدیو به داخل آن لایه یکی از پیشرفت های تعیین کننده هوش مصنوعی در سال های آینده خواهد بود.

منابع: PYMNTS، Bloomberg News، وبلاگ شرکت Twelve Labs.

---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

بیشتر بخوانید اخبار هوش مصنوعی →