Twelve Labs, סטארט-אפ הבונה בינה מלאכותית שיכולה להבין וידאו כמו שמודלים של שפות מבינים טקסט, גייסה 100 מיליון דולר בסבב גיוס מסדרה B כיוון שהיא מהמרת שהגבול הבא של AI נמצא בתנועה ולא במילים.

החברה הודיעה על המימון בבלוג שלה ב-1 ביולי 2026. את הסבב הובילו NEA ו-NAVER Ventures, בהשתתפות אמזון לצד Radical Ventures, Korea Investment Partners, Index Ventures, Quadrille Capital ו-Red Bull Ventures. למעקב רחב יותר סיקור תעשיית הבינה המלאכותית לאן זורם הון סיכון, העסקה מדגישה את האמונה הגוברת בקרב המשקיעים שווידאו הוא סוג הנתונים העיקרי הבא ש-AI חייב לשלוט.

'העולם לא קורה בטקסט'

מייסד שותף ומנכ"ל ג'יי לי סידר את משימת החברה במונחים ברורים. "לפני חמש שנים התחלנו בהתבוננות פשוטה: העולם לא קורה בטקסט. זה קורה בתנועה", כתב בהודעה.

בראיון לחדשות בלומברג, לי הרחיב על הרעיון, וטען שווידאו "הוא נתוני האותות הדומים ביותר שאנו מקבלים כבני אדם כדי ללמוד על העולם". הוא העמיד זאת בניגוד לארכיטקטורות הבינה המלאכותית הדומיננטיות של הרגע, וציין כי "זה שונה אפילו מדגמי הגבול העדכניים ביותר כמו Fable 5 ו-Mythos, שהם עדיין מודלים של שפה".

הטיעון נשען על פער באופן שבו AI עובד כרגע. העשור האחרון של פיתוח בינה מלאכותית, כתב לי, "הפך טקסט לניתן לתכנות", אבל הווידאו עדיין לא קיבל את אותו טיפול. הוא תיאר את הסרטון העולמי כ"חומר אפל בעיקר למכונות", היושב בארכיונים, על רחפנים ובזנות לוויינים, עדיין ניגש אליו בעיקר "דרך שמות קבצים, תיקיות, כיתובים, תמלילים וזיכרון אנושי".

הפיכת הסרטון לשמיש על ידי סוכנים

המטרה המוצהרת של Twelve Labs היא לסגור את הפער הזה. "המטרה שלנו היא להפוך כל שנייה של וידאו לניתנת להתייחסות, ניתנת לחיפוש ושמיש על ידי סוכנים", כתב לי, והצביע על עלייתם של סוכני בינה מלאכותית, מערכות אוטונומיות שיכולות לנמק ולנקוט פעולה, כמניע המרכזי של הביקוש.

אם מודלים של שפה יהפכו מסמכים לניתנים לחיפוש ומחוללי קוד יהפכו תוכנה למהירה יותר לבנייה, מודל להבנת וידאו יכול להפוך את הארכיון העצום והלא מנוצל ברובו של וידאו מוקלט לנגיש למערכות אוטומטיות. יש לזה יישומים בכל מדיה, אבטחה, כלי רכב אוטונומיים וארגונים, כל תחום שבו ההחלטות תלויות בהבנה של מה שקורה בתוך זרם וידאו.

קטגוריה צפופה אך מובחנת

Twelve Labs תופסת נישה שנמצאת בין שתיים מהקטגוריות הנראות ביותר ב-AI. בצד אחד נמצאים מחוללי וידאו, כלים שיוצרים וידאו חדש מהנחיות טקסט. מצד שני יש מודלים של שפה גדולים שמעבדים טקסט. Twelve Labs מתמקדת במקום זאת בהבנת וידאו, בפירוש וידאו קיים כך שמכונות יוכלו לחפש בו, לסכם אותו ולפעול על פיו.

PYMNTS ציינה שמחוללי וידאו היו חלק מדור חדש של קטגוריות תוכנה לצרכנים שנוצרו סביב בינה מלאכותית, לצד חברי AI, חיפוש שיחה וכלי קידוד מבוססי הנחיה. הגישה של Twelve Labs מתמקדת בצד ההיצע של מגמה זו, ובונה את המודלים הבסיסיים שיכולים להפוך את הווידאו לסוג נתונים ממדרגה ראשונה עבור הסוכנים והיישומים הנבנים מעליו.

מדוע משקיעים מגבים וידאו AI

סגל התומכים בסבב מצביע על פקודות ה-AI של וידאו לעניין האסטרטגי. השתתפותה של אמזון בולטת בהתחשב בכך שחטיבת הענן AWS של החברה היא ספקית מרכזית של תשתית AI והשקעות משלה בשירותי וידאו ומדיה. NAVER Ventures, זרוע ההשקעות של ענקית האינטרנט הדרום קוריאנית, וחברת Radical Ventures, חברה המתמקדת בבינה מלאכותית, מסמנת עניין עולמי בקטגוריה.

הסבב משקף גם דפוס רחב יותר במימון בינה מלאכותית עד אמצע 2026, שבו משקיעים מפנים הון לחברות סטארט-אפ הרודפות אחר שיטות מידע מעבר לטקסט. בעוד שמודלים מבוססי טקסט ספגו את חלק הארי של תשומת הלב וההשקעה, וידאו וצורות אחרות של נתונים עשירים בעולם האמיתי נתפסים כזירה הבאה שבה ניתן למצוא פריצות דרך משמעותיות, ותשואות.

מה המימון מאפשר

Twelve Labs לא פירטו תוכניות הוצאות ספציפיות, אבל היקף הגיוס, 100 מיליון דולר בסבב בודד, מצביע על השקעה משמעותית בפיתוח מחשוב, כישרון ומודלים. אימון מודלים של הבנת וידאו תובעני הרבה יותר מהכשרת מודלים של טקסט, בהתחשב בגודל העצום של קבצי וידאו, מה שמעלה את עלות ההתקדמות.

עבור לי, ההימור הוא שהתמורה מצדיקה את העלות הזו. כפי שהוא ניסח זאת, "התיעוד העשיר ביותר של המציאות עדיין נמצא ברובו מחוץ לשכבה הסמנטית שבה משתמשות מערכות בינה מלאכותית מודרניות". המימון החדש של Twelve Labs הוא הימור שהכנסת וידאו לתוך השכבה הזו תהיה אחת מהתקדמות הבינה המלאכותית המכוונות של השנים הקרובות.

מקורות: PYMNTS, Bloomberg News, בלוג החברה של Twelve Labs.

---

הישאר לפני AI

קבל את החדשות, הניתוחים ופריצות הדרך האחרונות של AI - הכל במקום אחד.

קרא עוד חדשות AI →