आर्टिफिशियल इंटेलिजेंस बनाने वाला एक स्टार्टअप, जो भाषा मॉडल टेक्स्ट को समझने के तरीके से वीडियो को समझ सकता है, ट्वेल्व लैब्स ने सीरीज बी फंडिंग राउंड में 100 मिलियन डॉलर जुटाए हैं क्योंकि यह शर्त लगाता है कि एआई की अगली सीमा शब्दों के बजाय गति में है।

कंपनी ने 1 जुलाई, 2026 को अपने ब्लॉग पर फंडिंग की घोषणा की। इस दौर का नेतृत्व NEA और NAVER वेंचर्स ने किया, जिसमें रेडिकल वेंचर्स, कोरिया इन्वेस्टमेंट पार्टनर्स, इंडेक्स वेंचर्स, क्वाड्रिल कैपिटल और रेड बुल वेंचर्स के साथ अमेज़ॅन की भागीदारी थी। व्यापक [एआई उद्योग कवरेज] (https://aibuzzwire.news) के लिए जहां उद्यम पूंजी प्रवाहित हो रही है, उस पर नज़र रखने के लिए, यह सौदा निवेशकों के बीच बढ़ते विश्वास को रेखांकित करता है कि वीडियो अगला प्रमुख डेटा प्रकार है जिसमें एआई को मास्टर होना चाहिए।

'दुनिया पाठ में नहीं घटती'

सह-संस्थापक और मुख्य कार्यकारी जे ली ने कंपनी के मिशन को स्पष्ट शब्दों में तैयार किया। उन्होंने घोषणा में लिखा, "पांच साल पहले, हमने एक साधारण अवलोकन के साथ शुरुआत की थी: दुनिया पाठ में नहीं घटित होती है। यह गति में घटित होती है।"

ब्लूमबर्ग न्यूज़ के साथ एक साक्षात्कार में, ली ने इस विचार का विस्तार करते हुए तर्क दिया कि वीडियो "सबसे समान सिग्नल डेटा है जो हम इंसानों के रूप में दुनिया के बारे में जानने के लिए प्राप्त करते हैं।" उन्होंने इसकी तुलना इस समय के प्रमुख एआई आर्किटेक्चर से करते हुए कहा कि "यह फ़ेबल 5 और माइथोस जैसे नवीनतम फ्रंटियर मॉडल से भी अलग है, जो अभी भी भाषा मॉडल हैं।"

यह तर्क इस बात पर आधारित है कि एआई वर्तमान में कैसे काम करता है। एआई विकास के आखिरी दशक में, ली ने लिखा, "टेक्स्ट को प्रोग्राम करने योग्य बनाया," लेकिन वीडियो को अभी तक वही उपचार नहीं मिला है। उन्होंने दुनिया के वीडियो को "मशीनों के लिए ज्यादातर डार्क मैटर" के रूप में वर्णित किया, अभिलेखागार में, ड्रोन पर और उपग्रह फ़ीड में, अभी भी बड़े पैमाने पर "फ़ाइल नाम, फ़ोल्डर्स, कैप्शन, ट्रांसक्रिप्ट और मानव स्मृति के माध्यम से एक्सेस किया जाता है।"

एजेंटों द्वारा वीडियो को उपयोगी बनाना

ट्वेल्व लैब्स का घोषित लक्ष्य उस अंतर को पाटना है। "हमारा लक्ष्य वीडियो के हर सेकंड को एजेंटों द्वारा पता लगाने योग्य, खोजने योग्य और उपयोग करने योग्य बनाना है," ली ने मांग के प्रमुख चालक के रूप में एआई एजेंटों, स्वायत्त प्रणालियों के उदय की ओर इशारा करते हुए लिखा, जो तर्क कर सकते हैं और कार्रवाई कर सकते हैं।

यदि भाषा मॉडल दस्तावेज़ों को खोजने योग्य बनाते हैं और कोड जेनरेटर सॉफ़्टवेयर को तेजी से बनाते हैं, तो एक वीडियो-समझने वाला मॉडल रिकॉर्ड किए गए वीडियो के विशाल और बड़े पैमाने पर अप्रयुक्त संग्रह को स्वचालित सिस्टम के लिए सुलभ बना सकता है। इसमें मीडिया, सुरक्षा, स्वायत्त वाहन और उद्यम, किसी भी क्षेत्र में अनुप्रयोग हैं जहां निर्णय यह समझने पर निर्भर करते हैं कि वीडियो स्ट्रीम के अंदर क्या हो रहा है।

एक भीड़भाड़ वाली लेकिन विशिष्ट श्रेणी

ट्वेल्व लैब्स एआई में सबसे अधिक दिखाई देने वाली दो श्रेणियों के बीच में एक स्थान रखती है। एक तरफ वीडियो जनरेटर हैं, उपकरण जो टेक्स्ट प्रॉम्प्ट से नया वीडियो बनाते हैं। दूसरी ओर बड़े भाषा मॉडल हैं जो पाठ को संसाधित करते हैं। ट्वेल्व लैब्स का ध्यान वीडियो को समझने, मौजूदा वीडियो की व्याख्या करने पर केंद्रित है ताकि मशीनें इसे खोज सकें, इसका सारांश बना सकें और उस पर कार्य कर सकें।

पीवाईएमएनटीएस ने नोट किया कि वीडियो जनरेटर एआई साथियों, संवादी खोज और प्रॉम्प्ट-आधारित कोडिंग टूल के साथ-साथ एआई के आसपास गठित उपभोक्ता सॉफ्टवेयर श्रेणियों की एक नई पीढ़ी का हिस्सा रहे हैं। बारह लैब्स का दृष्टिकोण उस प्रवृत्ति के आपूर्ति पक्ष को लक्षित करता है, अंतर्निहित मॉडल का निर्माण करता है जो वीडियो को एजेंटों और उसके शीर्ष पर बनाए जा रहे अनुप्रयोगों के लिए प्रथम श्रेणी डेटा प्रकार बना सकता है।

निवेशक वीडियो एआई का समर्थन क्यों कर रहे हैं

राउंड में समर्थकों का रोस्टर रणनीतिक रुचि वाले वीडियो एआई कमांड की ओर इशारा करता है। अमेज़ॅन की भागीदारी उल्लेखनीय है क्योंकि कंपनी का एडब्ल्यूएस क्लाउड डिवीजन एआई इंफ्रास्ट्रक्चर का एक प्रमुख प्रदाता है और वीडियो और मीडिया सेवाओं में इसका अपना निवेश है। दक्षिण कोरियाई इंटरनेट दिग्गज की निवेश शाखा NAVER वेंचर्स और AI पर केंद्रित फर्म रेडिकल वेंचर्स इस श्रेणी में वैश्विक रुचि का संकेत देते हैं।

यह दौर 2026 के मध्य तक एआई फंडिंग में एक व्यापक पैटर्न को भी दर्शाता है, जहां निवेशक टेक्स्ट से परे डेटा तौर-तरीकों को अपनाने वाले स्टार्टअप की ओर पूंजी निर्देशित कर रहे हैं। जबकि पाठ-आधारित मॉडल ने ध्यान और निवेश के बड़े हिस्से को अवशोषित कर लिया है, वीडियो और समृद्ध, वास्तविक दुनिया के डेटा के अन्य रूपों को अगले क्षेत्र के रूप में देखा जाता है जहां सार्थक सफलताएं और रिटर्न मिल सकते हैं।

फंडिंग क्या सक्षम बनाती है

बारह लैब्स ने विशिष्ट व्यय योजनाओं का विवरण नहीं दिया, लेकिन बढ़ोतरी का पैमाना, एक ही दौर में $100 मिलियन, गणना, प्रतिभा और मॉडल विकास में महत्वपूर्ण निवेश का सुझाव देता है। वीडियो फ़ाइलों के विशाल आकार को देखते हुए, वीडियो-समझने वाले मॉडल को प्रशिक्षित करना टेक्स्ट मॉडल को प्रशिक्षित करने की तुलना में कहीं अधिक कम्प्यूटेशनल रूप से कठिन है, जिससे प्रगति की लागत बढ़ जाती है।

ली के लिए, शर्त यह है कि भुगतान उस लागत को उचित ठहराता है। जैसा कि उन्होंने कहा, "वास्तविकता का सबसे समृद्ध रिकॉर्ड अभी भी काफी हद तक उस सिमेंटिक परत से बाहर है जिसका उपयोग आधुनिक एआई सिस्टम करते हैं।" ट्वेल्व लैब्स की नई फंडिंग एक शर्त है कि उस परत के अंदर वीडियो लाना आने वाले वर्षों की परिभाषित एआई प्रगति में से एक होगा।

स्रोत: PYMNTS, ब्लूमबर्ग न्यूज़, ट्वेल्व लैब्स कंपनी ब्लॉग।

---

एआई से आगे रहें

नवीनतम एआई समाचार, विश्लेषण और सफलताएँ प्राप्त करें - सभी एक ही स्थान पर।

अधिक AI समाचार पढ़ें →