Alibaba च्या Qwen टीमने Qwen3.8-Omni-Flash लाँच केले आहे, एक पुढील पिढीचे नेटिव्ह ऑम्निमोडल मॉडेल जे एकल 1 दशलक्ष-टोकन कॉन्टेक्स्ट विंडोद्वारे मजकूर, प्रतिमा, ऑडिओ आणि व्हिडिओ इनपुट स्वीकारते. अधिकृत क्वेन ब्लॉगवर तपशीलवार वर्णन केलेले प्रकाशन, निष्क्रीय इनपुटमधून ऑडिओ आणि व्हिडिओला प्राथमिक माध्यमात बदलण्यासाठी संघाचा सर्वात आक्रमक पुश चिन्हांकित करते ज्याद्वारे AI एजंट जगाला समजतात आणि त्यावर कार्य करतात.

माध्यम समजून घेण्यापासून त्यावर कृती करण्यापर्यंत

Qwen3.8-Omni-Flash चे नमूद केलेले उद्दिष्ट केवळ मीडियाचे चांगले आकलन नाही. क्वेन टीमच्या मते, मॉडेल "सर्वोत्कृष्ट सामग्री समजून घेणे" पासून "कार्यांचे नियोजन करणे, साधने कॉल करणे आणि सर्जनशील कार्य पूर्ण करणे" पर्यंत सर्वोत्कृष्ट प्रणाली विकसित करण्यासाठी डिझाइन केलेले आहे. सराव मध्ये, याचा अर्थ व्हिडिओ संपादन, संगीत व्हिडिओ निर्मिती, चित्रपट निर्मिती आणि समालोचन, ऑडिओ-व्हिज्युअल सारांश आणि रिअल-टाइम व्हॉइस संभाषणे यासारख्या कार्यप्रवाहांवर मॉडेलचे लक्ष्य आहे.

हे एजंटिक फ्रेमिंग रिलीझला आधीच्या मल्टीमोडल मॉडेल्सपासून वेगळे करते ज्यात ऑडिओ आणि व्हिडिओ लिप्यंतरण किंवा वर्णन करण्यासाठी इनपुट म्हणून मानले जाते. क्वेनने असा युक्तिवाद केला की ऑडिओ आणि व्हिडिओ "कोर मीडियामध्ये विकसित होत आहेत ज्याद्वारे एजंट त्यांचे वातावरण, कारण समजून घेतात आणि कार्ये पार पाडतात" - कंपनी एजंटिक बेंचमार्क परिणामांच्या मालिकेला पाठिंबा दर्शवते.

प्रकाशनामागील संख्या

ऑडिओ रिजनिंग, ऑडिओ-व्हिज्युअल रिजनिंग आणि ऑडिओ-व्हिज्युअल एजंट बेंचमार्क्सच्या 29 मूल्यांकनांमध्ये, Qwen म्हणतात की मॉडेलचा सरासरी स्कोअर त्याच्या पूर्ववर्ती, Qwen3.5-Omni-Plus पेक्षा 25% पेक्षा जास्त सुधारतो. क्वेन ब्लॉगवर नोंदवलेल्या शीर्षक परिणामांमध्ये हे समाविष्ट आहे:

  • WildClawBench-MM वर 36.5 गुणांची वाढ आणि AgenticVBench वर 22.3 गुण, ऑडिओ-व्हिज्युअल एजंटसाठी दोन बेंचमार्क, तसेच UniClawBench वर 69.6 गुण.
  • लाँग-फॉर्म ऑडिओ आणि व्हिडिओ समजण्यासाठी लाँगऑडिओस्पॅनवर 8.3-पॉइंट सुधारणा आणि OmniVideoBench वर 9.6-पॉइंट वाढ.
  • मल्टी-स्पीकर मीटिंग ट्रान्सक्रिप्शनमध्ये नाटकीय त्रुटी-दर कमी: मॉडेलचे AliMeeting DER आणि cpWER अनुक्रमे 88.11 आणि 89.61 वरून 3.35 आणि 17.18 पर्यंत घसरले.

स्पर्धात्मक आघाडीवर, क्वेन Google च्या ऑफरशी थेट तुलना करते: कंपनी जेमिनी 3.8 फ्लॅशच्या जवळील ऑडिओ-व्हिज्युअल कार्यप्रदर्शनाचा दावा करते आणि एकूण ऑडिओ कार्यप्रदर्शन त्यापेक्षा जास्त आहे. त्या तुलनांच्या स्वतंत्र पडताळणीस वेळ लागेल, परंतु बेंचमार्क दाव्याची विशिष्टता हे संकेत देते की क्वेन सर्वोत्कृष्ट कार्याच्या सीमेवर मॉडेलला स्पर्धात्मक मानते.

मीडियाच्या तासांसाठी 1M-टोकन विंडो

युनिफाइड 1 मिलियन-टोकन कॉन्टेक्स्ट विंडो हे रिलीझचे सर्वात व्यावहारिक वैशिष्ट्य आहे. ऑडिओ आणि व्हिडिओ मजकूरापेक्षा खूप वेगाने टोकन वापरत असल्याने, उत्पादनातील बहुतेक मल्टीमोडल मॉडेल्स एका वेळी फक्त काही मिनिटे मीडिया हाताळतात. सात-आकृती संदर्भ विंडो मॉडेलला मीटिंगचे तास रेकॉर्डिंग, विस्तारित व्हिडिओ फुटेज किंवा मोठ्या मिश्रित-मीडिया दस्तऐवज एकाच सत्रात खंडित न करता ठेवण्याची परवानगी देते.

क्वेनने नमूद केले आहे की मॉडेल समान आकाराच्या टेक्स्ट-ओन्ली मॉडेलच्या तुलनेत मजकूर कार्यप्रदर्शन राखते — सामान्य व्यापार-ऑफला संबोधित करते जेथे सर्वोत्कृष्ट प्रशिक्षण शुद्ध भाषेच्या क्षमतेला कमी करते.

ऑडिओ इनपुटवर 98% ची किंमत कपात

अलिबाबा सर्वात जास्त दबाव आणत आहे तेथे किंमत. ब्लॉगनुसार, प्रति तास ऑडिओ इनपुटची API किंमत Qwen3.5-Omni-Plus च्या तुलनेत 98% पेक्षा जास्त कमी झाली आहे, तर ऑडिओ-व्हिज्युअल इनपुटची प्रति तास किंमत 93% पेक्षा कमी आहे. कंपनीच्या कार्यपद्धतीच्या नोटमध्ये 720p आणि 1 फ्रेम प्रति सेकंदाने ऑडिओ-व्हिज्युअल इनपुटची गणना केलेल्या स्त्रोत सामग्रीच्या दोन मिनिटांच्या इनपुट खर्चाच्या 30 पट प्रति तास किंमतींचा अंदाज आहे.

व्हॉईस एजंट्स, मीटिंग सारांश किंवा मीडिया विश्लेषण पाइपलाइन बनवणाऱ्या डेव्हलपरसाठी, इनपुट कॉस्ट ही बऱ्याचदा स्केलवर बंधनकारक बंधन असते. दोन-ऑर्डर-ऑफ-मॅग्निट्यूड किमतीतील घसरण बदलते की कोणती उत्पादने आर्थिकदृष्ट्या व्यवहार्य आहेत — तीच डायनॅमिक ज्याने स्वस्त मजकूर-अनुमान API ची पहिली लहर आणली.

उपलब्धता आणि इकोसिस्टम

Qwen3.8-Omni-Flash आता Qianwen AI प्लॅटफॉर्मवर उपलब्ध आहे, ज्यामध्ये अलीबाबा क्लाउड मॉडेल स्टुडिओद्वारे API ऍक्सेस आहे, ज्यामध्ये संभाषणात्मक वापर प्रकरणांसाठी समर्पित रिअलटाइम एंडपॉइंट समाविष्ट आहे. टीमने GitHub वर समर्थन देणारे ओपन-सोर्स टूलिंग देखील प्रकाशित केले आहे, ज्यात Qwen-Live-Harness मूल्यमापन हार्नेस आणि Qwen-MM-Plugins यांचा समावेश आहे, ज्यामुळे विकासकांना मॉडेलच्या शीर्षस्थानी मीडिया-नेटिव्ह एजंट तयार करण्यासाठी एक प्रारंभिक बिंदू दिला जातो.

आठवड्याच्या सुरुवातीला लाँच शांतपणे उतरले परंतु अलीकडच्या दिवसांत विकसक समुदायामध्ये लक्षणीय आकर्षण मिळवले, हॅकर न्यूज आणि ओपन-मॉडेल इकोसिस्टमचा मागोवा घेणाऱ्या तंत्रज्ञान आउटलेट्सच्या कव्हरेजवर मोठी चर्चा झाली.

Omnimodal शर्यतीसाठी याचा अर्थ काय आहे

रिलीझने अलिबाबाच्या क्वेन कुटुंबातील स्पर्धात्मक बेंचमार्कसह आक्रमक किंमतींची जोड देण्याची रणनीती सुरू ठेवली आहे, जी वारंवार जगभरात सर्वाधिक डाउनलोड केलेल्या ओपन-मॉडेल वंशांमध्ये आहे. Qwen3.8-Omni-Flash सह, कंपनी पुढील रणांगण हे मजकूर चॅट नसून एजंट्स जे पाहू शकतात, ऐकू शकतात आणि कृती करू शकतात - फुटेज संपादित करणे, मीटिंगचा सारांश देणे आणि रिअल-टाइम व्हॉइस संभाषणे एकच एकात्मिक क्षमता म्हणून ठेवण्याची पैज लावत आहे.

Google साठी, ज्याचा जेमिनी 3.8 फ्लॅश हा स्पष्ट तुलनात्मक बिंदू आहे, संदेश असा आहे की सर्व-मोडल फ्रंटियर ही यूएस लॅबमधील दोन-घोड्यांची शर्यत नाही. विकसकांसाठी, 1M-टोकन मल्टीमोडल विंडो आणि जवळपास-मुक्त ऑडिओ इनपुटचे संयोजन ऑडिओ-व्हिज्युअल एजंट उत्पादनांच्या वर्गातील अडथळा कमी करते जे काही महिन्यांपूर्वी स्केलवर सेवा देण्यासाठी अव्यवहार्य होते.

Qwen चे बेंचमार्क दावे स्वतंत्र मूल्यमापनात टिकून राहतात की नाही हे उद्योग त्या पैजला किती गांभीर्याने वागवते हे आकार देईल. पण प्रवासाची दिशा स्पष्ट आहे: फ्रंटियर मॉडेल्स बनवणाऱ्या संघांना आता AI एजंट्ससाठी डीफॉल्ट इंटरफेस म्हणून - फक्त मजकूर बॉक्सच नव्हे तर कान आणि डोळे दिसतात.

AI च्या पुढे रहा

ऑम्निमोडल शर्यत आठवड्यातून वेग घेत आहे. अधिक ताज्या AI बातम्यांसाठी, नवीन मॉडेल रिलीझचे सखोल विश्लेषण आणि उद्योगाला आकार देणाऱ्या साधनांच्या कव्हरेजसाठी, अधिक AI बातम्या वाचा →.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →