अलीबाबा की क्वेन टीम ने अगली पीढ़ी का देशी सर्वव्यापी मॉडल क्वेन3.8-ओमनी-फ्लैश लॉन्च किया है, जो एकल 1 मिलियन-टोकन संदर्भ विंडो के माध्यम से टेक्स्ट, छवि, ऑडियो और वीडियो इनपुट स्वीकार करता है। आधिकारिक क्वेन ब्लॉग पर विस्तृत रिलीज, ऑडियो और वीडियो को निष्क्रिय इनपुट से प्राथमिक माध्यम में बदलने के लिए टीम के अब तक के सबसे आक्रामक प्रयास को चिह्नित करती है जिसके माध्यम से एआई एजेंट दुनिया को समझते हैं और उस पर कार्य करते हैं।
मीडिया को समझने से लेकर उस पर अमल करने तक
Qwen3.8-ओमनी-फ़्लैश का घोषित लक्ष्य केवल बेहतर मीडिया समझ नहीं है। क्वेन टीम के अनुसार, मॉडल को "सर्वव्यापी सामग्री को समझने" से लेकर "कार्यों की योजना बनाने, टूल को कॉल करने और रचनात्मक कार्य पूरा करने" तक सर्वव्यापी प्रणालियों को आगे बढ़ाने के लिए डिज़ाइन किया गया है। व्यवहार में, इसका मतलब है कि मॉडल का उद्देश्य वीडियो संपादन, संगीत वीडियो निर्माण, फिल्म निर्माण और कमेंट्री, ऑडियो-विज़ुअल सारांश और वास्तविक समय की आवाज वार्तालाप जैसे वर्कफ़्लोज़ पर है।
यह एजेंटिक फ़्रेमिंग रिलीज़ को पहले के मल्टीमॉडल मॉडल से अलग करती है जो ऑडियो और वीडियो को ट्रांसक्राइब या वर्णित किए जाने वाले इनपुट के रूप में मानते थे। क्वेन का तर्क है कि ऑडियो और वीडियो "मुख्य मीडिया के रूप में विकसित हो रहे हैं जिसके माध्यम से एजेंट अपने वातावरण को समझते हैं, तर्क करते हैं और कार्यों को निष्पादित करते हैं" - यह दावा कंपनी एजेंटिक बेंचमार्क परिणामों की एक श्रृंखला के साथ करती है।
रिलीज़ के पीछे के नंबर
ऑडियो रीजनिंग, ऑडियो-विजुअल रीजनिंग और ऑडियो-विजुअल एजेंट बेंचमार्क पर आधारित 29 मूल्यांकनों में, क्वेन का कहना है कि मॉडल का औसत स्कोर अपने पूर्ववर्ती, क्वेन3.5-ओमनी-प्लस की तुलना में 25% से अधिक बेहतर हुआ है। क्वेन ब्लॉग पर रिपोर्ट किए गए शीर्षक परिणामों में शामिल हैं:
- WildClawBench-MM पर 36.5 अंक और AgenticVBench पर 22.3 अंक का लाभ, ऑडियो-विज़ुअल एजेंटों के लिए दो बेंचमार्क, साथ ही UniClawBench पर 69.6 का स्कोर।
- लॉन्गऑडियोस्पैन पर 8.3-पॉइंट का सुधार और लॉन्ग-फॉर्म ऑडियो और वीडियो समझ के लिए ओमनीवीडियोबेंच पर 9.6-पॉइंट का लाभ।
- मल्टी-स्पीकर मीटिंग ट्रांसक्रिप्शन में नाटकीय त्रुटि-दर में गिरावट: मॉडल का अलीमीटिंग डीईआर और सीपीडब्ल्यूईआर क्रमशः 88.11 और 89.61 से गिरकर 3.35 और 17.18 हो गया।
प्रतिस्पर्धी मोर्चे पर, क्वेन Google की पेशकश के साथ सीधी तुलना करता है: कंपनी का दावा है कि जेमिनी 3.8 फ्लैश के करीब ऑडियो-विज़ुअल प्रदर्शन और समग्र ऑडियो प्रदर्शन इससे कहीं अधिक है। उन तुलनाओं के स्वतंत्र सत्यापन में समय लगेगा, लेकिन बेंचमार्क दावों की विशिष्टता संकेत देती है कि क्वेन मॉडल को सर्वव्यापी कार्य की सीमा पर प्रतिस्पर्धी मानता है।
मीडिया के घंटों के लिए 1M-टोकन विंडो
एकीकृत 1 मिलियन-टोकन संदर्भ विंडो यकीनन रिलीज़ की सबसे व्यावहारिक विशेषता है। क्योंकि ऑडियो और वीडियो टेक्स्ट की तुलना में कहीं अधिक तेजी से टोकन का उपभोग करते हैं, उत्पादन में अधिकांश मल्टीमॉडल मॉडल एक समय में केवल कुछ मिनट के मीडिया को संभालते हैं। एक सात-अंकीय संदर्भ विंडो मॉडल को बिना किसी खंडन के एक ही सत्र में घंटों की मीटिंग रिकॉर्डिंग, विस्तारित वीडियो फुटेज, या बड़े मिश्रित-मीडिया दस्तावेज़ रखने की अनुमति देती है।
क्वेन का कहना है कि मॉडल पाठ के प्रदर्शन को समान आकार के केवल-पाठ मॉडल के बराबर बनाए रखता है - सामान्य व्यापार-बंद को संबोधित करता है जहां सर्वव्यापी प्रशिक्षण शुद्ध भाषा क्षमता को कम कर देता है।
ऑडियो इनपुट पर कीमत में 98% की कटौती
मूल्य निर्धारण वह जगह है जहां अलीबाबा सबसे अधिक दबाव डाल रहा है। ब्लॉग के अनुसार, ऑडियो इनपुट की प्रति घंटे की एपीआई कीमत Qwen3.5-ओमनी-प्लस की तुलना में 98% से अधिक गिर गई है, जबकि ऑडियो-विजुअल इनपुट की प्रति घंटे की कीमत 93% से अधिक कम हो गई है। कंपनी के कार्यप्रणाली नोट में कहा गया है कि प्रति घंटे की कीमतें दो मिनट की स्रोत सामग्री की इनपुट लागत का 30 गुना होने का अनुमान है, जिसमें ऑडियो-विज़ुअल इनपुट की गणना 720p और 1 फ्रेम प्रति सेकंड पर की जाती है।
वॉइस एजेंट बनाने, सारांशकर्ताओं को पूरा करने या मीडिया विश्लेषण पाइपलाइन बनाने वाले डेवलपर्स के लिए, इनपुट लागत अक्सर पैमाने पर बाध्यकारी बाधा होती है। दो-ऑर्डर-आकार की कीमत में गिरावट से यह बदल जाता है कि कौन से उत्पाद आर्थिक रूप से व्यवहार्य हैं - वही गतिशीलता जिसने सस्ते पाठ-अनुमान एपीआई की पहली लहर को चलाया।
उपलब्धता और पारिस्थितिकी तंत्र
Qwen3.8-ओमनी-फ्लैश अब Qianwen AI प्लेटफॉर्म पर उपलब्ध है, जिसमें अलीबाबा क्लाउड मॉडल स्टूडियो के माध्यम से एपीआई एक्सेस है, जिसमें बातचीत के उपयोग के मामलों के लिए एक समर्पित रियलटाइम एंडपॉइंट भी शामिल है। टीम ने GitHub पर ओपन-सोर्स टूलिंग का समर्थन भी प्रकाशित किया है, जिसमें क्वेन-लाइव-हार्नेस मूल्यांकन हार्नेस और क्वेन-एमएम-प्लगइन्स शामिल हैं, जिससे डेवलपर्स को मॉडल के शीर्ष पर मीडिया-देशी एजेंटों के निर्माण के लिए एक शुरुआती बिंदु मिलता है।
लॉन्च सप्ताह की शुरुआत में चुपचाप हुआ लेकिन हाल के दिनों में डेवलपर समुदाय में महत्वपूर्ण आकर्षण प्राप्त हुआ, जिससे हैकर न्यूज़ और ओपन-मॉडल इकोसिस्टम पर नज़र रखने वाले प्रौद्योगिकी आउटलेट्स से कवरेज पर एक बड़ी चर्चा हुई।
सर्वव्यापी जाति के लिए इसका क्या अर्थ है
यह रिलीज़ अलीबाबा की उसके क्वेन परिवार में प्रतिस्पर्धी बेंचमार्क के साथ आक्रामक मूल्य निर्धारण को जोड़ने की रणनीति को जारी रखती है, जो बार-बार दुनिया भर में सबसे अधिक डाउनलोड किए जाने वाले ओपन-मॉडल वंशावली में से एक रही है। Qwen3.8-ओमनी-फ्लैश के साथ, कंपनी शर्त लगा रही है कि अगला युद्ध का मैदान टेक्स्ट चैट नहीं है, बल्कि एजेंट हैं जो देख सकते हैं, सुन सकते हैं और कार्य कर सकते हैं - फ़ुटेज संपादित करना, बैठकों का सारांश देना और एकल एकीकृत क्षमता के रूप में वास्तविक समय में ध्वनि वार्तालाप आयोजित करना।
Google के लिए, जिसका जेमिनी 3.8 फ़्लैश स्पष्ट तुलना बिंदु है, संदेश यह है कि ओमनी-मोडल सीमा अब अमेरिकी प्रयोगशालाओं के बीच दो-घोड़ों की दौड़ नहीं है। डेवलपर्स के लिए, 1M-टोकन मल्टीमॉडल विंडो और लगभग-मुक्त ऑडियो इनपुट का संयोजन ऑडियो-विजुअल एजेंट उत्पादों के एक वर्ग के लिए बाधा को कम करता है जो केवल कुछ महीने पहले बड़े पैमाने पर सेवा देने के लिए अव्यावहारिक थे।
क्या क्वेन के बेंचमार्क दावे स्वतंत्र मूल्यांकन के तहत टिके रहते हैं, यह तय करेगा कि उद्योग उस दांव को कितनी गंभीरता से लेता है। लेकिन यात्रा की दिशा स्पष्ट है: फ्रंटियर मॉडल बनाने वाली टीमें अब एआई एजेंटों के लिए डिफ़ॉल्ट इंटरफ़ेस के रूप में - केवल एक टेक्स्ट बॉक्स नहीं - कान और आंखें देखती हैं।
एआई से आगे रहें
सर्वव्यापी दौड़ सप्ताह दर सप्ताह तेज होती जा रही है। अधिक ब्रेकिंग एआई समाचार, नए मॉडल रिलीज के गहन विश्लेषण और उद्योग को आकार देने वाले उपकरणों के कवरेज के लिए, अधिक एआई समाचार पढ़ें →।
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →