علی بابا کی Qwen ٹیم نے Qwen3.8-Omni-Flash شروع کیا ہے، جو ایک اگلی نسل کا مقامی اومنی موڈل ماڈل ہے جو ایک 1 ملین ٹوکن سیاق و سباق کی ونڈو کے ذریعے متن، تصویر، آڈیو، اور ویڈیو ان پٹ کو قبول کرتا ہے۔ یہ ریلیز، آفیشل کیوین بلاگ پر تفصیلی ہے، ٹیم کے سب سے زیادہ جارحانہ دباؤ کو نشان زد کرتی ہے جو کہ غیر فعال ان پٹس سے آڈیو اور ویڈیو کو بنیادی میڈیم میں تبدیل کرتی ہے جس کے ذریعے AI ایجنٹ دنیا کو سمجھتے اور ان پر عمل کرتے ہیں۔
میڈیا کو سمجھنے سے لے کر اس پر عمل کرنے تک
Qwen3.8-Omni-Flash کا بیان کردہ ہدف صرف میڈیا کی بہتر سمجھ نہیں ہے۔ Qwen ٹیم کے مطابق، ماڈل کو "omnimodal مواد کو سمجھنے" سے لے کر "منصوبہ بندی کے کاموں، کالنگ ٹولز، اور تخلیقی کام کو مکمل کرنے" کے لیے تمام نظاموں کو آگے بڑھانے کے لیے ڈیزائن کیا گیا ہے۔ عملی طور پر، اس کا مطلب یہ ہے کہ ماڈل کا مقصد ورک فلو جیسے ویڈیو ایڈیٹنگ، میوزک ویڈیو تخلیق، فلم پروڈکشن اور کمنٹری، آڈیو ویژول خلاصہ، اور ریئل ٹائم صوتی گفتگو ہے۔
یہ ایجنٹی فریمنگ ریلیز کو پہلے کے ملٹی موڈل ماڈلز سے الگ کرتی ہے جس میں آڈیو اور ویڈیو کو نقل یا بیان کرنے کے لیے ان پٹ کے طور پر سمجھا جاتا تھا۔ کیوین کا استدلال ہے کہ آڈیو اور ویڈیو "بنیادی میڈیا میں تیار ہو رہے ہیں جس کے ذریعے ایجنٹ اپنے ماحول، وجہ کو سمجھتے ہیں اور کاموں کو انجام دیتے ہیں" - یہ دعویٰ ہے کہ کمپنی ایجنٹ بینچ مارک کے نتائج کی ایک سیریز کے ساتھ حمایت کرتی ہے۔
ریلیز کے پیچھے نمبر
آڈیو ریجننگ، آڈیو ویژول ریجننگ، اور آڈیو ویژول ایجنٹ بینچ مارکس پر محیط 29 جائزوں میں، Qwen کا کہنا ہے کہ ماڈل کا اوسط سکور اپنے پیشرو Qwen3.5-Omni-Plus کے مقابلے میں 25% سے زیادہ بہتر ہوا ہے۔ Qwen بلاگ پر رپورٹ کردہ سرخی کے نتائج میں شامل ہیں:
- WildClawBench-MM پر 36.5 پوائنٹس اور AgenticVBench پر 22.3 پوائنٹس کا اضافہ، آڈیو ویژول ایجنٹس کے لیے دو بینچ مارکس کے علاوہ UniClawBench پر 69.6 کا سکور۔
- لانگ آڈیو اسپین پر 8.3 پوائنٹ کی بہتری اور اومنی ویڈیو بینچ پر طویل شکل کی آڈیو اور ویڈیو کو سمجھنے کے لیے 9.6 پوائنٹ کا فائدہ۔
- ملٹی اسپیکر میٹنگ ٹرانسکرپشن میں ڈرامائی غلطی کی شرح میں کمی: ماڈل کی AliMeeting DER اور cpWER بالترتیب 88.11 اور 89.61 سے گر کر 3.35 اور 17.18 پر آگئے۔
مسابقتی محاذ پر، کیوین گوگل کی پیشکش سے براہ راست موازنہ کرتا ہے: کمپنی جیمنی 3.8 فلیش کے قریب آڈیو ویژول کارکردگی اور مجموعی آڈیو کارکردگی کا دعوی کرتی ہے جو اس سے زیادہ ہے۔ ان موازنوں کی آزادانہ تصدیق میں وقت لگے گا، لیکن بینچ مارک کے دعووں کی خصوصیت اس بات کا اشارہ دیتی ہے کہ Qwen ماڈل کو omnimodal کام کے محاذ پر مسابقتی سمجھتا ہے۔
میڈیا کے اوقات کے لیے 1M-ٹوکن ونڈو
متفقہ 1 ملین ٹوکن سیاق و سباق کی ونڈو دلیل کے طور پر ریلیز کی سب سے زیادہ عملی خصوصیت ہے۔ چونکہ آڈیو اور ویڈیو ٹیکسٹ سے کہیں زیادہ تیزی سے ٹوکن استعمال کرتے ہیں، اس لیے پروڈکشن میں زیادہ تر ملٹی موڈل ماڈل ایک وقت میں صرف چند منٹوں کا میڈیا ہینڈل کرتے ہیں۔ سات اعداد و شمار والی سیاق و سباق کی ونڈو ماڈل کو بغیر کسی ایک سیشن میں میٹنگ کے گھنٹوں کی ریکارڈنگ، توسیع شدہ ویڈیو فوٹیج، یا بڑے مخلوط میڈیا دستاویزات رکھنے کی اجازت دیتی ہے۔
Qwen نے نوٹ کیا کہ ماڈل متن کی کارکردگی کو اسی سائز کے صرف ٹیکسٹ ماڈل کے مقابلے میں برقرار رکھتا ہے - مشترکہ تجارت سے خطاب کرتے ہوئے جہاں ہر قسم کی تربیت خالص زبان کی صلاحیت کو کم کرتی ہے۔
آڈیو ان پٹ پر %98 کی قیمتوں میں کمی
قیمتوں کا تعین وہ جگہ ہے جہاں علی بابا سب سے زیادہ دباؤ ڈال رہا ہے۔ بلاگ کے مطابق، Qwen3.5-Omni-Plus کے مقابلے میں API کی فی گھنٹہ آڈیو ان پٹ کی قیمت میں 98% سے زیادہ کی کمی واقع ہوئی ہے، جبکہ آڈیو وژول ان پٹ کی فی گھنٹہ قیمت 93% سے زیادہ کم ہے۔ کمپنی کے طریقہ کار کے نوٹ میں کہا گیا ہے کہ فی گھنٹہ قیمتوں کا تخمینہ دو منٹ کے ماخذ مواد کی ان پٹ لاگت سے 30 گنا لگایا گیا ہے، جس میں آڈیو ویژول ان پٹ 720p اور 1 فریم فی سیکنڈ میں شمار ہوتا ہے۔
صوتی ایجنٹوں، میٹنگ سمریائزرز، یا میڈیا تجزیہ پائپ لائنز بنانے والے ڈویلپرز کے لیے، ان پٹ لاگت اکثر پیمانے پر پابند رکاوٹ ہوتی ہے۔ قیمتوں میں دو آرڈر آف میگنیٹیوڈ کمی تبدیلیاں کرتی ہیں کہ کون سی مصنوعات اقتصادی طور پر قابل عمل ہیں - وہی متحرک جس نے سستے ٹیکسٹ انفرنس APIs کی پہلی لہر کو آگے بڑھایا۔
دستیابی اور ماحولیاتی نظام
Qwen3.8-Omni-Flash اب Qianwen AI پلیٹ فارم پر دستیاب ہے، Alibaba Cloud Model Studio کے ذریعے API رسائی کے ساتھ، بشمول بات چیت کے استعمال کے معاملات کے لیے ایک وقف ریئل ٹائم اینڈ پوائنٹ۔ ٹیم نے GitHub پر اوپن سورس ٹولنگ کو بھی شائع کیا ہے، جس میں Qwen-Live-Harness کی تشخیص کا استعمال اور Qwen-MM-Plugins شامل ہیں، جو ڈویلپرز کو ماڈل کے اوپری حصے پر میڈیا کے مقامی ایجنٹوں کی تعمیر کے لیے ایک نقطہ آغاز فراہم کرتے ہیں۔
لانچ ہفتے کے شروع میں خاموشی سے اترا لیکن حالیہ دنوں میں اس نے ڈویلپر کمیونٹی میں نمایاں توجہ حاصل کی، ہیکر نیوز اور اوپن ماڈل ایکو سسٹم کو ٹریک کرنے والے ٹیکنالوجی آؤٹ لیٹس سے کوریج پر ایک بڑی بحث کی۔
Omnimodal ریس کے لیے اس کا کیا مطلب ہے۔
ریلیز علی بابا کی اپنی Qwen فیملی میں مسابقتی معیارات کے ساتھ جارحانہ قیمتوں کا جوڑا بنانے کی حکمت عملی کو جاری رکھتی ہے، جو بار بار دنیا بھر میں سب سے زیادہ ڈاؤن لوڈ ہونے والے اوپن ماڈل نسبوں میں شامل ہے۔ Qwen3.8-Omni-Flash کے ساتھ، کمپنی شرط لگا رہی ہے کہ اگلی جنگ کا میدان ٹیکسٹ چیٹ نہیں ہے بلکہ ایسے ایجنٹس ہیں جو دیکھ سکتے ہیں، سن سکتے ہیں اور عمل کر سکتے ہیں — فوٹیج میں ترمیم کرنا، میٹنگوں کا خلاصہ کرنا، اور حقیقی وقت میں صوتی گفتگو کرنا ایک واحد قابلیت کے طور پر۔
گوگل کے لیے، جس کا جیمنی 3.8 فلیش ایک واضح موازنہ نقطہ ہے، پیغام یہ ہے کہ اومنی ماڈل فرنٹیئر اب امریکی لیبز کے درمیان دو گھوڑوں کی دوڑ نہیں ہے۔ ڈویلپرز کے لیے، 1M-ٹوکن ملٹی موڈل ونڈو اور قریب فری آڈیو ان پٹ کا امتزاج آڈیو ویژول ایجنٹ پروڈکٹس کی ایک کلاس کی رکاوٹ کو کم کرتا ہے جو صرف مہینوں پہلے پیمانے پر پیش کرنا ناقابل عمل تھا۔
کیا Qwen کے بینچ مارک کے دعوے آزاد تشخیص کے تحت برقرار ہیں اس بات کی تشکیل کریں گے کہ صنعت اس شرط کے ساتھ کتنی سنجیدگی سے سلوک کرتی ہے۔ لیکن سفر کی سمت واضح ہے: فرنٹیئر ماڈلز بنانے والی ٹیمیں اب کان اور آنکھیں دیکھتی ہیں — نہ صرف ایک ٹیکسٹ باکس — AI ایجنٹوں کے لیے پہلے سے طے شدہ انٹرفیس کے طور پر۔
AI سے آگے رہیں
اومنی موڈل ریس ہفتہ بہ ہفتہ تیز ہو رہی ہے۔ مزید بریکنگ AI خبروں کے لیے، نئے ماڈل کی ریلیز کے گہرائی سے تجزیہ، اور صنعت کو تشکیل دینے والے ٹولز کی کوریج، مزید AI خبریں پڑھیں →۔
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →