تیم Qwen علیبابا Qwen3.8-Omni-Flash را راهاندازی کرده است، نسل بعدی مدل بومی همهوجهی که ورودیهای متن، تصویر، صدا و ویدئو را از طریق یک پنجره زمینه ۱ میلیون توکن میپذیرد. این انتشار که در وبلاگ رسمی Qwen به تفصیل شرح داده شده است، تهاجمیترین تلاش تیم را برای تبدیل صدا و تصویر از ورودیهای غیرفعال به رسانه اصلی که از طریق آن عوامل هوش مصنوعی جهان را درک میکنند و روی آن عمل میکنند، نشان میدهد.
از درک رسانه تا اقدام بر اساس آن
هدف اعلام شده Qwen3.8-Omni-Flash فقط درک بهتر رسانه نیست. به گفته تیم Qwen، این مدل برای پیشبرد سیستمهای همهوجهی از «درک محتوای همهوجهی» به «برنامهریزی وظایف، فراخوانی ابزارها و تکمیل کار خلاقانه» طراحی شده است. در عمل، این بدان معناست که هدف این مدل جریانهای کاری مانند ویرایش ویدیو، ایجاد موزیک ویدیو، تولید و تفسیر فیلم، خلاصهسازی صوتی و تصویری، و مکالمات صوتی در زمان واقعی است.
این قاب بندی عامل انتشار را از مدل های چندوجهی قبلی که صدا و تصویر را به عنوان ورودی هایی برای رونویسی یا توصیف در نظر می گرفتند جدا می کند. Qwen استدلال میکند که صدا و تصویر در حال تبدیل شدن به «رسانههای اصلی هستند که از طریق آن عوامل محیط، دلیل و وظایف خود را درک میکنند» - ادعایی که شرکت با مجموعهای از نتایج معیارهای عامل پشتیبانی میکند.
شماره های پشت انتشار
در 29 ارزیابی که شامل استدلال صوتی، استدلال سمعی و بصری، و معیارهای عامل سمعی و بصری می شود، Qwen می گوید میانگین امتیاز این مدل بیش از 25 درصد نسبت به مدل قبلی خود، Qwen3.5-Omni-Plus بهبود یافته است. نتایج سرفصل گزارش شده در وبلاگ Qwen عبارتند از:
- کسب امتیاز 36.5 در WildClawBench-MM و 22.3 امتیاز در AgenticVBench، دو معیار برای عوامل سمعی و بصری، به علاوه امتیاز 69.6 در UniClawBench.
- بهبود 8.3 امتیازی در LongAudioSpan و افزایش 9.6 امتیازی در OmniVideoBench برای درک طولانی صدا و تصویر.
- کاهش چشمگیر نرخ خطا در رونویسی جلسات چند سخنران: AliMeeting DER و cpWER مدل به ترتیب از 88.11 و 89.61 به 3.35 و 17.18 کاهش یافت.
در زمینه رقابتی، Qwen مقایسه مستقیمی با پیشنهاد گوگل انجام می دهد: این شرکت ادعا می کند عملکرد صوتی و تصویری نزدیک به Gemini 3.8 Flash و عملکرد صوتی کلی فراتر از آن است. راستیآزمایی مستقل این مقایسهها زمان میبرد، اما ویژگی ادعاهای معیار نشان میدهد که Qwen مدل را در مرز کار همهوجهی رقابتی میداند.
یک پنجره 1M-Token برای ساعت ها رسانه
پنجره زمینه یک میلیون توکن یکپارچه، مسلماً کاربردی ترین ویژگی انتشار است. از آنجایی که صدا و تصویر توکنها را بسیار سریعتر از متن مصرف میکنند، اکثر مدلهای چندوجهی در تولید تنها چند دقیقه از رسانه را در یک زمان مدیریت میکنند. یک پنجره زمینه هفت رقمی به مدل این امکان را میدهد که ساعتها ضبط جلسه، فیلمهای ویدئویی طولانی، یا اسناد بزرگ مختلط را در یک جلسه بدون تکهتکه نگه دارد.
Qwen خاطرنشان میکند که این مدل عملکرد متن را قابل مقایسه با یک مدل فقط متنی با همان اندازه حفظ میکند - با پرداختن به مبادله رایج که در آن آموزش همهوجهی توانایی زبان خالص را کاهش میدهد.
کاهش قیمت 98٪ در ورودی صوتی
قیمت گذاری جایی است که علی بابا بیشترین فشار را وارد می کند. طبق این وبلاگ، قیمت API هر ساعت ورودی صوتی در مقایسه با Qwen3.5-Omni-Plus بیش از 98٪ کاهش یافته است، در حالی که قیمت هر ساعت ورودی صوتی و تصویری بیش از 93٪ کاهش یافته است. یادداشت روششناسی این شرکت میگوید که قیمتهای ساعتی 30 برابر هزینه ورودی دو دقیقه منبع، با ورودی صوتی و تصویری در 720p و 1 فریم در ثانیه برآورد میشود.
برای توسعهدهندگانی که عوامل صوتی، جمعآوریکنندههای جلسات یا خطوط لوله تجزیه و تحلیل رسانه را میسازند، هزینه ورودی اغلب محدودیت الزامآور در مقیاس است. یک افت قیمت دو مرتبه ای، محصولاتی را که از نظر اقتصادی مقرون به صرفه هستند، تغییر می دهد - همان پویایی که موج اول API های استنتاج متنی ارزان را به همراه داشت.
در دسترس بودن و اکوسیستم
Qwen3.8-Omni-Flash اکنون در پلتفرم هوش مصنوعی Qianwen با دسترسی API از طریق Alibaba Cloud Model Studio، از جمله یک نقطه پایانی اختصاصی برای موارد استفاده مکالمه، در دسترس است. این تیم همچنین ابزارهای منبع باز پشتیبانی را در GitHub منتشر کرده است، از جمله مهار ارزیابی Qwen-Live-Harness و Qwen-MM-Plugins، که به توسعه دهندگان نقطه شروعی برای ساخت عوامل بومی رسانه در بالای مدل می دهد.
پرتاب بی سر و صدا در اوایل هفته فرود آمد، اما در روزهای اخیر در جامعه توسعه دهندگان مورد توجه قرار گرفت و بحث گسترده ای را در مورد اخبار هکر و پوشش رسانه های فناوری که اکوسیستم مدل باز را ردیابی می کردند، به همراه داشت.
چه معنایی برای نژاد Omnimodal دارد
این نسخه همچنان استراتژی علیبابا برای جفت کردن قیمتهای تهاجمی با معیارهای رقابتی در سرتاسر خانواده Qwen خود را ادامه میدهد، خانوادهای که بارها و بارها جزو پربارگیریترین دودمان مدل باز در سراسر جهان بوده است. با Qwen3.8-Omni-Flash، این شرکت شرط میبندد که میدان نبرد بعدی چت متنی نیست، بلکه عواملی هستند که میتوانند تماشا کنند، گوش دهند و عمل کنند - ویرایش فیلم، خلاصه کردن جلسات، و برگزاری مکالمات صوتی در زمان واقعی به عنوان یک قابلیت یکپارچه.
برای گوگل، که Gemini 3.8 Flash نقطه مقایسه صریح آن است، پیام این است که مرز همهمدال دیگر مسابقه دو اسب بین آزمایشگاههای ایالات متحده نیست. برای توسعهدهندگان، ترکیب یک پنجره چندوجهی با توکن 1M و ورودی صوتی تقریباً رایگان، مانع را برای دستهای از محصولات عامل سمعی و بصری که تنها چند ماه پیش برای ارائه در مقیاس غیرعملی بودند، کاهش میدهد.
اینکه آیا ادعاهای معیار Qwen تحت ارزیابی مستقل باقی می مانند یا خیر، چگونگی برخورد جدی صنعت با این شرط را تعیین می کند. اما جهت سفر مشخص است: تیمهایی که مدلهای مرزی میسازند اکنون گوشها و چشمها - نه فقط یک جعبه متن - را به عنوان رابط پیشفرض برای عوامل هوش مصنوعی میبینند.
از هوش مصنوعی جلوتر بمانید
مسابقه omnimodal هفته به هفته در حال افزایش است. برای اخبار جدید هوش مصنوعی، تجزیه و تحلیل عمیق نسخه های جدید مدل، و پوشش ابزارهای شکل دهنده صنعت، [اخبار هوش مصنوعی را بیشتر بخوانید →] (https://aibuzzwire.news/en).
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →