تیم Qwen علی‌بابا Qwen3.8-Omni-Flash را راه‌اندازی کرده است، نسل بعدی مدل بومی همه‌وجهی که ورودی‌های متن، تصویر، صدا و ویدئو را از طریق یک پنجره زمینه ۱ میلیون توکن می‌پذیرد. این انتشار که در وبلاگ رسمی Qwen به تفصیل شرح داده شده است، تهاجمی‌ترین تلاش تیم را برای تبدیل صدا و تصویر از ورودی‌های غیرفعال به رسانه اصلی که از طریق آن عوامل هوش مصنوعی جهان را درک می‌کنند و روی آن عمل می‌کنند، نشان می‌دهد.

از درک رسانه تا اقدام بر اساس آن

هدف اعلام شده Qwen3.8-Omni-Flash فقط درک بهتر رسانه نیست. به گفته تیم Qwen، این مدل برای پیشبرد سیستم‌های همه‌وجهی از «درک محتوای همه‌وجهی» به «برنامه‌ریزی وظایف، فراخوانی ابزارها و تکمیل کار خلاقانه» طراحی شده است. در عمل، این بدان معناست که هدف این مدل جریان‌های کاری مانند ویرایش ویدیو، ایجاد موزیک ویدیو، تولید و تفسیر فیلم، خلاصه‌سازی صوتی و تصویری، و مکالمات صوتی در زمان واقعی است.

این قاب بندی عامل انتشار را از مدل های چندوجهی قبلی که صدا و تصویر را به عنوان ورودی هایی برای رونویسی یا توصیف در نظر می گرفتند جدا می کند. Qwen استدلال می‌کند که صدا و تصویر در حال تبدیل شدن به «رسانه‌های اصلی هستند که از طریق آن عوامل محیط، دلیل و وظایف خود را درک می‌کنند» - ادعایی که شرکت با مجموعه‌ای از نتایج معیارهای عامل پشتیبانی می‌کند.

شماره های پشت انتشار

در 29 ارزیابی که شامل استدلال صوتی، استدلال سمعی و بصری، و معیارهای عامل سمعی و بصری می شود، Qwen می گوید میانگین امتیاز این مدل بیش از 25 درصد نسبت به مدل قبلی خود، Qwen3.5-Omni-Plus بهبود یافته است. نتایج سرفصل گزارش شده در وبلاگ Qwen عبارتند از:

  • کسب امتیاز 36.5 در WildClawBench-MM و 22.3 امتیاز در AgenticVBench، دو معیار برای عوامل سمعی و بصری، به علاوه امتیاز 69.6 در UniClawBench.
  • بهبود 8.3 امتیازی در LongAudioSpan و افزایش 9.6 امتیازی در OmniVideoBench برای درک طولانی صدا و تصویر.
  • کاهش چشمگیر نرخ خطا در رونویسی جلسات چند سخنران: AliMeeting DER و cpWER مدل به ترتیب از 88.11 و 89.61 به 3.35 و 17.18 کاهش یافت.

در زمینه رقابتی، Qwen مقایسه مستقیمی با پیشنهاد گوگل انجام می دهد: این شرکت ادعا می کند عملکرد صوتی و تصویری نزدیک به Gemini 3.8 Flash و عملکرد صوتی کلی فراتر از آن است. راستی‌آزمایی مستقل این مقایسه‌ها زمان می‌برد، اما ویژگی ادعاهای معیار نشان می‌دهد که Qwen مدل را در مرز کار همه‌وجهی رقابتی می‌داند.

یک پنجره 1M-Token برای ساعت ها رسانه

پنجره زمینه یک میلیون توکن یکپارچه، مسلماً کاربردی ترین ویژگی انتشار است. از آنجایی که صدا و تصویر توکن‌ها را بسیار سریع‌تر از متن مصرف می‌کنند، اکثر مدل‌های چندوجهی در تولید تنها چند دقیقه از رسانه را در یک زمان مدیریت می‌کنند. یک پنجره زمینه هفت رقمی به مدل این امکان را می‌دهد که ساعت‌ها ضبط جلسه، فیلم‌های ویدئویی طولانی، یا اسناد بزرگ مختلط را در یک جلسه بدون تکه‌تکه نگه دارد.

Qwen خاطرنشان می‌کند که این مدل عملکرد متن را قابل مقایسه با یک مدل فقط متنی با همان اندازه حفظ می‌کند - با پرداختن به مبادله رایج که در آن آموزش همه‌وجهی توانایی زبان خالص را کاهش می‌دهد.

کاهش قیمت 98٪ در ورودی صوتی

قیمت گذاری جایی است که علی بابا بیشترین فشار را وارد می کند. طبق این وبلاگ، قیمت API هر ساعت ورودی صوتی در مقایسه با Qwen3.5-Omni-Plus بیش از 98٪ کاهش یافته است، در حالی که قیمت هر ساعت ورودی صوتی و تصویری بیش از 93٪ کاهش یافته است. یادداشت روش‌شناسی این شرکت می‌گوید که قیمت‌های ساعتی 30 برابر هزینه ورودی دو دقیقه منبع، با ورودی صوتی و تصویری در 720p و 1 فریم در ثانیه برآورد می‌شود.

برای توسعه‌دهندگانی که عوامل صوتی، جمع‌آوری‌کننده‌های جلسات یا خطوط لوله تجزیه و تحلیل رسانه را می‌سازند، هزینه ورودی اغلب محدودیت الزام‌آور در مقیاس است. یک افت قیمت دو مرتبه ای، محصولاتی را که از نظر اقتصادی مقرون به صرفه هستند، تغییر می دهد - همان پویایی که موج اول API های استنتاج متنی ارزان را به همراه داشت.

در دسترس بودن و اکوسیستم

Qwen3.8-Omni-Flash اکنون در پلتفرم هوش مصنوعی Qianwen با دسترسی API از طریق Alibaba Cloud Model Studio، از جمله یک نقطه پایانی اختصاصی برای موارد استفاده مکالمه، در دسترس است. این تیم همچنین ابزارهای منبع باز پشتیبانی را در GitHub منتشر کرده است، از جمله مهار ارزیابی Qwen-Live-Harness و Qwen-MM-Plugins، که به توسعه دهندگان نقطه شروعی برای ساخت عوامل بومی رسانه در بالای مدل می دهد.

پرتاب بی سر و صدا در اوایل هفته فرود آمد، اما در روزهای اخیر در جامعه توسعه دهندگان مورد توجه قرار گرفت و بحث گسترده ای را در مورد اخبار هکر و پوشش رسانه های فناوری که اکوسیستم مدل باز را ردیابی می کردند، به همراه داشت.

چه معنایی برای نژاد Omnimodal دارد

این نسخه همچنان استراتژی علی‌بابا برای جفت کردن قیمت‌های تهاجمی با معیارهای رقابتی در سرتاسر خانواده Qwen خود را ادامه می‌دهد، خانواده‌ای که بارها و بارها جزو پربارگیری‌ترین دودمان مدل باز در سراسر جهان بوده است. با Qwen3.8-Omni-Flash، این شرکت شرط می‌بندد که میدان نبرد بعدی چت متنی نیست، بلکه عواملی هستند که می‌توانند تماشا کنند، گوش دهند و عمل کنند - ویرایش فیلم، خلاصه کردن جلسات، و برگزاری مکالمات صوتی در زمان واقعی به عنوان یک قابلیت یکپارچه.

برای گوگل، که Gemini 3.8 Flash نقطه مقایسه صریح آن است، پیام این است که مرز همه‌مدال دیگر مسابقه دو اسب بین آزمایشگاه‌های ایالات متحده نیست. برای توسعه‌دهندگان، ترکیب یک پنجره چندوجهی با توکن 1M و ورودی صوتی تقریباً رایگان، مانع را برای دسته‌ای از محصولات عامل سمعی و بصری که تنها چند ماه پیش برای ارائه در مقیاس غیرعملی بودند، کاهش می‌دهد.

اینکه آیا ادعاهای معیار Qwen تحت ارزیابی مستقل باقی می مانند یا خیر، چگونگی برخورد جدی صنعت با این شرط را تعیین می کند. اما جهت سفر مشخص است: تیم‌هایی که مدل‌های مرزی می‌سازند اکنون گوش‌ها و چشم‌ها - نه فقط یک جعبه متن - را به عنوان رابط پیش‌فرض برای عوامل هوش مصنوعی می‌بینند.

از هوش مصنوعی جلوتر بمانید

مسابقه omnimodal هفته به هفته در حال افزایش است. برای اخبار جدید هوش مصنوعی، تجزیه و تحلیل عمیق نسخه های جدید مدل، و پوشش ابزارهای شکل دهنده صنعت، [اخبار هوش مصنوعی را بیشتر بخوانید →] (https://aibuzzwire.news/en).

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →