أطلق فريق Qwen التابع لشركة Alibaba Qwen3.8-Omni-Flash، وهو نموذج أصلي متعدد الوسائط من الجيل التالي يقبل إدخالات النص والصورة والصوت والفيديو من خلال نافذة سياق واحدة تحتوي على مليون رمز مميز. يمثل الإصدار، المفصل على مدونة Qwen الرسمية، الدفعة الأكثر جرأة للفريق حتى الآن لتحويل الصوت والفيديو من المدخلات السلبية إلى الوسيط الأساسي الذي من خلاله يدرك عملاء الذكاء الاصطناعي العالم ويتصرفون فيه.

من فهم وسائل الإعلام إلى التصرف بناءً عليها

الهدف المعلن لـ Qwen3.8-Omni-Flash ليس مجرد فهم أفضل للوسائط. وفقًا لفريق Qwen، تم تصميم النموذج لتطوير الأنظمة متعددة الوسائط من "فهم المحتوى متعدد الوسائط" إلى "تخطيط المهام، وأدوات الاتصال، وإكمال العمل الإبداعي". من الناحية العملية، يعني هذا أن النموذج يهدف إلى سير العمل مثل تحرير الفيديو، وإنشاء مقاطع الفيديو الموسيقية، وإنتاج الأفلام والتعليق عليها، والتلخيص الصوتي والمرئي، والمحادثات الصوتية في الوقت الفعلي.

يفصل هذا الإطار الوكيل الإصدار عن النماذج متعددة الوسائط السابقة التي تعاملت مع الصوت والفيديو كمدخلات ليتم نسخها أو وصفها. يقول كوين إن الصوت والفيديو يتطوران إلى "وسائط أساسية يفهم الوكلاء من خلالها بيئتهم، وعقلهم، وينفذون المهام" - وهو ادعاء تدعمه الشركة بسلسلة من النتائج المعيارية للوكلاء.

الأرقام وراء الإصدار

عبر 29 تقييمًا تشمل الاستدلال الصوتي، والاستدلال السمعي البصري، ومعايير الوكيل السمعي البصري، يقول كوين إن متوسط درجة النموذج يتحسن بأكثر من 25% عن سابقه، Qwen3.5-Omni-Plus. تتضمن النتائج الرئيسية الواردة في مدونة Qwen ما يلي:

  • مكاسب قدرها 36.5 نقطة على WildClawBench-MM و22.3 نقطة على AgenticVBench، وهما معياران للوكلاء السمعيين والبصريين، بالإضافة إلى درجة 69.6 على UniClawBench.
  • تحسين بمقدار 8.3 نقطة على LongAudioSpan وزيادة قدرها 9.6 نقطة على OmniVideoBench لفهم الصوت والفيديو الطويل.
  • انخفاض كبير في معدل الخطأ في النسخ النصي للاجتماعات متعددة المتحدثين: انخفض نموذج AliMeeting DER وcpWER من 88.11 و89.61 إلى 3.35 و17.18 على التوالي.

على الصعيد التنافسي، يقوم Qwen بإجراء مقارنة مباشرة مع عروض Google: تدعي الشركة أن الأداء الصوتي والمرئي قريب من Gemini 3.8 Flash والأداء الصوتي الإجمالي الذي يتجاوزه. سيستغرق التحقق المستقل من هذه المقارنات بعض الوقت، لكن خصوصية المطالبات المعيارية تشير إلى أن كوين يعتبر النموذج تنافسيًا على حدود العمل متعدد الوسائط.

نافذة بحجم 1 مليون رمز لساعات من الوسائط

يمكن القول إن نافذة السياق الموحدة المكونة من مليون رمز هي الميزة الأكثر عملية للإصدار. نظرًا لأن الصوت والفيديو يستهلكان الرموز المميزة بشكل أسرع بكثير من النص، فإن معظم النماذج متعددة الوسائط في الإنتاج تتعامل مع دقائق قليلة فقط من الوسائط في المرة الواحدة. تسمح نافذة السياق المكونة من سبعة أرقام للنموذج بالاحتفاظ بساعات من تسجيلات الاجتماعات أو لقطات الفيديو الممتدة أو مستندات الوسائط المختلطة الكبيرة في جلسة واحدة دون تقطيع.

يشير كوين إلى أن النموذج يحافظ على أداء النص مشابهًا لنموذج النص فقط من نفس الحجم - مما يعالج المفاضلة الشائعة حيث يؤدي التدريب متعدد الوسائط إلى تدهور القدرة اللغوية البحتة.

تخفيضات في الأسعار بنسبة 98% على مدخلات الصوت

التسعير هو المكان الذي تمارس فيه علي بابا أكبر قدر من الضغط. وفقًا للمدونة، انخفض سعر واجهة برمجة التطبيقات (API) لكل ساعة من إدخال الصوت بأكثر من 98% مقارنةً بـ Qwen3.5-Omni-Plus، في حين انخفض سعر ساعة الإدخال الصوتي والمرئي بأكثر من 93%. تقول مذكرة منهجية الشركة أن الأسعار بالساعة تقدر بـ 30 ضعف تكلفة الإدخال لدقيقتين من المادة المصدر، مع حساب المدخلات الصوتية والمرئية بدقة 720 بكسل وإطار واحد في الثانية.

بالنسبة للمطورين الذين ينشئون وكلاء صوتيين، أو ملخصات الاجتماعات، أو خطوط أنابيب تحليل الوسائط، غالبًا ما تكون تكلفة المدخلات هي القيد الملزم على نطاق واسع. يؤدي انخفاض الأسعار بمقدار مرتبتين إلى تغيير المنتجات التي تكون قابلة للحياة اقتصاديًا - وهي نفس الديناميكية التي قادت الموجة الأولى من واجهات برمجة التطبيقات الرخيصة لاستدلال النص.

التوفر والنظام البيئي

يتوفر Qwen3.8-Omni-Flash الآن على منصة Qianwen AI، مع إمكانية الوصول إلى واجهة برمجة التطبيقات (API) من خلال Alibaba Cloud Model Studio، بما في ذلك نقطة نهاية مخصصة في الوقت الفعلي لحالات الاستخدام التحادثي. نشر الفريق أيضًا أدوات داعمة مفتوحة المصدر على GitHub، بما في ذلك أداة التقييم Qwen-Live-Harness وQwen-MM-Plugins، مما يمنح المطورين نقطة انطلاق لبناء وكلاء الوسائط الأصليين فوق النموذج.

تم الإطلاق بهدوء في وقت سابق من الأسبوع ولكنه اكتسب زخمًا كبيرًا في مجتمع المطورين في الأيام الأخيرة، مما أثار نقاشًا كبيرًا حول Hacker News وتغطية من منافذ التكنولوجيا التي تتبع النظام البيئي للنموذج المفتوح.

ماذا يعني بالنسبة للسباق متعدد الوسائط

ويواصل الإصدار استراتيجية علي بابا المتمثلة في الجمع بين التسعير القوي والمقاييس التنافسية عبر عائلة Qwen، والتي كانت مرارًا وتكرارًا من بين سلالات النماذج المفتوحة الأكثر تنزيلًا في جميع أنحاء العالم. مع Qwen3.8-Omni-Flash، تراهن الشركة على أن ساحة المعركة التالية ليست الدردشة النصية، بل الوكلاء الذين يمكنهم المشاهدة والاستماع والعمل – وتحرير اللقطات، وتلخيص الاجتماعات، وإجراء محادثات صوتية في الوقت الفعلي كقدرة واحدة متكاملة.

وبالنسبة لشركة جوجل، التي يشكل برنامجها Gemini 3.8 Flash نقطة المقارنة الصريحة، فإن الرسالة هي أن حدود الوسائط المتعددة لم تعد عبارة عن سباق بين مختبرات الولايات المتحدة. بالنسبة للمطورين، يؤدي الجمع بين نافذة متعددة الوسائط مكونة من مليون رمز وإدخال صوتي شبه مجاني إلى تقليل الحاجز أمام فئة منتجات الوكيل الصوتي والمرئي التي لم يكن من العملي تقديمها على نطاق واسع قبل أشهر فقط.

ما إذا كانت مطالبات Qwen المعيارية ستصمد في ظل التقييم المستقل سوف تحدد مدى جدية تعامل الصناعة مع هذا الرهان. لكن اتجاه السفر واضح: فالفرق التي تعمل على بناء النماذج الحدودية ترى الآن الأذنين والعيون - وليس مجرد مربع نص - كواجهة افتراضية لعملاء الذكاء الاصطناعي.

ابق في صدارة الذكاء الاصطناعي

السباق الشامل يتسارع أسبوعًا بعد أسبوع. لمزيد من أخبار الذكاء الاصطناعي العاجلة، والتحليل المتعمق لإصدارات النماذج الجديدة، وتغطية الأدوات التي تشكل الصناعة، اقرأ المزيد من أخبار الذكاء الاصطناعي →.

---

ابق على اطلاع بأخبار الذكاء الاصطناعي

آخر أخبار وتحليلات وإنجازات الذكاء الاصطناعي — في مكان واحد.

اقرأ المزيد من أخبار الذكاء الاصطناعي →