צוות ה-Qwen של עליבאבא השיק את Qwen3.8-Omni-Flash, מודל אומנימודאלי מהדור הבא המקבל קלט טקסט, תמונה, אודיו ווידאו דרך חלון הקשר יחיד של מיליון אסימונים. המהדורה, המפורטת בבלוג הרשמי של Qwen, מסמנת את הדחיפה האגרסיבית ביותר של הצוות עד כה להפוך אודיו ווידאו מכניסות פסיביות למדיום העיקרי שדרכו סוכני AI תופסים את העולם ופועלים בו.
מהבנת מדיה ועד לפעול לפיה
המטרה המוצהרת של Qwen3.8-Omni-Flash היא לא רק הבנת מדיה טובה יותר. לדברי צוות Qwen, המודל נועד לקדם מערכות אומנימודאליות מ"הבנת תוכן אומנימודאלי" ל"תכנון משימות, כלים להתקשרות והשלמת עבודה יצירתית". בפועל, זה אומר שהמודל מכוון לתהליכי עבודה כמו עריכת וידאו, יצירת קליפים, הפקת סרטים ופרשנות, סיכום אודיו-ויזואלי ושיחות קוליות בזמן אמת.
מסגור סוכן זה מפריד בין השחרור לבין מודלים מולטי-מודאליים קודמים שהתייחסו לאודיו ווידאו כאל קלט שיש לתמלל או לתאר. Qwen טוען כי אודיו ווידאו מתפתחים ל"מדיה ליבה שבאמצעותה סוכנים מבינים את הסביבה שלהם, את הסיבה ומבצעים משימות" - טענה שהחברה תומכת בשורה של תוצאות בנצ'מרק אנטי.
המספרים מאחורי השחרור
על פני 29 הערכות המתפרשות על נימוקים אודיו, הנמקה אודיו-ויזואלית ומדדי סוכן אודיו-ויזואלי, Qwen אומר שהציון הממוצע של הדגם משתפר ביותר מ-25% לעומת קודמו, Qwen3.5-Omni-Plus. תוצאות הכותרות שדווחו בבלוג Qwen כוללות:
- רווח של 36.5 נקודות ב-WildClawBench-MM ו-22.3 נקודות ב-AgenticVBench, שני מדדים עבור סוכנים אודיו-ויזואליים, בתוספת ציון של 69.6 ב-UniClawBench.
- שיפור של 8.3 נקודות ב-LongAudioSpan ורווח של 9.6 נקודות ב-OmniVideoBench להבנת אודיו ווידאו ארוכת טווח.
- ירידות דרמטיות בשיעור השגיאות בתמלול פגישות מרובה דוברים: AliMeeting DER ו-cpWER של הדגם ירדו מ-88.11 ו-89.61 ל-3.35 ו-17.18 בהתאמה.
בחזית התחרותית, Qwen עושה השוואה ישירה עם ההיצע של גוגל: החברה טוענת לביצועים אודיו-ויזואליים קרובים ל-Gemini 3.8 Flash וביצועי אודיו כלליים שעולים עליהם. אימות בלתי תלוי של ההשוואות הללו ייקח זמן, אבל הספציפיות של המדד טוענת ש-Qwen רואה במודל תחרותי בגבול העבודה הכל-מודאלית.
חלון של 1 מיליון אסימון לשעות של מדיה
חלון ההקשר המאוחד של מיליון אסימונים הוא ללא ספק התכונה המעשית ביותר של המהדורה. מכיוון ששמע ווידאו צורכים אסימונים הרבה יותר מהר מטקסט, רוב הדגמים המולטי-מודאליים בייצור מטפלים רק בדקות של מדיה בכל פעם. חלון הקשר בן שבע ספרות מאפשר לדגם להחזיק שעות של הקלטות פגישות, קטעי וידאו מורחבים או מסמכים מעורבים גדולים בסשן אחד ללא חתיכות.
Qwen מציין כי המודל שומר על ביצועי טקסט דומים למודל של טקסט בלבד באותו גודל - תוך התייחסות לפשרה הנפוצה שבה אימון אומנימודאלי משפיל את יכולת השפה הטהורה.
קיצוץ מחירים של 98% בכניסת אודיו
התמחור הוא המקום שבו עליבאבא מפעילה הכי הרבה לחץ. לפי הבלוג, מחיר ה-API לשעת קלט אודיו ירד ביותר מ-98% בהשוואה ל-Qwen3.5-Omni-Plus, בעוד שהמחיר לשעה של קלט אודיו-ויזואלי ירד ביותר מ-93%. הערת המתודולוגיה של החברה אומרת שהמחירים לשעה נאמדים פי 30 מעלות הקלט של שתי דקות של חומר מקור, עם קלט אודיו-ויזואלי המחושב ב-720p ו-1 פריים לשנייה.
עבור מפתחים הבונים סוכני קול, מסכמי פגישות או צינורות ניתוח מדיה, עלות הקלט היא לרוב המגבלה המחייבת בקנה מידה. ירידת מחירים של שני סדרי גודל משנה אילו מוצרים כדאיים מבחינה כלכלית - אותה דינמיקה שהניעה את הגל הראשון של ממשקי API זולים להסקת טקסט.
זמינות ומערכת אקולוגית
Qwen3.8-Omni-Flash זמין כעת בפלטפורמת Qianwen AI, עם גישה ל-API דרך Alibaba Cloud Model Studio, כולל נקודת קצה ייעודית בזמן אמת למקרי שימוש בשיחות. הצוות גם פרסם כלים תומכים בקוד פתוח ב-GitHub, כולל רתמת הערכת Qwen-Live-Harness ו-Qwen-MM-Plugins, מה שנותן למפתחים נקודת התחלה לבניית סוכנים מקוריים במדיה על גבי המודל.
ההשקה נחתה בשקט מוקדם יותר השבוע, אך זכתה למשיכה משמעותית בקהילת המפתחים בימים האחרונים, וגררה דיון נרחב ב-Hacker News וסיקור של ערוצי טכנולוגיה העוקבים אחר מערכת האקולוגית של המודל הפתוח.
מה זה אומר עבור המירוץ האומנימודאלי
המהדורה ממשיכה את האסטרטגיה של עליבאבא של שילוב תמחור אגרסיבי עם אמות מידה תחרותיות על פני משפחת ה-Qwen שלה, שהייתה שוב ושוב בין שושלת המודל הפתוחה שהורדת ביותר ברחבי העולם. עם Qwen3.8-Omni-Flash, החברה מהמרת ששדה הקרב הבא אינו צ'אט טקסט אלא סוכנים שיכולים לצפות, להאזין ולפעול - עריכת צילומים, סיכום פגישות וניהול שיחות קול בזמן אמת כיכולת משולבת אחת.
עבור גוגל, ש-Gemini 3.8 Flash היא נקודת ההשוואה המפורשת, המסר הוא שהגבול האומני-מודאלי אינו עוד מירוץ שני סוסים בין מעבדות בארה"ב. עבור מפתחים, השילוב של חלון רב-מודאלי אסימון של 1M וכניסת אודיו כמעט חופשית מוריד את המחסום לסוג של מוצרי סוכנים אודיו-ויזואליים שלא היה מעשי להגיש בקנה מידה רק לפני חודשים.
אם הטענות בנצ'מרק של Qwen עומדות בהערכה עצמאית תעצב את מידת הרצינות שהתעשייה מתייחסת להימור הזה. אבל כיוון הנסיעה ברור: הצוותים שבונים מודלים חזיתיים רואים כעת באוזניים ובעיניים - לא רק תיבת טקסט - כממשק ברירת המחדל עבור סוכני AI.
הישאר לפני AI
המירוץ האומנימודאלי מואץ משבוע לשבוע. לחדשות בינה מלאכותיות נוספות, ניתוח מעמיק של מהדורות דגמים חדשות וסיקור של הכלים המעצבים את התעשייה, קרא עוד חדשות AI →.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →