Alibaba's Qwen team released Qwen3.8-Flash-Next on Wednesday, a multimodal mixture-of-experts model that doubles as an architecture preview of the upcoming Qwen4 — and that delivers results the company says beat its much larger Qwen3.7-Plus at roughly one-ninth the training cost. רויטרס, בלומברג ו-The Decoder סיקרו כולם את ההשקה, ששמה משקלים פתוחים על Hugging Face ו-ModelScope באותו היום ש-Z.ai שלחה דגם פתוח משלה צמוד לגבול. עקבו אחר חדשות הבינה המלאכותית בזמן שהמירוץ במשקל פתוח מואץ.
ארכיטקטורה חדשה במיניאטורה
מפרט הכותרת הוא יעילות. ל-Qwen3.8-Flash-Next יש 125 מיליארד פרמטרים בסך הכל אבל מפעיל רק 6 מיליארד לכל אסימון. לשם השוואה, ל-Qwen3.7-Plus - המודל שהוא מתגבר עליו במדדים שפורסמו של עליבאבא - יש 397 מיליארד פרמטרים הכוללים עם 17 מיליארד מופעלים לכל אסימון, כמעט פי שלושה מספירת הפעילות של Flash-Next.
היצירה המעניינת ביותר מבחינה טכנית היא שכבת הטבעת N-גרם חדשה הנושאת 51 מיליארד פרמטרים. השכבה מאחסנת קבוצות מילים נפוצות כערכים עצמאיים במה שמתיאס בסטיאן של The Decoder תיאר כסוג של "מילון ביטויים", שמזין מידע ברמת הביטוי לתחילת הרשת. באופן מכריע, הוא יושב בזיכרון RAM של המערכת הרגיל ולא בזיכרון GPU יקר, במה שצוות Qwen מכנה עלות נוספת נמוכה יחסית - חידוש ארכיטקטוני המתוכנן להוביל ל-Qwen4.
המודל תומך באופן מקורי בחלון הקשר של 262,144 אסימונים ומתרחב למיליון אסימונים באמצעות סיומת YaRN בהקשר ארוך. דוח טכני מתפרסם ב-GitHub.
אמות מידה: קידוד ועבודה משרדית
Alibaba's benchmarks pit Flash-Next against DeepSeek-V4-Flash (284 billion parameters, 13 billion active) and Anthropic's Claude Opus 4.6 (Max). למרות ששתי היריבות גדולות או יקרות בהרבה, Flash-Next מובילה ברוב המשימות שנבדקו, עם הרווחים הגדולים ביותר בקידוד ובפרודוקטיביות המשרדית.
בקידוד סוכן, Flash-Next קיבל ציון של 58.7 ב-DeepSWE 1.1 ו-62.5 ב-SWE-bench Pro, וגבר על DeepSeek-V4-Flash וגם על קלוד אופוס 4.6. הפער במשימות המשרד גדול עוד יותר: 73.9 ב-CoWorkBench מול 45.1 ב-DeepSeek-V4-Flash, ו-55.7 ב-JobBench - כמעט כפול מ-27.6 של Qwen3.7-Plus. ההיגיון המדעי תואם באופן הדוק בכל התחום, עם Flash-Next ב-91.7 ב-GPQA Diamond ו-91.9 ב-LiveCodeBench v6. Claude Opus 4.6 only comes out ahead on Humanity's Last Exam, 40.0 to 35.9, and it is an older Anthropic model from February 2026. As always, published benchmark scores and real-world performance can differ.
לחץ תמחור על כל יריבה
גרסת הייצור נשלחת כ-Qwen3.8-Flash דרך QwenCloud, במחיר של $0.16 למיליון אסימוני קלט ו-$0.47 למיליון אסימוני פלט. זה מפחית אפילו את ה-GLM-5.3-Flash של Z.ai, ששוחרר באותו יום במחיר של 0.15 ו-$0.50 בהתאמה - למעשה שוויון בתחתית השוק.
הפער לספינת הדגל של עליבאבא עצמה הוא בולט. Qwen3.8-Max, שהוצג בתחילת אוגוסט כדי להתחרות עם קלוד אופוס 4.8, Gemini 3.1 Pro ו-GPT-5.6 Sol, עולה 2.00 דולר למיליון אסימוני קלט ו-6.00 דולר למיליון אסימוני פלט. Flash-Next מתפקד ממש מתחת לספינת הדגל, לפי המספרים של עליבאבא עצמה, בערך ב-12 מהמחיר הן בקלט והן בפלט.
ההקשר הארוך מוסיף ערך מעשי מעבר לגיליון המפרט. ב-262,144 אסימונים מקוריים, בקשה אחת יכולה להכיל מספר מאגרי קוד גדולים, סט חוזה מלא או שעות של פגישות מתומללות; מורחבת למיליון אסימונים עם YaRN, ניתוח כל הקורפוס הופך לאפשרי ללא פיגומי אחזור. For the agentic coding workloads where Flash-Next posts its strongest scores — independently finding and fixing bugs in real software projects — a large window means fewer context-management failures mid-task. צוות Qwen גם פרסם את הדוח הטכני ב-GitHub, ומזמין בדיוק את הסוג של בדיקת ארכיטקטורה עצמאית שמעבדות קנייניות נמנעות ממנה.
למה המהדורה הזו חשובה
Qwen3.8-Flash-Next מובן בצורה הטובה ביותר כחזרת לבוש ציבורית עבור Qwen4. שכבת הטבעת N-גרם, יחס הפרמטרים האקטיביים האגרסיביים ופריקת זיכרון RAM של פרמטרים מגושמים אך דרושים לעיתים רחוקות משרטטים פילוסופיית עיצוב: הזזת אינטליגנציה לכל דולר, לא אינטליגנציה לכל GPU. אימון דגם Qwen3.7-Plus-beating עבור תשיעית מהעלות היא בדיוק היכולת שהופכת מחזורי איטרציה מהירים למחיר סביר - ומהירות איטרציה, יותר מכל אמת מידה בודדת, היא מה שמחליט מי עומד על הגבול בעוד שנה מהיום.
הגעתם באותו יום של שני דגמי משקל פתוח צמודים לגבול ממעבדות סיניות - ה-GLM-5.3-Flash של Z.ai ו-Flash-Next של עליבאבא - מסמנת גם היא שינוי קצב, כפי שצפה FourWeekMBA. מעבדות מערביות עדיין מחזיקות בפסגות בנצ'מרק, אבל דרגת המשקל הפתוח שולחת כעת איכות שבועית קרוב לגבול, במחירים נמוכים בסדר גודל.
עבור המפתחים, ההטבה המעשית היא פשוטה: העלות של מודל רב-מודאלי בעל יכולת, קונטקסט ארוך, פשוט ירדה שוב, עם משקלים להורדה כביטוח מול כל ספק יחיד. עבור המתחרים, המסר פחות נוח - גבול היעילות נע כעת מהר יותר מכפי שתמחור הדגל יכול לעקוב באופן מציאותי, ועליבאבא לא הראתה שום סימן להאטה.
---
הישאר לפני AIקבל את החדשות, הניתוחים ופריצות הדרך האחרונות של AI - הכל במקום אחד.
קרא עוד חדשות AI →