تیم Qwen علیبابا Qwen3.8-Flash-Next را روز چهارشنبه منتشر کرد، یک مدل ترکیبی چند وجهی از متخصصان که به عنوان پیشنمایش معماری Qwen4 آینده دوچندان میشود – و نتایجی را ارائه میدهد که شرکت میگوید Qwen3.7-Plus بسیار بزرگتر خود را با تقریباً یک نهم هزینه آموزش شکست داد. رویترز، بلومبرگ و رسیور همگی این پرتاب را پوشش دادند، که وزنههای باز را روی Hugging Face و ModelScope در همان روزی که Z.ai مدل باز مجاور مرزی خود را ارسال کرد. اخبار جدید هوش مصنوعی را با شتاب گرفتن مسابقه وزن آزاد دنبال کنید.
معماری جدید در مینیاتور
مشخصات سرفصل کارایی است. Qwen3.8-Flash-Next دارای 125 میلیارد پارامتر کل است اما در هر توکن فقط 6 میلیارد پارامتر را فعال می کند. برای مقایسه، Qwen3.7-Plus - مدلی که در معیارهای منتشر شده علی بابا عملکرد بهتری دارد - دارای 397 میلیارد پارامتر کل با 17 میلیارد فعال در هر توکن است که تقریباً سه برابر تعداد فعال Flash-Next است.
جالبترین قطعه از نظر فنی، یک لایه جدید تعبیهشده N-gram است که حاوی 51 میلیارد پارامتر است. این لایه گروه های کلمه رایج را به عنوان ورودی های مستقل در آنچه ماتیاس باستیان از Decoder به عنوان نوعی "فرهنگ لغت نامه" توصیف می کند، ذخیره می کند، که اطلاعات سطح عبارت را به شروع شبکه می دهد. مهمتر از همه، این دستگاه به جای حافظه GPU گران قیمت، در RAM سیستم معمولی قرار می گیرد، چیزی که تیم Qwen آن را هزینه اضافی نسبتا کم می نامد - یک نوآوری معماری که قرار است در Qwen4 نیز اجرا شود.
این مدل به طور بومی از یک پنجره زمینه 262144 توکن پشتیبانی می کند و با استفاده از پسوند زمینه طولانی YaRN تا یک میلیون توکن مقیاس می کند. یک گزارش فنی در GitHub منتشر شده است.
معیارها: کدنویسی و کار اداری
معیارهای علی بابا Flash-Next را در مقابل DeepSeek-V4-Flash (284 میلیارد پارامتر، 13 میلیارد فعال) و Claude Opus 4.6 (حداکثر) از Anthropic قرار می دهند. علیرغم اینکه هر دو رقیب بسیار بزرگتر یا گرانتر هستند، Flash-Next در اکثر کارهای آزمایش شده با بیشترین دستاوردها در کدنویسی و بهره وری اداری پیشتاز است.
در کدنویسی عاملی، Flash-Next در DeepSWE 1.1 امتیاز 58.7 و در SWE-bench Pro امتیاز 62.5 را کسب کرد که هر دو DeepSeek-V4-Flash و Claude Opus 4.6 را شکست داد. شکاف در کارهای اداری هنوز هم گسترده تر است: 73.9 در CoWorkBench در مقابل 45.1 برای DeepSeek-V4-Flash، و 55.7 در JobBench - تقریبا دو برابر Qwen3.7-Plus 27.6. استدلال علمی در این زمینه کاملاً مشابه است، با Flash-Next در GPQA Diamond 91.7 و در LiveCodeBench v6 91.9. Claude Opus 4.6 فقط در آخرین امتحان Humanity با نسخه 40.0 تا 35.9 عرضه می شود و یک مدل قدیمی Anthropic از فوریه 2026 است. مثل همیشه، امتیازات معیار منتشر شده و عملکرد در دنیای واقعی می توانند متفاوت باشند.
فشار قیمت بر هر رقیب
نسخه تولیدی با نام Qwen3.8-Flash از طریق QwenCloud با قیمت 0.16 دلار به ازای هر میلیون توکن ورودی و 0.47 دلار به ازای هر میلیون توکن خروجی عرضه می شود. این حتی GLM-5.3-Flash Z.ai را که در همان روز با قیمت 0.15 دلار و 0.50 دلار عرضه شد، کاهش می دهد - عملاً برابری در انتهای بازار.
شکاف با پرچمدار خود علی بابا بسیار زیاد است. Qwen3.8-Max که در اوایل آگوست برای رقابت با Claude Opus 4.8، Gemini 3.1 Pro و GPT-5.6 Sol معرفی شد، برای هر میلیون توکن ورودی 2.00 دلار و به ازای هر میلیون توکن خروجی 6.00 دلار هزینه دارد. بر اساس اعداد خود علی بابا، Flash-Next دقیقاً زیر پرچمدار عمل می کند، تقریباً یک دوازدهم قیمت در ورودی و خروجی.
زمینه طولانی ارزش عملی فراتر از برگه مشخصات میافزاید. در ۲۶۲۱۴۴ توکن بومی، یک درخواست میتواند چندین مخزن بزرگ کد، مجموعه قرارداد کامل یا ساعتها جلسات رونویسی شده را در خود نگه دارد. با گسترش به یک میلیون توکن با YaRN، تجزیه و تحلیل کل پیکره بدون داربست بازیابی امکان پذیر می شود. برای بارهای کاری کدگذاری عاملی که در آن Flash-Next قوی ترین امتیازات خود را ارسال می کند - به طور مستقل پیدا کردن و رفع اشکالات در پروژه های نرم افزاری واقعی - یک پنجره بزرگ به معنای خرابی های مدیریت زمینه کمتر در اواسط کار است. تیم Qwen همچنین گزارش فنی GitHub را منتشر کرده است و دقیقاً از نوع بررسی معماری مستقلی که آزمایشگاههای اختصاصی از آن اجتناب میکنند دعوت کرده است.
چرا این نسخه مهم است
Qwen3.8-Flash-Next بهتر است به عنوان یک تمرین لباس عمومی برای Qwen4 شناخته شود. لایه جاسازی N-gram، نسبت پارامتر فعال تهاجمی، و تخلیه RAM پارامترهای حجیم، اما به ندرت مورد نیاز، فلسفه طراحی را ترسیم می کند: حرکت هوشمند به ازای دلار، نه هوش به ازای هر GPU. آموزش یک مدل Qwen3.7-Plus-beating برای یک نهم هزینه دقیقاً قابلیتی است که چرخه های تکرار سریع را مقرون به صرفه می کند - و سرعت تکرار، بیش از هر معیار واحدی، چیزی است که تصمیم می گیرد چه کسی در یک سال آینده در مرز ایستاده باشد.
همانطور که FourWeekMBA مشاهده کرد، ورود همان روز دو مدل وزن باز مرزی از آزمایشگاههای چینی - GLM-5.3-Flash Z.ai و Flash-Next علیبابا - همچنین نشاندهنده تغییر آهنگ است. آزمایشگاههای غربی همچنان اوجهای معیار را حفظ میکنند، اما سطح وزن باز اکنون هر هفته کیفیت نزدیک به مرز را با قیمتهای یک مرتبه پایینتر ارسال میکند.
برای توسعهدهندگان، راهکار عملی ساده است: هزینه یک مدل چندوجهی با زمینه طولانی و توانا، با وزنهای قابل دانلود به عنوان بیمه در برابر هر ارائهدهنده منفرد، دوباره کاهش یافت. برای رقبا، پیام راحتتر است - مرز بهرهوری اکنون سریعتر از قیمتگذاری پرچمدار در حال حرکت است و علیبابا هیچ نشانهای از کاهش سرعت نشان نداده است.
---
از هوش مصنوعی جلوتر بمانیدآخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →