تیم Qwen علی‌بابا Qwen3.8-Flash-Next را روز چهارشنبه منتشر کرد، یک مدل ترکیبی چند وجهی از متخصصان که به عنوان پیش‌نمایش معماری Qwen4 آینده دوچندان می‌شود – و نتایجی را ارائه می‌دهد که شرکت می‌گوید Qwen3.7-Plus بسیار بزرگ‌تر خود را با تقریباً یک نهم هزینه آموزش شکست داد. رویترز، بلومبرگ و رسیور همگی این پرتاب را پوشش دادند، که وزنه‌های باز را روی Hugging Face و ModelScope در همان روزی که Z.ai مدل باز مجاور مرزی خود را ارسال کرد. اخبار جدید هوش مصنوعی را با شتاب گرفتن مسابقه وزن آزاد دنبال کنید.

معماری جدید در مینیاتور

مشخصات سرفصل کارایی است. Qwen3.8-Flash-Next دارای 125 میلیارد پارامتر کل است اما در هر توکن فقط 6 میلیارد پارامتر را فعال می کند. برای مقایسه، Qwen3.7-Plus - مدلی که در معیارهای منتشر شده علی بابا عملکرد بهتری دارد - دارای 397 میلیارد پارامتر کل با 17 میلیارد فعال در هر توکن است که تقریباً سه برابر تعداد فعال Flash-Next است.

جالب‌ترین قطعه از نظر فنی، یک لایه جدید تعبیه‌شده N-gram است که حاوی 51 میلیارد پارامتر است. این لایه گروه های کلمه رایج را به عنوان ورودی های مستقل در آنچه ماتیاس باستیان از Decoder به عنوان نوعی "فرهنگ لغت نامه" توصیف می کند، ذخیره می کند، که اطلاعات سطح عبارت را به شروع شبکه می دهد. مهمتر از همه، این دستگاه به جای حافظه GPU گران قیمت، در RAM سیستم معمولی قرار می گیرد، چیزی که تیم Qwen آن را هزینه اضافی نسبتا کم می نامد - یک نوآوری معماری که قرار است در Qwen4 نیز اجرا شود.

این مدل به طور بومی از یک پنجره زمینه 262144 توکن پشتیبانی می کند و با استفاده از پسوند زمینه طولانی YaRN تا یک میلیون توکن مقیاس می کند. یک گزارش فنی در GitHub منتشر شده است.

معیارها: کدنویسی و کار اداری

معیارهای علی بابا Flash-Next را در مقابل DeepSeek-V4-Flash (284 میلیارد پارامتر، 13 میلیارد فعال) و Claude Opus 4.6 (حداکثر) از Anthropic قرار می دهند. علیرغم اینکه هر دو رقیب بسیار بزرگتر یا گرانتر هستند، Flash-Next در اکثر کارهای آزمایش شده با بیشترین دستاوردها در کدنویسی و بهره وری اداری پیشتاز است.

در کدنویسی عاملی، Flash-Next در DeepSWE 1.1 امتیاز 58.7 و در SWE-bench Pro امتیاز 62.5 را کسب کرد که هر دو DeepSeek-V4-Flash و Claude Opus 4.6 را شکست داد. شکاف در کارهای اداری هنوز هم گسترده تر است: 73.9 در CoWorkBench در مقابل 45.1 برای DeepSeek-V4-Flash، و 55.7 در JobBench - تقریبا دو برابر Qwen3.7-Plus 27.6. استدلال علمی در این زمینه کاملاً مشابه است، با Flash-Next در GPQA Diamond 91.7 و در LiveCodeBench v6 91.9. Claude Opus 4.6 فقط در آخرین امتحان Humanity با نسخه 40.0 تا 35.9 عرضه می شود و یک مدل قدیمی Anthropic از فوریه 2026 است. مثل همیشه، امتیازات معیار منتشر شده و عملکرد در دنیای واقعی می توانند متفاوت باشند.

فشار قیمت بر هر رقیب

نسخه تولیدی با نام Qwen3.8-Flash از طریق QwenCloud با قیمت 0.16 دلار به ازای هر میلیون توکن ورودی و 0.47 دلار به ازای هر میلیون توکن خروجی عرضه می شود. این حتی GLM-5.3-Flash Z.ai را که در همان روز با قیمت 0.15 دلار و 0.50 دلار عرضه شد، کاهش می دهد - عملاً برابری در انتهای بازار.

شکاف با پرچمدار خود علی بابا بسیار زیاد است. Qwen3.8-Max که در اوایل آگوست برای رقابت با Claude Opus 4.8، Gemini 3.1 Pro و GPT-5.6 Sol معرفی شد، برای هر میلیون توکن ورودی 2.00 دلار و به ازای هر میلیون توکن خروجی 6.00 دلار هزینه دارد. بر اساس اعداد خود علی بابا، Flash-Next دقیقاً زیر پرچمدار عمل می کند، تقریباً یک دوازدهم قیمت در ورودی و خروجی.

زمینه طولانی ارزش عملی فراتر از برگه مشخصات می‌افزاید. در ۲۶۲۱۴۴ توکن بومی، یک درخواست می‌تواند چندین مخزن بزرگ کد، مجموعه قرارداد کامل یا ساعت‌ها جلسات رونویسی شده را در خود نگه دارد. با گسترش به یک میلیون توکن با YaRN، تجزیه و تحلیل کل پیکره بدون داربست بازیابی امکان پذیر می شود. برای بارهای کاری کدگذاری عاملی که در آن Flash-Next قوی ترین امتیازات خود را ارسال می کند - به طور مستقل پیدا کردن و رفع اشکالات در پروژه های نرم افزاری واقعی - یک پنجره بزرگ به معنای خرابی های مدیریت زمینه کمتر در اواسط کار است. تیم Qwen همچنین گزارش فنی GitHub را منتشر کرده است و دقیقاً از نوع بررسی معماری مستقلی که آزمایشگاه‌های اختصاصی از آن اجتناب می‌کنند دعوت کرده است.

چرا این نسخه مهم است

Qwen3.8-Flash-Next بهتر است به عنوان یک تمرین لباس عمومی برای Qwen4 شناخته شود. لایه جاسازی N-gram، نسبت پارامتر فعال تهاجمی، و تخلیه RAM پارامترهای حجیم، اما به ندرت مورد نیاز، فلسفه طراحی را ترسیم می کند: حرکت هوشمند به ازای دلار، نه هوش به ازای هر GPU. آموزش یک مدل Qwen3.7-Plus-beating برای یک نهم هزینه دقیقاً قابلیتی است که چرخه های تکرار سریع را مقرون به صرفه می کند - و سرعت تکرار، بیش از هر معیار واحدی، چیزی است که تصمیم می گیرد چه کسی در یک سال آینده در مرز ایستاده باشد.

همانطور که FourWeekMBA مشاهده کرد، ورود همان روز دو مدل وزن باز مرزی از آزمایشگاه‌های چینی - GLM-5.3-Flash Z.ai و Flash-Next علی‌بابا - همچنین نشان‌دهنده تغییر آهنگ است. آزمایشگاه‌های غربی همچنان اوج‌های معیار را حفظ می‌کنند، اما سطح وزن باز اکنون هر هفته کیفیت نزدیک به مرز را با قیمت‌های یک مرتبه پایین‌تر ارسال می‌کند.

برای توسعه‌دهندگان، راهکار عملی ساده است: هزینه یک مدل چندوجهی با زمینه طولانی و توانا، با وزن‌های قابل دانلود به عنوان بیمه در برابر هر ارائه‌دهنده منفرد، دوباره کاهش یافت. برای رقبا، پیام راحت‌تر است - مرز بهره‌وری اکنون سریع‌تر از قیمت‌گذاری پرچم‌دار در حال حرکت است و علی‌بابا هیچ نشانه‌ای از کاهش سرعت نشان نداده است.

---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

بیشتر بخوانید اخبار هوش مصنوعی →