علی بابا کی Qwen ٹیم نے بدھ کے روز Qwen3.8-Flash-Next جاری کیا، ماہرین کا ملٹی موڈل مرکب جو آنے والے Qwen4 کے آرکیٹیکچر کے پیش نظارہ کے طور پر دگنا ہوتا ہے - اور یہ نتائج فراہم کرتا ہے کہ کمپنی کا کہنا ہے کہ اس کے بہت بڑے Qwen3.7-Plus کو تربیت کی لاگت سے تقریباً ایک نواں حصہ ہرا دیا ہے۔ رائٹرز، بلومبرگ، اور دی ڈیکوڈر سبھی نے اس لانچ کا احاطہ کیا، جس نے ہگنگ فیس اور ماڈل اسکوپ پر کھلے وزن کو اسی دن Z.ai نے اپنے فرنٹیئر سے ملحقہ اوپن ماڈل بھیجا۔ بریکنگ AI نیوز* کی پیروی کریں کیونکہ اوپن ویٹ ریس میں تیزی آتی ہے۔

چھوٹے میں ایک نیا فن تعمیر

سرخی کی تصریح کارکردگی ہے۔ Qwen3.8-Flash-Next کے کل پیرامیٹرز 125 بلین ہیں لیکن فی ٹوکن صرف 6 بلین کو چالو کرتا ہے۔ مقابلے کے لیے، Qwen3.7-Plus - جو ماڈل یہ علی بابا کے شائع کردہ معیارات میں بہتر کارکردگی کا مظاہرہ کرتا ہے - کے پاس 397 بلین کل پیرامیٹرز ہیں جن میں 17 بلین فی ٹوکن ایکٹیویٹ ہوتے ہیں، جو فلیش-نیکسٹ کی فعال تعداد سے تقریباً تین گنا زیادہ ہے۔

سب سے زیادہ تکنیکی طور پر دلچسپ ٹکڑا ایک ناول این گرام ایمبیڈنگ پرت ہے جس میں 51 بلین پیرامیٹرز ہیں۔ پرت عام الفاظ کے گروپوں کو اسٹینڈ اکیلے اندراجات کے طور پر ذخیرہ کرتی ہے جس میں ڈیکوڈر کے میتھیاس باسٹین نے ایک قسم کی "جملے لغت" کے طور پر بیان کیا ہے، جو نیٹ ورک کے آغاز میں فقرے کی سطح کی معلومات فراہم کرتا ہے۔ اہم طور پر، یہ مہنگی GPU میموری کی بجائے باقاعدہ سسٹم RAM میں بیٹھتا ہے، جس پر Qwen ٹیم نسبتاً کم اضافی لاگت کہتی ہے - ایک آرکیٹیکچرل اختراع جو Qwen4 میں لے جانے والی ہے۔

ماڈل مقامی طور پر 262,144 ٹوکن سیاق و سباق کی ونڈو کو سپورٹ کرتا ہے اور YaRN طویل سیاق و سباق کی توسیع کا استعمال کرتے ہوئے 10 لاکھ ٹوکن تک اسکیل کرتا ہے۔ گٹ ہب پر ایک تکنیکی رپورٹ شائع کی گئی ہے۔

بینچ مارکس: کوڈنگ اور دفتری کام

Alibaba کے بینچ مارکس Flash-Next کو DeepSeek-V4-Flash (284 بلین پیرامیٹرز، 13 بلین ایکٹیو) اور Anthropic کے Claude Opus 4.6 (زیادہ سے زیادہ) کے مقابلے میں کھڑا کرتے ہیں۔ دونوں حریفوں کے بہت بڑے یا زیادہ مہنگے ہونے کے باوجود، فلیش-نیکسٹ آزمائشی کاموں میں سب سے آگے ہے، کوڈنگ اور دفتری پیداواری صلاحیت میں سب سے زیادہ فوائد کے ساتھ۔

ایجنٹی کوڈنگ پر، Flash-Next نے DeepSWE 1.1 پر 58.7 اور SWE-bench Pro پر 62.5 کا سکور کیا، جس نے DeepSeek-V4-Flash اور Claude Opus 4.6 دونوں کو شکست دی۔ دفتری کاموں میں فرق اب بھی وسیع ہے: CoWorkBench پر 73.9 جبکہ DeepSeek-V4-Flash کے لیے 45.1، اور JobBench پر 55.7 - تقریباً دوگنا Qwen3.7-Plus کا 27.6۔ GPQA ڈائمنڈ پر Flash-Next 91.7 اور LiveCodeBench v6 پر 91.9 کے ساتھ، سائنسی استدلال پورے میدان میں قریب سے ملتا ہے۔ Claude Opus 4.6 صرف Humanity's Last Exam، 40.0 سے 35.9 پر سامنے آتا ہے، اور یہ فروری 2026 سے ایک پرانا انتھروپک ماڈل ہے۔ ہمیشہ کی طرح، شائع شدہ بینچ مارک سکور اور حقیقی دنیا کی کارکردگی میں فرق ہو سکتا ہے۔

ہر حریف پر قیمتوں کا دباؤ

پروڈکشن ورژن Qwen3.8-Flash کے طور پر QwenCloud کے ذریعے بھیجتا ہے، جس کی قیمت $0.16 فی ملین ان پٹ ٹوکن اور $0.47 فی ملین آؤٹ پٹ ٹوکن ہے۔ یہ Z.ai کے GLM-5.3-Flash کو بھی کم کرتا ہے، اسی دن بالترتیب $0.15 اور $0.50 پر ریلیز ہوا - مؤثر طریقے سے مارکیٹ کے نچلے حصے میں برابری۔

علی بابا کے اپنے فلیگ شپ کا فرق بہت بڑا ہے۔ Qwen3.8-Max، جو اگست کے اوائل میں Claude Opus 4.8، Gemini 3.1 Pro، اور GPT-5.6 Sol کے ساتھ مقابلہ کرنے کے لیے متعارف کرایا گیا تھا، اس کی قیمت $2.00 فی ملین ان پٹ ٹوکن اور $6.00 فی ملین آؤٹ پٹ ٹوکن ہے۔ Flash-Next، علی بابا کے اپنے نمبروں کے مطابق، ان پٹ اور آؤٹ پٹ دونوں پر تقریباً ایک بارہویں قیمت پر، فلیگ شپ کے بالکل نیچے پرفارم کرتا ہے۔

طویل سیاق و سباق مخصوص شیٹ سے آگے عملی قدر کا اضافہ کرتا ہے۔ 262,144 مقامی ٹوکنز پر، ایک درخواست کئی بڑے کوڈ ریپوزٹریز، ایک مکمل معاہدہ سیٹ، یا ٹرانسکرائب شدہ میٹنگز کے گھنٹے رکھ سکتی ہے۔ YaRN کے ساتھ 10 لاکھ ٹوکنز تک بڑھا دیا گیا، مکمل کارپس تجزیہ بازیافت سہاروں کے بغیر ممکن ہو جاتا ہے۔ ایجنٹی کوڈنگ کے کام کے بوجھ کے لیے جہاں Flash-Next اپنے مضبوط ترین اسکور پوسٹ کرتا ہے — اصلی سافٹ ویئر پروجیکٹس میں آزادانہ طور پر کیڑے ڈھونڈنا اور ٹھیک کرنا — ایک بڑی ونڈو کا مطلب ہے کم سیاق و سباق کے انتظام میں ناکامیاں وسط کام میں۔ Qwen ٹیم نے GitHub پر تکنیکی رپورٹ بھی شائع کی ہے، جس میں بالکل اسی قسم کی آزاد فن تعمیر کی جانچ کی دعوت دی گئی ہے جس سے ملکیتی لیبارٹریز گریز کرتی ہیں۔

یہ ریلیز کیوں اہم ہے۔

Qwen3.8-Flash-Next کو Qwen4 کے لیے عوامی ڈریس ریہرسل کے طور پر بہترین سمجھا جاتا ہے۔ این گرام ایمبیڈنگ پرت، جارحانہ ایکٹیو پیرامیٹر ریشو، اور بھاری لیکن شاذ و نادر ہی ضروری پیرامیٹرز کی RAM آف لوڈنگ ایک ڈیزائن فلسفہ کا خاکہ پیش کرتی ہے: انٹیلی جنس فی ڈالر منتقل کریں، انٹیلی جنس فی GPU نہیں۔ Qwen3.7-Plus-beating ماڈل کی تربیت ایک نویں لاگت کے لیے خاص طور پر وہ صلاحیت ہے جو تیز رفتار تکرار سائیکلوں کو سستی بناتی ہے — اور تکرار کی رفتار، کسی ایک بینچ مارک سے زیادہ، یہ فیصلہ کرتی ہے کہ اب سے ایک سال بعد کون سرحد پر کھڑا ہے۔

چینی لیبز سے فرنٹیئر سے ملحقہ اوپن ویٹ ماڈلز کی اسی دن آمد — Z.ai's GLM-5.3-Flash اور Alibaba's Flash-Next — بھی ایک کیڈینس شفٹ کی نشاندہی کرتی ہے، جیسا کہ FourWeekMBA نے مشاہدہ کیا ہے۔ مغربی لیبز اب بھی بینچ مارک کی چوٹیوں پر فائز ہیں، لیکن کھلے وزن والے درجے میں اب ہفتہ وار قریب ترین کوالٹی بھیجی جاتی ہے، جس کی قیمتیں کم ہوتی ہیں۔

ڈویلپرز کے لیے، عملی راستہ آسان ہے: ایک قابل، طویل سیاق و سباق، ملٹی موڈل ماڈل کی لاگت ایک بار پھر گر گئی، کسی ایک فراہم کنندہ کے خلاف انشورنس کے طور پر ڈاؤن لوڈ کے قابل وزن کے ساتھ۔ حریفوں کے لیے، پیغام کم آرام دہ ہے — کارکردگی کا محاذ اب اس تیزی سے آگے بڑھ رہا ہے جتنا کہ فلیگ شپ پرائسنگ حقیقت پسندانہ طور پر چل سکتی ہے، اور علی بابا نے سست ہونے کا کوئی نشان نہیں دکھایا ہے۔

---

AI سے آگے رہیں

تازہ ترین AI خبریں، تجزیہ اور کامیابیاں حاصل کریں — سب ایک جگہ پر۔

مزید AI خبریں پڑھیں →