AMD نے Instella-MoE-16B-A3B جاری کیا ہے، جو ایک مکمل طور پر کھلا مکسچر آف ایکسپرٹس (MoE) زبان کا ماڈل ہے جو اپنے طور پر شروع سے تربیت یافتہ ہے Instinct MI300X اور MI325X GPUs۔ ریلیز سلیکون کے بارے میں اتنا ہی بیان ہے جتنا کہ یہ سافٹ ویئر کے بارے میں ہے: ہر تربیتی مرحلے، ڈیٹا مکسچر اور کنفیگریشن کو شائع کرکے، AMD یہ ظاہر کر رہا ہے کہ اس کے ڈیٹا سینٹر ایکسلریٹر فرنٹیئر کلاس اوپن ماڈلز کو آخر تک بنا سکتے ہیں۔ یہ کھلے وزن کی دوڑ میں سب سے زیادہ نمایاں چالوں میں سے ایک ہے جسے ہم اپنی بریکنگ AI نیوز میں ٹریک کرتے ہیں۔

ماہرین کے ڈیزائن کا ایک چھوٹا لیکن چوڑا مرکب

MarkTechPost میں تفصیلی بریک ڈاؤن کے مطابق، Instella-MoE-16B-A3B ایک ڈیکوڈر صرف MoE ماڈل ہے جس میں 16 بلین کل پیرامیٹرز ہیں جو صرف 2.8 بلین فی ٹوکن کو فعال کرتے ہیں۔ اس کی 27 پرتوں میں سے ہر ایک 2 مشترکہ ماہرین کے علاوہ 6 روٹڈ ماہرین کو 64 کے پول سے منتخب کرتی ہے، جس میں 2048 کے پوشیدہ سائز، 16 توجہ کے سر، اور 128,896 ٹوکن الفاظ ہیں۔ ایک ملٹی ٹوکن پیشین گوئی** مقصد پری ٹریننگ اور درمیانی تربیت دونوں کے دوران استعمال کیا جاتا ہے۔

وہ ویرل فن تعمیر - جہاں نیٹ ورک کا ایک چھوٹا سا ٹکڑا ہر ٹوکن کے لیے "جاگتا ہے" - سستے سے چلنے والے اوپن ماڈلز کے پیچھے وہی کارکردگی کی منطق ہے جس نے پچھلے سال کے دوران مارکیٹ کو نئی شکل دی ہے۔ AMD نے ماڈل کو 7.1 ٹریلین ٹوکنز پر تربیت دی جو کھلے کارپورا بشمول Nemotron-CC-v2، MegaMath، FineMath، RefineCode، اور TxT360 سے تیار کی گئی تھی، پھر Dolma3 Dolmino 100B پر ایک درمیانی تربیتی مرحلہ چلایا گیا جو کہ ایک دوسرے کے وزن کے ساتھ ملایا گیا تھا۔ طویل سیاق و سباق کا مرحلہ YaRN کا استعمال کرتے ہوئے ونڈو کو 4K سے 64K ٹوکن تک پھیلاتا ہے۔

دو نظاموں کی سطح کی اختراعات

ریلیز میں دو ساختی انتخاب ہیں جنہیں AMD نے انجینئرنگ کی بامعنی جیت کے طور پر نمایاں کیا ہے۔ پہلا گیٹڈ ملٹی ہیڈ لیٹنٹ اٹینشن (گیٹڈ ایم ایل اے) ہے، جو ملٹی ہیڈ لیٹنٹ اٹینشن میں ایک ہلکا پھلکا سیکھا ہوا آؤٹ پٹ گیٹ شامل کرتا ہے۔ ایک وقف شدہ لکیری پروجیکشن ایک ان پٹ کنڈیشنڈ گیٹ حاصل کرتا ہے جو آؤٹ پٹ پروجیکشن سے پہلے ضرب کے ساتھ لاگو ہوتا ہے۔

دوسری، FarSkip-Collective، ایک کنیکٹیویٹی اسکیم ہے جو پرانی اور جزوی ایکٹیویشن کو MoE اور توجہ کی تہوں میں منتقل کرتی ہے، جو کہ حساب کے ساتھ ماہر متوازی مواصلات کو اوور لیپ کرتی ہے۔ AMD 12.7% پری ٹریننگ اسپیڈ اپ اور پہلے ٹوکن کے لیے وقت میں 39.2% تک کمی** کی اطلاع دیتا ہے جب ماہر ہم آہنگی کے ساتھ خدمت کرتے ہیں۔ قیمت کی کارکردگی پر اپنے ہارڈ ویئر کو پچ کرنے والی کمپنی کے لیے، یہ بالکل وہی نمبر ہیں جو خریدار دیکھنا چاہتا ہے۔

مکمل طور پر کھلے ماڈل کے لیے مضبوط بینچ مارکس

بیس چیک پوائنٹ پر، Instella-MoE کی اوسط 76.7 تشخیصات میں ہے، جسے AMD مکمل طور پر کھلے ماڈلز میں سب سے مضبوط نتیجہ قرار دیتا ہے۔ یہ اسے Moonlight-16B-A3B (76.2)، SmolLM3-3B-Base (70.5)، OLMo-3-7B (70.1)، اور OLMoE-1B-7B (61.9) سے آگے رکھتا ہے، حالانکہ یہ اب بھی Qwen3.5-4B-Base (79.5) سے آگے ہے۔ یہ WinoGrande پر 86.5 کے اسکور کے ساتھ آگے ہے اور HumanEval+ پر 65.7 پوسٹ کرتا ہے۔ طویل سیاق و سباق کے کاموں کے لیے، یہ ہیلمیٹ پر اوسطاً 41.5 اور RULER پر 79.4 ہے۔

پوسٹ ٹریننگ ماڈل کو مزید تیز کرتی ہے۔ اولمو3-7B-تھنک (71.97)، Gemma-4-E4B Think (70.47)، اور Qwen3.35-73.22 کی نگرانی کے بعد اوسط اسکور 71.58 سے DPO کے بعد 72.67 اور "تھنک" کنفیگریشن میں 73.22 تک پہنچ گئے۔ ہدایات پر عمل کرنے پر، IFEval 77.08 سے بڑھ کر 83.70 ہو جاتا ہے۔

تربیت کے بعد کی ترکیب خود قابل ذکر ہے۔ Dolci-Think-SFT-7B اور Nemotron کے مرکب پر SFT کے بعد، AMD DPO کو راؤٹر بائیس اپ ڈیٹس کے ساتھ چلاتا ہے اور انحطاط سے بچنے کے لیے معاون لوڈ بیلنسنگ نقصان کو غیر فعال کر دیا جاتا ہے۔ اس کے بعد کمک سیکھنے کا عمل AMD کے Miles فریم ورک کے اندر آگے بڑھتا ہے: RLVR کے بعد ہدایات کے 1,400 مراحل، اس کے بعد ملٹی ٹیچر آن پالیسی ڈسٹلیشن جو کہ ریاضی یا کوڈ کی کارکردگی کو قربان کیے بغیر حاصل کو واپس لے جاتا ہے۔

لائسنسنگ کیچ

ایک انتباہ ہے جو تجارتی صارفین کے لیے اہم ہے۔ ماڈل کا وزن ریسرچ ریل لائسنس کے تحت ہوتا ہے، جو صرف تعلیمی اور تحقیقی مقاصد تک استعمال کو محدود کرتا ہے، اس لیے Instella-MoE پیداوار کی تعیناتیوں کے لیے ڈراپ ان ماڈل نہیں ہے۔ ٹریننگ کوڈ بیس، تاہم، MIT لائسنس یافتہ ہے، اور یہ قابل اعتراض طور پر زیادہ قابل استعمال اثاثہ ہے - یہ دوسری لیبز کو AMD سلکان پر تربیت کے لیے ٹھوس بلیو پرنٹ فراہم کرتا ہے۔

AMD نے ہر تربیتی مرحلے، ڈیٹا کے مرکب، تربیتی کنفیگریشنز، اور ہگنگ فیس کلیکشن، ایک GitHub ریپوزٹری، اور اس کے ROCm بلاگ میں انفرنس کوڈ سے مکمل وزن شائع کیا ہے۔ کھلے پن کی وہ سطح — تربیت کے مرحلے سے تربیت کا مرحلہ، نہ صرف ایک آخری چوکی — وہی ہے جو "مکمل طور پر کھلے" ریلیز کو ایک عام کھلے وزن سے ممتاز کرتی ہے۔

یہ معیارات سے آگے کیوں اہم ہے۔

ریلیز کا ذیلی متن ہارڈ ویئر مقابلہ ہے۔ Nvidia کا CUDA ایکو سسٹم اور H100-class GPUs فرنٹیئر ماڈل ٹریننگ کے لیے ڈیفالٹ سبسٹریٹ رہے ہیں، اور چیلنجرز نے یہ ثابت کرنے کی کوشش میں برسوں گزارے ہیں کہ ان کے ایکسلریٹر مکمل ٹریننگ اسٹیک کو سنبھال سکتے ہیں۔ Instella-MoE ایک قابل اعتبار نمونہ ہے جسے AMD کی Instinct لائن - پہلے ہی ہائپر اسکیلرز اور نیشنل لیبز کے ذریعہ بڑے پیمانے پر تعینات کیا گیا ہے - انفرنس ورک بوجھ سے زیادہ کام کرسکتا ہے۔ اگر AMD اپنے ہارڈ ویئر پر تربیت یافتہ مسابقتی کھلے ماڈلز کی تیاری جاری رکھ سکتا ہے، تو یہ ان خریداروں کے لیے کیس کو مضبوط بناتا ہے جو AI کمپیوٹ مارکیٹ پر Nvidia کی گرفت کو توڑنا چاہتے ہیں۔

محققین کے لیے، اپیل شفافیت ہے۔ مکمل طور پر کھلی ریلیز جو ڈیٹا مکس، درمیانی تربیتی مرکب، کشید کرنے کی حکمت عملی، اور RL نصاب کی دستاویز کرتی ہیں نایاب رہیں، اور وہ کمیونٹی کو اس کے لیے لیب کا لفظ لینے کے بجائے دعووں کا آڈٹ اور دوبارہ پیش کرنے دیتے ہیں۔ Instella-MoE ایک چھوٹے لیکن بڑھتے ہوئے روسٹر میں شامل ہوتا ہے - بشمول AMD کے اپنے پہلے کے Instella کے گھنے ماڈلز - اس معیار کو آگے بڑھاتے ہوئے۔

AI سے آگے رہیں

اس طرح کی گہری تکنیکی کوریج چاہتے ہیں جیسا کہ یہ ہوتا ہے؟ تازہ ترین AI پیش رفت کے لیے ہمارے مرکز کو بُک مارک کریں اور کبھی بھی ریلیز سے محروم نہ ہوں۔

مزید AI خبریں پڑھیں →