ایک آزاد ڈویلپر نے یہ ظاہر کیا ہے کہ ڈیپ سیک کا V4 فلیش ماڈل، ایک 304 بلین پیرامیٹر مکسچر آف ایکسپرٹس سسٹم، ایک واحد AMD MI300X GPU پر پیداوار میں چل سکتا ہے، بغیر کسی وزن کی مقدار یا آف لوڈنگ کے سنگل اسٹریم ڈی کوڈنگ میں 168.6 ٹوکن فی سیکنڈ حاصل کرتا ہے۔ یہ کام، GitHub پر شائع ہوا اور 4 اگست 2026 کو Hacker News کے اوپری حصے پر آتا ہے، ابھی تک اس بات کا واضح ثبوت پیش کرتا ہے کہ AMD کا ہارڈویئر Nvidia پر بھروسہ کیے بغیر فرنٹیئر پیمانے کے اوپن ماڈل کی خدمت کر سکتا ہے۔
ڈویلپر ریان ژاؤ کے زیر انتظام ریپوزٹری میں ایک MI300X پر DeepSeek-V4-Flash-0731 چیک پوائنٹ کو چلانے کے لیے مکمل ڈوکر کمپوز اسٹیک، پِنڈ فائل اوورلیز اور ٹیوننگ ٹیبلز شامل ہیں۔ AMD اور Nvidia کے درمیان چپ جنگ پر بریکنگ AI نیوز کو ٹریک کرنے والے قارئین کے لیے، نتیجہ اہم ہے کیونکہ یہ اس مفروضے کو چیلنج کرتا ہے کہ فرنٹیئر انفرنس کے لیے Nvidia کے جدید ترین اور مہنگے ترین ہارڈ ویئر کی ضرورت ہے۔
نمبرز
vLLM کی ROCm نائٹ بلڈ کا استعمال کرتے ہوئے پن کیے ہوئے سافٹ ویئر اسٹیک پر ماپی گئی بینچ مارک کی کارکردگی، ایک زبردست کہانی بتاتی ہے کہ ایک AMD ایکسلریٹر کیا کر سکتا ہے:
- سنگل اسٹریم ڈی کوڈ: 168.6 ٹوکن فی سیکنڈ، ریئل ٹائم چیٹ اور ایجنٹ ورک بوجھ کے لیے کافی تیز۔
- پری فل تھرو پٹ: ٹیونڈ کرنل کے ساتھ تقریباً 7,900 سے 8,500 ٹوکن فی سیکنڈ، یعنی لمبے پرامپٹس کو ایک سیکنڈ کے اندر اچھی طرح سے پروسیس کیا جاتا ہے۔
- آٹھ ہم وقتی سلسلے: 542 ٹوکن فی سیکنڈ مجموعی، 90.3 ٹوکن فی سیکنڈ فی اسٹریم کے ساتھ۔
- 64-سٹریم برسٹ: 830 ٹوکن فی سیکنڈ مجموعی، بغیر میموری کی خرابی اور انجن کی خرابی کے بغیر۔
- سیاق و سباق کی لمبائی: 256,000 ٹوکنز کی جانچ میں توثیق کی گئی، فن تعمیر دس لاکھ تک کی حمایت کرتا ہے۔
پورے ماڈل میں 156.67 گیگا بائٹس ہائی بینڈوتھ میموری ہے، جو مکمل طور پر MI300X کے 192-gigabyte HBM3 پول میں فٹ ہے۔ کسی اضافی کوانٹائزیشن یا ویٹ آف لوڈنگ کی ضرورت نہیں تھی، جو ماڈل کی مکمل درستگی کو محفوظ رکھتی ہے۔
MI300X کیوں کام کرتا ہے۔
AMD MI300X میں دو صفات ہیں جو ایک ماڈل کی سنگل-GPU تعیناتی کو اتنا بڑا ممکن بناتے ہیں۔ اس میں 192 گیگا بائٹس HBM3 میموری ہے، Nvidia H100 SXM5 کی گنجائش 2.4 گنا، اور میموری بینڈوتھ کا 5.3 ٹیرا بائٹس فی سیکنڈ ہے۔ فرگس فن کے نام سے ایک ڈویلپر کی ایک علیحدہ تحریر، جس نے اس تعیناتی کی بنیاد رکھی، اندازہ لگایا گیا کہ MI300X کی قیمت فہرست قیمت پر موازنہ Nvidia ہارڈویئر سے تقریباً نصف ہے۔
اس مخصوص 304-بلین پیرامیٹر چیک پوائنٹ کے لیے، میموری کی گنجائش فیصلہ کن عنصر ہے۔ ماڈل مکمل طور پر آن چپ میموری میں فٹ بیٹھتا ہے، جس سے 20-گیگا بائٹ GPU کلیدی قدر کیش پول اور 96-گیگا بائٹ CPU ٹائر کو بے دخل شدہ پریفکس-کیشے اندراجات کے لیے جگہ چھوڑی جاتی ہے۔ ایک کارڈ دو سے آٹھ عام کنکرنٹ اسٹریمز کو ہینڈل کرسکتا ہے اور 64 تک اسٹریمز کے پھٹ سکتا ہے، جو کہ بہت سے پروڈکشن انفرنس ورک بوجھ کے لیے کافی ہے۔
انجینئرنگ کی رکاوٹیں
MI300X پر DeepSeek V4 Flash چلانا سیدھا سیدھا نہیں تھا۔ سرکاری vLLM نسخہ Nvidia ہارڈویئر اور نئے AMD GPUs جیسے MI325X اور MI355X کا احاطہ کرتا ہے، لیکن 31 جولائی کے چیک پوائنٹ کے لیے ایک بھی-MI300X پروڈکشن کنفیگریشن نہیں ہے۔
ذخیرے میں انجینئرنگ کے کئی مسائل درج ہیں جنہیں حل کرنا تھا۔ MI300X FP8 نمبر فارمیٹ کا ایک متغیر استعمال کرتا ہے جو کہ نئے AMD چپس کے استعمال کردہ معیار سے مختلف ہوتا ہے، اور ایک دانا جو غلط سیمنٹکس کو فرض کرتا ہے دو کے ایک عنصر سے نتائج پیدا کر سکتا ہے۔ ڈویلپر کو اعلی ہم آہنگی پر ماہرین کی روٹنگ کو بھی ٹھیک کرنا تھا، قیاس آرائی کی تصدیق، اور CPU کلیدی قدر کی مطابقت پذیری، جن میں سے کئی upstream vLLM میں غیر فکسڈ رہتے ہیں۔
ریپوزٹری میں درستگی کے اوورلیز، قیاس آرائی پر مبنی ڈرافٹنگ کے ساتھ ایک توثیق شدہ سرونگ کنفیگریشن، چپ کی شکلوں کے لیے AITER GEMM ٹیوننگ ٹیبلز جو پیک کی گئی میزیں غائب تھیں، اور ایک ہائبرڈ کلیدی قدر کی حکمت عملی جو کہ CPU آف لوڈ کے ساتھ GPU کیشے کو جوڑتی ہے۔
چپ جنگ کے لیے اس کا کیا مطلب ہے۔
یہ مظاہرہ AI میں AMD کے عزائم کے لیے ایک اہم لمحے پر پہنچتا ہے۔ Nvidia AI ایکسلریٹر مارکیٹ کی بھاری اکثریت کو کنٹرول کرتی ہے، جو اس کے CUDA سافٹ ویئر ایکو سسٹم سے متاثر ہے، جسے بہت سے ڈویلپرز ایک کھائی کے طور پر دیکھتے ہیں جسے AMD نے عبور کرنے کے لیے جدوجہد کی ہے۔ SemiAnalysis نے جولائی 2026 کے تجزیہ میں اس سوال کا براہ راست جائزہ لیا جس کا عنوان تھا "کیا AMD CUDA moat کو توڑ سکتا ہے؟" اور جواب مقابلہ رہتا ہے.
لیکن اوپن سورس پروجیکٹس اس طرح کے تصور کے فرق سے ایک چپ دور ہیں۔ اگر ایک واحد MI300X مسابقتی رفتار پر فرنٹیئر پیمانے پر ماڈل پیش کر سکتا ہے، تو AMD کے لیے لاگت کی دلیل کو مسترد کرنا مشکل ہو جاتا ہے۔ AMD اپنا کھلا ماڈل پورٹ فولیو بھی بنا رہا ہے، Instella-MoE-16B جاری کر رہا ہے، ایک مکمل طور پر کھلا ماڈل جو اس کے اپنے Instinct GPUs پر شروع سے تربیت یافتہ ہے، اور Zyphra کے ساتھ 15-megawat MI355X پلیٹ فارم پر شراکت داری کر رہا ہے۔
دریں اثنا، ڈیپ سیک خود فرنٹیئر AI کی لاگت کو کم کر رہا ہے۔ V4 فلیش ماڈل پہلے سے ہی ریسرچ فرم کے تجزیہ کے مطابق چلانے کے لیے سب سے سستا معروف ماڈل تھا، جو GPT-5.6 Luna سے 60 فیصد کم قیمت پر مماثل تھا۔ سستے AMD ہارڈ ویئر کے ساتھ مل کر، Nvidia ایکو سسٹم سے باہر بڑے ماڈل پیش کرنے کی معاشیات تیزی سے بہتر ہو رہی ہے۔
اوپن سورس کا فائدہ
ذخیرہ 2026 AI کی ترقی میں ایک وسیع تر تھیم کی نشاندہی کرتا ہے: اوپن ویٹ ماڈل اور اوپن سورس انفرنس ٹولنگ آزاد انجینئرز کے لیے ان تعیناتیوں کی نقل تیار کرنا اور بہتر بنانا ممکن بنا رہے ہیں جو کبھی اچھی طرح سے فنڈڈ لیبز کا خصوصی ڈومین ہوا کرتا تھا۔ مکمل کنفیگریشن، ٹیوننگ ٹیبلز، اور راستے میں طے شدہ مخصوص کیڑے شائع کرنے سے، یہ کام کسی بھی ایسے شخص کے لیے رکاوٹ کو کم کرتا ہے جو AI کے سنجیدہ کام کے بوجھ کے لیے AMD ہارڈویئر پر غور کرتا ہے۔
AI سے آگے رہیں
اے ایم ڈی اور این ویڈیا کے درمیان اے آئی کا اندازہ لگانے کی جنگ تیز ہوتی جا رہی ہے، اور اس تعیناتی جیسی اوپن سورس شراکتیں خاموشی سے مسابقتی منظر نامے کو بدل رہی ہیں۔ ہارڈ ویئر، اوپن ماڈلز اور انفراسٹرکچر میں تازہ ترین AI پیش رفت کے لیے، ہماری کوریج کے ساتھ رہیں۔
مزید AI خبریں پڑھیں →