Strata نامی ایک غیر معروف اوپن سورس پروجیکٹ ایک لمحہ گزار رہا ہے۔ ایم آئی ٹی کا لائسنس یافتہ انجن، جو علی بابا کا Qwen3.8-Flash-Next چلاتا ہے - ایک 125-بلین پیرامیٹر مرکب-ماہرین کا ماڈل - عام گیمنگ پی سی پر، 4 اکتوبر کو ہیکر نیوز کے صفحہ اول پر 640 سے زیادہ پوائنٹس کے ساتھ شاٹ ہوا، اور اس کے GitHub ذخیرے کو ستمبر 1000 سے زیادہ جمع کیا گیا تھا۔ 24.

پچ آسان ہے: ایک 125-بلین پیرامیٹر ماڈل جو عام طور پر سرور پر رہتا ہے چیٹ کر سکتا ہے، کوڈ لکھ سکتا ہے، تصاویر پڑھ سکتا ہے اور کوڈنگ ایجنٹوں کو مکمل طور پر صارف گرافکس کارڈ پر چلا سکتا ہے، جس میں مشین کو کچھ نہیں چھوڑتا ہے۔

طبقہ دراصل کیا کرتا ہے۔

سٹراٹا ایک انفرنس انجن اور ونڈوز اور لینکس کے لیے ایک کلک انسٹالر دونوں ہے۔ اس کی دستاویزات کے مطابق، فرنٹیئر ماڈل کے معیارات کے مطابق ضروریات معمولی ہیں: NVIDIA کے RTX 20، 30، 40 یا 50 سیریز یا AMD کی Radeon RX 6000، 7000 یا 9000 سیریز سے کم از کم 12GB VRAM کے ساتھ ایک GPU، کم از کم 32GB RAM، SD 8GB کی مفت جگہ۔

انجن Qwen3.8-Flash-Next کے کوانٹائز ورژن کو کئی کمپریشن لیولز پر بھیجتا ہے، Q2_0 سے لے کر IQ3_S تک، نیز ایک کوڈ اسپیشلائزڈ ویرینٹ۔ یہ لوکل ہوسٹ پر OpenAI اور Anthropic-compatible APIs کو بے نقاب کرتا ہے، یعنی ChatGPT یا Claude کے لیے بنائے گئے ٹولز — بشمول کلاڈ کوڈ، کرسر اور کوڈیکس جیسے کوڈنگ ایجنٹس — کو کم سے کم تبدیلیوں کے ساتھ مقامی سرور کی طرف اشارہ کیا جا سکتا ہے۔ اختیاری امیج ان پٹ اور ملٹی جی پی یو سپورٹ شامل ہیں، اور انسٹالر AI کی مدد سے سیٹ اپ موڈ بھی پیش کرتا ہے جو ایک کوڈنگ اسسٹنٹ کو ایک پیسٹ شدہ پرامپٹ سے مشین کو کنفیگر کرنے دیتا ہے۔

رفتار کے نمبر

پروجیکٹ کے شائع کردہ بینچ مارکس، جو دو صارفین کے ڈیسک ٹاپس پر ماپا جاتا ہے، ریلیز کے پھیلنے کی وجہ ہے۔ ایک NVIDIA RTX 5070 پر 12GB VRAM کے ساتھ Ryzen 5 7600 اور 64GB RAM کے ساتھ جوڑا بنایا گیا ہے، Strata رپورٹ کرتا ہے:

  • Q2_0 کوانٹائزیشن: نسل کے لیے 94 ٹوکن فی سیکنڈ اور 32K ٹوکن دستاویز پر فوری کارروائی کے لیے 2,650 ٹوکن فی سیکنڈ
  • IQ3_S: 53 ٹوکن فی سیکنڈ جنریشن، 1,620 ٹوکن فی سیکنڈ پرامپٹ پروسیسنگ
  • کوڈر ویرینٹ: 55 ٹوکن فی سیکنڈ جنریشن

AMD کی طرف، 16GB VRAM کے ساتھ ایک RX 9070 XT Q2_0 پر 60 ٹوکن فی سیکنڈ کا انتظام کرتا ہے۔ دستاویزات کا اندازہ لگایا گیا ہے کہ 24GB VRAM کے ساتھ RTX 3090 کو 100 سے 140 ٹوکن فی سیکنڈ تک پہنچنا چاہئے - زیادہ تر لوگ پڑھنے سے زیادہ تیز۔

مقابلے کے لیے، چھ ماہ قبل، مقامی طور پر قابل استعمال رفتار پر 70-بلین پیرامیٹر کے گھنے ماڈل کو چلانے کے لیے سینکڑوں گیگا بائٹس کی متحد میموری یا جارحانہ قیاس آرائی پر مبنی ضابطہ کشائی کی چالوں کے ساتھ ایک ورک سٹیشن کی ضرورت تھی۔

گیمنگ کارڈ پر 125B ماڈل کیوں فٹ بیٹھتا ہے۔

ٹیکنالوجی کے دو ٹکڑے اسے ممکن بناتے ہیں۔ پہلا ماڈل خود ہے۔ جیسا کہ AI Buzz Wire نے اپنی ریلیز میں احاطہ کیا، Qwen3.8-Flash-Next ماہرین کا ایک مرکب فن تعمیر ہے جس میں تقریباً 125 بلین کل پیرامیٹرز ہیں لیکن فی ٹوکن صرف 6 بلین ایکٹیو ہیں — اس لیے ہر تیار کردہ لفظ نیٹ ورک کے ایک چھوٹے سے ٹکڑے کو چھوتا ہے، ڈرامائی طور پر فی ٹوکن کمپیوٹ کو کاٹتا ہے۔

دوسرا کوانٹائزیشن ہے۔ Strata کے تیز ترین presets ماڈل کے وزن کو دو یا تین بٹس فی پیرامیٹر تک کمپریس کرتے ہیں، جو کہ 12GB GPU اور سسٹم RAM میں فٹ ہونے والے فٹ پرنٹ کے لیے کچھ درستگی کی تجارت کرتے ہیں۔ یہ ٹریڈ آف اہم انتباہ ہے: Q2-class اور IQ2-class کوانٹس استدلال کے بھاری کاموں پر معیار کو ناپ تول کر دیتے ہیں، اور خریداروں کو ہر کام کے بوجھ کی ضمانت کے بجائے ہیڈ لائن کی رفتار کے نمبروں کو نقطہ آغاز کے طور پر ماننا چاہیے۔ ریپوزٹری میں کمیونٹی بینچ مارک صفحات تمام سائز کے معیار کے نتائج کو ٹریک کرتے ہیں۔

ایک بڑی مقامی-AI لہر کا حصہ

مقامی اندازہ کے لیے تیز رفتار رفتار کے درمیان طبقہ پہنچ گیا۔ Alibaba کی Qwen فیملی سب سے زیادہ ڈاؤن لوڈ کی جانے والی اوپن ویٹ ماڈل لائن بن گئی ہے، Meta اور Google کے پاس اپنے طور پر اوپن سورس مسابقتی ماڈلز ہیں، اور ٹولز کی ایک لہر اب صارفین کو اپنے آلات کو چھوڑ کر سبسکرپشنز یا ڈیٹا کے بغیر قابل اسسٹنٹ چلانے دیتی ہے۔

پروجیکٹ اس بات کی بھی عکاسی کرتا ہے کہ "صارفین کے ہارڈ ویئر" کی تعریف کس طرح بدل رہی ہے۔ VRAM کے 12GB کے ساتھ ایک درمیانے درجے کا 2026 گرافکس کارڈ، جو بنیادی طور پر گیمنگ کے لیے بھیجا گیا تھا، اب سائز کی کلاس میں اس ماڈل کے لیے ایک قابل عمل انفرنس ایکسلریٹر ہے جس نے صرف دو سال قبل فرنٹیئر سسٹمز کی وضاحت کی تھی۔

اسٹراٹا ابتدائی سافٹ ویئر بنی ہوئی ہے - ریپوزٹری کا جاری کردہ ٹریکر پرانے GPUs اور نان-AVX2 پروسیسرز پر کسی نہ کسی طرح کی دستاویزات پیش کرتا ہے - لیکن یہ پروجیکٹ MIT-لائسنس یافتہ، مفت، اور کھلے میدان میں تیار کیا گیا ہے، جس میں Intel Arc، پرانے Tesla اور Radeon کارڈز، اور کثیر GPU رگوں کے لیے تجرباتی تعاون کے ساتھ کمیونٹی کے اراکین کے ذریعے دستاویزی دستاویز کی گئی ہے۔

ڈویلپرز کے لیے، سب سے زیادہ عملی طریقہ لوکل ہوسٹ API مطابقت ہو سکتا ہے: OpenAI یا Anthropic SDK کے خلاف لکھے گئے کسی بھی اسکرپٹ یا ایجنٹ کو بنیادی یو آر ایل کو تبدیل کر کے مقامی Qwen کی تعیناتی پر ری ڈائریکٹ کیا جا سکتا ہے، جس سے Strata کو پرائیویسی کے لیے حساس پروٹو ٹائپنگ، آف لائن استعمال، یا صرف API کے اخراجات کو محدود کرنے کے لیے کم رگڑ کا اختیار بنایا جا سکتا ہے۔

اسے کیسے آزمایا جائے۔

شروع کرنے کے لیے دستی کے ساتھ ٹرمینل سیشن کی ضرورت نہیں ہے۔ انسٹالر ڈرائیورز، ماڈل ویٹ اور لوکل سرور کو ایک پاس میں فراہم کرتا ہے، اور ریپوزٹری میں ایک سیٹ اپ فائل شامل ہے جو براہ راست AI کوڈنگ اسسٹنٹ میں چسپاں کرنے کے لیے بنائی گئی ہے، جو پھر مشین کو خود مختار طور پر کنفیگر کرتی ہے۔ پہلی لانچیں سست ہوتی ہیں جبکہ وزن ڈسک سے لوڈ ہوتا ہے۔ دستاویز ایک SSD کی سفارش کرتی ہے اور متنبہ کرتی ہے کہ طویل گفتگو زیادہ کام کو سسٹم RAM پر منتقل کرتی ہے۔

اے آئی سے آگے رہیں

اوپن سورس ماڈلز، مقامی AI ٹولز، اور انفرنس ہارڈ ویئر پر تازہ ترین معلومات کے لیے AI Buzz Wire کو فالو کریں۔

مزید AI خبریں پڑھیں →