Unsloth، مقامی طور پر بڑے لینگویج ماڈلز کو چلانے اور ٹھیک کرنے کے لیے سب سے زیادہ استعمال ہونے والے کچھ ٹولز کے پیچھے اوپن سورس ٹیم نے Dynamic 3.0 جاری کیا ہے، جو GGUF ماڈل فائلوں کے لیے اس کے کوانٹائزیشن طریقہ کی تیسری نسل ہے۔ نئی سکیم کے تحت بھیجے جانے والے پہلے ماڈلز Qwen3.8-27B کی مقدار ہیں، اور Unsloth کا دعویٰ ہے کہ وہ ہر دوسرے کوانٹائزیشن فراہم کنندہ کے مقابلے میں ایک ہی فائل سائز میں 10 فیصد سے زیادہ بہتر ٹاپ-1 فیصد درستگی فراہم کرتے ہیں۔
ریلیز تیزی سے ہیکر نیوز کے صفحہ اول پر پہنچ گئی، جہاں مقامی ماڈل کے شوقین افراد نے بینچ مارک چارٹس کو الگ کیا۔ یہ پروجیکٹ کے لیے قابل ذکر کرشن کے درمیان پہنچا: انسلتھ کا کہنا ہے کہ ماڈل کی ریلیز کے پانچ دنوں میں اس کی Qwen3.8 کوانٹائزیشنز 5.1 ملین سے زیادہ بار ڈاؤن لوڈ کی گئیں۔ For more context on this story, see our ongoing artificial intelligence updates.
کوانٹائزیشن کا معیار کیوں اہمیت رکھتا ہے۔
کوانٹائزیشن ماڈل کی فائل کے سائز کو اس کے وزن کو کم درستگی پر محفوظ کر کے سکڑتی ہے، جس سے صارفین کے GPUs اور لیپ ٹاپس پر بڑے ماڈلز کو چلانا ممکن ہو جاتا ہے۔ ٹریڈ آف ہمیشہ سے درستگی رہی ہے: بھاری ہاتھ سے کوانٹائزیشن آؤٹ پٹ کو ان طریقوں سے کم کرتی ہے جس سے آرام دہ بینچ مارکس چھوٹ سکتے ہیں۔ مقامی طور پر ماڈلز چلانے والی بڑھتی ہوئی کمیونٹی کے لیے — ڈویلپرز سے لے کر مہنگے کلاؤڈ API تک رسائی والے خطوں کے صارفین تک ایجنٹ کے ورک فلو کی جانچ کرنے والے — کوانٹ کوالٹی مؤثر طریقے سے تعین کرتی ہے کہ کون سے ماڈل بالکل قابل استعمال ہیں۔
ڈائنامک 3.0 اس ٹریڈ آف کا انسلتھ کا جواب ہے۔ ٹیم کی دستاویزات کے مطابق، نئی ریلیز "ایک ہی سائز کو برقرار رکھتے ہوئے مزید ماڈل کے معیار کو محفوظ رکھتی ہے، جس میں Divergence-300 @32 اور KL Divergence جیسے میٹرکس میں مضبوط نتائج حاصل کیے گئے ہیں۔"
ورژن 3.0 میں کیا تبدیل ہوا۔
طریقہ کار کے اپ گریڈ چالوں کے بجائے دانے دار ہیں۔ Unsloth کا کہنا ہے کہ اب یہ متنوع ذرائع سے تیار کردہ ایک بہت ہی اعلیٰ معیار کی اہمیت کے حامل میٹرکس کیلیبریشن ڈیٹاسیٹ کا استعمال کرتا ہے، جو ایجنٹ کوڈنگ، چیٹ اور کثیر لسانی کارکردگی کے لیے واضح طور پر بہتر ہے۔ پرتوں کا انتخاب - یہ فیصلہ کرنا کہ ماڈل کے کون سے حصے سخت نچوڑے جاتے ہیں - کو بہتر بنایا گیا ہے، اور معیار کو برقرار رکھنے کے لیے اضافی کوانٹائزیشن تکنیک متعارف کرائی گئی ہیں۔
خاص طور پر، ٹیم اس بات پر زور دیتی ہے کہ سب کچھ پوسٹ ٹریننگ کوانٹائزیشن کے ذریعے کیا جاتا ہے: کوئی کوانٹائزیشن سے آگاہ ٹریننگ اور کوئی کوانٹائزیشن آگاہی کشید نہیں۔ کیلیبریشن ڈیٹاسیٹ خود تربیت یافتہ نہیں ہے، اور imatrix فائل کو عوامی طور پر جاری کیا جاتا ہے تاکہ کمیونٹی اس کام کو دوبارہ پیش کر سکے یا اس کے اوپر عمدہ دھنیں بنا سکے۔
مخصوص مقدار کے درجے عملی اثر کو ظاہر کرتے ہیں۔ UD-Q2_K_XL کوانٹ، 9.83 GB پر، اس سائز کے اگلے بہترین آپشن کے مقابلے ٹاپ-1 فیصد میٹرک پر تقریباً 8 فیصد زیادہ درست بتایا گیا ہے۔ ایک غیر رسمی ٹیسٹ میں Unsloth کی جھلکیاں، اس کوانٹ نے ایک چھوٹے جاوا اسکرپٹ بگ کے ساتھ ایک ورکنگ ایچ ٹی ایم ایل پروگرام تیار کیا - آؤٹ پٹ جو کہ اسی سائز کے کوانٹس کی پچھلی نسلیں مکمل طور پر ٹوٹ چکی ہوں گی۔
انتہائی کم سرے پر، UD-IQ1_S کوانٹ ماڈل کو 6.2 GB میں نچوڑ دیتا ہے — اصل سے 89 فیصد چھوٹا — جبکہ ٹاپ-1 فیصد درستگی کا تقریباً 72 فیصد برقرار رکھتا ہے۔ Unsloth نے تقریباً 500 MB ڈسک کی جگہ کو محفوظ کرنے کے لیے 8.37 GB سے کم مقدار سے ملٹی ٹوکن-پیش گوئی ماڈیول کو بھی ہٹا دیا، ماڈیول ان صارفین کے لیے الگ سے دستیاب ہے جو اسے چاہتے ہیں۔
ایک مشکل بینچ مارک، نہ صرف ایک دوستانہ
شاید اعلان کا زیادہ نتیجہ خیز حصہ طریقہ کار ہے۔ Unsloth کا استدلال ہے کہ ٹاپ-1 فیصد درستگی - بنیادی طور پر ایک واحد پیشین گوئی آرگمیکس ٹیسٹ - حقیقی تخمینہ کے معیار کا ایک موثر گیج نہیں ہے۔ بینچ مارک اوور فٹنگ کا مقابلہ کرنے کے لیے، ٹیم نے Divergence-300 @32 بنایا: Terminal-Bench 2.1، DeepSWE، Harbor، MathArena 2025-26، اور غیر لاطینی طویل دستاویز پرامپٹس سے تیار کردہ 300 مثالوں کا ایک ہولڈ آؤٹ ڈیٹاسیٹ، جن میں سے کوئی بھی ڈیٹا میں ظاہر نہیں ہوتا ہے۔
میٹرک 32 ٹوکنز کے لیے لالچی ڈی کوڈنگ چلاتا ہے اور پیمائش کرتا ہے کہ ہر کوانٹ کا آؤٹ پٹ ٹریجٹری اصل BF16 ماڈل سے کتنی قریب سے میل کھاتا ہے — قریب تر رفتار کا مطلب ہے کہ کوانٹ ملٹی ٹوکن جنریشن پر مکمل ماڈل کی طرح برتاؤ کرتا ہے، نہ کہ صرف ایک پیشین گوئی پر۔ تمام فراہم کنندگان پر چلنے والے KL ڈائیورجینس بینچ مارکس Unsloth کے UD-3 کوانٹس کو چھوٹے سائز پر سب سے زیادہ فائدہ کے ساتھ مساوی ڈسک اسپیس پر 10 فیصد اضافی ٹاپ-1 فیصد درستگی دکھاتے ہیں۔
ٹیم نے نادیدہ وکی ٹیکسٹ اور کوڈ پر اس کی پرانی ڈائنامک 2.0 ریلیزز کے خلاف نئی مقداروں کا موازنہ کرنے والا ایک اوور فٹنگ تجزیہ بھی شائع کیا، اور کہا کہ یہ بڑے مقدار کے سائز پر تکرار جاری رکھے گی جہاں فائدہ زیادہ معمولی تھا۔
ٹریک ریکارڈ اور انتباہات
Unsloth نے ماڈل وینڈرز کے ساتھ براہ راست تعاون کے ذریعے مقامی ماڈل کمیونٹی میں ساکھ حاصل کی ہے — ٹیم Qwen3، Meta's Llama 4، Mistral's Devstral، Google کی Gemma سیریز، اور Microsoft کے Phi ماڈلز میں تعاون کردہ اصلاحات کی فہرست بناتی ہے، جس نے تاریخی طور پر درستگی کی خرابیوں کو حل کیا ہے۔
عام انتباہ لاگو ہوتا ہے: یہ وینڈر کے ذریعے چلائے جانے والے بینچ مارکس ہیں، اور حریف کوانٹائزر مختلف طریقے سے پیمائش کرتے ہیں۔ لیکن کیلیبریشن فائلوں کی ریلیز، ہولڈ آؤٹ ایویلیویشن سیٹس، اور فی کوانٹ ڈائیورجینس ڈیٹا آزاد تصدیق کو غیر معمولی طور پر آسان بنا دیتا ہے - اور یہ شفافیت بالکل وہی ہے جس نے پروجیکٹ کو مقامی LLM ماحولیاتی نظام کے مرکز میں رکھا ہے کیونکہ یہ مرکزی دھارے کے استعمال کی طرف بڑھتا ہے۔
مقامی ہارڈویئر پر Qwen3.8 یا کسی بھی فرنٹیئر اوپن ویٹ ماڈل کو چلانے والے ڈویلپرز کے لیے، Dynamic 3.0 ریلیز مؤثر طریقے سے اس منزل کو بلند کرتا ہے جو ایک کوانٹائزڈ ماڈل کر سکتا ہے — اور اسی سختی کو شائع کرنے کے لیے ہر دوسرے کوانٹائزیشن فراہم کنندہ پر دباؤ ڈالتا ہے۔
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →