अनस्लोथ, स्थानीय स्तर पर बड़े भाषा मॉडल को चलाने और फाइन-ट्यूनिंग के लिए सबसे व्यापक रूप से उपयोग किए जाने वाले कुछ टूल के पीछे की ओपन-सोर्स टीम ने डायनेमिक 3.0 जारी किया है, जो जीजीयूएफ मॉडल फ़ाइलों के लिए इसकी परिमाणीकरण विधि की तीसरी पीढ़ी है। नई योजना के तहत भेजे जाने वाले पहले मॉडल Qwen3.8-27B के क्वांट हैं, और अनस्लोथ का दावा है कि वे हर दूसरे क्वांटाइजेशन प्रदाता की तुलना में समान फ़ाइल आकार पर 10 प्रतिशत से अधिक बेहतर टॉप-1 प्रतिशत सटीकता प्रदान करते हैं।

रिलीज़ जल्दी ही हैकर न्यूज़ के पहले पन्ने पर पहुंच गई, जहां स्थानीय-मॉडल के प्रति उत्साही लोगों ने बेंचमार्क चार्ट का विश्लेषण किया। यह परियोजना के लिए उल्लेखनीय आकर्षण के बीच आया है: अनस्लोथ का कहना है कि मॉडल के जारी होने के बाद पांच दिनों में इसके Qwen3.8 क्वांटिज़ेशन को 5.1 मिलियन से अधिक बार डाउनलोड किया गया था। For more context on this story, see our ongoing latest AI developments.

परिमाणीकरण गुणवत्ता क्यों मायने रखती है

क्वांटाइजेशन किसी मॉडल के वजन को कम परिशुद्धता पर संग्रहीत करके उसके फ़ाइल आकार को छोटा कर देता है, जिससे उपभोक्ता जीपीयू और लैपटॉप पर बड़े मॉडल चलाना संभव हो जाता है। व्यापार-बंद हमेशा सटीकता रहा है: भारी-भरकम परिमाणीकरण आउटपुट को इस तरह से ख़राब कर देता है कि आकस्मिक बेंचमार्क चूक सकते हैं। स्थानीय स्तर पर मॉडल चलाने वाले बढ़ते समुदाय के लिए - डेवलपर्स परीक्षण एजेंट वर्कफ़्लो से लेकर महंगे क्लाउड एपीआई एक्सेस वाले क्षेत्रों में उपयोगकर्ताओं तक - मात्रा गुणवत्ता प्रभावी ढंग से निर्धारित करती है कि कौन से मॉडल उपयोग करने योग्य हैं।

डायनामिक 3.0 उस ट्रेड-ऑफ़ का अनस्लोथ का उत्तर है। टीम के दस्तावेज़ीकरण के अनुसार, नई रिलीज़ "डाइवर्जेंस-300 @32 और केएल डायवर्जेंस जैसे मेट्रिक्स में मजबूत परिणामों के साथ, समान आकार रखते हुए अधिक मॉडल गुणवत्ता को बरकरार रखती है।"

संस्करण 3.0 में क्या परिवर्तन हुआ

कार्यप्रणाली उन्नयन दिखावटी होने के बजाय बारीक हैं। अनस्लोथ का कहना है कि यह अब विभिन्न स्रोतों से तैयार किए गए उच्च-गुणवत्ता वाले महत्व-मैट्रिक्स अंशांकन डेटासेट का उपयोग करता है, जो एजेंटिक कोडिंग, चैट और बहुभाषी प्रदर्शन के लिए स्पष्ट रूप से परिष्कृत है। परत चयन - यह तय करना कि मॉडल के कौन से हिस्से सबसे अधिक दबते हैं - में सुधार किया गया है, और गुणवत्ता बनाए रखने के लिए अतिरिक्त परिमाणीकरण तकनीकें पेश की गईं।

विशेष रूप से, टीम इस बात पर जोर देती है कि सब कुछ प्रशिक्षण के बाद परिमाणीकरण के माध्यम से किया जाता है: कोई परिमाणीकरण-जागरूक प्रशिक्षण नहीं और कोई परिमाणीकरण-जागरूक आसवन नहीं। अंशांकन डेटासेट को स्वयं प्रशिक्षित नहीं किया जाता है, और इमैट्रिक्स फ़ाइल को सार्वजनिक रूप से जारी किया जाता है ताकि समुदाय कार्य को पुन: पेश कर सके या इसके शीर्ष पर फाइन-ट्यून्स का निर्माण कर सके।

विशिष्ट मात्रा स्तर व्यावहारिक प्रभाव दिखाते हैं। 9.83 जीबी पर यूडी-क्यू2_के_एक्सएल मात्रा को उस आकार के अगले-सर्वोत्तम विकल्प की तुलना में शीर्ष-1 प्रतिशत मीट्रिक पर लगभग 8 प्रतिशत अधिक सटीक बताया गया है। एक अनौपचारिक परीक्षण में अनस्लोथ हाइलाइट्स, उस क्वांट ने एक छोटे से जावास्क्रिप्ट बग के साथ एक कार्यशील HTML प्रोग्राम का उत्पादन किया - आउटपुट जो कि समान आकार के क्वांट की पिछली पीढ़ियों ने पूरी तरह से तोड़ दिया होगा।

चरम निचले स्तर पर, एक UD-IQ1_S मात्रा मॉडल को 6.2 जीबी में निचोड़ देती है - मूल से 89 प्रतिशत छोटा - जबकि शीर्ष -1 प्रतिशत सटीकता के लगभग 72 प्रतिशत को बरकरार रखती है। अनस्लोथ ने लगभग 500 एमबी डिस्क स्थान को संरक्षित करने के लिए 8.37 जीबी से कम की छोटी मात्रा से मल्टी-टोकन-भविष्यवाणी मॉड्यूल को भी हटा दिया, जो मॉड्यूल उन उपयोगकर्ताओं के लिए अलग से उपलब्ध है जो इसे चाहते हैं।

एक कठिन बेंचमार्क, न कि केवल मित्रतापूर्ण

शायद घोषणा का अधिक परिणामी हिस्सा पद्धतिगत है। अनस्लोथ का तर्क है कि शीर्ष-1 प्रतिशत सटीकता - अनिवार्य रूप से एकल-भविष्यवाणी आर्गमैक्स परीक्षण - वास्तविक अनुमान गुणवत्ता का एक प्रभावी गेज नहीं है। बेंचमार्क ओवरफिटिंग का मुकाबला करने के लिए, टीम ने डायवर्जेंस-300 @32 बनाया: टर्मिनल-बेंच 2.1, डीपएसडब्ल्यूई, हार्बर, मैथएरेना 2025-26 और गैर-लैटिन लंबे-दस्तावेज़ संकेतों से तैयार किए गए 300 उदाहरणों का एक आयोजित डेटासेट, जिनमें से कोई भी अंशांकन डेटा में दिखाई नहीं देता है।

मीट्रिक 32 टोकन के लिए लालची डिकोडिंग चलाता है और मापता है कि प्रत्येक क्वांट का आउटपुट प्रक्षेपवक्र मूल BF16 मॉडल से कितनी बारीकी से मेल खाता है - करीबी प्रक्षेपवक्र का मतलब है कि क्वांट मल्टी-टोकन पीढ़ी पर पूर्ण मॉडल की तरह व्यवहार करता है, न कि केवल एकल भविष्यवाणियों पर। सभी प्रदाताओं पर चलने वाले केएल डाइवर्जेंस बेंचमार्क दिखाते हैं कि अनस्लोथ की यूडी-3 मात्रा समान डिस्क स्थान पर 10 प्रतिशत अतिरिक्त टॉप-1 प्रतिशत सटीकता प्राप्त कर रही है, जिसमें छोटे आकार पर सबसे बड़ा लाभ है।

टीम ने अनदेखे विकीटेक्स्ट और कोड पर अपने पुराने डायनामिक 2.0 रिलीज के मुकाबले नए क्वांट की तुलना करते हुए एक ओवरफिटिंग विश्लेषण भी प्रकाशित किया, और कहा कि यह बड़े क्वांट आकारों पर पुनरावृत्ति जारी रखेगा जहां लाभ अधिक मामूली थे।

ट्रैक रिकॉर्ड और चेतावनी

अनस्लोथ ने मॉडल विक्रेताओं के साथ सीधे सहयोग के माध्यम से स्थानीय-मॉडल समुदाय में विश्वसनीयता अर्जित की है - टीम ने क्वेन 3, मेटा के लामा 4, मिस्ट्रल के डेवस्ट्रल, Google की जेम्मा श्रृंखला और माइक्रोसॉफ्ट के फी मॉडल में योगदान किए गए सुधारों को सूचीबद्ध किया है, जो काम ऐतिहासिक रूप से हाल ही में जारी किए गए वजन में सटीकता बग को हल करता है।

सामान्य चेतावनी लागू होती है: ये विक्रेता द्वारा संचालित बेंचमार्क हैं, और प्रतिद्वंद्वी क्वांटाइज़र अलग-अलग मापते हैं। लेकिन अंशांकन फ़ाइलों, आयोजित-आउट मूल्यांकन सेट और प्रति-मात्रा विचलन डेटा की रिहाई स्वतंत्र सत्यापन को असामान्य रूप से आसान बनाती है - और यह पारदर्शिता ही है जिसने परियोजना को स्थानीय एलएलएम पारिस्थितिकी तंत्र के केंद्र में रखा है क्योंकि यह मुख्यधारा के उपयोग की ओर बढ़ता है।

Qwen3.8 या स्थानीय हार्डवेयर पर किसी फ्रंटियर ओपन-वेट मॉडल को चलाने वाले डेवलपर्स के लिए, डायनेमिक 3.0 रिलीज प्रभावी ढंग से एक क्वांटाइज्ड मॉडल क्या कर सकता है, इसके लिए फर्श उठाता है - और हर दूसरे क्वांटाइजेशन प्रदाता पर उसी कठोरता को प्रकाशित करने के लिए दबाव डालता है।

इस तरह के टूल का कवरेज एआई बज़ वायर के दैनिक एआई उद्योग कवरेज का हिस्सा है - नवीनतम एआई विकास के लिए जारी रखें।

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →