अनस्लॉथ, स्थानिक पातळीवर मोठ्या भाषा मॉडेल्स चालवण्यासाठी आणि फाईन-ट्यून करण्यासाठी काही मोठ्या प्रमाणात वापरल्या जाणाऱ्या साधनांमागील ओपन-सोर्स टीमने डायनॅमिक 3.0 जारी केले आहे, जी GGUF मॉडेल फाइल्ससाठी तिसरी पिढी आहे. नवीन स्कीम अंतर्गत पाठवले जाणारे पहिले मॉडेल Qwen3.8-27B चे प्रमाण आहेत आणि अनस्लॉथचा दावा आहे की ते प्रत्येक इतर क्वांटायझेशन प्रदात्याच्या तुलनेत समान फाइल आकारात 10 टक्क्यांहून अधिक चांगली टॉप-1 टक्के अचूकता देतात.
प्रकाशन त्वरीत हॅकर न्यूजच्या पहिल्या पानावर पोहोचले, जिथे स्थानिक-मॉडेल उत्साहींनी बेंचमार्क चार्टचे विच्छेदन केले. हे प्रकल्पासाठी उल्लेखनीय कर्षण दरम्यान आले आहे: अनस्लॉथ म्हणतात की मॉडेलच्या प्रकाशनानंतर पाच दिवसांत त्याचे Qwen3.8 क्वांटायझेशन 5.1 दशलक्षपेक्षा जास्त वेळा डाउनलोड केले गेले. For more context on this story, see our ongoing breaking AI news.
परिमाणीकरण गुणवत्ता महत्त्वाची का आहे
क्वांटायझेशन मॉडेलचे वजन कमी अचूकतेवर साठवून फाइल आकार कमी करते, ज्यामुळे ग्राहक GPU आणि लॅपटॉपवर मोठे मॉडेल चालवणे शक्य होते. ट्रेड-ऑफ नेहमीच अचूकता असते: हेवी-हँडेड क्वांटायझेशन आउटपुटला अशा प्रकारे कमी करते की जे कॅज्युअल बेंचमार्क चुकवू शकतात. स्थानिक पातळीवर चालणाऱ्या वाढत्या समुदायासाठी — विकसकांकडून एजंट वर्कफ्लोची चाचणी करणाऱ्या लोकांकडून महागड्या क्लाउड API ऍक्सेस असलेल्या प्रदेशांमधील वापरकर्त्यांपर्यंत — कोणती मॉडेल्स वापरण्यायोग्य आहेत हे क्वांट गुणवत्ता प्रभावीपणे निर्धारित करते.
डायनॅमिक 3.0 हे त्या ट्रेड-ऑफला अनस्लॉथचे उत्तर आहे. संघाच्या दस्तऐवजीकरणानुसार, नवीन प्रकाशन "समान आकार ठेवत असताना अधिक मॉडेल गुणवत्ता जतन करते, डायव्हर्जन-300 @32 आणि KL डायव्हर्जन्स सारख्या मेट्रिक्समध्ये मजबूत परिणामांसह."
आवृत्ती ३.० मध्ये काय बदलले
पद्धती सुधारणा नौटंकी ऐवजी दाणेदार आहेत. अनस्लॉथ म्हणते की ते आता खूप उच्च-गुणवत्तेचे महत्त्व-मॅट्रिक्स कॅलिब्रेशन डेटासेट वापरते जे विविध स्त्रोतांकडून काढले जाते, स्पष्टपणे एजंटिक कोडिंग, चॅट आणि बहुभाषिक कार्यप्रदर्शनासाठी परिष्कृत केले जाते. लेयर सिलेक्शन — मॉडेलचे कोणते भाग सर्वात जास्त दाबले जातील हे ठरवणे — सुधारित केले गेले आहे आणि गुणवत्ता टिकवून ठेवण्यासाठी अतिरिक्त क्वांटायझेशन तंत्र सादर केले गेले.
विशेष म्हणजे, संघ भर देतो की सर्व काही प्रशिक्षणोत्तर क्वांटायझेशनद्वारे केले जाते: कोणतेही क्वांटायझेशन-जागरूक प्रशिक्षण नाही आणि क्वांटायझेशन-अवेअर डिस्टिलेशन नाही. कॅलिब्रेशन डेटासेट स्वतःच प्रशिक्षित नाही, आणि imatrix फाइल सार्वजनिकरीत्या रिलीझ केली जाते जेणेकरून समुदाय कामाचे पुनरुत्पादन करू शकेल किंवा त्यावर उत्कृष्ट ट्यून तयार करू शकेल.
विशिष्ट परिमाण स्तर व्यावहारिक प्रभाव दर्शवतात. UD-Q2_K_XL क्वांट, 9.83 GB वर, त्या आकारातील पुढील-सर्वोत्तम पर्यायापेक्षा टॉप-1 टक्के मेट्रिकवर सुमारे 8 टक्के अधिक अचूक असल्याचे वर्णन केले आहे. अनस्लॉथ हायलाइट्सच्या एका अनौपचारिक चाचणीमध्ये, त्या क्वांटने एकाच लहान JavaScript बगसह कार्यरत HTML प्रोग्राम तयार केला - आउटपुट जे समान आकाराच्या क्वांटच्या मागील पिढ्या पूर्णपणे खंडित झाले असते.
अत्यंत कमी टोकाला, UD-IQ1_S क्वांट मॉडेलला 6.2 GB मध्ये दाबते — मूळपेक्षा 89 टक्के लहान — तर टॉप-1 टक्के अचूकता सुमारे 72 टक्के राखून ठेवते. अनस्लॉथने 8.37 GB पेक्षा कमी आकारमानातील मल्टी-टोकन-प्रेडिक्शन मॉड्यूल देखील काढून टाकले आहे जेणेकरुन सुमारे 500 MB डिस्क स्पेस वाचवता येईल, ज्या वापरकर्त्यांना ते हवे आहे त्यांच्यासाठी मॉड्यूल स्वतंत्रपणे उपलब्ध आहे.
एक कठीण बेंचमार्क, फक्त एक मैत्रीपूर्ण नाही
कदाचित घोषणेचा अधिक परिणामकारक भाग पद्धतशीर आहे. अनस्लॉथचा असा युक्तिवाद आहे की टॉप-1 टक्के अचूकता — मूलत: सिंगल-प्रेडिक्शन आर्गमॅक्स चाचणी — वास्तविक निष्कर्ष गुणवत्तेचे प्रभावी मापक नाही. बेंचमार्क ओव्हरफिटिंगचा मुकाबला करण्यासाठी, टीमने Divergence-300 @32 तयार केला: टर्मिनल-बेंच 2.1, DeepSWE, हार्बर, MathArena 2025-26 आणि नॉन-लॅटिन लाँग-डॉक्युमेंट प्रॉम्प्टमधून काढलेल्या 300 उदाहरणांचा होल्ड-आउट डेटासेट, यापैकी कोणताही डेटा कॅलिबमध्ये दिसत नाही.
मेट्रिक 32 टोकन्ससाठी लोभी डीकोडिंग चालवते आणि प्रत्येक क्वांटचा आउटपुट ट्रॅजेक्टोरी मूळ BF16 मॉडेलशी किती जवळून जुळतो याचे मोजमाप करते — जवळच्या ट्रॅजेक्टोरीजचा अर्थ असा आहे की क्वांट बहु-टोकन जनरेशनवर पूर्ण मॉडेलप्रमाणे वागते, केवळ एकल अंदाजांवर नाही. सर्व प्रदात्यांवर चालणारे KL डायव्हर्जन बेंचमार्क अनस्लॉथच्या UD-3 क्वांट्सना समान डिस्क स्पेसवर 10 टक्के अतिरिक्त टॉप-1 टक्के अचूकता मिळवून दाखवतात, ज्यामध्ये लहान आकारांवर सर्वात जास्त फायदा होतो.
टीमने न पाहिलेल्या WikiText आणि कोडवरील जुन्या डायनॅमिक 2.0 रिलीझच्या विरूद्ध नवीन क्वांट्सची तुलना करणारे एक ओव्हरफिटिंग विश्लेषण देखील प्रकाशित केले आहे आणि ते म्हणतात की ते मोठ्या प्रमाणात आकारांवर पुनरावृत्ती करत राहील जेथे नफा अधिक माफक होता.
ट्रॅक रेकॉर्ड आणि चेतावणी
अनस्लॉथने मॉडेल विक्रेत्यांसह थेट सहकार्याने स्थानिक-मॉडेल समुदायामध्ये विश्वासार्हता मिळवली आहे — संघाने Qwen3, Meta's Llama 4, Mistral's Devstral, Google's Gemma मालिका आणि Microsoft च्या Phi मॉडेल्समध्ये योगदान दिलेल्या निराकरणांची यादी केली आहे, ज्याने ऐतिहासिकदृष्ट्या अचूकतेतील त्रुटींचे निराकरण केले आहे.
नेहमीची सावधगिरी लागू होते: हे विक्रेत्याने चालवलेले बेंचमार्क आहेत आणि प्रतिस्पर्धी क्वांटायझर वेगळ्या पद्धतीने मोजतात. परंतु कॅलिब्रेशन फाइल्स, धरून ठेवलेले मूल्यमापन संच आणि प्रति-क्वांट डायव्हर्जन डेटाचे प्रकाशन स्वतंत्र पडताळणी विलक्षणपणे सोपे करते — आणि ती पारदर्शकता हीच आहे ज्याने प्रकल्पाला स्थानिक LLM इकोसिस्टमच्या केंद्रस्थानी ठेवले आहे कारण ते मुख्य प्रवाहात वापराकडे जाते.
स्थानिक हार्डवेअरवर Qwen3.8 किंवा कोणतेही फ्रंटियर ओपन-वेट मॉडेल चालवणाऱ्या डेव्हलपरसाठी, डायनॅमिक 3.0 रिलीझ क्वांटाइज्ड मॉडेल काय करू शकते यासाठी मजला प्रभावीपणे वाढवते — आणि समान कठोरता प्रकाशित करण्यासाठी इतर प्रत्येक क्वांटायझेशन प्रदात्यावर दबाव आणते.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →