Unsloth، تیم منبع باز پشت برخی از پرکاربردترین ابزارها برای اجرا و تنظیم دقیق مدلهای زبان بزرگ به صورت محلی، Dynamic 3.0 را منتشر کرده است، نسل سوم روش کوانتیزهسازی خود برای فایلهای مدل GGUF. اولین مدلهایی که تحت این طرح جدید عرضه میشوند، مقادیری از Qwen3.8-27B هستند و Unsloth ادعا میکند که در مقایسه با سایر ارائهدهندههای کوانتیزاسیون، دقت بالای 1 درصدی بالاتر از 10 درصد بهتر را در همان اندازه فایل ارائه میکنند.
انتشار به سرعت به صفحه اول هکر نیوز رسید، جایی که علاقه مندان به مدل های محلی نمودارهای معیار را تجزیه کردند. این در میان کشش قابل توجهی برای پروژه وارد میشود: Unsloth میگوید کوانتیزههای Qwen3.8 آن در پنج روز پس از عرضه مدل، بیش از 5.1 میلیون بار دانلود شده است. For more context on this story, see our ongoing artificial intelligence updates.
چرا کیفیت کوانتیزاسیون مهم است
Quantization اندازه فایل مدل را با ذخیره وزن آن با دقت کمتر کوچک می کند و امکان اجرای مدل های بزرگ را بر روی GPU و لپ تاپ های مصرف کننده فراهم می کند. معاوضه همیشه دقت بوده است: کوانتیزهسازی سنگین خروجیها را به گونهای کاهش میدهد که معیارهای معمولی ممکن است از دست بروند. برای جامعه رو به رشدی که مدلهای محلی را اجرا میکنند - از توسعهدهندگانی که جریانهای کاری عامل را آزمایش میکنند تا کاربران در مناطقی با دسترسی API ابری گرانقیمت - کیفیت کمیت به طور موثر تعیین میکند که کدام مدلها اصلاً قابل استفاده هستند.
Dynamic 3.0 پاسخ Unsloth به این مبادله است. با توجه به مستندات این تیم، نسخه جدید "کیفیت مدل بیشتری را حفظ می کند و در عین حال همان اندازه را حفظ می کند، با نتایج قوی تر در معیارهایی مانند Divergence-300 @32 و KL Divergence."
چه چیزی در نسخه 3.0 تغییر کرد
ارتقای روششناسی به جای حیلهگری، جزئی است. Unsloth میگوید اکنون از مجموعه دادههای کالیبراسیون ماتریس اهمیت بسیار باکیفیتتری استفاده میکند که از منابع مختلف استخراج شده است، که به صراحت برای کدنویسی، چت و عملکرد چند زبانه اصلاح شده است. انتخاب لایه - تصمیم گیری در مورد اینکه کدام بخش از مدل بیشتر فشرده شود - بهبود یافته است و تکنیک های کوانتیزاسیون اضافی برای حفظ کیفیت معرفی شده است.
شایان ذکر است، این تیم تاکید میکند که همه چیز از طریق کوانتیزه کردن پس از آموزش انجام میشود: بدون آموزش آگاهانه از کوانتیشن و بدون تقطیر آگاه از کوانتیشن. مجموعه داده کالیبراسیون روی خود آموزش ندیده است و فایل imatrix به صورت عمومی منتشر می شود تا جامعه بتواند کار را بازتولید کند یا روی آن آهنگ های دقیق بسازد.
سطوح کمیت خاص تأثیر عملی را نشان می دهد. مقدار UD-Q2_K_XL، با 9.83 گیگابایت، تقریباً 8 درصد دقیق تر از بهترین گزینه بعدی در آن اندازه، در متریک بالای 1 درصد توصیف شده است. در یکی از آزمایشهای غیررسمی Unsloth نشان میدهد که این کوانت یک برنامه HTML کارآمد با یک باگ کوچک جاوا اسکریپت تولید میکند - خروجیای که نسلهای قبلی کوانتهای با اندازه مشابه به طور کامل شکسته شده بودند.
در پایین ترین سطح، یک کوانت UD-IQ1_S مدل را به 6.2 گیگابایت فشرده می کند - 89 درصد کوچکتر از نسخه اصلی - در حالی که حدود 72 درصد از دقت بالای 1 درصد را حفظ می کند. Unsloth همچنین ماژول پیشبینی چند نشانهای را از حجمهای کوچکتر زیر 8.37 گیگابایت حذف کرد تا تقریباً 500 مگابایت فضای دیسک را حفظ کند، با این ماژول به طور جداگانه برای کاربرانی که آن را میخواهند در دسترس است.
یک معیار سخت تر، نه فقط یک معیار دوستانه تر
شاید بخش مهمتر اعلامیه روش شناختی باشد. Unsloth استدلال می کند که دقت بالای 1 درصد - اساساً یک آزمون argmax تک پیش بینی - یک سنج موثر برای کیفیت استنتاج واقعی نیست. برای مقابله با برازش بیش از حد معیار، تیم Divergence-300 @32 را ساخت: مجموعه دادهای از 300 نمونه برگرفته از Terminal-Bench 2.1، DeepSWE، Harbor، MathArena 2025-26، و درخواستهای سند بلند غیر لاتین، که هیچکدام از آنها در کالیبراسیون ظاهر نمیشوند.
این متریک رمزگشایی حریصانهای را برای 32 توکن انجام میدهد و اندازهگیری میکند که مسیر خروجی هر کوانت چقدر با مدل اصلی BF16 مطابقت دارد - مسیرهای نزدیکتر به این معنی است که کوانت مانند مدل کامل در تولید چند نشانه رفتار میکند، نه فقط در پیشبینیهای منفرد. معیارهای واگرایی KL که در همه ارائهدهندگان اجرا میشوند نشان میدهند که کوانتهای UD-3 Unsloth تا 10 درصد دقت بالای 1 درصد اضافی را در فضای دیسک برابر به دست میآورند، با بیشترین سود در اندازههای کوچکتر.
این تیم همچنین تجزیه و تحلیل بیشازحدی را منتشر کرد که در آن کوانتهای جدید را با نسخههای قدیمیتر Dynamic 2.0 در ویکیمتن و کدهای دیده نشده مقایسه میکرد و میگوید که در اندازههای کوانت بزرگتر که در آن سود کمتر بود، به تکرار ادامه خواهد داد.
سابقه و هشدارها
Unsloth از طریق همکاری مستقیم با فروشندگان مدل، اعتباری را در جامعه مدل محلی به دست آورده است - تیم اصلاحات ارائه شده به Qwen3، Meta's Llama 4، Mistral's Devstral، سری Gemma Google و مدل های Phi مایکروسافت را فهرست می کند، کاری که از لحاظ تاریخی اشکالات دقت وزن های تازه منتشر شده را برطرف کرده است.
اخطار معمول اعمال می شود: اینها معیارهایی هستند که توسط فروشنده اجرا می شوند و کوانتیزرهای رقیب به طور متفاوتی اندازه گیری می کنند. اما انتشار فایلهای کالیبراسیون، مجموعههای ارزیابی نگهداشتهشده، و دادههای واگرایی به ازای هر کوانت، تأیید مستقل را بهطور غیرعادی آسان میکند – و این شفافیت دقیقاً همان چیزی است که پروژه را در مرکز اکوسیستم LLM محلی نگه میدارد، زیرا به سمت استفاده اصلی میرود.
برای توسعهدهندگانی که Qwen3.8 یا هر مدل وزن باز مرزی را بر روی سختافزار محلی اجرا میکنند، نسخه Dynamic 3.0 به طور موثری سطح کاری را که یک مدل کوانتیزهشده میتواند انجام دهد افزایش میدهد - و بر هر ارائهدهنده کوانتیزاسیون دیگری فشار میآورد تا همان سختافزاری را منتشر کند.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →