Unsloth، تیم منبع باز پشت برخی از پرکاربردترین ابزارها برای اجرا و تنظیم دقیق مدل‌های زبان بزرگ به صورت محلی، Dynamic 3.0 را منتشر کرده است، نسل سوم روش کوانتیزه‌سازی خود برای فایل‌های مدل GGUF. اولین مدل‌هایی که تحت این طرح جدید عرضه می‌شوند، مقادیری از Qwen3.8-27B هستند و Unsloth ادعا می‌کند که در مقایسه با سایر ارائه‌دهنده‌های کوانتیزاسیون، دقت بالای 1 درصدی بالاتر از 10 درصد بهتر را در همان اندازه فایل ارائه می‌کنند.

انتشار به سرعت به صفحه اول هکر نیوز رسید، جایی که علاقه مندان به مدل های محلی نمودارهای معیار را تجزیه کردند. این در میان کشش قابل توجهی برای پروژه وارد می‌شود: Unsloth می‌گوید کوانتیزه‌های Qwen3.8 آن در پنج روز پس از عرضه مدل، بیش از 5.1 میلیون بار دانلود شده است. For more context on this story, see our ongoing artificial intelligence updates.

چرا کیفیت کوانتیزاسیون مهم است

Quantization اندازه فایل مدل را با ذخیره وزن آن با دقت کمتر کوچک می کند و امکان اجرای مدل های بزرگ را بر روی GPU و لپ تاپ های مصرف کننده فراهم می کند. معاوضه همیشه دقت بوده است: کوانتیزه‌سازی سنگین خروجی‌ها را به گونه‌ای کاهش می‌دهد که معیارهای معمولی ممکن است از دست بروند. برای جامعه رو به رشدی که مدل‌های محلی را اجرا می‌کنند - از توسعه‌دهندگانی که جریان‌های کاری عامل را آزمایش می‌کنند تا کاربران در مناطقی با دسترسی API ابری گران‌قیمت - کیفیت کمیت به طور موثر تعیین می‌کند که کدام مدل‌ها اصلاً قابل استفاده هستند.

Dynamic 3.0 پاسخ Unsloth به این مبادله است. با توجه به مستندات این تیم، نسخه جدید "کیفیت مدل بیشتری را حفظ می کند و در عین حال همان اندازه را حفظ می کند، با نتایج قوی تر در معیارهایی مانند Divergence-300 @32 و KL Divergence."

چه چیزی در نسخه 3.0 تغییر کرد

ارتقای روش‌شناسی به جای حیله‌گری، جزئی است. Unsloth می‌گوید اکنون از مجموعه داده‌های کالیبراسیون ماتریس اهمیت بسیار باکیفیت‌تری استفاده می‌کند که از منابع مختلف استخراج شده است، که به صراحت برای کدنویسی، چت و عملکرد چند زبانه اصلاح شده است. انتخاب لایه - تصمیم گیری در مورد اینکه کدام بخش از مدل بیشتر فشرده شود - بهبود یافته است و تکنیک های کوانتیزاسیون اضافی برای حفظ کیفیت معرفی شده است.

شایان ذکر است، این تیم تاکید می‌کند که همه چیز از طریق کوانتیزه کردن پس از آموزش انجام می‌شود: بدون آموزش آگاهانه از کوانتیشن و بدون تقطیر آگاه از کوانتیشن. مجموعه داده کالیبراسیون روی خود آموزش ندیده است و فایل imatrix به صورت عمومی منتشر می شود تا جامعه بتواند کار را بازتولید کند یا روی آن آهنگ های دقیق بسازد.

سطوح کمیت خاص تأثیر عملی را نشان می دهد. مقدار UD-Q2_K_XL، با 9.83 گیگابایت، تقریباً 8 درصد دقیق تر از بهترین گزینه بعدی در آن اندازه، در متریک بالای 1 درصد توصیف شده است. در یکی از آزمایش‌های غیررسمی Unsloth نشان می‌دهد که این کوانت یک برنامه HTML کارآمد با یک باگ کوچک جاوا اسکریپت تولید می‌کند - خروجی‌ای که نسل‌های قبلی کوانت‌های با اندازه مشابه به طور کامل شکسته شده بودند.

در پایین ترین سطح، یک کوانت UD-IQ1_S مدل را به 6.2 گیگابایت فشرده می کند - 89 درصد کوچکتر از نسخه اصلی - در حالی که حدود 72 درصد از دقت بالای 1 درصد را حفظ می کند. Unsloth همچنین ماژول پیش‌بینی چند نشانه‌ای را از حجم‌های کوچک‌تر زیر 8.37 گیگابایت حذف کرد تا تقریباً 500 مگابایت فضای دیسک را حفظ کند، با این ماژول به طور جداگانه برای کاربرانی که آن را می‌خواهند در دسترس است.

یک معیار سخت تر، نه فقط یک معیار دوستانه تر

شاید بخش مهمتر اعلامیه روش شناختی باشد. Unsloth استدلال می کند که دقت بالای 1 درصد - اساساً یک آزمون argmax تک پیش بینی - یک سنج موثر برای کیفیت استنتاج واقعی نیست. برای مقابله با برازش بیش از حد معیار، تیم Divergence-300 @32 را ساخت: مجموعه داده‌ای از 300 نمونه برگرفته از Terminal-Bench 2.1، DeepSWE، Harbor، MathArena 2025-26، و درخواست‌های سند بلند غیر لاتین، که هیچ‌کدام از آنها در کالیبراسیون ظاهر نمی‌شوند.

این متریک رمزگشایی حریصانه‌ای را برای 32 توکن انجام می‌دهد و اندازه‌گیری می‌کند که مسیر خروجی هر کوانت چقدر با مدل اصلی BF16 مطابقت دارد - مسیرهای نزدیکتر به این معنی است که کوانت مانند مدل کامل در تولید چند نشانه رفتار می‌کند، نه فقط در پیش‌بینی‌های منفرد. معیارهای واگرایی KL که در همه ارائه‌دهندگان اجرا می‌شوند نشان می‌دهند که کوانت‌های UD-3 Unsloth تا 10 درصد دقت بالای 1 درصد اضافی را در فضای دیسک برابر به دست می‌آورند، با بیشترین سود در اندازه‌های کوچکتر.

این تیم همچنین تجزیه و تحلیل بیش‌ازحدی را منتشر کرد که در آن کوانت‌های جدید را با نسخه‌های قدیمی‌تر Dynamic 2.0 در ویکی‌متن و کدهای دیده نشده مقایسه می‌کرد و می‌گوید که در اندازه‌های کوانت بزرگ‌تر که در آن سود کمتر بود، به تکرار ادامه خواهد داد.

سابقه و هشدارها

Unsloth از طریق همکاری مستقیم با فروشندگان مدل، اعتباری را در جامعه مدل محلی به دست آورده است - تیم اصلاحات ارائه شده به Qwen3، Meta's Llama 4، Mistral's Devstral، سری Gemma Google و مدل های Phi مایکروسافت را فهرست می کند، کاری که از لحاظ تاریخی اشکالات دقت وزن های تازه منتشر شده را برطرف کرده است.

اخطار معمول اعمال می شود: اینها معیارهایی هستند که توسط فروشنده اجرا می شوند و کوانتیزرهای رقیب به طور متفاوتی اندازه گیری می کنند. اما انتشار فایل‌های کالیبراسیون، مجموعه‌های ارزیابی نگه‌داشته‌شده، و داده‌های واگرایی به ازای هر کوانت، تأیید مستقل را به‌طور غیرعادی آسان می‌کند – و این شفافیت دقیقاً همان چیزی است که پروژه را در مرکز اکوسیستم LLM محلی نگه می‌دارد، زیرا به سمت استفاده اصلی می‌رود.

برای توسعه‌دهندگانی که Qwen3.8 یا هر مدل وزن باز مرزی را بر روی سخت‌افزار محلی اجرا می‌کنند، نسخه Dynamic 3.0 به طور موثری سطح کاری را که یک مدل کوانتیزه‌شده می‌تواند انجام دهد افزایش می‌دهد - و بر هر ارائه‌دهنده کوانتیزاسیون دیگری فشار می‌آورد تا همان سخت‌افزاری را منتشر کند.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →