Unsloth, צוות הקוד הפתוח שמאחורי כמה מהכלים הנפוצים ביותר להרצה ולכוונן עדין של דגמי שפה גדולים באופן מקומי, הוציאה את Dynamic 3.0, הדור השלישי של שיטת הקוונטיזציה שלה עבור קובצי מודל GGUF. הדגמים הראשונים שנשלחו במסגרת הסכימה החדשה הם כמויות של Qwen3.8-27B, ו- Unsloth טוענת שהם מספקים דיוק של למעלה מ-10 אחוז טוב יותר ב-1 אחוז באותו גודל קובץ בהשוואה לכל ספק קוונטיזציה אחר.

המהדורה הגיעה במהירות לעמוד הראשון של האקר ניוז, שם חובבי דוגמניות מקומיות ניתחו את טבלאות ההשוואה. הוא מגיע תוך כדי משיכה יוצאת דופן עבור הפרויקט: Unsloth אומרת שכימות ה-Qwen3.8 שלה הורדו יותר מ-5.1 מיליון פעמים בחמשת הימים שלאחר יציאת הדגם. For more context on this story, see our ongoing AI news.

מדוע איכות הקוונטיזציה חשובה

קוונטיזציה מכווצת את גודל הקובץ של הדגם על ידי אחסון המשקולות שלו בדיוק נמוך יותר, מה שמאפשר להפעיל דגמים גדולים על GPUs ומחשבים ניידים לצרכן. הפשרה תמיד הייתה דיוק: קוונטיזציה כבדה משפילה את התפוקות בדרכים שאמות מידה מזדמנות עלולות לפספס. עבור הקהילה ההולכת וגדלה שמריצה מודלים מקומית - ממפתחים הבודקים זרימות עבודה של סוכנים ועד למשתמשים באזורים עם גישה יקרה ל-API בענן - האיכות הכמותית קובעת ביעילות אילו דגמים ניתנים לשימוש בכלל.

Dynamic 3.0 היא התשובה של Unsloth לפשרה הזו. לפי התיעוד של הצוות, המהדורה החדשה "שומרת על איכות דגמים רבה יותר תוך שמירה על אותו גודל, עם תוצאות חזקות יותר על פני מדדים כמו Divergence-300 @32 ו-KL Divergence".

מה השתנה בגרסה 3.0

שדרוגי המתודולוגיה הם פרטניים ולא גימיקיים. Unsloth אומרת שהיא משתמשת כעת במערך נתונים של כיול מטריצת חשיבות הרבה יותר איכותי, שנלקח ממקורות מגוונים, משוכלל במפורש לקידוד סוכן, צ'אט וביצועים רב לשוניים. בחירת השכבות - ההחלטה אילו חלקים בדגם יידחקו בצורה הקשה ביותר - שופרה, וטכניקות קוונטיזציה נוספות הוכנסו כדי לשמור על האיכות.

ראוי לציין כי הצוות מדגיש שהכל נעשה באמצעות קוונטיזציה לאחר אימון: ללא הכשרה מודעת לכימות וללא זיקוק מודעת לכימות. מערך הנתונים הכיול עצמו אינו מאומן, וקובץ האימטריקס פורסם בפומבי כדי שהקהילה תוכל לשחזר את העבודה או לבנות עליה כוונון עדין.

שכבות כמות ספציפיות מראים את ההשפעה המעשית. כמות ה-UD-Q2_K_XL, ב-9.83 ג'יגה-בייט, מתוארת כמדויקת בסביבות 8% יותר במדד 1 האחוז העליון מאשר האפשרות הבאה הכי טובה בגודל זה. בבדיקה לא רשמית אחת Unsloth מדגישה, הקוואנט הזה יצר תוכנית HTML עובדת עם באג JavaScript קטן יחיד - פלט שדורות קודמים של קוואנטים בגודל דומה היו נשברים לחלוטין.

בקצה הקיצוני הנמוך, כמות UD-IQ1_S סוחטת את הדגם ל-6.2 GB - קטן ב-89 אחוז מהמקור - תוך שמירה על כ-72 אחוז מהדיוק העליון של 1. Unsloth גם הסירה את מודול החיזוי מרובה אסימונים מכמות קטנה יותר מתחת ל-8.37 GB כדי לחסוך בערך 500 MB של שטח דיסק, כאשר המודול זמין בנפרד עבור משתמשים שרוצים בכך.

אמת מידה קשה יותר, לא רק ידידותית יותר

אולי החלק המשמעותי יותר של ההודעה הוא מתודולוגי. Unsloth טוען שהדיוק העליון של 1 אחוז - בעצם מבחן argmax עם חיזוי יחיד - אינו מדד יעיל לאיכות הסקת מסקנות אמיתית. כדי להתמודד עם התאמה יתרה של המדדים, הצוות בנה את Divergence-300 @32: מערך נתונים ממושך של 300 דוגמאות שנלקחו מ-Terminal-Bench 2.1, DeepSWE, Harbor, MathArena 2025-26, והנחיות למסמכים ארוכים שאינם לטינית, שאף אחת מהן לא מופיעה בנתוני הכיול.

המדד מפעיל פענוח חמדן עבור 32 אסימונים ומודד עד כמה מסלול הפלט של כל קוואנט תואם את מסלול ה-BF16 המקורי - מסלולים קרובים יותר פירושם שהקוואנט מתנהג כמו המודל המלא על פני יצירת ריבוי אסימונים, לא רק על תחזיות בודדות. מדדי סטיית KL המופעלים על פני כל הספקים מראים שכמויות ה-UD-3 של Unsloth זוכות לעד 10 אחוזים נוספים של דיוק העליון של 1 אחוז בשטח דיסק שווה, עם הרווחים הגדולים ביותר בגדלים קטנים יותר.

הצוות גם פרסם ניתוח התאמת יתר המשווה את הכמויות החדשות מול מהדורות ה-Dynamic 2.0 הישנות יותר שלו ב-WikiText וקוד שלא נראו, ואומר שהוא ימשיך לחזור על גדלי כמות גדולים יותר שבהם הרווחים היו צנועים יותר.

רקורד ואזהרות

Unsloth זכתה לאמינות בקהילת הדוגמניות המקומיות באמצעות שיתוף פעולה ישיר עם ספקי דגמים - הצוות מפרט תיקונים שנתרמו ל-Qwen3, ל-Llama 4 של Meta, ל-Devstral של Mistral, לסדרת Gemma של גוגל ודגמי Phi של מיקרוסופט, עבודה שפתרה היסטורית באגי דיוק במשקלים שפורסמו לאחרונה.

האזהרה הרגילה חלה: אלו הם מדדים המופעלים על ידי ספקים, ומכמתים מתחרים מודדים אחרת. אבל השחרור של קבצי כיול, ערכות הערכה ממושכות ונתוני סטייה לפי כמות הופכים אימות עצמאי לקל בצורה יוצאת דופן - והשקיפות הזו היא בדיוק מה ששמר את הפרויקט במרכז האקולוגית המקומית של LLM כשהיא מתרחבת לקראת השימוש במיינסטרים.

עבור מפתחים המריצים Qwen3.8 או כל מודל בעל משקל פתוח על חומרה מקומית, המהדורה של Dynamic 3.0 למעשה מעלה את הרצפה למה שמודל קוונטי יכול לעשות - ומפעילה לחץ על כל ספק קוונטיזציה אחר לפרסם את אותה קפדנות.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →