Η Unsloth, η ομάδα ανοιχτού κώδικα πίσω από μερικά από τα πιο ευρέως χρησιμοποιούμενα εργαλεία για την εκτέλεση και τη λεπτομερή ρύθμιση μοντέλων μεγάλων γλωσσών τοπικά, κυκλοφόρησε το Dynamic 3.0, την τρίτη γενιά της μεθόδου κβαντοποίησης για αρχεία μοντέλων GGUF. Τα πρώτα μοντέλα που θα αποσταλούν στο πλαίσιο του νέου συστήματος είναι ποσότητες Qwen3.8-27B και η Unsloth ισχυρίζεται ότι παρέχουν μεγαλύτερη από 10 τοις εκατό καλύτερη ακρίβεια top-1 τοις εκατό στο ίδιο μέγεθος αρχείου σε σύγκριση με κάθε άλλο πάροχο κβαντοποίησης.

Η κυκλοφορία έφτασε γρήγορα στην πρώτη σελίδα του Hacker News, όπου οι λάτρεις των τοπικών μοντέλων ανέλυσαν τα γραφήματα αναφοράς. Φτάνει μέσα σε μια αξιοσημείωτη έλξη για το έργο: Η Unsloth λέει ότι οι κβαντοποιήσεις Qwen3.8 της λήφθηκαν περισσότερες από 5,1 εκατομμύρια φορές μέσα σε πέντε ημέρες μετά την κυκλοφορία του μοντέλου. For more context on this story, see our ongoing more AI stories.

Γιατί η ποιότητα της κβαντοποίησης έχει σημασία

Η κβαντοποίηση συρρικνώνει το μέγεθος αρχείου ενός μοντέλου αποθηκεύοντας τα βάρη του με χαμηλότερη ακρίβεια, καθιστώντας δυνατή την εκτέλεση μεγάλων μοντέλων σε GPU και φορητούς υπολογιστές καταναλωτών. Η αντιστάθμιση ήταν πάντα η ακρίβεια: ο βαρύς κβαντισμός υποβαθμίζει τα αποτελέσματα με τρόπους που μπορεί να χάνουν τα περιστασιακά σημεία αναφοράς. Για την αναπτυσσόμενη κοινότητα που εκτελούνται μοντέλα τοπικά — από προγραμματιστές που δοκιμάζουν ροές εργασίας αντιπροσώπων έως χρήστες σε περιοχές με ακριβή πρόσβαση στο cloud API — η ποσοτική ποιότητα καθορίζει αποτελεσματικά ποια μοντέλα μπορούν να χρησιμοποιηθούν καθόλου.

Το Dynamic 3.0 είναι η απάντηση του Unsloth σε αυτόν τον συμβιβασμό. Σύμφωνα με την τεκμηρίωση της ομάδας, η νέα έκδοση «διατηρεί περισσότερη ποιότητα μοντέλου διατηρώντας το ίδιο μέγεθος, με ισχυρότερα αποτελέσματα σε μετρήσεις όπως το Divergence-300 @32 και το KL Divergence».

Τι άλλαξε στην έκδοση 3.0

Οι αναβαθμίσεις της μεθοδολογίας είναι αναλυτικές και όχι απλές. Η Unsloth λέει ότι χρησιμοποιεί τώρα ένα σύνολο δεδομένων βαθμονόμησης μήτρας σπουδαιότητας πολύ υψηλότερης ποιότητας που προέρχεται από διαφορετικές πηγές, ρητά βελτιωμένο για πρακτορική κωδικοποίηση, συνομιλία και πολυγλωσσική απόδοση. Η επιλογή στρώματος — η απόφαση ποια μέρη του μοντέλου συμπιέζονται περισσότερο — έχει βελτιωθεί και εισήχθησαν πρόσθετες τεχνικές κβαντοποίησης για τη διατήρηση της ποιότητας.

Σημειωτέον, η ομάδα τονίζει ότι όλα γίνονται μέσω της κβαντοποίησης μετά την εκπαίδευση: καμία εκπαίδευση με επίγνωση κβαντισμού και καμία απόσταξη με επίγνωση κβαντισμού. Το ίδιο το σύνολο δεδομένων βαθμονόμησης δεν εκπαιδεύεται και το αρχείο imatrix κυκλοφορεί δημόσια, ώστε η κοινότητα να μπορεί να αναπαράγει το έργο ή να δημιουργήσει τελειοποιήσεις πάνω από αυτό.

Τα συγκεκριμένα ποσοτικά επίπεδα δείχνουν τον πρακτικό αντίκτυπο. Η ποσότητα UD-Q2_K_XL, στα 9,83 GB, περιγράφεται ως περίπου 8 τοις εκατό πιο ακριβή στη μέτρηση κορυφαίου 1 τοις εκατό από την επόμενη καλύτερη επιλογή σε αυτό το μέγεθος. Σε μια άτυπη δοκιμή που επισημαίνει το Unsloth, αυτό το quant παρήγαγε ένα λειτουργικό πρόγραμμα HTML με ένα μόνο μικρό σφάλμα JavaScript - έξοδο που οι προηγούμενες γενιές παρόμοιων μεγεθών quant θα είχαν σπάσει εντελώς.

Στο ακραίο χαμηλό επίπεδο, μια ποσότητα UD-IQ1_S συμπιέζει το μοντέλο σε 6,2 GB - 89 τοις εκατό μικρότερο από το αρχικό - ενώ διατηρεί περίπου το 72 τοις εκατό της κορυφαίας ακρίβειας του 1 τοις εκατό. Το Unsloth αφαίρεσε επίσης τη μονάδα πρόβλεψης πολλαπλών σημείων από μικρότερες ποσότητες κάτω των 8,37 GB για να εξοικονομήσει περίπου 500 MB χώρου στο δίσκο, με τη μονάδα να είναι διαθέσιμη ξεχωριστά για τους χρήστες που τη θέλουν.

Ένα πιο δύσκολο σημείο αναφοράς, όχι απλώς ένα πιο φιλικό

Ίσως το πιο συνεπακόλουθο κομμάτι της ανακοίνωσης είναι μεθοδολογικό. Ο Unsloth υποστηρίζει ότι η ακρίβεια κορυφαίου 1 τοις εκατό - ουσιαστικά μια δοκιμή argmax μεμονωμένης πρόβλεψης - δεν είναι αποτελεσματικός μετρητής πραγματικής ποιότητας συμπερασμάτων. Για να αντιμετωπιστεί η υπερβολική προσαρμογή των κριτηρίων αξιολόγησης, η ομάδα δημιούργησε το Divergence-300 @32: ένα συγκρατημένο σύνολο δεδομένων 300 παραδειγμάτων που προέρχονται από το Terminal-Bench 2.1, DeepSWE, Harbor, MathArena 2025-26 και μη λατινικά μακροσκελής προτροπές εγγράφων, κανένα από τα οποία δεν εμφανίζεται στη βαθμονόμηση.

Η μέτρηση εκτελεί άπληστη αποκωδικοποίηση για 32 μάρκες και μετρά πόσο πολύ ταιριάζει η τροχιά εξόδου κάθε quant με το αρχικό μοντέλο BF16 — οι πιο κοντινές τροχιές σημαίνουν ότι το quant συμπεριφέρεται όπως το πλήρες μοντέλο στη γενιά πολλών σημείων, όχι μόνο σε μεμονωμένες προβλέψεις. Τα σημεία αναφοράς απόκλισης KL που εκτελούνται σε όλους τους παρόχους δείχνουν ότι τα quants UD-3 της Unsloth αποκτούν έως και 10 τοις εκατό επιπλέον ακρίβεια top-1 τοις εκατό σε ίσο χώρο στο δίσκο, με τα μεγαλύτερα κέρδη σε μικρότερα μεγέθη.

Η ομάδα δημοσίευσε επίσης μια υπερπροσαρμοσμένη ανάλυση συγκρίνοντας τις νέες ποσότητες με τις παλαιότερες εκδόσεις Dynamic 2.0 σε αόρατο WikiText και κώδικα, και λέει ότι θα συνεχίσει να επαναλαμβάνει τα μεγαλύτερα μεγέθη ποσοτήτων όπου τα κέρδη ήταν πιο μέτρια.

Ρεκόρ πορείας και επιφυλάξεις

Το Unsloth έχει κερδίσει αξιοπιστία στην τοπική κοινότητα μοντέλων μέσω της άμεσης συνεργασίας με προμηθευτές μοντέλων — η ομάδα απαριθμεί διορθώσεις που συνέβαλαν στο Qwen3, στο Meta's Llama 4, στο Mistral's Devstral, στη σειρά Gemma της Google και στα μοντέλα Phi της Microsoft, έργο που έχει επιλύσει ιστορικά σφάλματα ακρίβειας σε πρόσφατα δημοσιευμένα σφάλματα.

Ισχύει η συνήθης προειδοποίηση: πρόκειται για δείκτες αναφοράς που εκτελούνται από προμηθευτές και οι ανταγωνιστικοί κβαντιστές μετρούν διαφορετικά. Ωστόσο, η κυκλοφορία αρχείων βαθμονόμησης, συνόλων αξιολόγησης και δεδομένων απόκλισης ανά ποσότητα καθιστά ασυνήθιστα εύκολη την ανεξάρτητη επαλήθευση - και αυτή η διαφάνεια είναι ακριβώς αυτό που κράτησε το έργο στο κέντρο του τοπικού οικοσυστήματος LLM καθώς κλιμακώνεται προς την κύρια χρήση.

Για προγραμματιστές που εκτελούν Qwen3.8 ή οποιοδήποτε μοντέλο ανοιχτού συνοριακού βάρους σε τοπικό υλικό, η έκδοση Dynamic 3.0 ανεβάζει αποτελεσματικά το πάτωμα για το τι μπορεί να κάνει ένα κβαντισμένο μοντέλο — και ασκεί πίεση σε κάθε άλλο πάροχο κβαντοποίησης να δημοσιεύσει την ίδια αυστηρότητα.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →