Unsloth, pasukan sumber terbuka di belakang beberapa alatan yang paling banyak digunakan untuk menjalankan dan memperhalusi model bahasa besar secara tempatan, telah mengeluarkan Dynamic 3.0, generasi ketiga kaedah pengkuantitiannya untuk fail model GGUF. Model pertama yang dihantar di bawah skim baharu ialah kuantiti Qwen3.8-27B, dan Unsloth mendakwa ia memberikan ketepatan 1 peratus teratas lebih 10 peratus lebih baik pada saiz fail yang sama berbanding dengan setiap penyedia pengkuantitian lain.

Keluaran itu cepat sampai ke muka depan Berita Hacker, di mana peminat model tempatan membedah carta penanda aras. Ia tiba di tengah-tengah daya tarikan yang luar biasa untuk projek itu: Unsloth berkata kuantisasi Qwen3.8nya telah dimuat turun lebih daripada 5.1 juta kali dalam tempoh lima hari selepas keluaran model itu. For more context on this story, see our ongoing more AI stories.

Mengapa kualiti pengkuantitian penting

Kuantiti mengecilkan saiz fail model dengan menyimpan pemberatnya pada ketepatan yang lebih rendah, membolehkan model besar dijalankan pada GPU dan komputer riba pengguna. Pertukaran itu sentiasa ketepatan: pengkuantitian berat merendahkan output dengan cara yang boleh terlepas oleh penanda aras kasual. Bagi komuniti yang semakin berkembang, model yang dijalankan secara tempatan — daripada pembangun menguji aliran kerja ejen kepada pengguna di wilayah yang mempunyai akses API awan yang mahal — kualiti kuantiti menentukan model yang boleh digunakan sama sekali.

Dynamic 3.0 ialah jawapan Unsloth kepada pertukaran itu. Menurut dokumentasi pasukan, keluaran baharu itu "memelihara lebih banyak kualiti model sambil mengekalkan saiz yang sama, dengan hasil yang lebih kukuh merentas metrik seperti Divergence-300 @32 dan KL Divergence."

Perkara yang berubah dalam versi 3.0

Peningkatan metodologi adalah berbutir dan bukannya gimik. Unsloth berkata ia kini menggunakan set data penentukuran matriks kepentingan yang lebih berkualiti tinggi yang diambil daripada pelbagai sumber, diperhalusi secara eksplisit untuk pengekodan agen, sembang dan prestasi berbilang bahasa. Pemilihan lapisan — menentukan bahagian model yang paling sukar dihimpit — telah dipertingkatkan, dan teknik pengkuantitian tambahan telah diperkenalkan untuk mengekalkan kualiti.

Terutamanya, pasukan menekankan bahawa segala-galanya dilakukan melalui pengkuantitian selepas latihan: tiada latihan sedar pengkuantitian dan tiada penyulingan sedar pengkuantitian. Set data penentukuran itu sendiri tidak dilatih dan fail imatrix dikeluarkan secara terbuka supaya komuniti boleh menghasilkan semula kerja atau membina lagu-lagu halus di atasnya.

Peringkat kuantiti tertentu menunjukkan kesan praktikal. Kuantiti UD-Q2_K_XL, pada 9.83 GB, digambarkan sebagai sekitar 8 peratus lebih tepat pada metrik 1 peratus teratas daripada pilihan terbaik seterusnya pada saiz itu. Dalam satu ujian tidak formal sorotan Unsloth, kuan itu menghasilkan program HTML yang berfungsi dengan satu pepijat JavaScript kecil — output yang generasi sebelumnya dengan kuantiti yang sama akan dipecahkan sepenuhnya.

Pada tahap paling rendah yang melampau, kuantiti UD-IQ1_S memerah model kepada 6.2 GB — 89 peratus lebih kecil daripada asal — sambil mengekalkan kira-kira 72 peratus ketepatan 1 peratus teratas. Unsloth juga mengalih keluar modul ramalan berbilang token daripada kuantiti yang lebih kecil di bawah 8.37 GB untuk menjimatkan kira-kira 500 MB ruang cakera, dengan modul tersedia secara berasingan untuk pengguna yang menginginkannya.

Penanda aras yang lebih sukar, bukan hanya yang lebih mesra

Mungkin bahagian pengumuman yang lebih penting adalah metodologi. Unsloth berhujah bahawa ketepatan 1 peratus teratas - pada asasnya ujian argmax ramalan tunggal - bukanlah tolok yang berkesan bagi kualiti inferens sebenar. Untuk mengatasi overfitting penanda aras, pasukan itu membina Divergence-300 @32: set data tertahan yang mengandungi 300 contoh yang diambil daripada Terminal-Bench 2.1, DeepSWE, Harbor, MathArena 2025-26 dan gesaan dokumen panjang bukan Latin, tiada satu pun daripadanya muncul dalam data penentukuran.

Metrik menjalankan penyahkodan tamak untuk 32 token dan mengukur sejauh mana trajektori keluaran setiap kuantiti sepadan dengan model asal BF16 — trajektori yang lebih dekat bermakna kuantiti berkelakuan seperti model penuh sepanjang penjanaan berbilang token, bukan hanya pada ramalan tunggal. Penanda aras perbezaan KL dijalankan merentasi semua pembekal menunjukkan kuantiti UD-3 Unsloth memperoleh sehingga 10 peratus tambahan ketepatan atas-1 peratus pada ruang cakera yang sama, dengan keuntungan terbesar pada saiz yang lebih kecil.

Pasukan itu juga menerbitkan analisis berlebihan yang membandingkan kuantiti baharu dengan keluaran Dynamic 2.0 yang lebih lama pada WikiText dan kod yang tidak kelihatan, dan mengatakan ia akan terus berulang pada saiz kuantiti yang lebih besar di mana keuntungan adalah lebih sederhana.

Rekod jejak dan kaveat

Unsloth telah memperoleh kredibiliti dalam komuniti model tempatan melalui kerjasama langsung dengan vendor model — pasukan menyenaraikan pembetulan yang disumbangkan kepada Qwen3, Meta Llama 4, Mistral's Devstral, siri Gemma Google dan model Phi Microsoft, kerja yang secara sejarah telah menyelesaikan pepijat ketepatan dalam pemberat yang baru dikeluarkan.

Kaveat biasa digunakan: ini adalah penanda aras yang dikendalikan oleh vendor, dan pengkuantiti saingan mengukur secara berbeza. Tetapi pelepasan fail penentukuran, set penilaian yang ditahan dan data perbezaan per kuantiti menjadikan pengesahan bebas menjadi luar biasa mudah — dan ketelusan itulah yang telah memastikan projek itu berada di tengah-tengah ekosistem LLM tempatan apabila ia meningkat ke arah penggunaan arus perdana.

Untuk pembangun yang menjalankan Qwen3.8 atau mana-mana model pemberat terbuka sempadan pada perkakasan tempatan, keluaran Dynamic 3.0 dengan berkesan meningkatkan tahap yang boleh dilakukan oleh model terkuantiti — dan memberi tekanan kepada setiap penyedia pengkuantitian lain untuk menerbitkan ketegasan yang sama.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →