Büyük dil modellerini yerel olarak çalıştırmak ve ince ayar yapmak için en yaygın kullanılan araçlardan bazılarının arkasındaki açık kaynak ekibi olan Unsloth, GGUF model dosyalarına yönelik niceleme yönteminin üçüncü nesli olan Dynamic 3.0'ı piyasaya sürdü. Yeni plan kapsamında gönderilen ilk modeller, Qwen3.8-27B kuantumlarıdır ve Unsloth, diğer kuantizasyon sağlayıcılarına kıyasla aynı dosya boyutunda yüzde 10'dan daha iyi yüzde 1'lik doğruluk sağladıklarını iddia ediyor.

Bu sürüm, yerel model meraklılarının kıyaslama tablolarını incelediği Hacker News'in ön sayfasına hızla ulaştı. Proje için dikkat çekici bir ilginin ortasında geldi: Unsloth, Qwen3.8 nicelemelerinin, modelin piyasaya sürülmesinden sonraki beş gün içinde 5,1 milyondan fazla indirildiğini söylüyor. For more context on this story, see our ongoing more AI stories.

Niceleme kalitesi neden önemlidir?

Niceleme, ağırlıklarını daha düşük hassasiyette depolayarak bir modelin dosya boyutunu küçültür ve büyük modellerin tüketici GPU'larında ve dizüstü bilgisayarlarında çalıştırılmasını mümkün kılar. Takas her zaman doğruluk olmuştur: Yoğun niceleme, çıktıları sıradan kıyaslamaların gözden kaçırabileceği şekillerde düşürür. Modelleri yerel olarak çalıştıran büyüyen topluluk için (aracı iş akışlarını test eden geliştiricilerden pahalı bulut API erişimi olan bölgelerdeki kullanıcılara kadar) nicelik kalitesi, hangi modellerin kullanılabilir olduğunu etkili bir şekilde belirler.

Dynamic 3.0, Unsloth'un bu ödünleşime verdiği yanıttır. Ekibin belgelerine göre, yeni sürüm "aynı boyutu korurken daha fazla model kalitesini koruyor ve Divergence-300 @32 ve KL Divergence gibi metriklerde daha güçlü sonuçlar veriyor."

Sürüm 3.0'da neler değişti?

Metodoloji yükseltmeleri dikkat çekici olmaktan ziyade ayrıntılıdır. Unsloth, artık çeşitli kaynaklardan alınan ve açıkça aracılı kodlama, sohbet ve çok dilli performans için geliştirilmiş, çok daha yüksek kalitede bir önem matrisi kalibrasyon veri kümesi kullandığını söylüyor. Modelin hangi bölümlerinin en çok sıkıştırılacağına karar veren katman seçimi iyileştirildi ve kaliteyi korumak için ek niceleme teknikleri eklendi.

Ekip, özellikle her şeyin eğitim sonrası kuantizasyon yoluyla yapıldığını vurguluyor: kuantizasyona duyarlı eğitim ve kuantizasyona duyarlı damıtma yok. Kalibrasyon veri setinin kendisi üzerinde eğitim yapılmaz ve imatrix dosyası kamuya açıklanır, böylece topluluk çalışmayı yeniden üretebilir veya bunun üzerine ince ayarlar yapabilir.

Belirli miktar katmanları pratik etkiyi gösterir. 9,83 GB'lık UD-Q2_K_XL miktarının, en üst yüzde 1'lik ölçümde, bu boyuttaki bir sonraki en iyi seçeneğe göre yaklaşık yüzde 8 daha doğru olduğu belirtiliyor. Unsloth'un resmi olmayan bir testinde, bu quant'ın tek bir küçük JavaScript hatasıyla çalışan bir HTML programı ürettiğini öne sürüyor; bu çıktı, benzer boyuttaki quant'ların önceki nesillerinin tamamen bozulacağı bir çıktı.

En düşük uçta, bir UD-IQ1_S niceliği, modeli 6,2 GB'a (orijinalinden yüzde 89 daha küçük) sıkıştırırken, en üst yüzde 1'lik doğruluğun yaklaşık yüzde 72'sini koruyor. Unsloth ayrıca, yaklaşık 500 MB disk alanından tasarruf etmek için 8,37 GB'nin altındaki daha küçük miktarlardan çoklu token tahmin modülünü de kaldırdı; modül, isteyen kullanıcılar için ayrı olarak mevcut.

Yalnızca daha dostane değil, daha sert bir kıyaslama

Belki de duyurunun daha önemli kısmı metodolojiktir. Unsloth, en yüksek yüzde 1'lik doğruluğun (esasen tek tahminli bir argmax testi) gerçek çıkarım kalitesinin etkili bir ölçüsü olmadığını savunuyor. Ekip, kıyaslama gereğinden fazla uyum sağlamaya karşı koymak için Divergence-300 @32'yi geliştirdi: Terminal-Bench 2.1, DeepSWE, Harbor, MathArena 2025-26 ve Latin olmayan uzun belge istemlerinden alınan 300 örnekten oluşan uzun bir veri kümesi; bunların hiçbiri kalibrasyon verilerinde görünmüyor.

Metrik, 32 token için açgözlü kod çözme çalıştırıyor ve her bir quant'ın çıktı yörüngesinin orijinal BF16 modelinin çıktı yörüngesine ne kadar yakın eşleştiğini ölçüyor; daha yakın yörüngeler, quant'ın yalnızca tek tahminlerde değil, çoklu token üretimi boyunca tam model gibi davrandığı anlamına geliyor. Tüm sağlayıcılarda yürütülen KL sapma kıyaslamaları, Unsloth'un UD-3 quant'larının, eşit disk alanında yüzde 10'a kadar ekstra ilk yüzde 1 doğruluk elde ettiğini ve en büyük kazanımların daha küçük boyutlarda olduğunu gösteriyor.

Ekip ayrıca yeni nicelikleri, daha önce görülmemiş WikiText ve koddaki eski Dynamic 2.0 sürümleriyle karşılaştıran aşırı uygun bir analiz yayınladı ve kazanımların daha mütevazı olduğu daha büyük nicelik boyutlarını yinelemeye devam edeceğini söyledi.

Takip kayıtları ve uyarılar

Unsloth, model satıcılarıyla doğrudan işbirliği yaparak yerel model topluluğunda güvenilirlik kazandı; ekip, Qwen3, Meta'nın Llama 4'ü, Mistral'ın Devstral'ı, Google'ın Gemma serisi ve Microsoft'un Phi modellerine katkıda bulunan düzeltmeleri listeliyor; bu çalışmalar, yeni yayımlanan ağırlıklardaki doğruluk hatalarını tarihsel olarak çözmüştür.

Her zamanki uyarı geçerlidir: bunlar satıcı tarafından yürütülen kıyaslamalardır ve rakip niceleyiciler farklı ölçüm yapar. Ancak kalibrasyon dosyalarının, uzun süreli değerlendirme setlerinin ve nicelik başına farklılık verilerinin yayınlanması, bağımsız doğrulamayı alışılmadık derecede kolay hale getiriyor - ve bu şeffaflık, projeyi ana kullanıma doğru ölçeklenirken yerel LLM ekosisteminin merkezinde tutan şey tam da bu.

Dynamic 3.0 sürümü, Qwen3.8'i veya yerel donanımda herhangi bir sınır açık ağırlık modelini çalıştıran geliştiriciler için, nicelenmiş bir modelin yapabilecekleri konusunda etkili bir şekilde zemini yükseltiyor ve diğer tüm niceleme sağlayıcılarına aynı titizliği yayınlamaları için baskı yapıyor.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →