Unsloth, nhóm nguồn mở đằng sau một số công cụ được sử dụng rộng rãi nhất để chạy và tinh chỉnh cục bộ các mô hình ngôn ngữ lớn, đã phát hành Dynamic 3.0, thế hệ thứ ba của phương pháp lượng tử hóa cho các tệp mô hình GGUF. Các mô hình đầu tiên được xuất xưởng theo sơ đồ mới là lượng tử Qwen3.8-27B và Unsloth tuyên bố rằng chúng mang lại độ chính xác trong top 1% cao hơn 10% ở cùng kích thước tệp so với mọi nhà cung cấp lượng tử hóa khác.

Bản phát hành nhanh chóng xuất hiện trên trang nhất của Hacker News, nơi những người đam mê mô hình địa phương mổ xẻ các biểu đồ điểm chuẩn. Nó xuất hiện trong bối cảnh có sức hút đáng kể đối với dự án: Unsloth cho biết lượng tử hóa Qwen3.8 của họ đã được tải xuống hơn 5,1 triệu lần trong năm ngày sau khi mô hình được phát hành. For more context on this story, see our ongoing breaking AI news.

Tại sao chất lượng lượng tử hóa lại quan trọng

Lượng tử hóa thu nhỏ kích thước tệp của mô hình bằng cách lưu trữ trọng lượng của nó ở độ chính xác thấp hơn, giúp có thể chạy các mô hình lớn trên GPU và máy tính xách tay dành cho người tiêu dùng. Sự đánh đổi luôn là độ chính xác: lượng tử hóa nặng tay làm giảm kết quả đầu ra theo những cách mà các tiêu chuẩn thông thường có thể bỏ qua. Đối với cộng đồng đang phát triển đang chạy các mô hình cục bộ — từ quy trình làm việc của tác nhân thử nghiệm của nhà phát triển đến người dùng ở các khu vực có quyền truy cập API đám mây đắt tiền — chất lượng định lượng sẽ xác định một cách hiệu quả những mô hình nào có thể sử dụng được.

Dynamic 3.0 là câu trả lời của Unsloth cho sự đánh đổi đó. Theo tài liệu của nhóm, bản phát hành mới "bảo toàn chất lượng mô hình tốt hơn trong khi vẫn giữ nguyên kích thước, mang lại kết quả tốt hơn trên các chỉ số như Divergence-300 @32 và KL Divergence."

Những gì đã thay đổi trong phiên bản 3.0

Việc nâng cấp phương pháp luận là chi tiết hơn là phô trương. Unsloth cho biết hiện tại họ sử dụng bộ dữ liệu hiệu chỉnh ma trận quan trọng chất lượng cao hơn nhiều được lấy từ nhiều nguồn khác nhau, được tinh chỉnh rõ ràng cho mã hóa tác nhân, trò chuyện và hiệu suất đa ngôn ngữ. Lựa chọn lớp - quyết định phần nào của mô hình bị nén mạnh nhất - đã được cải thiện và các kỹ thuật lượng tử hóa bổ sung đã được giới thiệu để duy trì chất lượng.

Đáng chú ý, nhóm nhấn mạnh rằng mọi thứ đều được thực hiện thông qua lượng tử hóa sau đào tạo: không đào tạo nhận thức lượng tử hóa và không chưng cất nhận thức lượng tử hóa. Bản thân tập dữ liệu hiệu chỉnh không được đào tạo và tệp imatrix được phát hành công khai để cộng đồng có thể tái tạo tác phẩm hoặc xây dựng các tinh chỉnh trên đó.

Các bậc định lượng cụ thể cho thấy tác động thực tế. Định lượng UD-Q2_K_XL, ở mức 9,83 GB, được mô tả là chính xác hơn khoảng 8% trên chỉ số 1% hàng đầu so với tùy chọn tốt nhất tiếp theo ở kích thước đó. Trong một thử nghiệm không chính thức mà Unsloth nêu bật, quant đó đã tạo ra một chương trình HTML đang hoạt động với một lỗi JavaScript nhỏ duy nhất - kết quả mà các thế hệ quant có kích thước tương tự trước đó sẽ bị hỏng hoàn toàn.

Ở mức cực thấp, định lượng UD-IQ1_S nén mô hình thành 6,2 GB — nhỏ hơn 89% so với ban đầu — trong khi vẫn giữ được khoảng 72% độ chính xác của top 1%. Unsloth cũng đã loại bỏ mô-đun dự đoán nhiều mã thông báo khỏi các lượng nhỏ hơn dưới 8,37 GB để tiết kiệm khoảng 500 MB dung lượng ổ đĩa, với mô-đun này có sẵn riêng cho người dùng muốn.

Một tiêu chuẩn khó hơn, không chỉ là một tiêu chuẩn thân thiện hơn

Có lẽ phần quan trọng hơn của thông báo là phương pháp luận. Unsloth lập luận rằng độ chính xác cao nhất 1% - về cơ bản là phép thử argmax dự đoán đơn - không phải là thước đo hiệu quả về chất lượng suy luận thực. Để chống lại việc trang bị quá mức điểm chuẩn, nhóm đã xây dựng Divergence-300 @32: một tập dữ liệu có sẵn gồm 300 ví dụ được lấy từ Terminal-Bench 2.1, DeepSWE, Harbor, MathArena 2025-26 và các lời nhắc tài liệu dài không phải tiếng Latinh, không có lời nhắc nào trong số đó xuất hiện trong dữ liệu hiệu chuẩn.

Số liệu này chạy giải mã tham lam cho 32 mã thông báo và đo lường mức độ khớp quỹ đạo đầu ra của mỗi lượng tử với mô hình BF16 ban đầu — quỹ đạo gần hơn có nghĩa là lượng tử hoạt động giống như mô hình đầy đủ trong quá trình tạo nhiều mã thông báo, không chỉ trên các dự đoán đơn lẻ. Điểm chuẩn phân kỳ KL chạy trên tất cả các nhà cung cấp cho thấy định lượng UD-3 của Unsloth đạt được độ chính xác cao hơn tới 10% trong top 1% ở không gian đĩa bằng nhau, với mức tăng lớn nhất trên kích thước nhỏ hơn.

Nhóm cũng đã xuất bản một phân tích quá phù hợp so sánh các lượng tử mới với các bản phát hành Dynamic 2.0 cũ hơn trên WikiText và mã chưa được xem, đồng thời cho biết họ sẽ tiếp tục lặp lại trên các kích thước lượng tử lớn hơn với mức tăng khiêm tốn hơn.

Theo dõi hồ sơ và cảnh báo

Unsloth đã giành được sự tín nhiệm trong cộng đồng mô hình địa phương thông qua sự cộng tác trực tiếp với các nhà cung cấp mô hình — nhóm liệt kê các bản sửa lỗi được đóng góp cho Qwen3, Llama 4 của Meta, Devstral của Mistral, dòng Gemma của Google và các mô hình Phi của Microsoft, công việc trước đây đã giải quyết các lỗi về độ chính xác trong các trọng số mới được phát hành.

Áp dụng cảnh báo thông thường: đây là các điểm chuẩn do nhà cung cấp thực hiện và các bộ lượng tử hóa đối thủ đo lường khác nhau. Tuy nhiên, việc phát hành các tệp hiệu chuẩn, các bộ đánh giá được lưu trữ sẵn và dữ liệu phân kỳ theo lượng khiến việc xác minh độc lập trở nên dễ dàng một cách bất thường — và tính minh bạch đó chính xác là điều đã giữ dự án ở vị trí trung tâm của hệ sinh thái LLM địa phương khi nó mở rộng theo hướng sử dụng phổ biến.

Đối với các nhà phát triển chạy Qwen3.8 hoặc bất kỳ mô hình trọng lượng mở biên giới nào trên phần cứng cục bộ, bản phát hành Dynamic 3.0 nâng cao hiệu quả nền tảng cho những gì mô hình lượng tử hóa có thể làm — và gây áp lực lên mọi nhà cung cấp lượng tử hóa khác để xuất bản mức độ nghiêm ngặt tương tự.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →