대규모 언어 모델을 로컬에서 실행하고 미세 조정하는 데 가장 널리 사용되는 도구를 제공하는 오픈 소스 팀인 Unsloth는 GGUF 모델 파일을 위한 3세대 양자화 방법인 Dynamic 3.0을 출시했습니다. 새로운 체계에 따라 출시되는 첫 번째 모델은 Qwen3.8-27B의 퀀트이며 Unsloth는 이 모델이 다른 모든 양자화 제공업체에 비해 동일한 파일 크기에서 상위 1% 정확도가 10% 이상 더 높다고 주장합니다.
이 릴리스는 현지 모델 애호가들이 벤치마크 차트를 분석한 Hacker News의 첫 페이지에 빠르게 게재되었습니다. Unsloth는 모델 출시 후 5일 동안 자사의 Qwen3.8 양자화가 510만 번 이상 다운로드되었다고 밝혔습니다. 이 이야기에 대한 자세한 내용은 인공지능 뉴스를 참조하세요.
양자화 품질이 중요한 이유
양자화는 가중치를 더 낮은 정밀도로 저장하여 모델의 파일 크기를 줄여 소비자 GPU 및 노트북에서 대규모 모델을 실행할 수 있게 해줍니다. 균형은 항상 정확성이었습니다. 가혹한 양자화는 일반 벤치마크가 놓칠 수 있는 방식으로 출력을 저하시킵니다. 에이전트 워크플로를 테스트하는 개발자부터 고가의 클라우드 API 액세스 권한이 있는 지역의 사용자에 이르기까지 로컬에서 모델을 실행하는 커뮤니티가 성장하고 있는 경우, 정량적 품질은 어떤 모델이 사용 가능한지 효과적으로 결정합니다.
Dynamic 3.0은 이러한 균형에 대한 Unsloth의 대답입니다. 팀의 문서에 따르면 새 릴리스는 "동일한 크기를 유지하면서 더 많은 모델 품질을 유지하며 Divergence-300 @32 및 KL Divergence와 같은 지표 전반에 걸쳐 더 강력한 결과를 제공합니다."
버전 3.0에서 변경된 사항
방법론 업그레이드는 눈에 띄기보다는 세분화되어 있습니다. Unsloth는 이제 에이전트 코딩, 채팅 및 다국어 성능을 위해 명시적으로 개선된 다양한 소스에서 가져온 훨씬 더 높은 품질의 중요도 매트릭스 교정 데이터 세트를 사용한다고 말합니다. 모델의 어느 부분이 가장 많이 압축되는지 결정하는 레이어 선택이 개선되었으며, 품질을 유지하기 위해 추가 양자화 기술이 도입되었습니다.
특히 팀은 모든 것이 훈련 후 양자화를 통해 수행된다는 점을 강조합니다. 양자화 인식 훈련이나 양자화 인식 증류가 없습니다. 교정 데이터 세트 자체는 교육을 받지 않았으며, imatrix 파일은 공개적으로 공개되어 커뮤니티가 작업을 재현하거나 그 위에 미세 조정을 구축할 수 있습니다.
특정 수량 계층은 실질적인 영향을 보여줍니다. 9.83GB의 UD-Q2_K_XL 수량은 해당 크기에서 차선책인 옵션보다 상위 1% 측정항목에서 약 8% 더 정확하다고 설명됩니다. Unsloth가 강조한 한 비공식 테스트에서 해당 퀀트는 하나의 작은 JavaScript 버그가 있는 작동하는 HTML 프로그램을 생성했습니다. 이전 세대의 비슷한 크기의 퀀트가 완전히 망가졌을 출력입니다.
가장 낮은 수준에서 UD-IQ1_S 퀀트는 모델을 원본보다 89% 작은 6.2GB로 압축하는 동시에 상위 1% 정확도의 약 72%를 유지합니다. Unsloth는 또한 약 500MB의 디스크 공간을 절약하기 위해 8.37GB 미만의 작은 수량에서 멀티 토큰 예측 모듈을 제거했으며, 원하는 사용자는 모듈을 별도로 사용할 수 있습니다.
단지 친숙한 벤치마크가 아닌 더 어려운 벤치마크
아마도 발표에서 더 중요한 부분은 방법론적인 부분일 것입니다. Unsloth는 상위 1%의 정확도(본질적으로 단일 예측 argmax 테스트)가 실제 추론 품질을 측정하는 효과적인 척도가 아니라고 주장합니다. 벤치마크 과적합에 대응하기 위해 팀은 Divergence-300 @32를 구축했습니다. Terminal-Bench 2.1, DeepSWE, Harbor, MathArena 2025-26 및 비라틴어 긴 문서 프롬프트에서 가져온 300개의 예제로 구성된 홀드아웃 데이터 세트는 교정 데이터에 나타나지 않습니다.
이 메트릭은 32개의 토큰에 대해 그리디 디코딩을 실행하고 각 퀀트의 출력 궤적이 원래 BF16 모델과 얼마나 밀접하게 일치하는지 측정합니다. 궤적이 더 가깝다는 것은 퀀트가 단일 예측뿐만 아니라 다중 토큰 생성에 대해 전체 모델처럼 동작한다는 것을 의미합니다. 모든 공급자에 걸쳐 실행되는 KL 다이버전스 벤치마크는 Unsloth의 UD-3 퀀트가 동일한 디스크 공간에서 최대 10%의 추가 상위 1% 정확도를 얻었으며 더 작은 크기에서 가장 큰 이득을 얻었음을 보여줍니다.
또한 팀은 보이지 않는 WikiText 및 코드에 대한 이전 Dynamic 2.0 릴리스와 새로운 퀀트를 비교하는 과적합 분석을 발표했으며, 이득이 더 적었던 더 큰 퀀트 크기에서 계속 반복할 것이라고 말했습니다.
실적 및 주의사항
Unsloth는 모델 공급업체와의 직접적인 협력을 통해 로컬 모델 커뮤니티에서 신뢰를 얻었습니다. 팀에는 Qwen3, Meta의 Llama 4, Mistral의 Devstral, Google의 Gemma 시리즈 및 Microsoft의 Phi 모델에 기여한 수정 사항이 나열되어 있으며, 역사적으로 새로 출시된 가중치의 정확도 버그를 해결한 작업입니다.
일반적인 주의 사항이 적용됩니다. 이는 공급업체가 실행하는 벤치마크이며 경쟁사 양자화기는 다르게 측정합니다. 그러나 교정 파일, 보류 평가 세트 및 정량별 발산 데이터의 출시로 인해 독립적인 검증이 매우 쉬워졌습니다. 그리고 이러한 투명성은 프로젝트가 주류 사용으로 확장됨에 따라 로컬 LLM 생태계의 중심에 유지되도록 했습니다.
로컬 하드웨어에서 Qwen3.8 또는 모든 최전선 개방형 모델을 실행하는 개발자의 경우 Dynamic 3.0 릴리스는 양자화 모델이 수행할 수 있는 작업의 기반을 효과적으로 높이고 다른 모든 양자화 공급자에게 동일한 엄격함을 게시하도록 압력을 가합니다.
---
AI 최신 소식최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.
AI 뉴스 더 보기 →