Unsloth, команда з відкритим кодом, яка розробляє деякі з найпоширеніших інструментів для локального запуску та тонкого налаштування великих мовних моделей, випустила Dynamic 3.0, третє покоління методу квантування для файлів моделей GGUF. Першими моделями, які постачатимуться за новою схемою, є Quants Qwen3.8-27B, і Unsloth стверджує, що вони забезпечують більш ніж на 10 відсотків кращу точність на 1 відсоток при тому самому розмірі файлу порівняно з будь-яким іншим постачальником квантування.
Реліз швидко потрапив на першу сторінку Hacker News, де місцеві ентузіасти моделей аналізували таблиці тестів. Він з’явився на тлі надзвичайної тяги для проекту: Unsloth каже, що його квантування Qwen3.8 було завантажено понад 5,1 мільйона разів протягом п’яти днів після випуску моделі. For more context on this story, see our ongoing latest AI developments.
Чому якість квантування має значення
Квантування зменшує розмір файлу моделі, зберігаючи його ваги з нижчою точністю, що дає змогу запускати великі моделі на споживчих графічних процесорах і ноутбуках. Компромісом завжди була точність: жорстке квантування погіршує результати таким чином, що випадкові тести можуть пропустити. Для зростаючої спільноти, яка запускає моделі локально — від розробників, що тестують робочі процеси агентів, до користувачів у регіонах із дорогим доступом до хмарного API — кількісна якість ефективно визначає, які моделі взагалі можна використовувати.
Dynamic 3.0 — це відповідь Unsloth на цей компроміс. Згідно з документацією команди, новий випуск «зберігає кращу якість моделі, зберігаючи той самий розмір, з кращими результатами за такими показниками, як Divergence-300 @32 і KL Divergence».
Що змінилося у версії 3.0
Оновлення методології є більш детальними, ніж трюками. Unsloth каже, що тепер він використовує набагато якісніший калібрувальний набір даних матриці важливості, отриманий із різних джерел, явно вдосконалений для агентського кодування, чату та багатомовної продуктивності. Вибір шару — визначення того, які частини моделі стискаються найсильніше — було покращено, а для збереження якості введено додаткові методи квантування.
Примітно, що команда підкреслює, що все виконується через квантування після навчання: без навчання з урахуванням квантування та без дистиляції з урахуванням квантування. Сам набір калібрувальних даних не навчається, а файл imatrix оприлюднюється для всіх, щоб спільнота могла відтворити роботу або створювати точні налаштування на її основі.
Конкретні кількісні рівні показують практичний вплив. Показник UD-Q2_K_XL із розміром 9,83 ГБ описується як приблизно на 8 відсотків точніший за першим 1 відсотком показника, ніж наступний найкращий варіант із таким розміром. В одному неофіційному тесті Unsloth підкреслює, що квант створив робочу HTML-програму з єдиною невеликою помилкою JavaScript — результат, який попередні покоління квантів подібного розміру повністю зламали б.
У найнижчому діапазоні кількісне значення UD-IQ1_S стискає модель до 6,2 ГБ — на 89 відсотків менше, ніж у оригіналу — зберігаючи приблизно 72 відсотки від 1-го відсотка точності. Unsloth також видалив модуль прогнозування кількох токенів із менших обсягів до 8,37 ГБ, щоб заощадити приблизно 500 МБ дискового простору, причому модуль доступний окремо для користувачів, які цього бажають.
Складніший тест, а не просто зручніший
Можливо, більш значуща частина оголошення — методологічна. Unsloth стверджує, що максимальна точність у 1 відсоток — по суті тест argmax з одним прогнозом — не є ефективним показником якості справжнього висновку. Щоб протистояти переобладнанню контрольного тесту, команда створила Divergence-300 @32: збережений набір даних із 300 прикладів, взятих із Terminal-Bench 2.1, DeepSWE, Harbor, MathArena 2025-26, і нелатинських підказок у довгих документах, жоден із яких не відображається в даних калібрування.
Метрика запускає жадібне декодування для 32 токенів і вимірює, наскільки близько вихідна траєкторія кожного кванта збігається з оригінальною моделлю BF16 — ближчі траєкторії означають, що квант поводиться як повна модель при генерації кількох токенів, а не лише на окремих прогнозах. Контрольні показники розбіжності KL, які проводяться в усіх постачальників, показують, що кількісні показники Unsloth UD-3 отримують до 10 відсотків додаткової точності до 1 відсотка за рівного дискового простору, з найбільшим приростом на менших розмірах.
Команда також опублікувала аналіз переобладнання, у якому порівнює нові кванти зі своїми старими версіями Dynamic 2.0 на невідомому WikiText і коді, і каже, що продовжуватиме ітерацію на більших розмірах квантів, де переваги були скромнішими.
Послужний список і застереження
Unsloth заслужив довіру в місцевій спільноті моделей завдяки прямій співпраці з постачальниками моделей — команда перераховує виправлення, внесені до Qwen3, Llama 4 від Meta, Devstral від Mistral, серії Gemma від Google і моделей Phi від Microsoft, роботи, яка історично вирішувала помилки точності в нещодавно випущених вагових коефіцієнтах.
Застосовується звичайне застереження: це контрольні тести постачальників, а квантизатори конкурентів вимірюють по-різному. Але випуск калібрувальних файлів, наборів затриманих оцінок і даних про кількісну розбіжність робить незалежну перевірку надзвичайно легкою — і саме ця прозорість утримує проект у центрі місцевої екосистеми LLM, оскільки він масштабується до масового використання.
Для розробників, які використовують Qwen3.8 або будь-яку передову відкриту модель на локальному апаратному забезпеченні, випуск Dynamic 3.0 ефективно підвищує рівень можливостей квантованої моделі — і змушує всіх інших постачальників квантування публікувати таку ж суворість.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →