Unsloth, команда открытого исходного кода, создающая некоторые из наиболее широко используемых инструментов для локального запуска и тонкой настройки больших языковых моделей, выпустила Dynamic 3.0, третье поколение своего метода квантования для файлов моделей GGUF. Первыми моделями, которые будут поставляться по новой схеме, являются кванты Qwen3.8-27B, и Unsloth утверждает, что они обеспечивают более чем на 10 процентов лучшую точность в топ-1 проценте при том же размере файла по сравнению с любым другим поставщиком квантования.
Релиз быстро попал на первую полосу Hacker News, где энтузиасты местных моделей анализировали контрольные диаграммы. Он появился на фоне невероятной популярности проекта: Unsloth сообщает, что его квантования Qwen3.8 были загружены более 5,1 миллиона раз за пять дней после выпуска модели. Подробнее об этой истории — в нашем тенденции ИИ.
Почему качество квантования имеет значение
Квантование уменьшает размер файла модели, сохраняя ее веса с более низкой точностью, что позволяет запускать большие модели на потребительских графических процессорах и ноутбуках. Компромиссом всегда была точность: жесткое квантование ухудшает результаты настолько, что случайные тесты могут его не заметить. Для растущего сообщества, использующего модели локально — от разработчиков, тестирующих рабочие процессы агентов, до пользователей в регионах с дорогим доступом к облачным API — качество количественного анализа фактически определяет, какие модели вообще можно использовать.
Dynamic 3.0 — это ответ Unsloth на этот компромисс. Согласно документации команды, новая версия «сохраняет большее качество модели при том же размере и дает более высокие результаты по таким показателям, как Divergence-300 @32 и KL Divergence».
Что изменилось в версии 3.0
Обновления методологии являются скорее детальными, чем бесполезными. Unsloth заявляет, что теперь использует гораздо более качественный набор калибровочных данных матрицы важности, взятый из различных источников и специально усовершенствованный для агентского кодирования, чата и многоязычной работы. Выбор слоев — принятие решения о том, какие части модели сжимаются сильнее всего — был улучшен, а для сохранения качества были введены дополнительные методы квантования.
Примечательно, что команда подчеркивает, что все делается посредством квантования после обучения: без обучения с учетом квантования и без дистилляции с учетом квантования. Сам набор калибровочных данных не обучается, а файл imatrix публикуется публично, чтобы сообщество могло воспроизвести работу или выполнить на его основе точную настройку.
Конкретные количественные уровни демонстрируют практическое воздействие. Квант UD-Q2_K_XL объемом 9,83 ГБ описывается как примерно на 8 процентов более точный по показателю «верхний 1 процент», чем следующий лучший вариант такого размера. В одном неофициальном тесте, как подчеркивает Unsloth, этот квант создал работающую HTML-программу с единственной небольшой ошибкой JavaScript — выходные данные, которые предыдущие поколения квантов такого же размера были бы полностью нарушены.
На крайне низком уровне квант UD-IQ1_S сжимает модель до 6,2 ГБ — на 89 процентов меньше, чем оригинал — сохраняя при этом около 72 процентов точности верхнего 1 процента. Unsloth также удалила модуль прогнозирования нескольких токенов из небольших квантов размером менее 8,37 ГБ, чтобы сэкономить примерно 500 МБ дискового пространства, при этом модуль доступен отдельно для пользователей, которым он нужен.
Более сложный тест, а не просто более дружелюбный
Возможно, наиболее важная часть заявления носит методологический характер. Анслот утверждает, что точность в один процент — по сути, тест argmax с одним прогнозом — не является эффективным показателем реального качества вывода. Чтобы противостоять переоснащению тестов, команда создала Divergence-300 @32: набор данных из 300 примеров, взятых из Terminal-Bench 2.1, DeepSWE, Harbour, MathArena 2025-26 и подсказок длинных документов, написанных не на латинице, ни один из которых не появляется в данных калибровки.
Метрика запускает жадное декодирование для 32 токенов и измеряет, насколько близко выходная траектория каждого кванта соответствует исходной модели BF16 — более близкие траектории означают, что квант ведет себя как полная модель при генерации нескольких токенов, а не только при отдельных прогнозах. Тесты дивергенции KL, проведенные среди всех поставщиков, показывают, что кванты Unsloth UD-3 получают до 10 процентов дополнительной точности в один процент при одинаковом дисковом пространстве, при этом наибольший прирост достигается при меньших размерах.
Команда также опубликовала анализ переоснащения, сравнивая новые кванты со старыми версиями Dynamic 2.0 для невидимого WikiText и кода, и заявила, что продолжит итерации для квантов большего размера, где выигрыш был более скромным.
Послужной список и предостережения
Unsloth заслужила доверие в сообществе местных моделей благодаря прямому сотрудничеству с поставщиками моделей — команда перечисляет исправления, внесенные в модели Qwen3, Llama 4 от Meta, Devstral от Mistral, серию Gemma от Google и модели Phi от Microsoft — работы, которые исторически устраняли ошибки точности в недавно выпущенных весах.
Применяется обычное предостережение: это тесты, проводимые поставщиками, а конкурирующие квантователи измеряют по-другому. Но выпуск калибровочных файлов, закрытых наборов оценок и данных о поквантовых расхождениях делает независимую проверку необычайно простой — и именно эта прозрачность удерживает проект в центре местной экосистемы LLM по мере его масштабирования в сторону массового использования.
Для разработчиков, использующих Qwen3.8 или любую передовую модель с открытым весом на локальном оборудовании, выпуск Dynamic 3.0 эффективно поднимает планку возможностей квантовой модели — и заставляет всех остальных поставщиков квантования публиковать такую же строгость.
---
Будьте в курсе ИИПоследние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.
Читать больше новостей об ИИ →