大規模な言語モデルをローカルで実行および微調整するために最も広く使用されているツールのいくつかを支援するオープンソース チームである Unsloth は、GGUF モデル ファイルの量子化方法の第 3 世代である Dynamic 3.0 をリリースしました。新しいスキームの下で出荷される最初のモデルは Qwen3.8-27B のクオンツであり、Unsloth は、他のすべての量子化プロバイダーと比較して、同じファイル サイズで上位 1 パーセントの精度が 10 パーセント以上優れていると主張しています。

このリリースはすぐに Hacker News のトップページに掲載され、地元モデルの愛好家がベンチマーク チャートを分析しました。このプロジェクトは注目に値する勢いで登場しました。Unsloth によれば、Qwen3.8 の量子化はモデルのリリース後 5 日間で 510 万回以上ダウンロードされました。 この件の詳細は、人工知能の最新情報をご覧ください。

量子化の品質が重要な理由

量子化により、モデルの重みを低精度で保存することでモデルのファイル サイズが縮小され、消費者向け GPU やラップトップで大規模なモデルを実行できるようになります。トレードオフは常に精度です。強引な量子化は、カジュアルなベンチマークでは見逃す可能性がある方法で出力を低下させます。エージェント ワークフローをテストする開発者から高価なクラウド API アクセスを利用する地域のユーザーに至るまで、モデルをローカルで実行する成長するコミュニティにとって、どのモデルが使用可能であるかは定量的な品質によって効果的に決まります。

Dynamic 3.0 は、そのトレードオフに対する Unsloth の答えです。チームのドキュメントによると、新しいリリースでは「同じサイズを維持しながらモデルの品質がさらに向上し、Divergence-300 @32 や KL Divergence などのメトリクス全体でより強力な結果が得られます。」

バージョン 3.0 での変更点

方法論のアップグレードは、複雑ではなく、きめ細かいものです。 Unsloth によれば、現在は、さまざまなソースから抽出され、エージェントティック コーディング、チャット、および多言語パフォーマンス向けに明示的に改良された、はるかに高品質な重要度マトリックス キャリブレーション データセットを使用しているとのことです。レイヤーの選択 (モデルのどの部分が最も強く圧縮されるかを決定する) が改善され、品質を維持するために追加の量子化技術が導入されました。

特に、チームはすべてがトレーニング後の量子化によって行われることを強調しています。量子化を意識したトレーニングや量子化を意識した蒸留はありません。キャリブレーション データセット自体はトレーニングされておらず、imatrix ファイルは公開されているため、コミュニティは作業を再現したり、その上に微調整を構築したりできます。

特定の数量階層は、実際的な影響を示します。 9.83 GB の UD-Q2_K_XL クオントは、そのサイズの次善のオプションよりも上位 1 パーセントのメトリクスで約 8 パーセント精度が高いと説明されています。 Unsloth が強調した非公式テストの 1 つでは、そのクオントは 1 つの小さな JavaScript バグを備えた正常に動作する HTML プログラムを生成しました。前世代の同様のサイズのクオントでは完全に壊れていたであろう出力です。

極度のローエンドでは、UD-IQ1_S クオントはモデルを 6.2 GB に圧縮します。これはオリジナルより 89 パーセント小さくなりますが、上位 1 パーセントの約 72 パーセントの精度を維持します。また、Unsloth は、約 500 MB のディスク領域を節約するために、8.37 GB 未満の小さなクオンツからマルチトークン予測モジュールを削除し、モジュールを必要とするユーザーが個別に利用できるようにしました。

単なるフレンドリーなベンチマークではなく、より厳しいベンチマーク

おそらく、この発表のより重要な部分は方法論的なものです。 Unsloth 氏は、上位 1% の精度 (基本的に単一予測の argmax テスト) は、実際の推論の品質を測る有効な尺度ではないと主張します。ベンチマークのオーバーフィッティングに対抗するために、チームは Divergence-300 @32 を構築しました。これは、 Terminal-Bench 2.1、DeepSWE、Harbor、MathArena 2025-26、および非ラテン語の長い文書プロンプトから抽出された 300 個のサンプルの保持データセットであり、いずれもキャリブレーション データには表示されません。

このメトリクスは、32 個のトークンに対して貪欲なデコーディングを実行し、各クオントの出力軌跡が元の BF16 モデルの出力軌跡とどの程度一致しているかを測定します。軌跡が近いということは、単一の予測だけでなく、複数のトークンの生成にわたってクオントが完全なモデルのように動作することを意味します。すべてのプロバイダーで実行された KL ダイバージェンス ベンチマークでは、Unsloth の UD-3 クオントが、等しいディスク容量で上位 1 パーセントの精度が最大 10 パーセント向上し、サイズが小さい場合に最大の向上が見られることが示されています。

同チームはまた、未確認のWikiTextとコードについて、新しいクオンツを古いDynamic 2.0リリースと比較した過剰適合分析を公開し、ゲインがより控えめだったより大きなクオンツサイズで反復を続けると述べている。

実績と注意点

Unsloth は、モデル ベンダーとの直接協力を通じて、ローカル モデル コミュニティでの信頼を獲得しています。チームは、Qwen3、Meta の Llama 4、Mistral の Devstral、Google の Gemma シリーズ、および Microsoft の Phi モデルに貢献した修正をリストしており、これらのモデルは、歴史的にリリースされたばかりの重みの精度バグを解決してきた成果です。

通常の注意事項が適用されます。これらはベンダーが実行するベンチマークであり、競合する量子化器の測定方法は異なります。しかし、キャリブレーション ファイル、保持されている評価セット、クォントごとの相違データのリリースにより、独立した検証が非常に簡単になります。そしてその透明性こそが、プロジェクトが主流の使用に向けて拡大する際に、ローカル LLM エコシステムの中心に位置し続ける理由なのです。

Qwen3.8 またはローカル ハードウェア上でフロンティアのオープンウェイト モデルを実行している開発者にとって、Dynamic 3.0 リリースは量子化モデルでできることの底値を効果的に引き上げ、他のすべての量子化プロバイダーに同じ厳密さを公開するよう圧力をかけます。

---

AIの最新情報をお届け

AIの最新ニュース、分析、ブレイクスルーを一箇所で。

AIニュースをもっと読む →