Unsloth ทีมโอเพ่นซอร์สที่อยู่เบื้องหลังเครื่องมือที่ใช้กันอย่างแพร่หลายที่สุดสำหรับการรันและปรับแต่งโมเดลภาษาขนาดใหญ่ในพื้นที่ ได้เปิดตัว Dynamic 3.0 ซึ่งเป็นเจเนอเรชันที่สามของวิธีการหาปริมาณสำหรับไฟล์โมเดล GGUF รุ่นแรกที่จัดส่งภายใต้โครงการใหม่คือ Qwen3.8-27B และ Unsloth อ้างว่าให้ความแม่นยำระดับบนสุด 1 เปอร์เซ็นต์ที่ดีกว่าถึง 10 เปอร์เซ็นต์ในขนาดไฟล์เดียวกัน เมื่อเทียบกับผู้ให้บริการการวัดปริมาณอื่นๆ ทุกราย
การเผยแพร่ดังกล่าวไปถึงหน้าแรกของ Hacker News อย่างรวดเร็ว ซึ่งผู้ที่ชื่นชอบโมเดลท้องถิ่นได้วิเคราะห์แผนภูมิมาตรฐาน มันมาถึงท่ามกลางแรงผลักดันที่โดดเด่นสำหรับโปรเจ็กต์นี้ Unsloth กล่าวว่าปริมาณการดาวน์โหลด Qwen3.8 ของมันมากกว่า 5.1 ล้านครั้งในห้าวันหลังจากการเปิดตัวโมเดล For more context on this story, see our ongoing breaking AI news.
เหตุใดคุณภาพเชิงปริมาณจึงมีความสำคัญ
การแบ่งปริมาณจะย่อขนาดไฟล์ของโมเดลโดยการจัดเก็บน้ำหนักของโมเดลด้วยความแม่นยำที่ต่ำกว่า ทำให้สามารถรันโมเดลขนาดใหญ่บน GPU และแล็ปท็อปสำหรับผู้บริโภคได้ การแลกเปลี่ยนมีความถูกต้องเสมอมา: การหาปริมาณแบบมือหนักทำให้เอาท์พุตด้อยคุณภาพในลักษณะที่เกณฑ์มาตรฐานทั่วไปอาจพลาดได้ สำหรับชุมชนที่กำลังเติบโตที่กำลังใช้งานโมเดลในพื้นที่ ตั้งแต่นักพัฒนาทดสอบเวิร์กโฟลว์ตัวแทนไปจนถึงผู้ใช้ในภูมิภาคที่มีสิทธิ์เข้าถึง Cloud API ที่มีราคาแพง คุณภาพเชิงปริมาณจะกำหนดได้อย่างมีประสิทธิภาพว่าโมเดลใดสามารถใช้งานได้เลย
Dynamic 3.0 คือคำตอบของ Unsloth สำหรับการแลกเปลี่ยนนั้น ตามเอกสารของทีม เวอร์ชันใหม่ "รักษาคุณภาพของโมเดลได้มากขึ้นในขณะที่ยังคงขนาดเท่าเดิม โดยให้ผลลัพธ์ที่ดีกว่าในเมตริกต่างๆ เช่น Divergence-300 @32 และ KL Divergence"
สิ่งที่เปลี่ยนแปลงไปในเวอร์ชัน 3.0
การอัพเกรดวิธีการนั้นละเอียดมากกว่าเป็นลูกเล่น Unsloth กล่าวว่าตอนนี้ใช้ชุดข้อมูลการสอบเทียบเมทริกซ์ความสำคัญคุณภาพสูงกว่ามากที่ดึงมาจากแหล่งที่มาที่หลากหลาย ซึ่งได้รับการปรับปรุงอย่างชัดเจนสำหรับการเข้ารหัสแบบตัวแทน การแชท และประสิทธิภาพหลายภาษา การเลือกเลเยอร์ — การตัดสินใจว่าส่วนใดของแบบจำลองจะถูกบีบยากที่สุด — ได้รับการปรับปรุง และมีการนำเทคนิคการหาปริมาณเพิ่มเติมมาใช้เพื่อรักษาคุณภาพ
ทีมงานเน้นย้ำว่าทุกสิ่งทุกอย่างเสร็จสิ้นผ่านการวัดปริมาณหลังการฝึกอบรม: ไม่มีการฝึกอบรมที่คำนึงถึงปริมาณ และไม่มีการกลั่นโดยคำนึงถึงปริมาณ ชุดข้อมูลการสอบเทียบไม่ได้รับการฝึกฝน และไฟล์ imatrix ได้รับการเผยแพร่สู่สาธารณะ เพื่อให้ชุมชนสามารถทำซ้ำงานหรือสร้างการปรับแต่งเพิ่มเติมได้
ระดับปริมาณที่เฉพาะเจาะจงแสดงให้เห็นผลกระทบในทางปฏิบัติ ปริมาณ UD-Q2_K_XL ที่ 9.83 GB ได้รับการอธิบายว่าแม่นยำกว่าประมาณ 8 เปอร์เซ็นต์ในเมตริก 1 เปอร์เซ็นต์แรกมากกว่าตัวเลือกที่ดีที่สุดรองลงมาในขนาดนั้น ในการทดสอบอย่างไม่เป็นทางการครั้งหนึ่ง Unsloth เน้นย้ำว่า quant ได้สร้างโปรแกรม HTML ที่ใช้งานได้โดยมีข้อผิดพลาด JavaScript เล็กๆ น้อยๆ เพียงจุดเดียว ซึ่งเป็นเอาต์พุตที่ quant ที่มีขนาดใกล้เคียงกันรุ่นก่อนๆ จะเสียหายทั้งหมด
ที่ระดับต่ำสุดสุด ปริมาณ UD-IQ1_S จะบีบโมเดลให้เหลือ 6.2 GB ซึ่งเล็กกว่ารุ่นดั้งเดิมถึง 89 เปอร์เซ็นต์ ในขณะที่ยังคงความแม่นยำระดับบนสุดประมาณ 72 เปอร์เซ็นต์ Unsloth ยังลบโมดูล multi-token-prediction ออกจากควอนตัมที่มีขนาดเล็กกว่า 8.37 GB เพื่อประหยัดพื้นที่ดิสก์ประมาณ 500 MB โดยโมดูลดังกล่าวมีจำหน่ายแยกต่างหากสำหรับผู้ใช้ที่ต้องการ
มาตรฐานที่ยากขึ้น ไม่ใช่แค่มาตรฐานที่เป็นมิตรมากขึ้น
บางทีส่วนที่เป็นผลสืบเนื่องมากกว่าของการประกาศอาจเป็นเรื่องระเบียบวิธี Unsloth ให้เหตุผลว่าความแม่นยำสูงสุด 1 เปอร์เซ็นต์ — โดยพื้นฐานแล้วเป็นการทดสอบ argmax แบบทำนายครั้งเดียว — ไม่ใช่มาตรวัดคุณภาพการอนุมานที่แท้จริงที่มีประสิทธิภาพ เพื่อตอบโต้การปรับเกณฑ์มาตรฐานมากเกินไป ทีมงานได้สร้าง Divergence-300 @32: ชุดข้อมูล 300 ตัวอย่างที่ดึงมาจาก Terminal-Bench 2.1, DeepSWE, Harbor, MathArena 2025-26 และข้อความแจ้งเอกสารขนาดยาวที่ไม่ใช่ภาษาละติน ซึ่งไม่มีข้อความแจ้งใดปรากฏในข้อมูลการสอบเทียบ
หน่วยเมตริกทำการถอดรหัสอย่างโลภสำหรับ 32 โทเค็น และวัดว่าวิถีเอาต์พุตของควอนตัมแต่ละตัวตรงกับโมเดล BF16 ดั้งเดิมมากน้อยเพียงใด — วิถีโคจรที่ใกล้กว่าหมายความว่าควอนตัมมีพฤติกรรมเหมือนกับโมเดลเต็มรูปแบบในการสร้างโทเค็นหลายรายการ ไม่ใช่แค่การคาดการณ์เพียงครั้งเดียว การวัดประสิทธิภาพความแตกต่างของ KL ดำเนินการกับผู้ให้บริการทุกราย แสดงให้เห็นว่าปริมาณ UD-3 ของ Unsloth ได้รับความแม่นยำสูงสุด 1 เปอร์เซ็นต์เพิ่มขึ้นสูงสุด 10 เปอร์เซ็นต์ที่พื้นที่ดิสก์เท่ากัน โดยมีขนาดเพิ่มขึ้นมากที่สุดในขนาดที่เล็กลง
ทีมงานยังได้เผยแพร่การวิเคราะห์ที่มากเกินไปโดยเปรียบเทียบปริมาณใหม่กับ Dynamic 2.0 รุ่นเก่าบน WikiText และโค้ดที่มองไม่เห็น และกล่าวว่าจะยังคงวนซ้ำในขนาดปริมาณที่มากขึ้นโดยที่กำไรจะน้อยกว่า
บันทึกการติดตามและคำเตือน
Unsloth ได้รับความน่าเชื่อถือในชุมชนโมเดลท้องถิ่นผ่านการทำงานร่วมกันโดยตรงกับผู้จำหน่ายโมเดล - ทีมงานแสดงรายการการแก้ไขที่มีส่วนสนับสนุนใน Qwen3, Llama 4 ของ Meta, Devstral ของ Mistral, ซีรีส์ Gemma ของ Google และโมเดล Phi ของ Microsoft ซึ่งเป็นผลงานที่ได้แก้ไขข้อผิดพลาดด้านความแม่นยำในอดีตในน้ำหนักที่ออกใหม่
มีข้อแม้ตามปกติ: สิ่งเหล่านี้เป็นการวัดประสิทธิภาพที่ดำเนินการโดยผู้ขาย และตัวควอนไทเซอร์ของคู่แข่งจะวัดผลต่างกัน แต่การเปิดตัวไฟล์การสอบเทียบ ชุดการประเมินที่จัดขึ้น และข้อมูลความแตกต่างต่อปริมาณทำให้การตรวจสอบอิสระเป็นเรื่องง่ายผิดปกติ และความโปร่งใสนั้นเป็นสิ่งที่ทำให้โครงการเป็นศูนย์กลางของระบบนิเวศ LLM ในท้องถิ่นเมื่อปรับขนาดไปสู่การใช้งานกระแสหลัก
สำหรับนักพัฒนาที่ใช้ Qwen3.8 หรือโมเดล open-weight ระดับแนวหน้าใดๆ บนฮาร์ดแวร์ในเครื่อง รุ่น Dynamic 3.0 จะช่วยยกระดับสิ่งที่โมเดลเชิงปริมาณสามารถทำได้อย่างมีประสิทธิผล และสร้างแรงกดดันให้กับผู้ให้บริการเชิงปริมาณรายอื่นๆ ทุกรายในการเผยแพร่ความเข้มงวดแบบเดียวกัน
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →