Tencent ได้เปิดตัวและแสดงตัวอย่าง Hy4 แบบโอเพ่นซอร์ส ซึ่งเป็นโมเดลภาษาขนาดใหญ่เรือธงตัวใหม่จากทีมงาน Hunyuan ที่บริษัทกำลังวางตำแหน่งอยู่ที่ชายแดนโอเพ่นซอร์ส น้ำหนักดังกล่าวลงสู่ Hugging Face, ModelScope, GitCode และ CNB เมื่อวันที่ 28 สิงหาคม ภายใต้ใบอนุญาต Apache 2.0 ที่ได้รับอนุญาต ควบคู่ไปกับตัวแปร FP8-quantized เพื่อการอนุมานที่ถูกกว่า

การเปิดตัวครั้งนี้ทำให้การแข่งขันรุนแรงขึ้นระหว่างห้องปฏิบัติการของจีนที่จัดส่งโมเดล open-weight frontier ซึ่งปัจจุบันครอบคลุมซีรีส์ GLM ของ Z.AI และโมเดล Kimi ของ Moonshot AI Bloomberg รายงานว่า Tencent อ้างว่าโมเดลใหม่นี้มีประสิทธิภาพเหนือกว่าคู่แข่งทั้งสองในการทดสอบภายใน ซึ่งเป็นข้อกล่าวอ้างที่สมควรได้รับการตรวจสอบอย่างละเอียด เช่นเดียวกับการประเมินที่ดำเนินการโดยผู้ขายทั้งหมด For more context on this story, see our ongoing AI industry coverage.

หมายเลขพาดหัว

การแสดงตัวอย่าง Hy4 เป็นโมเดล Mixture-of-Experts (MoE) ที่มีพารามิเตอร์ทั้งหมด 770 พันล้านพารามิเตอร์ โดยในจำนวนนี้มีการเปิดใช้งาน 49 พันล้านรายการต่อโทเค็น ตามการ์ดโมเดลอย่างเป็นทางการที่เผยแพร่บนพื้นที่เก็บข้อมูล Tencent-Hunyuan GitHub แกนหลักมี 78 เลเยอร์ ผู้เชี่ยวชาญที่กำหนดเส้นทาง 256 รายและผู้เชี่ยวชาญที่ใช้ร่วมกันหนึ่งราย และเปิดใช้งานผู้เชี่ยวชาญที่กำหนดเส้นทางสูงสุด 8 รายสำหรับทุกโทเค็น เลเยอร์การคาดการณ์หลายโทเค็น (MTP) ดั้งเดิม — พารามิเตอร์ทั้งหมด 10 พันล้านพารามิเตอร์ เปิดใช้งาน 0.7 พันล้าน — ถูกสร้างขึ้นเพื่อการถอดรหัสแบบเก็งกำไร

หน้าต่างบริบทเป็นข้อกำหนดเฉพาะอื่นๆ ของ Marquee: 1 ล้านโทเค็น ความยาวที่ช่วยให้โมเดลประมวลผลโค้ดเบสทั้งหมด เอกสารทางกฎหมายขนาดยาว หรือบันทึกการประชุมที่มีความยาวหนึ่งชั่วโมงได้ในครั้งเดียว

สถาปัตยกรรมที่ยืมมาจากคู่แข่ง — และสร้างขึ้นเหนือสิ่งอื่นใด

ในระดับน้ำใสใจจริงที่ไม่ธรรมดาสำหรับการเปิดตัวเรือธง เอกสารของ Tencent ระบุว่าโมดูลความสนใจได้รับ "แรงบันดาลใจจาก DeepSeek และ GLM" การแสดงตัวอย่าง Hy4 ใช้ Gated DeepSeek Sparse Attention (Gated DSA) ร่วมกับ IndexCache สำหรับการนำดัชนีแบบกระจายข้ามเลเยอร์มาใช้ซ้ำ ในขณะที่เส้นทางที่เหลือใช้เอกลักษณ์ Hyper-Connections (iHC) เพื่อขยายการไหลของข้อมูลระหว่างเลเยอร์

การเปิดกว้างมีความสำคัญสำหรับนักพัฒนาในการประเมินโมเดล: ความสนใจที่เบาบางคือสิ่งที่ทำให้บริบทโทเค็น 1M สามารถให้บริการได้ในเชิงเศรษฐกิจ เนื่องจากการเอาใจใส่อย่างไร้เดียงสาอย่างเต็มที่ในช่วงระยะเวลานั้นจึงมีราคาแพงมาก ทั้ง DeepSeek และ Z.AI ได้จัดส่งดีไซน์นี้ในรูปแบบต่างๆ ในรุ่นเรือธงของตัวเอง

สร้างขึ้นเพื่อประสิทธิภาพการทำงาน ปรับแต่งโดยผู้เชี่ยวชาญภายในองค์กร

Tencent กล่าวว่าได้ร่วมมือกับผู้เชี่ยวชาญภายในบริษัท เช่น วิศวกรซอฟต์แวร์ นักพัฒนาเกม นักวิเคราะห์การเงิน และผู้เชี่ยวชาญด้านความปลอดภัย และสร้างข้อมูลการฝึกอบรมเกี่ยวกับงานที่พวกเขาจัดส่งจริง การ์ดโมเดลจะเน้นประเด็นสำคัญสี่ส่วน:

  • วิศวกรรมซอฟต์แวร์: ปรับปรุงการวางแผน การแก้จุดบกพร่อง และการตรวจสอบงานการพัฒนาในขอบเขตที่ยาวนาน รวมถึงได้รับ "รสนิยมทางการมองเห็น" ส่วนหน้า
  • สำนักงานและการวิเคราะห์: แปลงบริบทหลายไฟล์ที่ยุ่งเหยิงให้เป็นเอกสาร สเปรดชีต และงานนำเสนอที่แชร์ได้ พร้อมการจัดการสมการและแบบจำลองทางการเงินที่แข็งแกร่งยิ่งขึ้น
  • การพัฒนาเกม: สร้างต้นแบบที่สามารถเล่นได้จากการแจ้งเพียงครั้งเดียว และทำงานอย่างคล่องแคล่วกับเอ็นจิ้นเกมในเทิร์นการปรับแต่งหลายเทิร์น
  • การวิจัยทางวิทยาศาสตร์: อ้างความคืบหน้าในการวิจัย AI พลศาสตร์โมเลกุล ฟิสิกส์สสารควบแน่น และปัญหาทางคณิตศาสตร์ล้วนๆ

Tencent ยังกล่าวอีกว่าการแสดงตัวอย่าง Hy4 ได้รับการออกแบบร่วมกับผลิตภัณฑ์ของตัวเอง CodeBuddy และ WorkBuddy เพื่อให้แบบจำลองดังกล่าวได้รับการแปลเป็นการปรับปรุงผลิตภัณฑ์

สิ่งที่แสดงให้เห็นเกณฑ์มาตรฐานของ Tencent

การเปรียบเทียบที่เป็นรูปธรรมมากที่สุดในวัสดุสำหรับการเปิดตัวคือการประเมินแบบ Blind-by-side ที่ Tencent ดำเนินการร่วมกับผู้เชี่ยวชาญภายใน 163 คน ให้คะแนนผลลัพธ์ในงานวิศวกรรม 203 งาน ในการทดสอบเหล่านั้น การแสดงตัวอย่าง Hy4 ได้คะแนนเฉลี่ย 2.99 เล็กน้อย เหนือกว่า GLM 5.3 ที่ได้ 2.92 เปอร์เซ็นต์ (ชนะ 46.8 เปอร์เซ็นต์, เสมอกัน 12.8 เปอร์เซ็นต์, แพ้ 40.4 เปอร์เซ็นต์) และ Kimi K3 ได้ 2.94 เปอร์เซ็นต์ (ชนะ 51.2 เปอร์เซ็นต์, เสมอ 7.9 เปอร์เซ็นต์, แพ้ 40.9 เปอร์เซ็นต์)

มีคำเตือนสองประการที่ควรค่าแก่การระบุอย่างชัดเจน ประการแรก นี่เป็นการประเมินภายในของ Tencent ไม่ใช่เกณฑ์มาตรฐานอิสระ บริษัทยังไม่ได้เผยแพร่ผลการตรวจสอบครั้งที่สามบนกระดานผู้นำสาธารณะ ประการที่สอง อัตรากำไรขั้นต้นนั้นแคบ — ช่องว่าง 0.05 ถึง 0.07 จุดในระดับการให้คะแนนผู้เชี่ยวชาญแบบอัตนัยนั้นอยู่ในช่วงที่กลุ่มการให้คะแนนที่แตกต่างกันสามารถพลิกกลับได้อย่างง่ายดาย

การตรวจสอบที่เป็นอิสระจะมาจากการรวมกลุ่มสาธารณะในขณะที่ชุมชนดำเนินการโมเดลผ่านชุดการเข้ารหัส การใช้เหตุผล และตัวแทนที่เป็นมาตรฐานในอีกไม่กี่สัปดาห์ข้างหน้า

จัดส่งก่อนกำหนดพร้อมข้อบกพร่องที่ทราบ

Tencent ชัดเจนว่านี่คือการแสดงตัวอย่าง การ์ดโมเดลแสดงรายการข้อจำกัดที่ทราบ รวมถึงการใช้เวลานานเกินความจำเป็นในการให้เหตุผลผ่านงานที่ซับซ้อน และแนวโน้มที่จะตรวจสอบงานของตัวเองมากเกินไป ทีมงานกล่าวว่าจะ "จัดส่งก่อนเวลาและรับฟังว่ามีอะไรผิดปกติ" โดยอ้างถึงแนวทางที่ปรับปรุงรุ่น Hy3

สำหรับการปรับใช้ ตุ้มน้ำหนักมีทั้งแบบ BF16 และ FP8 พร้อมรองรับวันแรกใน vLLM และ SGLang Tencent เผยแพร่อิมเมจ Docker ที่สร้างไว้ล่วงหน้าสำหรับทั้งคู่ พร้อมสูตรที่แนะนำเทนเซอร์แบบขนานใน 8 GPU และการถอดรหัสแบบเก็งกำไรที่ใช้ MTP สำหรับการให้บริการที่ไวต่อความหน่วง ไปป์ไลน์การปรับแต่งอย่างละเอียดและชุดเครื่องมือการวัดปริมาณ AngelSlim จะจัดส่งไปพร้อมกับโมเดล

ทำไมมันถึงสำคัญ

การแข่งขัน open-weight ในประเทศจีนกลายเป็นสงครามสองแนวหน้าระหว่างซีรีส์ GLM ของ Z.AI และโมเดล Kimi ของ Moonshot โดยมี DeepSeek, Qwen และตอนนี้ Hunyuan ที่ใหญ่กว่ามากเข้ามาอัดแน่นอยู่ในสนาม การผสมผสานระหว่างการให้สิทธิ์ใช้งาน Apache 2.0 ในตัวอย่าง Hy4 ขนาดพารามิเตอร์ 770B และบริบทโทเค็น 1M ยกระดับเพดานของสิ่งที่ใครๆ ก็สามารถดาวน์โหลดและโฮสต์เองได้ และการรองรับ vLLM และ SGLang วันแรกจะลดอุปสรรคในการรันจริง

สำหรับองค์กรที่ชั่งน้ำหนักโมเดลแบบเปิดเทียบกับ API แบบปิดของตะวันตก คำถามเชิงปฏิบัติไม่ใช่อีกต่อไปว่าโมเดลแบบเปิดสามารถจับคู่กับประสิทธิภาพแบบปิดบนกระดาษได้หรือไม่ แต่ถามว่าเครื่องมือโดยรอบ เช่น การหาปริมาณ การให้บริการ และการปรับแต่งอย่างละเอียด มีความสมบูรณ์เพียงพอหรือไม่ Tencent กำลังเดิมพันว่าการจัดส่งทั้งหมดในครั้งเดียวภายใต้ใบอนุญาตที่อนุญาตคือวิธีที่ Hunyuan กลับเข้าสู่การสนทนา

การอ้างเกณฑ์มาตรฐานภายในที่อยู่ภายใต้การทดสอบอิสระจะกำหนดว่าการแสดงตัวอย่าง Hy4 ได้รับการจดจำว่าเป็นรุ่นโอเพ่นซอร์สระดับแนวหน้าของแท้หรือเกณฑ์มาตรฐานของผู้จำหน่ายรายอื่นในพื้นที่ที่มีผู้คนหนาแน่น ขณะนี้น้ำหนักเปิดเผยต่อสาธารณะแล้ว ดังนั้นคำตัดสินของชุมชนจึงไม่ควรใช้เวลานาน

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →