Z.ai บริษัทปัญญาประดิษฐ์ในปักกิ่งหรือที่รู้จักในชื่อ Zhipu ได้เปิดตัว GLM-5.3 ซึ่งเป็นรุ่นเรือธงรุ่นใหม่ที่บริษัทกล่าวว่าเป็นระบบเปิดน้ำหนักที่มีความสามารถมากที่สุดสำหรับวิศวกรรมซอฟต์แวร์ และเป็นสิ่งหนึ่งที่พัฒนาทักษะความปลอดภัยทางไซเบอร์ที่น่าเกรงขามอย่างไม่คาดคิด ประกาศเมื่อวันที่ 14 สิงหาคมและมีรายละเอียดในบล็อกโพสต์ของบริษัท GLM-5.3 สร้างขึ้นจากโมเดลพื้นฐานประมาณ 700 พันล้านพารามิเตอร์แบบเดียวกับ GLM-5.2 รุ่นก่อน ซึ่งเปิดตัวในเดือนมิถุนายน บริษัทกล่าวว่าการปรับปรุงทุกอย่างมาจากการหลังการฝึกอบรมมากกว่ารากฐานที่ใหญ่ขึ้น การเปิดตัวครั้งนี้เป็นกระแสล่าสุดของโมเดล open-weight ของจีนที่มีจุดมุ่งหมายเพื่อเอาชนะระบบปิดจาก Anthropic และ OpenAI สำหรับเครื่องมือติดตามโมเดล AI Buzz Wire GLM-5.3 ถือเป็นสัญญาณที่ชัดเจนว่าพรมแดนแบบเปิดกำลังปิดช่องว่างการเขียนโค้ดเร็วกว่าที่หลายๆ คนคาดไว้
กำไรที่สร้างขึ้นทั้งหมดจากการฝึกอบรมหลังการฝึกอบรม
Z.ai ตรงไปตรงมาเกี่ยวกับแนวทางของตนกับ GLM-5.3: "สิ่งที่เราทำคือการปรับขยายหลังการฝึกอบรม" บริษัทได้ดำเนินการชุดการเรียนรู้แบบเสริมกำลังที่เปิดตัวใน GLM-5.2 ซึ่งรวมถึง IndexShare สำหรับการประมวลผลบริบทแบบยาวที่มีประสิทธิภาพ SAO สำหรับการเรียนรู้แบบเสริมกำลังในงานขอบฟ้าระยะไกล และเฟรมเวิร์กโอเพ่นซอร์สที่เรียกว่าสไลม์สำหรับการฝึกอบรมแบบอะซิงโครนัสขนาดใหญ่ ในช่วงเดือนที่ผ่านมา มีการเทสภาพแวดล้อมมากขึ้น งานที่หลากหลายมากขึ้น และประมวลผลลงในสแต็กนั้นมากขึ้น
ผลตอบแทนจะแสดงตามเกณฑ์มาตรฐานการเข้ารหัส บน Terminal Bench 3.0 GLM-5.3 เพิ่มขึ้นจากคะแนน GLM-5.2 ที่ 4.6 เป็น 28.3 ซึ่งเพิ่มขึ้นมากกว่าหกเท่า โดยโพสต์ผลลัพธ์โอเพ่นซอร์สที่ล้ำสมัยบน Terminal Bench 3.0 และในการทดสอบล่าสุดของตัวแทน และปรับปรุงจาก 23.8 เป็น 28.5 ในการวัดความสามารถของเอเจนต์ ALE-CLI Z.ai รายงานการปรับปรุง 50% เมื่อเทียบกับ GLM-5.2 บน Z.ai Code Bench ในตัว ซึ่งเป็นเกณฑ์มาตรฐานส่วนตัวที่ออกแบบมาเพื่อประเมินเอเจนต์การเขียนโค้ดในสภาพแวดล้อมการพัฒนาที่สมจริง และลดความเสี่ยงของการปนเปื้อนจากชุดการทดสอบสาธารณะ
สิ่งสำคัญที่สุดคือการได้รับมาพร้อมกับประสิทธิภาพของโทเค็นที่ดีขึ้น ไม่ใช่แค่ผลลัพธ์ที่ดีขึ้นเท่านั้น ด้วยความพยายามระดับสูง GLM-5.3 บรรลุผลสำเร็จ 31.4% จากเกณฑ์มาตรฐานภายในองค์กร โดยมีโทเค็นเอาท์พุตประมาณ 50,000 รายการต่องาน ซึ่ง Z.ai กล่าวว่าเหนือกว่า Claude Opus 4.8 ของ Anthropic ที่ 29.5% ด้วยโทเค็น 120,000 รายการ GLM-5.3 ยังคงตามรอย Claude Fable 5 ที่ก้าวหน้ากว่าของ Anthropic ซึ่งเข้าถึง 39.5% ด้วยความพยายามสูงสุด
การก้าวกระโดดอย่างไม่คาดคิดในความสามารถทางไซเบอร์
ผลลัพธ์ที่โดดเด่นที่สุดจาก GLM-5.3 ไม่ได้อยู่ในการเขียนโค้ด แต่อยู่ที่ความปลอดภัย เนื่องจาก Z.ai ปรับขนาดหลังการฝึกอบรมและแนะนำข้อมูลและสภาพแวดล้อมการค้นพบช่องโหว่ลงในการผสมผสานการฝึกอบรม จึงคาดว่าแบบจำลองจะปรับปรุงในการค้นหาและการให้เหตุผลเกี่ยวกับข้อบกพร่อง สิ่งที่ทำให้ทีมประหลาดใจคือความสามารถนั้นพัฒนาได้เร็วแค่ไหน
GLM-5.3 ไม่เพียงแต่ตรวจจับจุดบกพร่องที่อยู่โดดเดี่ยวได้ดีขึ้นเท่านั้น มันเริ่มใช้เหตุผลในการแสวงหาผลประโยชน์หลายขั้นตอน ก่อให้เกิดแผนงานที่สอดคล้องกันสำหรับห่วงโซ่การโจมตีที่สมบูรณ์ บน CyberGym ซึ่งเป็นเกณฑ์มาตรฐานที่ทดสอบว่าโมเดลสามารถระบุและตรวจสอบช่องโหว่จากซอร์สโค้ดไวท์บ็อกซ์ได้หรือไม่ GLM-5.3 ได้คะแนน 84.5% เพิ่มขึ้นจาก GLM-5.2 ที่ 77.2% นั่นคือผลลัพธ์ที่ดีที่สุดในเกณฑ์มาตรฐาน เหนือกว่า Mythos 5 ที่ 83.8% และ GPT-5.6 Sol ที่ 83.6% ใน ExploitBench ซึ่งต้องการเหตุผลที่ลึกซึ้งยิ่งขึ้นเกี่ยวกับช่องโหว่ที่แท้จริงและการแสวงหาผลประโยชน์ GLM-5.3 เพิ่มคะแนนของ GLM-5.2 มากกว่าสองเท่า โดยอยู่ที่ 54.4% แม้ว่าจะยังตามหลัง Mythos 5 ที่ 78.0% และ GPT-5.6 Sol ที่ 76.5% ก็ตาม
Z.ai สังเกตรูปแบบที่สอดคล้องกัน: ยิ่งห่วงโซ่การแสวงหาประโยชน์มีเกณฑ์มาตรฐานสูงขึ้นเท่าใด กำไรจาก GLM-5.2 ก็จะยิ่งมากขึ้นเท่านั้น และช่องว่างที่เหลือไปยังพรมแดนปิดก็กว้างขึ้นด้วย “ความสามารถเติบโตเร็วที่สุดเท่าที่เราตามหลังมามาก” บริษัทตั้งข้อสังเกต
การค้นพบช่องโหว่ในโลกแห่งความเป็นจริง
ทักษะทางไซเบอร์ไม่ได้จำกัดอยู่เพียงเกณฑ์มาตรฐานเท่านั้น Z.ai รายงานว่าตั้งแต่ GLM-5.2 ได้ทำงานร่วมกับทีมรักษาความปลอดภัยหลายแห่งในประเทศจีนเพื่อทดสอบโมเดลกับโค้ดเบสในโลกแห่งความเป็นจริง หลังจากการตรวจสอบโดยผู้เชี่ยวชาญ การคัดกรอง และการขจัดข้อมูลซ้ำซ้อน โมเดลดังกล่าวระบุช่องโหว่ได้ 2,436 รายการใน 269 โปรเจ็กต์ รวมถึงปัญหาที่มีความรุนแรงปานกลางถึงสูง 1,097 รายการ การค้นพบนี้ครอบคลุมถึงเคอร์เนลของระบบ ระบบปฏิบัติการ เอ็นจิ้นเบราว์เซอร์ โครงสร้างพื้นฐานโอเพ่นซอร์ส เว็บแอปพลิเคชัน และโปรโตคอลเครือข่าย ซึ่งส่วนใหญ่ไม่มีใครสังเกตเห็นมานานหลายปีหรือหลายทศวรรษ โดยที่เก่าแก่ที่สุดมีอายุประมาณ 40 ปี
ผลลัพธ์เหล่านี้สะท้อนถึงการทำงานของ Anthropic ได้อธิบายไว้ในการวิจัยด้านความปลอดภัยแบบหลายเอเจนต์ของตนเอง โดยมีการใช้กลุ่มตัวแทนที่ประสานงานเพื่อค้นหาช่องโหว่ในซอฟต์แวร์โอเพ่นซอร์สในวงกว้าง
Open Weights — ด้วยความล่าช้า
Z.ai กล่าวว่าจะปล่อยตุ้มน้ำหนัก GLM-5.3 ภายในสองสัปดาห์ เมื่อการประเมินความปลอดภัยและการชุบแข็งเสร็จสมบูรณ์ ความล่าช้าโดยเจตนานั้นสะท้อนให้เห็นถึงความตึงเครียดที่เกิดขึ้นระหว่างการประกาศ: โมเดลที่พัฒนาขีดความสามารถทางไซเบอร์ที่น่ารังเกียจได้เร็วกว่าที่ผู้สร้างคาดการณ์ไว้คือระบบประเภทที่ทำให้เกิดคำถามเกี่ยวกับการปล่อยตัวอย่างรับผิดชอบ บริษัทเน้นย้ำว่าความสอดคล้องในการฝึกอบรมและการเปิดตัวได้รับการปรับปรุงให้มีความแม่นยำเชิงตัวเลขในระดับสูง และความยากในการปรับขนาดได้เปลี่ยนจากตัวแบบจำลองไปสู่การออกแบบสภาพแวดล้อมงานที่สมจริงและตรวจสอบได้
ภาพการแข่งขันก็ชัดเจน GLM-5.3 ลดระยะห่างจากขอบเขตปิดในด้านการเขียนโค้ดและงานเอเจนต์ ในขณะเดียวกันก็อ้างว่าเป็นผู้นำในเกณฑ์มาตรฐานการค้นพบช่องโหว่ที่สำคัญอย่างน้อยหนึ่งรายการ โดยเป็นโมเดล open-weight ซึ่งหมายความว่าเมื่อเปิดตัวแล้ว ตุ้มน้ำหนักจะพร้อมให้ทุกคนดาวน์โหลด ศึกษา และสร้างต่อได้ฟรี ไม่ว่าการเปิดกว้างดังกล่าวจะเร่งความคืบหน้าหรือทำให้เกิดข้อกังวลด้านความปลอดภัยครั้งใหม่หรือไม่ ก็คือข้อถกเถียง GLM-5.3 ทั้งหมดนี้รับประกันได้ว่าจะกลับมาลุกเป็นไฟอีกครั้ง
ก้าวนำหน้า AI
สำหรับการเปิดตัวโมเดล AI ล่าสุด การต่อสู้ของเกณฑ์มาตรฐาน และการวิเคราะห์อุตสาหกรรม โปรดบุ๊กมาร์ก AI Buzz Wire
อ่านข่าว AI เพิ่มเติม →