เกณฑ์มาตรฐานใหม่จากบริษัทรักษาความปลอดภัยแอปพลิเคชัน Semgrep ให้ผลลัพธ์ที่ไม่คาดคิด: โมเดลแบบเปิดจาก Zhipu AI ของจีนมีประสิทธิภาพเหนือกว่า Claude ของ Anthropic ในการค้นหาข้อบกพร่องด้านความปลอดภัยที่แท้จริงในซอฟต์แวร์ การค้นพบนี้เพิ่มเชื้อเพลิงให้กับการถกเถียงกันว่า AI ที่มีความสามารถมากที่สุดจำเป็นต้องมีราคาแพงที่สุดหรือถูกจำกัดมากที่สุด

ด้วยโมเดล Mythos อันทรงพลังของ Anthropic ที่ถูกล็อกอยู่เบื้องหลังการห้ามส่งออกของสหรัฐฯ ทีมรักษาความปลอดภัยที่กำลังมองหาทางเลือกที่เข้าถึงได้จึงหันมาใช้ตัวเลือกแบบ open-weight เช่น GLM 5.2 เพื่อความครอบคลุมของอุตสาหกรรม AI ล่าสุด การทดสอบของเซมเกรปซึ่งเผยแพร่เมื่อวันที่ 22 มิถุนายน ระบุว่าการล่าอาจให้ผลเร็วกว่าที่คาดไว้

สิ่งที่ Semgrep ทดสอบ

Semgrep ประเมินกลุ่มผลิตภัณฑ์รุ่น open-weight และรุ่น frontier บนเกณฑ์มาตรฐานการตรวจจับ IDOR ภายใน IDORs — การอ้างอิงวัตถุโดยตรงที่ไม่ปลอดภัย — เป็นข้อบกพร่องในการควบคุมการเข้าถึงที่อนุญาตให้ผู้ใช้รายหนึ่งเข้าถึงข้อมูลของผู้ใช้รายอื่น การวิเคราะห์แบบคงที่จับได้ยากอย่างฉาวโฉ่ เนื่องจากข้อบกพร่องนั้นมีเหตุผลมากกว่าเชิงวากยสัมพันธ์: รหัสมีความถูกต้องในทางเทคนิค เพียงแต่ขาดการตรวจสอบการอนุญาต

บริษัทได้ปรับปรุงขั้นตอนการทำงานเพื่อระบุช่องโหว่เหล่านี้โดยการรวมกลไกตามกฎเข้ากับการใช้เหตุผลของ AI เพื่อแยกประสิทธิภาพที่มาจากตัวโมเดลเทียบกับโครงที่อยู่รอบๆ นักวิจัยได้รันชุดของโมเดลน้ำหนักเปิดยอดนิยมโดยใช้สายรัดเพียงเล็กน้อย — การตั้งค่า Pydantic แบบง่ายๆ โดยใช้ IDOR prompt เดียวกันกับที่มอบให้กับทุกรุ่น โดยไม่มีการค้นพบจุดสิ้นสุด และไม่มีการนำทางแบบมีคำแนะนำ ข้อความแจ้งนี้นำเสนอเพียงกลยุทธ์การค้นหาขั้นพื้นฐานและคำแนะนำบางประการเกี่ยวกับลักษณะของ IDOR ซึ่งมากกว่า "นี่คือโค้ด ค้นหาจุดบกพร่อง" เล็กน้อย แต่น้อยกว่าสิ่งที่ตัวแทนการเข้ารหัสชายแดนได้รับเมื่อทำงานภายในไปป์ไลน์แบบเต็มของ Semgrep

IDOR เป็นปัญหาที่น่าปวดหัวอย่างต่อเนื่องสำหรับทีมรักษาความปลอดภัยแอปพลิเคชัน เนื่องจาก IDOR เหล่านี้ตกอยู่ภายใต้ช่องโหว่ของเครื่องสแกนทั่วไป เครื่องมือตามกฎสามารถทำเครื่องหมายการตรวจสอบอินพุตที่ขาดหายไป แต่การทำความเข้าใจว่าปลายทางเฉพาะเจาะจงเปิดเผยข้อมูลของผู้ใช้รายอื่นจริง ๆ หรือไม่นั้นจำเป็นต้องให้เหตุผลเกี่ยวกับตรรกะทางธุรกิจของแอปพลิเคชัน — การตัดสินตามบริบทประเภทที่โมเดลภาษาขนาดใหญ่มีความชำนาญมากขึ้นเรื่อยๆ

GLM 5.2 เป็นผู้นำ

ความโดดเด่นคือ GLM 5.2 ซึ่งเป็นโมเดล open-weight ของ Zhipu AI โดยไม่ได้ดำเนินการอะไรนอกจากการแจ้งเตือนโดยเปล่าประโยชน์ โดยได้คะแนน F1 39% ในการตรวจจับ IDOR ซึ่งเอาชนะ Claude Code ได้ 32% ด้วยคะแนนเต็มเจ็ดคะแนน จากข้อมูลของ Semgrep โมเดล open-weight ยังเหนือกว่า Claude Opus 4.8 ในงาน ทำให้เป็นตัวเลือก non-frontier ที่แข็งแกร่งที่สุดที่ได้รับการทดสอบ

เศรษฐศาสตร์ก็โดดเด่นไม่แพ้กัน ที่ราคาของ GLM 5.2 การรันมีค่าใช้จ่ายประมาณ 0.17 ดอลลาร์ต่อช่องโหว่ที่พบ สำหรับองค์กรที่อาจสแกนจุดสิ้นสุดหลายพันจุด Semgrep ตั้งข้อสังเกตว่าต้นทุนต่อจุดบกพร่องมักเป็นปัจจัยตัดสินว่าเทคนิคการตรวจจับจะใช้งานได้จริงในวงกว้างหรือไม่

ผู้เข้าแข่งขันรุ่นเปิดรายอื่นตามหลังไปไกลกว่านั้น MiniMax M3 ได้คะแนน 23% F1 และรหัส Kimi K2.7 อยู่ที่ 22% ซึ่งทั้งสองกลุ่มอยู่ต่ำกว่ารหัส Claude Code Semgrep กำหนดให้ GLM 5.2 เป็นข้อยกเว้นที่ชัดเจน แทนที่จะเป็นผลลัพธ์ที่เป็นตัวแทนสำหรับหมวดหมู่น้ำหนักเปิด

สายรัดยังคงมีความสำคัญ

แม้จะชนะแบบ open-weight ในประเภท raw-prompt แต่ไปป์ไลน์ที่สร้างขึ้นโดยเฉพาะของ Semgrep ยังคงเป็นผู้นำโดยรวม การตั้งค่าหลายรูปแบบของบริษัท ซึ่งรวมการใช้เหตุผลของ AI เข้ากับการตรวจจับตามกฎและการแจงนับจุดสิ้นสุดที่มีโครงสร้าง บรรลุผลสำเร็จ 53% ถึง 61% F1 ขึ้นอยู่กับการกำหนดค่า ช่องว่างดังกล่าวตอกย้ำคำถามเดิมของนักวิจัย: แบบจำลองนี้มีประสิทธิภาพการตรวจจับช่องโหว่มากน้อยเพียงใด และสถาปัตยกรรมโดยรอบมีราคาเท่าใด

คำตอบดูเหมือนจะเป็น "ทั้งสองอย่าง แต่มากกว่าที่คนอื่นคิดว่าเป็นสายรัด" GLM 5.2 พิสูจน์แล้วว่าโมเดลที่มีความสามารถสามารถทำงานได้อย่างมีความหมายโดยมีการสนับสนุนเพียงเล็กน้อย แต่ก็ยังไม่สามารถจับคู่กับระบบที่ออกแบบมาเพื่อปัญหาโดยเฉพาะได้

ทีมงาน Semgrep ซึ่งรวมถึงนักวิจัย Paxton-Fear, Seth Jaksik, Brenden Noblitt และ Erik Buchanan กล่าวว่าพวกเขา "ตกใจอย่างแท้จริง" ที่แบบจำลอง open-weight ที่ทำงานพร้อมท์เปลือยเปล่านั้นเหนือกว่าเอเจนต์การเข้ารหัสระดับแนวหน้าในงานรักษาความปลอดภัยที่ต้องใช้เหตุผลหนักมาก

มิธอสที่บ้าน

เกณฑ์มาตรฐานนี้มีน้ำหนักเพิ่มขึ้นเมื่อเทียบกับฉากหลังทางภูมิรัฐศาสตร์ในปัจจุบัน ชื่อของโพสต์บนบล็อก — "We Have Mythos at Home" — เป็นการอ้างอิงถึงความจริงที่ว่าโมเดล Mythos ที่เน้นความปลอดภัยทางไซเบอร์ของ Anthropic นั้นไม่สามารถใช้งานได้ทั่วโลก หลังจากที่ฝ่ายบริหารของ Trump ห้ามมิให้ผู้ที่ไม่ใช่ชาวอเมริกันใช้ Mythos และ Fable 5 ซึ่งเป็นพี่น้องที่ถูกจำกัด ทีมรักษาความปลอดภัยทั่วโลกก็สูญเสียการเข้าถึงสิ่งที่ได้รับการยอมรับอย่างกว้างขวางว่าเป็น AI ที่มีความสามารถมากที่สุดสำหรับงานรักษาความปลอดภัยเชิงรุกและเชิงรับ

ในสุญญากาศนั้น โมเดลน้ำหนักเปิดที่สามารถเข้าถึงได้กำลังเข้ามาเติมเต็มช่องว่าง ความจริงที่ว่า GLM 5.2 ซึ่งสามารถดาวน์โหลดและปรับใช้ได้ฟรีจากทุกที่ สามารถจับคู่หรือเอาชนะโมเดลที่เป็นกรรมสิทธิ์ของชายแดนในงานรักษาความปลอดภัยเฉพาะได้อยู่แล้ว แสดงให้เห็นว่าผลกระทบที่ร้ายแรงของการห้ามส่งออกอาจมีน้อยกว่าที่ตั้งใจไว้ หากโมเดลที่ "ไม่จำกัด" ที่ดีที่สุดยังคงพัฒนาต่อไป คุณค่าเชิงกลยุทธ์ของการกักตุนขีดความสามารถชายแดนก็จะลดลง

สำหรับตอนนี้ ผลลัพธ์ที่ได้ยังแคบ: เกณฑ์มาตรฐานเดียวสำหรับช่องโหว่ระดับเดียว แต่เป็นสัญญาณว่าเขตแดนแบบ open-weight กำลังปิดเร็วกว่าที่หลายๆ คนคิดไว้ และการเข้าถึงซึ่งไม่ใช่ความสามารถดิบๆ อาจกลายเป็นตัวแปรที่กำหนดในภูมิทัศน์ความปลอดภัยของ AI

การค้นพบนี้ยังทำให้เกิดคำถามที่ไม่สบายใจสำหรับห้องปฏิบัติการชายแดน หากโมเดลที่พร้อมใช้งานอย่างเสรีสามารถจับคู่ระบบที่เป็นกรรมสิทธิ์ในงานเหตุผลด้านความปลอดภัยได้แล้ว การแข่งขันรอบโมเดลแบบปิดก็จะแคบลง โดยเฉพาะอย่างยิ่งเมื่อการควบคุมการส่งออกทำให้โมเดลแบบปิดเหล่านั้นไม่สามารถเข้าถึงได้ในขอบเขตของตลาดโลก นักพัฒนาแบบ Open-weight ที่ไม่มีภาระผูกพันจากข้อจำกัดการใช้งาน สามารถทำซ้ำและปรับใช้ได้ทุกที่พร้อมกัน

ก้าวนำหน้า AI

ช่องว่างระหว่าง AI ระดับแนวหน้าและ AI แบบเปิดกำลังแคบลงใน ข่าวด่วน AI และการวิจัยที่ปรับรูปแบบความปลอดภัย โครงสร้างพื้นฐาน และนโยบาย

อ่านข่าว AI เพิ่มเติม →