การประเมินเบื้องต้นร่วมกันโดยสถาบันความปลอดภัย AI ของรัฐบาลสหรัฐอเมริกาและสหราชอาณาจักร ได้ข้อสรุปว่าโมเดล Kimi K3 แบบเปิดของ Moonshot AI นั้นตามรอยโมเดลแนวชายแดนของสหรัฐฯ ด้วยอัตรากำไรที่กว้างจากงานทางไซเบอร์ที่น่ารังเกียจ การค้นพบนี้เผยแพร่เมื่อวันที่ 25 กรกฎาคม พ.ศ. 2569 เพิ่มข้อมูลที่เป็นรูปธรรมในการอภิปรายที่เข้มข้นขึ้นว่าระบบ AI ที่พัฒนาโดยจีนควรได้รับการปฏิบัติอย่างไรเมื่อได้รับการยอมรับภายในประเทศสหรัฐอเมริกา
การประเมินนี้เผยแพร่โดยสถาบันความปลอดภัย AI ของสหรัฐอเมริกา ซึ่งตั้งอยู่ที่ NIST หรือที่รู้จักในชื่อ CAISI ร่วมกับ AISI ของสหราชอาณาจักร ถือเป็นการประเมินอย่างเป็นทางการครั้งแรกของตะวันตกสำหรับ Kimi K3 ที่เน้นไปที่โดเมนไซเบอร์โดยเฉพาะ สำหรับผู้อ่านที่ติดตามภูมิทัศน์ที่เปลี่ยนแปลงไปอย่างรวดเร็วของ ข่าวด่วน AI ผลลัพธ์ที่ได้นั้นมีความโดดเด่นน้อยกว่าคะแนนมาตรฐานใดๆ เมื่อเทียบกับสิ่งที่ส่งสัญญาณเกี่ยวกับบทบาทที่เพิ่มขึ้นเรื่อยๆ ห้องปฏิบัติการของรัฐบาลในการตรวจสอบโมเดลจากต่างประเทศก่อนที่จะนำไปใช้อย่างกว้างขวาง
สิ่งที่วัดผลการประเมิน
Kimi K3 ซึ่งเปิดตัวโดย Moonshot AI ในกรุงปักกิ่ง เป็นโมเดล Open Weight ขนาดใหญ่ที่ดึงดูดความสนใจจากทั่วโลกอย่างรวดเร็วในด้านประสิทธิภาพการใช้งานทั่วไปที่แข็งแกร่งหลังจากเปิดตัว การกระจายแบบเปิดหมายความว่านักวิจัยและนักพัฒนาสามารถดาวน์โหลดและตรวจสอบตุ้มน้ำหนักได้โดยตรง ซึ่งทำให้เป็นตัวเลือกโดยธรรมชาติสำหรับการทดสอบความปลอดภัยภายนอก
รายงานเบื้องต้นฉบับใหม่มุ่งเน้นไปที่คำถามที่แคบและละเอียดอ่อนมากขึ้น: โมเดลนี้มีความสามารถเพียงใดในการปฏิบัติการทางไซเบอร์ที่น่ารังเกียจ ซึ่งเป็นงานที่สำคัญที่สุดสำหรับหน่วยงานความมั่นคงของชาติ แทนที่จะประเมิน Kimi K3 ด้วยความรู้หรือการใช้เหตุผลอย่างกว้างๆ สถาบันต่างๆ ตรวจสอบว่าสามารถช่วยดำเนินการโจมตีทางไซเบอร์ ใช้ประโยชน์จากช่องโหว่ของซอฟต์แวร์ หรือช่วยเหลือในการดำเนินการทางคอมพิวเตอร์ที่เป็นอันตรายได้หรือไม่
ตัวเลข: ประมาณ 32% เทียบกับ 76%
ผลลัพธ์พาดหัวคือช่องว่างที่คมชัด ในการประเมินความสามารถทางไซเบอร์ Kimi K3 ได้คะแนนประมาณ 32% ในขณะที่โมเดลชั้นนำของสหรัฐฯ สูงถึงประมาณ 76% ตามรายงานการประเมิน หากแปลเป็นคำธรรมดาแล้ว สถาบันของสหรัฐฯ พบว่าโมเดลของจีนสามารถทำงานไซเบอร์เชิงรุกได้สำเร็จเพียงประมาณหนึ่งในสามของโมเดลตะวันตกชั้นนำเท่านั้น
ช่องจ่ายหลายช่องที่ครอบคลุมการวางจำหน่ายวางกรอบช่องว่างอย่างสม่ำเสมอ South China Morning Post รายงานว่า Kimi K3 "ตามหลังคู่แข่งในสหรัฐฯ ในด้านความสามารถในการโจมตีทางไซเบอร์" ในขณะที่ วิศวกรรมที่น่าสนใจ เน้นย้ำถึงสเปรด 76% เทียบกับ 32% ในเกณฑ์มาตรฐานทางไซเบอร์ การประเมินดังกล่าวได้รับการอธิบายว่าเป็นการประเมินเบื้องต้น ซึ่งหมายความว่าสถาบันต่างๆ กำลังส่งสัญญาณว่าอาจมีการทดสอบเพิ่มเติมก่อนที่จะได้ข้อสรุปขั้นสุดท้าย
เหตุใดจึงอาจมีช่องว่าง
โมเดลที่ทำงานได้อย่างแข็งแกร่งบนเกณฑ์มาตรฐานทั่วไปแต่อ่อนแอต่อความผิดทางไซเบอร์ทำให้เกิดปริศนาที่น่าสนใจ และนักวิเคราะห์ก็เริ่มชั่งน้ำหนักแล้ว ผู้เขียนที่ The Decoder นักวิจารณ์ตั้งข้อสังเกตว่าการกลั่นกรองอาจอธิบายส่วนหนึ่งของความคลาดเคลื่อนได้
การกลั่นเป็นเทคนิคการฝึกอบรมที่แบบจำลองเรียนรู้โดยการเลียนแบบผลลัพธ์ของแบบจำลอง "ครู" ที่มีความสามารถมากกว่า แทนที่จะสร้างความสามารถทุกอย่างตั้งแต่เริ่มต้น หาก Kimi K3 ได้รับการพัฒนาโดยการกลั่นบางส่วน นักวิเคราะห์แย้งว่า มันสามารถสืบทอดเพดานความสามารถที่กำหนดโดยโมเดลใดก็ตามที่ทำหน้าที่เป็นผู้สอน ซึ่งอาจจำกัดประสิทธิภาพในการทำงานที่ยากที่สุด เช่น ปฏิบัติการทางไซเบอร์ที่น่ารังเกียจที่ซับซ้อน
สมมติฐานนั้นยังคงเป็นเพียงสมมติฐานนั้น รายงานเบื้องต้นไม่ได้ระบุว่าเหตุใดจึงมีช่องว่าง เพียงแต่มีอยู่เท่านั้น ปัจจัยที่เป็นไปได้อื่นๆ ได้แก่ การจำกัดความสามารถโดยเจตนา ความแตกต่างในข้อมูลการฝึกอบรม หรือข้อเสียที่เกิดขึ้นเพื่อให้โมเดลมีประสิทธิภาพเพียงพอที่จะทำงานบนฮาร์ดแวร์ที่มีจำหน่ายทั่วไป
ฉากหลังทางการเมืองที่ถูกตั้งข้อหา
การประเมินดังกล่าวเกิดขึ้นท่ามกลางการผลักดันของสหรัฐฯ ในวงกว้างในการตรวจสอบระบบ AI ของจีน เมื่อต้นเดือนกรกฎาคม ฝ่ายบริหารของทรัมป์ได้รื้อฟื้นความพยายามในการจำกัดการใช้โมเดล AI ที่พัฒนาโดยจีนในสหรัฐอเมริกา โดยอ้างถึงข้อกังวลด้านความปลอดภัยทางไซเบอร์ โดย Kimi K3 ถูกเสนอชื่อซ้ำๆ ในการสนทนาครั้งนั้น ผู้ร่างกฎหมายของสหรัฐฯ แยกกดดันบริษัทอเมริกันเกี่ยวกับผลกระทบด้านความปลอดภัยของข้อมูลจากการบูรณาการโมเดลจากต่างประเทศเข้ากับผลิตภัณฑ์ของตน
เมื่อเทียบกับฉากหลังดังกล่าว รัฐบาลพบว่าโมเดลน้ำหนักเปิดของจีนที่โดดเด่นที่สุดมีประสิทธิภาพต่ำกว่าการตัดความผิดในสองทิศทาง สำหรับผู้ที่โต้แย้งเรื่องข้อจำกัด จะมีหลักฐานอย่างเป็นทางการว่าโมเดลดังกล่าวได้รับการปฏิบัติอย่างจริงจังเพียงพอที่จะทดสอบได้ สำหรับผู้ที่ระวังการเข้าถึงข้อมูลมากเกินไป คะแนนทางไซเบอร์ที่ค่อนข้างต่ำยังทำให้การเล่าเรื่องที่ซับซ้อนขึ้นว่าแบบจำลองของจีนทุกแบบแสดงถึงภัยคุกคามทางไซเบอร์ในทันที
การรับน้ำหนักแบบเปิดหมายความว่าอย่างไร
ผลลัพธ์ยังนำไปสู่การอภิปรายแยกต่างหากเกี่ยวกับ AI แบบเปิดน้ำหนักในวงกว้างมากขึ้น ผู้เสนอโมเดล open-weight ให้เหตุผลว่าตุ้มน้ำหนักที่ดาวน์โหลดได้ฟรีทำให้สามารถทดสอบความปลอดภัยโดยอิสระได้เหมือนกับที่ CAISI และ AISI ของสหราชอาณาจักรดำเนินการ ซึ่งทำให้การกระจายแบบเปิดเป็นผลบวกสุทธิด้านความปลอดภัย นักวิจารณ์โต้แย้งว่าการเปิดกว้างแบบเดียวกันนั้นช่วยลดอุปสรรคสำหรับผู้ไม่ประสงค์ดีในการปรับเปลี่ยนหรือใช้ระบบที่มีความสามารถในทางที่ผิด
ในกรณีของ Kimi K3 ความพร้อมใช้งานแบบ open-weight คือสิ่งที่ทำให้การประเมินของรัฐบาลอิสระนี้เป็นไปได้ ไม่ว่าคะแนนไซเบอร์ที่ค่อนข้างจะช่วยสร้างความมั่นใจหรือสัญญาณเตือนภัยของผู้กำหนดนโยบายนั้น มักจะขึ้นอยู่กับจำนวนที่น้อยลง และขึ้นอยู่กับวิธีที่หน่วยงานของสหรัฐอเมริกาและสหราชอาณาจักรเลือกวางกรอบในอีกไม่กี่สัปดาห์ข้างหน้า
สำหรับตอนนี้ การประเมินเบื้องต้นถือเป็นจุดอ้างอิง: การวัดความสามารถทางไซเบอร์เชิงรุกของ Kimi K3 อย่างเป็นทางการครั้งแรกของตะวันตก และการวัดที่อยู่เบื้องหลังโมเดลชายแดนของสหรัฐอเมริกาซึ่งมักจะถูกนำมาเปรียบเทียบกัน
ก้าวนำหน้า AI
คะแนนความสามารถทางไซเบอร์เป็นเพียงหนึ่งในการแข่งขันที่ใหญ่กว่ามากในด้านความปลอดภัยของ AI กฎระเบียบ และการแข่งขันระดับโลก ภาพรวมของนโยบายมีการเปลี่ยนแปลงทุกสัปดาห์ และการพลาดการประเมินเพียงครั้งเดียวอาจหมายถึงการพลาดบริบทที่อยู่เบื้องหลังพาดหัวถัดไป อ่านข่าว AI เพิ่มเติมบน AI Buzz Wire เพื่อติดตามการเปิดตัวโมเดลทุกรุ่น การพิจารณาคดีของรัฐบาล และการประเมินความปลอดภัยที่สำคัญ
ก้าวนำหน้าการแข่งขัน AI — เยี่ยมชม AI Buzz Wire


