ข้อสันนิษฐานยอดนิยมที่ว่าการตรวจสอบโดยมนุษย์แต่ละคำสั่งสามารถรักษาตัวแทนการเข้ารหัส AI ไว้ได้ กำลังเผชิญกับการตรวจสอบที่ร้ายแรง การวิเคราะห์ครั้งใหม่เกี่ยวกับเซสชันเกมมากกว่า 40,000 เซสชัน และการตัดสินใจอนุมัติหรือปฏิเสธมากกว่า 409,000 รายการ พบว่าผู้ตรวจสอบที่เป็นมนุษย์พลาดคำสั่งที่เป็นอันตรายประมาณหนึ่งในสามจากตัวแทน AI ทำให้เกิดคำถามเร่งด่วนว่า "human-in-the-loop" เป็นขอบเขตความปลอดภัยที่เชื่อถือได้หรือไม่
การค้นพบนี้มาจากเกมบนเบราว์เซอร์ที่สร้างขึ้นโดย Alex Wauters อดีตวิศวกรพนักงานของ Uber ผู้เขียนเกี่ยวกับความปลอดภัยของนักพัฒนาที่ Scale X เกมดังกล่าวให้ผู้เล่นรับบทบาทเป็นผู้ตรวจสอบที่เป็นมนุษย์สำหรับตัวแทนการเข้ารหัส AI โดยขอให้พวกเขาอนุมัติหรือปฏิเสธคำสั่งเชลล์ภายใต้แรงกดดันด้านเวลา คำสั่งบางคำสั่งเป็นคำสั่งประจำ เช่น "สถานะ git" หรือ "การทดสอบ npm" บุคคลอื่นพยายามปลอมแปลงอย่างระมัดระวังเพื่อขโมยข้อมูลประจำตัว ติดตั้งแบ็คดอร์ หรือส่งความลับไปยังเซิร์ฟเวอร์ระยะไกล หลังจากเพิ่มการติดตามทางสถิติ Wauters ได้รวบรวมข้อมูลเพียงพอที่จะวาดภาพโดยละเอียดว่าการตัดสินของมนุษย์ประสบความสำเร็จและบ่อยครั้งที่ล้มเหลว หากต้องการข้อมูลเพิ่มเติมเกี่ยวกับ ความครอบคลุมของอุตสาหกรรม AI ในวงกว้าง การศึกษานี้มีความโดดเด่นในฐานะหนึ่งในการทดลองที่มีข้อมูลมากที่สุดในปัจจุบัน
คำสั่งที่อันตรายที่สุดนั้นจับได้ยากที่สุด
การค้นพบที่โดดเด่นที่สุดของการศึกษานี้คือ คำสั่งทำลายล้างที่ชัดเจน เช่น `rm -rf` ในไดเร็กทอรีที่สำคัญ ถูกจับได้อย่างน่าเชื่อถือ ภัยคุกคามที่ขโมยข้อมูลประจำตัวได้สำเร็จนั้นพลาดบ่อยกว่าเกือบสามเท่า คำสั่งเดียวที่พลาดมากที่สุดในเกมทั้งหมดคือ `npm run analyse` ซึ่งได้รับการอนุมัติโดยผู้เล่น 64.7 เปอร์เซ็นต์ แม้ว่าบันทึกประวัติของเอเจนต์จะแสดงอย่างชัดเจนว่าสคริปต์ที่ซ่อนอยู่นั้นถูกดัดแปลงเพื่อไปป์ข้อมูลรับรองไปยังเซิร์ฟเวอร์ภายนอก
ปัญหาคือโครงสร้าง คำสั่งเช่น `npm run` จะรันสคริปต์ใดก็ตามที่กำหนดไว้ในไฟล์ `package.json` ของโปรเจ็กต์ สคริปต์นั้นอาจเป็นตัววิเคราะห์บันเดิลที่ถูกต้องตามกฎหมายหรือโค้ดที่เป็นอันตรายที่ถูกแทรกโดยการแก้ไขไฟล์ก่อนหน้านี้ที่เอเจนต์แก้ไข หากต้องการทราบแน่ชัด นักพัฒนาจะต้องตรวจสอบไฟล์ที่แก้ไขทุกไฟล์ก่อนที่จะอนุมัติ ซึ่งจะลบล้างข้อได้เปรียบด้านความเร็วที่เครื่องมือเข้ารหัส AI ควรมีให้
จากคำสั่งเพย์โหลดปลอมทั้ง 3 คำสั่งในเกม อัตราความผิดพลาดอยู่ที่ 52.5 เปอร์เซ็นต์ เทียบกับ 28.4 เปอร์เซ็นต์สำหรับการโจมตีเพื่อขโมยข้อมูลประจำตัวอื่นๆ ทั้งหมด การซ่อนเพย์โหลดไว้ด้านหลังชื่อสคริปต์ที่คุ้นเคยจะเพิ่มอัตราความสำเร็จเป็นสองเท่าโดยประมาณ แม้ว่าเพย์โหลดจะมองเห็นได้ในบันทึกประวัติที่แสดงอยู่เหนือข้อความแจ้งสิทธิ์ก็ตาม
ความเมื่อยล้าที่ได้รับอนุญาตกัดกร่อนความระมัดระวังเมื่อเวลาผ่านไป
ก่อนหน้านี้ Anthropic ยอมรับว่าความเหนื่อยล้าของการอนุญาตเป็นปรากฏการณ์ที่แท้จริงในผลิตภัณฑ์ Claude Code โดยสังเกตว่ายิ่งผู้ใช้เห็นการอนุมัติมากเท่าใด พวกเขาก็จะให้ความสนใจต่อแต่ละรายการน้อยลงเท่านั้น ข้อมูล Scale X สนับสนุนข้อกังวลนี้ในเชิงประจักษ์ อัตราการพลาดลดลงในช่วงสองสามคำสั่งแรกของแต่ละเซสชั่นเมื่อผู้เล่นวอร์มร่างกาย แต่จากนั้นก็ไต่ขึ้นอย่างต่อเนื่องจนถึงจุดสิ้นสุด ซึ่งสอดคล้องกับความเหนื่อยล้าหรือแรงกดดันที่เพิ่มขึ้นของนาฬิกาฟ้อง
รูปแบบนี้สะท้อนถึงไดนามิกในโลกแห่งความเป็นจริง นักพัฒนาที่เร่งรีบในการส่งมอบคุณสมบัติต่างๆ ภายใต้แรงกดดันด้านกำหนดเวลา ต้องเผชิญกับแรงจูงใจแบบเดียวกันให้คลิกอนุมัติอย่างรวดเร็ว และคำสั่งประจำที่มีปริมาณมากขึ้นทำให้เกิดปัญหากองซ้อนในกองหญ้า ซึ่งภัยคุกคามที่แท้จริงนั้นหาได้ยากทางสถิติ ผลลัพธ์ที่ได้คือระบบที่ฝึกผู้ใช้ให้ประทับตรายางทุกอย่าง
อีกด้านหนึ่ง: การบล็อกมากเกินไปจะทำให้ทุกอย่างช้าลง
การศึกษายังบันทึกโหมดความล้มเหลวที่ตรงกันข้ามด้วย คำสั่งที่ไม่เป็นพิษเป็นภัยอย่างแท้จริงหลายคำสั่งถูกบล็อกเป็นประจำโดยผู้เล่นที่ระมัดระวัง รวมถึงคำสั่งสร้างและทดสอบมาตรฐาน การบล็อกมากเกินไปนี้จะทำให้เอเจนต์ช้าลง และในทางกลับกันจะเพิ่มความเสี่ยงในระยะยาว เมื่อผู้ใช้ถูกขอให้อนุมัติคำสั่งที่กลายเป็นว่าไม่มีอันตรายซ้ำแล้วซ้ำเล่า เสียงดังกล่าวจะกัดกร่อนความตั้งใจที่จะพิจารณาข้อความแจ้งในอนาคตอย่างละเอียดถี่ถ้วน และในที่สุดก็ผลักดันให้พวกเขาเข้าสู่โหมดบายพาสหรืออนุมัติอัตโนมัติซึ่งจะลบการตรวจสอบโดยมนุษย์โดยสิ้นเชิง
ฟีเจอร์เช่นโหมดอัตโนมัติของ Anthropic พยายามบรรเทาปัญหานี้โดยพิจารณาโดยอัตโนมัติว่าคำสั่งนั้นปลอดภัยหรือไม่ก่อนที่จะแจ้งเตือนผู้ใช้ แต่จากข้อมูลการศึกษาเกี่ยวกับน้ำหนักบรรทุกปลอม แม้แต่เนื้อหาคำสั่งที่มองเห็นได้ก็ยังไม่เพียงพอสำหรับมนุษย์ที่จะตัดสินได้อย่างน่าเชื่อถือภายใต้แรงกดดัน
บริบทที่ขาดหายไปคือปัญหาหลัก
คำสั่งหนึ่ง `cat ~/.zshrc` ได้รับการพิสูจน์แล้วว่าเป็นคำสั่งที่มีความแตกแยกมากที่สุดในเกม โดยได้รับการอนุมัติจากผู้เล่น 45.9 เปอร์เซ็นต์ คำสั่งนี้ไม่เป็นอันตรายสำหรับนักพัฒนาที่ไม่เก็บความลับในโปรไฟล์เชลล์ของตน แต่จะเปิดเผยคีย์ API สำหรับหลายๆ คนที่ส่งออกข้อมูลประจำตัวไปที่นั่น ความเสี่ยงขึ้นอยู่กับการกำหนดค่าระบบที่ตัวแทนไม่สามารถมองเห็นได้และผู้ตรวจสอบอาจจำไม่ได้
คำสั่งอื่น ๆ อีกหลายคำสั่งทำให้เกิดข้อโต้แย้งที่คล้ายกันในกระทู้สนทนาของ Hacker News ด้วยเหตุผลเดียวกัน ปัญหาพื้นฐานคือนักพัฒนาถูกขอให้ตัดสินด้านความปลอดภัยโดยไม่มีภาพรวมว่าไฟล์ใดมีการเปลี่ยนแปลง สิ่งที่เอเจนต์ทำในขั้นตอนก่อนหน้า และการกำหนดค่าปัจจุบันของระบบมีอะไรบ้าง ดังที่ผู้แสดงความคิดเห็นคนหนึ่งตั้งข้อสังเกต การขอให้ผู้ใช้ตรวจสอบคำสั่งที่ไม่ชัดเจนโดยไม่มีบริบทนั้นไม่ใช่การป้องกันที่รัดกุม
อะไรจะเกิดขึ้นต่อไปสำหรับการรักษาความปลอดภัยของตัวแทน
Wauters ให้เหตุผลว่าวิธีแก้ปัญหาไม่ใช่มนุษย์ที่ดีกว่า แต่เป็นการใช้เครื่องมือที่ดีกว่า เจ้าหน้าที่แซนด์บ็อกซ์ที่ทำให้ไม่สามารถเข้าถึงข้อมูลรับรองได้โดยตรง การแยกบริบทที่เข้มงวด และข้อจำกัดทางโครงสร้างเกี่ยวกับสิ่งที่เจ้าหน้าที่สามารถทำได้โดยไม่ต้องมีการอนุญาตระดับสูง ล้วนมีแนวโน้มที่ดีกว่าการอาศัยความระมัดระวังของมนุษย์ จนกว่าจะมีการใช้มาตรการป้องกันเหล่านั้น การให้สิทธิ์แก่ตัวแทนในวงกว้างยังคงมีความเสี่ยง ไม่ว่ามนุษย์จะอยู่ในวงในนามหรือไม่ก็ตาม
การศึกษานี้ไม่ใช่รายงานทางวิชาการที่ได้รับการตรวจสอบจากผู้ทรงคุณวุฒิ และ Wauters รับทราบถึงข้อจำกัดของการศึกษานี้ เกมดังกล่าวเตือนผู้เล่นเกี่ยวกับภัยคุกคามและใช้แรงกดดันด้านเวลาเทียมซึ่งอาจไม่สะท้อนสภาพแวดล้อมการพัฒนาที่แท้จริงได้อย่างสมบูรณ์แบบ แต่การค้นพบหลักที่ว่าผู้ตรวจสอบที่เป็นมนุษย์ที่ได้รับการฝึกอบรมภายใต้แรงกดดันพลาดหนึ่งในสามของการโจมตีที่จงใจปลอมแปลง ควรให้ทุกทีมที่ใช้เอเจนต์การเขียนโค้ด AI มีเหตุผลในการพิจารณาโมเดลความปลอดภัยของตนอีกครั้ง
สำหรับนักพัฒนาที่สร้างด้วยตัวแทน AI ในปัจจุบัน สิ่งที่นำไปใช้ได้จริงคือการคิดว่ามนุษย์ในวงจะล้มเหลวในที่สุด ออกแบบสิทธิ์ตัวแทนและแซนด์บ็อกซ์ของคุณ เพื่อให้การพลาดการอนุมัติไม่ได้หมายความว่าคีย์ AWS รั่วไหลหรือไปป์ไลน์บิวด์ที่ถูกบุกรุก ข้อมูลดังกล่าวชี้ให้เห็นว่าการปฏิบัติต่อการตรวจสอบโดยเจ้าหน้าที่เป็นการป้องกันหลักเป็นเดิมพันที่ไม่ได้ผล
ก้าวนำหน้า AI
ภาพรวมการรักษาความปลอดภัยของตัวแทน AI กำลังพัฒนาอย่างรวดเร็ว รับข่าวสารล่าสุดเกี่ยวกับ การพัฒนา AI และการวิจัยล่าสุด
อ่านข่าว AI เพิ่มเติม →