นักวิจัยได้สาธิตการโจมตีครั้งใหม่ที่ทรงพลังต่อโมเดล AI ให้เหตุผล ซึ่งใช้ประโยชน์จากจุดบอดพื้นฐานในการที่โมเดลภาษาขนาดใหญ่ (LLM) แยกคำสั่งจากข้อมูล เทคนิคนี้เรียกว่า Chain-of-Thought (CoT) Forgery หลอกให้โมเดลปฏิบัติต่อข้อความที่ผู้โจมตีส่งมาราวกับว่าเป็นเหตุผลส่วนตัวภายในของโมเดลเอง ทำให้ข้อความสามารถแทนที่คำสั่งที่ถูกต้องได้
การค้นพบนี้รายงานโดย Hackaday เน้นย้ำว่าเหตุใดการรักษาความปลอดภัยระบบ AI จากการยักย้ายยังคงเป็นปัญหาที่ยังไม่ได้รับการแก้ไข เพื่อตามทันภัยคุกคามที่เกิดขึ้นในภาคสนาม โปรดติดตาม การรายงานข่าวของอุตสาหกรรม AI ของเราเพื่อรับการวิเคราะห์อย่างต่อเนื่อง
สาเหตุที่แท้จริง: ความสับสนในบทบาท
หัวใจของความเปราะบางคือสิ่งที่นักวิจัยอธิบายว่าเป็น "ความสับสนในบทบาท" LLM สมัยใหม่ได้รับการป้อนข้อมูลทั้งหมด เช่น กฎของระบบ คำขอของผู้ใช้ และการให้เหตุผลแบบห่วงโซ่ความคิดของโมเดลผ่านช่องทางข้อความเดียว ในการกำหนดลำดับ นักพัฒนาจะใช้แท็กข้อมูลเมตา เช่น `
แท็ก `
วิธีการทำงานของการโจมตี
สิ่งสำคัญที่สุดคือ CoT Forgery ไม่ใช่แค่เรื่องของการรวมข้อความเตือนที่เป็นอันตรายไว้ในแท็ก `
จากข้อมูลของ Hackaday สิ่งนี้ทำให้ LLM ยอมรับการให้เหตุผลที่ไร้เหตุผลอย่างโปร่งใสเป็นข้อสรุปที่กล่าวมาข้างต้น โดยเปลี่ยนแปลงการตอบสนองต่อคำขอของผู้ใช้ เนื่องจากเนื้อหาที่ปลอมแปลงถูกมองว่าเป็นความคิดภายในที่มีความน่าเชื่อถือสูง แทนที่จะเป็นข้อมูลที่ผู้ใช้มีความน่าเชื่อถือต่ำ จึงสามารถข้ามราวกั้นความปลอดภัยที่ปกติจะบล็อกคำสั่งบิดเบือนได้
ลำดับชั้นของความไว้วางใจภายใน LLM
การทำความเข้าใจว่าเหตุใดการโจมตีจึงประสบความสำเร็จต้องอาศัยความเข้าใจว่าบทบาททำงานอย่างไร ภายใต้ประทุน บทบาทแบ่งส่วนอินพุตของโมเดลออกเป็นลำดับชั้นที่จัดระเบียบ มีการปฏิบัติตามคำแนะนำในบทบาทตราบใดที่ไม่ขัดแย้งกับคำสั่งที่มีลำดับความสำคัญสูงกว่า ตัวอย่างเช่น คำสั่งระดับระบบ "ห้ามหารือเกี่ยวกับกิจกรรมที่ผิดกฎหมาย" มีจุดมุ่งหมายเพื่อแทนที่คำขอของผู้ใช้ในการจัดเตรียมสูตรอาหารต้องห้าม บทบาท `<คิด>` อยู่ใกล้กับด้านบนสุดของลำดับชั้นนั้น เพราะมันแสดงถึงข้อสรุปที่แบบจำลองเชื่อว่าได้บรรลุถึงแล้วด้วยตัวมันเอง
การแยกย่อยเกิดขึ้นเนื่องจากแบบจำลองไม่ได้บังคับใช้ลำดับชั้นนั้นโดยกลไก แต่จะอนุมานว่าข้อความใดเป็นของบทบาทใดส่วนหนึ่งมาจากตัวชี้นำโวหาร ตามที่การอภิปรายในชุมชนเกี่ยวกับการวิจัยระบุไว้ หากข้อความมีรูปแบบเหมือนบริบทการคิด แบบจำลองอาจทำให้ข้อความใดๆ ที่มีโครงสร้างคล้ายกันเข้าใจผิดว่าเป็นการให้เหตุผลอย่างแท้จริง และข้อความการคิดจะมีลำดับความสำคัญสูงกว่าข้อความของผู้ใช้ทั่วไป
รูปแบบที่คุ้นเคยพร้อมลูกเล่นใหม่
การวิจัยสร้างขึ้นจากจุดอ่อนในระบบ AI ที่ได้รับการยอมรับมายาวนาน: การฉีดยาทันที การโจมตีตั้งแต่เนิ่นๆ ใช้ประโยชน์จากข้อเท็จจริงที่ว่า LLM ไม่มีช่องทางแยกสำหรับคำแนะนำและข้อมูล ดังนั้นวลีเช่น "ละเว้นคำสั่งก่อนหน้านี้ทั้งหมด" บางครั้งอาจแย่งชิงพฤติกรรมของแบบจำลองได้ การแนะนำบทบาทและแท็กข้อมูลเมตามีจุดมุ่งหมายเพื่อบรรเทาปัญหานี้โดยการสร้างลำดับชั้นความน่าเชื่อถือ
CoT Forgery แสดงให้เห็นว่าการบรรเทาผลกระทบไม่สมบูรณ์ ตราบใดที่แบบจำลองตัดสินความน่าเชื่อถือของข้อความบางส่วนจากลักษณะโวหาร แทนที่จะตัดสินโดยเมทาดาทาเชิงโครงสร้างอย่างเคร่งครัด ผู้โจมตีที่สามารถเลียนแบบรูปแบบที่เหมาะสมก็สามารถเพิ่มการรับรู้ถึงอำนาจในการป้อนข้อมูลของตนได้
ทำไมจึงแก้ไขได้ยาก
นักวิจัย Charles Ye, Jasmine Cui และ Dylan Hadfield-Menll โต้แย้งว่าการรับรู้บทบาทใน LLM ไม่ใช่คุณสมบัติไบนารีที่สามารถบังคับใช้ได้อย่างหมดจด โมเดลเรียนรู้ที่จะตีความแท็กผ่านการฝึกอบรมมากกว่าผ่านกฎแบบตายตัว ซึ่งหมายความว่าพฤติกรรมของแท็กจะถูกกำหนดโดยรูปแบบในข้อมูล และรูปแบบสามารถเลียนแบบได้
การอภิปรายในชุมชนเกี่ยวกับงานนี้ ซึ่งเน้นโดย Hackaday ทำให้เกิดธีมที่เกิดขึ้นซ้ำๆ: การแก้ไขที่ชัดเจนที่สุดจะต้องมีแบบจำลองเพื่อจัดการกับอินพุตที่เชื่อถือได้ผ่านเส้นทางที่แยกจากกันเชิงโครงสร้าง แทนที่จะอาศัยการเรียนรู้ตามรูปแบบที่เรียนรู้ จนกว่าจะเป็นเช่นนั้น การป้องกันการโจมตีแบบฉีดทันทีมีแนวโน้มที่จะยังคงเป็นกระบวนการที่กำลังพัฒนามากกว่าปัญหาที่ได้รับการแก้ไข
ผลกระทบที่กว้างขึ้น
ช่องโหว่มีความสำคัญมากกว่าการสาธิตในห้องปฏิบัติการ โมเดลการใช้เหตุผลมีการปรับใช้มากขึ้นในระบบเอเจนต์ ซึ่งสามารถเรียกดูเว็บ รันโค้ด และดำเนินการในนามของผู้ใช้ได้ หากผู้โจมตีสามารถปลอมแปลงข้อสรุปภายในของโมเดลได้ พวกเขาอาจสามารถควบคุมการกระทำเหล่านั้นไปสู่ผลลัพธ์ที่ไม่ได้ตั้งใจหรือเป็นอันตรายได้ ความเสี่ยงจะเพิ่มขึ้นเมื่อโมเดลได้รับความเป็นอิสระและเข้าถึงเครื่องมือได้มากขึ้น นักวิจัยตั้งข้อสังเกตว่ามนุษย์ยังคงฉลาดและสร้างสรรค์ และตราบใดที่แบบจำลองขาดการแบ่งแยกทางสถาปัตยกรรมที่ชัดเจนระหว่างข้อความที่เชื่อถือได้และไม่น่าเชื่อถือ ผู้โจมตีที่มุ่งมั่นจะยังคงหาวิธีทำให้เส้นแบ่งไม่ชัดเจน เอกสารนี้กำหนดกรอบความท้าทายให้น้อยลงในฐานะจุดบกพร่องที่ต้องได้รับการแก้ไข และเป็นคุณสมบัติทางโครงสร้างของระบบที่เรียนรู้พฤติกรรมจากข้อมูลมากกว่าจากกฎที่กำหนดไว้ตายตัว
บทความฉบับสมบูรณ์มีอยู่ใน arXiv และนักวิจัยได้เผยแพร่ตัวอย่างโค้ดบน GitHub เพื่อให้นักพัฒนาสามารถทดสอบได้ว่าระบบของตนเองอ่อนแอหรือไม่
ก้าวนำหน้า AI
หากต้องการข้อมูลเพิ่มเติมเกี่ยวกับการวิจัยด้านความปลอดภัยของ AI ช่องโหว่ด้านความปลอดภัย และขอบเขตของโมเดลภาษาขนาดใหญ่ โปรดไปที่ AI Buzz Wire
อ่านข่าว AI เพิ่มเติม →


