OpenAI เผยแพร่โพสต์ด้านความปลอดภัยเมื่อวันที่ 30 กันยายน 2026 โดยอธิบายถึงวิธีการระบุและขัดขวางแคมเปญที่ประสานงานเพื่อแยกเหตุผลที่ได้รับการคุ้มครองจากแบบจำลอง และระบุแหล่งที่มาของคลัสเตอร์หลักของกิจกรรมให้กับบุคคลที่เกี่ยวข้องกับ Moonshot AI ซึ่งเป็นห้องปฏิบัติการของจีนที่อยู่เบื้องหลังตระกูลโมเดล Kimi

การเปิดเผยข้อมูลเกิดขึ้นในช่วงเวลาที่มีความละเอียดอ่อนสำหรับอุตสาหกรรม โดยที่มูลค่าของแบบจำลองขอบเขตเพิ่มมากขึ้นไม่เพียงแต่ในคำตอบเท่านั้น แต่ยังรวมถึงเหตุผลด้วย สำหรับผู้อ่านที่ติดตามการพัฒนา AI ล่าสุด กรณีนี้จะนำเสนอรายละเอียดที่ผิดปกติเกี่ยวกับวิธีการโจมตี IP ของโมเดลในวงกว้าง และวิธีที่ห้องปฏิบัติการตอบสนอง

"การกลั่นแบบฝ่ายตรงข้าม" ในที่นี้หมายถึงอะไร

OpenAI อธิบายกิจกรรมว่าสอดคล้องกับการกลั่นแบบฝ่ายตรงข้าม ซึ่งกำหนดว่าเป็นการใช้ผลลัพธ์หรือการให้เหตุผลของโมเดลหนึ่งอย่างเป็นระบบและไม่ได้รับอนุญาต เพื่อช่วยฝึก ทำซ้ำ หรือปรับปรุงโมเดลอื่น "การใช้เหตุผลที่ได้รับการคุ้มครอง" คือบันทึกภายในของโมเดลสำหรับการทำงานผ่านงาน ซึ่งเป็นข้อมูลที่ปกติแล้วจะถูกระงับจากคำตอบสุดท้ายที่ผู้ใช้เห็น บริษัทระบุว่าการแยกมันออกมาสามารถช่วยผู้อื่นสร้างขีดความสามารถที่พวกเขาไม่ได้สร้างขึ้นได้

ที่สำคัญ OpenAI กล่าวว่าโอเปอเรเตอร์ไม่ได้ทำลายการเข้ารหัส ทำลายฐานข้อมูล หรือเข้าถึงการสนทนาของผู้ใช้ที่เก็บไว้โดยตรง แต่พวกเขากลับปรับเปลี่ยนการโต้ตอบของโมเดลเพื่อให้สามารถทำซ้ำการให้เหตุผลที่ได้รับการคุ้มครองในรูปแบบที่ผู้ร้องขอมองเห็นได้ ซึ่งเป็นการประสานงานกันและใช้ผลิตภัณฑ์ในทางที่ผิดในปริมาณมาก แทนที่จะเป็นการแฮ็กแบบดั้งเดิม

เทคนิคหนึ่งที่ OpenAI บันทึกไว้เกี่ยวข้องกับการคัดลอกร่องรอยการให้เหตุผลที่เข้ารหัสจากการสนทนาหนึ่ง จากนั้นขอให้แบบจำลองในการสนทนาแยกต่างหากถอดรหัสและถอดเสียงเนื้อหาการให้เหตุผลที่ซ่อนอยู่ บริษัทเน้นย้ำว่าการจัดการไม่ใช่ช่องโหว่ที่มีเฉพาะในโมเดลของบริษัท และกล่าวว่าได้แบ่งปันรายละเอียดกับพันธมิตรในอุตสาหกรรมผ่านทางฟอรั่มโมเดลชายแดนเพื่อเสริมสร้างการป้องกันโดยรวม

ไทม์ไลน์: 16,000 คำขอในสองวัน

ตามโพสต์ แคมเปญนี้เริ่มในวันที่ 1 กรกฎาคม 2026 ด้วยปริมาณที่ค่อนข้างน้อย เพิ่มขึ้นอย่างรวดเร็วในวันที่ 24 และ 25 กรกฎาคม เมื่อ OpenAI สังเกตเห็นคำขอที่เพิ่มขึ้นอย่างรวดเร็วถึง 16,000 รายการโดยใช้รูปแบบการแยกข้อมูลที่เกี่ยวข้อง ซึ่งมาจากผู้ใช้มากกว่า 4,000 ราย เชิงอรรถในโพสต์เตือนว่าตัวเลขเหล่านี้อธิบายถึงความพยายามในการสกัดข้อมูล ซึ่งไม่จำเป็นต้องประสบความสำเร็จเสมอไป

การตรวจสอบเพิ่มเติมเผยให้เห็นกิจกรรมรูปแบบพรอมต์ที่เกี่ยวข้องในกลุ่มผู้ใช้มากกว่า 15,000 ราย OpenAI กล่าวว่าได้ขัดขวางแคมเปญอย่างสมบูรณ์ภายในวันที่ 28 กรกฎาคม 2026 และกิจกรรมดังกล่าวยังคงมีการพัฒนาอย่างต่อเนื่องเมื่อเวลาผ่านไป ซึ่งตอกย้ำมุมมองที่ว่าการกลั่นแบบฝ่ายตรงข้ามต้องใช้การป้องกันแบบหลายชั้นและปรับเปลี่ยนได้ แทนที่จะแก้ไขเพียงครั้งเดียว

การระบุแหล่งที่มาชี้ไปที่ Moonshot AI

OpenAI ระมัดระวังในการระบุแหล่งที่มา กล่าวว่ายังไม่ชัดเจนว่าผู้ปฏิบัติงานทั้งหมดที่สังเกตในช่วงเวลานั้นมาจากนักแสดงเพียงคนเดียวหรือไม่ แต่กลุ่มหลักของกิจกรรมนั้นมาจากบุคคลที่เกี่ยวข้องกับ Moonshot AI ซึ่งเป็นผู้พัฒนา Kimi

การเรียกร้องไม่มาถึงในสุญญากาศ เมื่อวันที่ 8 กันยายน พ.ศ. 2569 สำนักงานความมั่นคงแห่งชาติ สำนักงานความมั่นคงปลอดภัยทางไซเบอร์และโครงสร้างพื้นฐาน และ FBI ได้ออกคำแนะนำร่วมกันด้านความปลอดภัยทางไซเบอร์ โดยระบุว่า Moonshot AI ได้ดำเนินการรณรงค์กลั่นกรองอย่างกว้างขวางเพื่อต่อต้านบริษัท AI ชายแดนของสหรัฐอเมริกาตั้งแต่อย่างน้อยกลางปี ​​พ.ศ. 2568 ตามคำแนะนำดังกล่าว Moonshot ดึงข้อมูลที่สำคัญของ Claude Fable 5 เพื่อฝึกโมเดล Kimi-K3 และข้อมูล GPT-4o เพื่อฝึก Kimi-K2 โดยใช้แบบจำลองของสหรัฐฯ เพื่อกลั่นกรองความสามารถในการปรับแต่งแบบละเอียดภายใต้การดูแล การเรียนรู้แบบเสริมกำลัง วิศวกรรมซอฟต์แวร์ และคณิตศาสตร์

คำแนะนำดังกล่าวระบุต่อไปว่า มีแนวโน้มว่ารัฐบาลจีนจะตระหนักรู้ดีว่า DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun และ Z.AI ได้รวบรวมโทเค็นนับพันล้านโทเค็นจากการแลกเปลี่ยนนับล้านจากโมเดลชายแดนของสหรัฐอเมริกา รวมถึงตัวแปรของ Claude, GPT, Gemini และ Grok ตั้งแต่อย่างน้อยปลายปี 2024 หน่วยงานต่างๆ อธิบายขั้นตอนลอจิสติกส์ของ API ดั้งเดิม ผู้ให้บริการคลาวด์ระยะไกล และผู้รวบรวมบุคคลที่สาม รวมถึงสีเทา ตลาดของพร็อกซี API ที่เรียกว่า "สถานีถ่ายโอน" ที่ใช้เพื่อหลีกเลี่ยงข้อจำกัดทางภูมิศาสตร์และข้อกำหนดในการให้บริการ มีรายงานว่าการประหยัดต้นทุนมาจากการจัดซื้อการสมัครสมาชิกระดับพรีเมียมจำนวนมากซึ่งแชร์กันระหว่างทีมนักพัฒนา

ทำไมร่องรอยการให้เหตุผลจึงคุ้มค่าที่จะขโมย

ข้อกังวลด้านความปลอดภัยมีมากกว่าความได้เปรียบทางการแข่งขัน OpenAI ให้เหตุผลว่าการแยกเหตุผลสามารถนำมาใช้ในการฝึกโมเดลอื่นได้โดยไม่ต้องรักษาการป้องกันที่ใช้กับเอาต์พุตที่ผู้ใช้ต้องเผชิญของโมเดลดั้งเดิม ซึ่งหมายความว่าการกลั่นในระดับสามารถถ่ายโอนความสามารถขั้นสูงโดยไม่ต้องลงทุนด้านความปลอดภัยที่สอดคล้องกัน บริษัทกล่าวว่าความเสี่ยงเหล่านั้นเพิ่มขึ้นเมื่อโมเดลมีความสามารถในโดเมนแบบใช้สองทาง

นักวิจัยอิสระก็ส่งเสียงเตือนเหมือนกัน ในรายงานที่ส่งไปยัง arXiv เมื่อวันที่ 10 สิงหาคม 2026 กลุ่มนักวิจัยซึ่งรวมถึง Alexander Panfilov, Ilia Shumailov และ Maksym Andriushchenko รายงานว่าผู้ให้บริการชั้นนำไม่ได้ปกปิดร่องรอยการให้เหตุผลของแบบจำลองของตนอย่างเต็มที่ และแสดงให้เห็นถึงช่องโหว่ข้ามโมเดลและการบีบอัดการสนทนาที่เกี่ยวข้องผ่านการเปิดเผยอย่างมีความรับผิดชอบ OpenAI กล่าวว่าได้ตรวจสอบการค้นพบเหล่านั้น ยืนยันว่าเส้นทางการโจมตีมีจริง และใช้งานเพื่อเร่งการบรรเทาผลกระทบ

อะไรจะเกิดขึ้นต่อไป

OpenAI กล่าวว่าได้ตรวจสอบขอบเขตของแคมเปญและผลกระทบที่อาจเกิดขึ้นก่อนเผยแพร่ ปรับใช้มาตรการบรรเทาผลกระทบของตนเอง และแบ่งปันข้อค้นพบกับนักวิจัยและพันธมิตรในอุตสาหกรรมเพื่อขอคำติชม งานบรรเทาผลกระทบและการสืบสวนเพิ่มเติมยังคงดำเนินต่อไป และบริษัทวางกรอบการกลั่นกรองฝ่ายตรงข้ามว่าเป็นความท้าทายด้านความปลอดภัยที่กว้างขึ้นสำหรับระบบนิเวศของห้องปฏิบัติการชายแดนทั้งหมด แทนที่จะเป็นเหตุการณ์เดียว

ตอนนี้ยังทำให้การอภิปรายนโยบายที่กำลังดำเนินอยู่คมชัดขึ้นอีกด้วย หากหน่วยงานของสหรัฐอเมริกาสนับสนุนแคมเปญการกลั่นอย่างเป็นทางการให้กับห้องปฏิบัติการของจีน คาดว่าจะมีการควบคุมการเข้าถึง API ที่เข้มงวดมากขึ้น การจำกัดอัตราและการตรวจสอบตัวตนที่เข้มงวดมากขึ้น และแรงกดดันอย่างต่อเนื่องต่อตลาดผู้รวบรวมและพร็อกซีที่ทำให้การซ่อนการละเมิดในวงกว้างง่ายขึ้น สำหรับบริษัท AI ทั้งสองด้านของมหาสมุทรแปซิฟิก ชั้นการให้เหตุผลกลายเป็นทรัพย์สินที่มีการโต้แย้ง และการปกป้องก็กลายเป็นวินัยด้านความปลอดภัยของตัวเอง

---

ก้าวนำหน้า AI

รับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว

อ่านข่าว AI เพิ่มเติม →