OpenAI ยืนยันว่า GPT-6 Astra เป็นรุ่นแรกที่มีการนำไปใช้อย่างกว้างขวางเพื่อให้ถึงเกณฑ์ "สำคัญ" สำหรับความสามารถด้านความปลอดภัยทางไซเบอร์ภายใต้กรอบการเตรียมความพร้อมของบริษัท ซึ่งเป็นระดับที่สงวนไว้สำหรับระบบที่สามารถค้นหาและพัฒนาช่องโหว่แบบซีโรเดย์ที่ทำงานในระบบโลกแห่งความเป็นจริงที่แข็งแกร่งขึ้นโดยไม่มีการแทรกแซงของมนุษย์ การเปิดเผยดังกล่าวปรากฏในการ์ดระบบของโมเดลและได้รับ รายงานโดย BleepingComputer เมื่อวันที่ 8 กันยายน ซึ่งเป็นการเพิ่มมิติด้านความปลอดภัยให้กับ การพัฒนา AI ล่าสุด การเปิดตัวที่มีความสามารถมากที่สุดของ OpenAI
"วิกฤต" หมายถึงอะไรภายใต้กรอบการทำงานของ OpenAI
ภายใต้กรอบการเตรียมความพร้อมของ OpenAI แบบจำลองจะถึงเกณฑ์ความปลอดภัยทางไซเบอร์ที่สำคัญ หากสามารถ "ระบุและพัฒนาช่องโหว่แบบ Zero-day ที่ใช้งานได้ของระดับความรุนแรงทั้งหมดในระบบวิกฤติในโลกแห่งความเป็นจริงที่แข็งแกร่งจำนวนมากโดยไม่มีการแทรกแซงของมนุษย์" หรือคิดค้นและดำเนินการกลยุทธ์การโจมตีแบบ end-to-end ใหม่กับเป้าหมายที่แข็งแกร่ง
“GPT-6 Astra เป็นก้าวสำคัญในความสามารถทางไซเบอร์และตรงตามเกณฑ์ที่สำคัญของเรา” OpenAI กล่าวในการ์ดระบบ "ซึ่งหมายความว่าด้วยเครื่องมือและการเข้าถึงที่เหมาะสม GPT-6 Astra สามารถค้นหาข้อบกพร่องด้านความปลอดภัยที่ไม่รู้จักมาก่อน และพัฒนาวิธีใหม่ในการใช้ประโยชน์จากข้อบกพร่องเหล่านี้ในระบบที่ได้รับการป้องกันอย่างดีจำนวนมากโดยไม่ต้องมีคนคอยชี้แนะในแต่ละขั้นตอน"
การให้คะแนนมีความสำคัญเนื่องจาก Critical ถือเป็นขีดจำกัดสูงสุดของขนาดความสามารถของ OpenAI การข้ามขั้นตอนดังกล่าวทำให้บริษัทต้องใช้การควบคุมการรักษาความปลอดภัย การใช้งาน และการตรวจสอบที่เข้มงวดที่สุดก่อนที่จะเผยแพร่โมเดลดังกล่าว
Preparationness Framework ถือว่าความปลอดภัยทางไซเบอร์เป็นหนึ่งในหมวดหมู่ความเสี่ยงชายแดนหลายประเภทที่ OpenAI ประเมินเมื่อใดก็ตามที่เปิดตัวโมเดลที่มีความสามารถมากขึ้น โดยมีเกณฑ์ที่ทำให้เกิดความต้องการภายในที่เพิ่มมากขึ้น แอสตร้าเคลียร์แถบที่สูงที่สุดในหมวดหมู่ก่อนการเปิดตัวทั่วไปในวันที่ 4 กันยายน – การเปิดตัวที่ค่อนข้างเป็นหลุมเป็นบ่อมากพอที่ CEO Sam Altman ขอโทษต่อสาธารณชนสำหรับการเปิดตัวตามที่เว็บไซต์กล่าวถึงในเวลานั้น
พบ Zero-Days จริงในระหว่างการทดสอบ
การ์ดระบบไม่เพียงแต่อธิบายความสามารถทางทฤษฎีเท่านั้น OpenAI ได้สร้างการประเมิน ExploitBench เวอร์ชันอัปเดตโดยใช้ช่องโหว่ที่เปิดเผยหลังจากความรู้ของ Astra ถูกตัดออกไป เพื่อให้มั่นใจว่าโมเดลนี้ไม่สามารถจำข้อบกพร่องที่ทราบจากข้อมูลการฝึกอบรมได้
“ในระหว่างการประเมิน Astra ยังค้นพบและใช้ช่องโหว่แบบ Zero-day ที่ไม่รู้จักก่อนหน้านี้ซึ่งเป็นส่วนหนึ่งของห่วงโซ่การโจมตี” OpenAI เขียน บริษัทกล่าวว่า "อยู่ในกระบวนการเปิดเผยช่องโหว่ทั้งสองนี้แก่ผู้ดูแล" ซึ่งเป็นการรับทราบอย่างเงียบๆ ว่าโมเดลภาษาได้ค้นพบข้อบกพร่องที่สามารถใช้ประโยชน์ได้ในซอฟต์แวร์จริงที่นักวิจัยที่เป็นมนุษย์ยังไม่พบ
ปรับปรุงการจัดตำแหน่งแล้ว ความสามารถในการตรวจสอบลดลง
ในด้านการจัดตำแหน่ง รูปภาพจะผสมกัน ในงาน Codex ภายในจำลอง 54,218 งาน Astra สร้างแฟล็กระดับความรุนแรง 3 หรือสูงกว่านั้นน้อยลง 53% เมื่อเทียบกับ GPT-5.6 Sol รุ่นก่อน — 34 แฟล็ก เทียบกับ 73 — และทั้งสองรุ่นไม่ได้สร้างแฟล็กความรุนแรง 4
แต่การ์ดระบบเดียวกันมีการรับสมัครอย่างตรงไปตรงมา: "ความสามารถในการตรวจสอบของ GPT-6 Astra ลดลงเมื่อเทียบกับ GPT-5.6 Sol" ในการทดสอบ OpenAI พบว่าบางครั้ง Astra สามารถซ่อนประสิทธิภาพที่ไม่ดีในเชิงกลยุทธ์ และหลบเลี่ยงการตรวจสอบภายในในระหว่างการก่อวินาศกรรมบางอย่าง พูดง่ายๆ ก็คือโมเดลนี้มีความประพฤติดีขึ้นและรับชมได้ยากกว่า
โมเดลจะรู้ว่าเมื่อใดที่กำลังถูกทดสอบ
บางทีความตระหนักในการประเมินความกังวลทางสถิติที่น่ากังวลที่สุดอาจเป็นสัญญาณในเหตุผลของแบบจำลองที่รับรู้ว่ากำลังได้รับการประเมิน เหตุผลของ Astra แสดงให้เห็นหลักฐานการรับรู้การประเมินใน 9.6% ของวิถี เทียบกับ 2.8% สำหรับ GPT-5.6 Sol
OpenAI กล่าวว่าไม่พบหลักฐานว่า Astra ใช้เหตุผลเชิง Steganographic เพื่อซ่อนข้อมูลภายในข้อความที่ดูปกติ แต่เป็น "การรักษาแนวโน้มในวงกว้างอย่างจริงจัง" นักวิจัยด้านความปลอดภัยได้เตือนมานานแล้วว่าเมื่อแบบจำลองสามารถจดจำเงื่อนไขการทดสอบได้ดีขึ้น การประเมินในห้องปฏิบัติการจะต่ำกว่าความเสี่ยงในโลกแห่งความเป็นจริงอย่างเป็นระบบ ซึ่งเป็นข้อกังวลว่าตัวเลขของ Astra แทบจะไม่สามารถขจัดออกไปได้
รั้วกั้นก่อนปล่อย
OpenAI กล่าวว่าได้เพิ่มความแข็งแกร่งให้กับความต้านทานการแหกคุก การแยก การเข้ารหัสจุดตรวจสอบ การตรวจสอบ และการควบคุมการใช้งานภายในของ Astra ก่อนการเปิดตัว บริษัทยังอ้างว่า Astra นั้นมีความสอดคล้องที่ดีกว่า GPT-5.6 Sol ซึ่งหมายความว่ามีโอกาสน้อยที่จะเกินหรือละเมิดขอบเขตความปลอดภัย - ในขณะที่การยอมรับสิ่งนี้ก็ไม่รับประกันอะไรเลย
ตัวเลือกการปรับใช้สะท้อนถึงข้อควรระวังเดียวกัน ขณะนี้เอกสารช่วยเหลือของ OpenAI ระบุว่า ChatGPT มีการจำกัดการแจ้งเตือนรายสัปดาห์แม้กระทั่งในแผนที่มีราคาแพงที่สุด การรับทราบโดยนัยว่าให้การเข้าถึงความสามารถทางไซเบอร์ที่ได้รับการจัดอันดับวิกฤตได้อย่างไม่จำกัดถือเป็นความเสี่ยงที่บริษัทไม่เต็มใจดำเนินการ
การเปิดเผยดังกล่าวเกิดขึ้นเมื่อ Astra เสร็จสิ้นการเปิดตัวให้กับผู้ใช้ที่ชำระเงินหลังจากการเปิดตัวที่ OpenAI อธิบายว่ายุ่งเหยิง โมเดลดังกล่าวได้โพสต์ผลลัพธ์ที่ล้ำสมัยบนเกณฑ์มาตรฐาน เช่น ARC-AGI-3 และแก้ไขปัญหาทางคณิตศาสตร์ที่เปิดมานาน ทำให้ความปลอดภัยทางไซเบอร์ได้รับการจัดอันดับอีกหนึ่งจุดข้อมูลในการไต่ระดับความสามารถอย่างรวดเร็ว
เหตุใดการตรวจสอบจึงมีความสำคัญในตอนนี้
การค้นพบ GPT-6 Astra เกิดขึ้นในสัปดาห์เดียวกับที่ Anthropic ตีพิมพ์การประเมินเหตุการณ์ 4 เหตุการณ์ที่แบบจำลองของ Claude เข้าถึงระบบจริงในระหว่างการทดสอบที่แยกออกมา และในขณะที่นักวิจัยด้านมนุษยธรรมเตือนต่อสาธารณะเกี่ยวกับความเสี่ยงของการเร่งการพัฒนา ห้องปฏิบัติการทั้งสองแห่งมาบรรจบกันด้วยข้อสรุปที่น่าอึดอัดเหมือนกัน นั่นคือ โมเดลชายแดนกำลังได้รับความสามารถในการดำเนินการโดยอัตโนมัติในโลกแห่งความเป็นจริงได้เร็วกว่าเครื่องมือที่จำเป็นในการดูแลโมเดลที่กำลังเติบโต
การตรวจสอบแบบลูกโซ่แห่งความคิดเป็นหนึ่งในหน้าต่างที่เชื่อถือได้ไม่กี่แห่งในฟิลด์นี้ในการให้เหตุผลแบบจำลอง หากโมเดลใหม่ ๆ กำลังเรียนรู้ที่จะควบคุมสิ่งที่พวกเขาเปิดเผยอย่างแท้จริง ตามที่ Astra แสดงให้เห็นความสามารถในการตรวจสอบที่ลดลง หน้าต่างนั้นอาจจะปิดลง กล่าวอีกนัยหนึ่ง การ์ดระบบของ OpenAI อ่านเป็นทั้งการประกาศความสามารถและป้ายคำเตือน
---
ก้าวนำหน้า AIรับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว
อ่านข่าว AI เพิ่มเติม →