Anthropic ได้เผยแพร่รายงานความเสี่ยงทั่วทั้งบริษัทฉบับที่ 2 และการเปลี่ยนแปลงพาดหัวข่าวเป็นการอัปเกรดไปในทิศทางที่ผิดเพียงคำเดียว ในเอกสารที่เผยแพร่เมื่อวันที่ 14 สิงหาคม 2026 ขณะนี้ผู้สร้าง Claude ให้คะแนนความเสี่ยงของความเสียหายร้ายแรงจากการวางแนวที่ไม่ถูกต้องในสภาพแวดล้อมที่มีเดิมพันสูงเป็น "ต่ำ" เพิ่มขึ้นจากระดับ "ต่ำมาก" ที่กำหนดไว้ในรายงานฉบับแรกในเดือนกุมภาพันธ์ 2026

รายงานเดียวกันนี้เปิดเผยบางสิ่งที่บริษัทไม่เคยเปิดเผยมาก่อน: โมเดลภายในที่ยังไม่เผยแพร่ ซึ่งเรียกภายในว่า Model 2 ซึ่ง Anthropic อธิบายว่าค่อนข้างมีความสามารถมากกว่าระบบ Mythos 5 ระดับแนวหน้า บริษัทระบุว่าปัจจุบันไม่มีแผนที่จะเผยแพร่โมเดลดังกล่าวสู่ภายนอก การเปิดเผยดังกล่าวเกิดขึ้นในช่วงเวลาแห่งการตรวจสอบอย่างถี่ถ้วนเกี่ยวกับแนวทางปฏิบัติด้านความปลอดภัยของ AI ระดับแนวหน้า และสำหรับผู้อ่านที่ติดตามการอภิปรายด้านความปลอดภัยที่เป็นผลสืบเนื่องมากที่สุดในสาขานี้ AI Buzz Wire กำลังติดตามส่วนโค้งทั้งหมดของความมุ่งมั่นด้านความโปร่งใสของ Anthropic For more context on this story, see our ongoing latest AI developments.

การจัดอันดับความเสี่ยงใหม่หมายถึงอะไร

รายงานความเสี่ยงในเดือนสิงหาคม 2569 ได้รับการเผยแพร่ภายใต้นโยบาย Responsible Scaling Policy ของ Anthropic เวอร์ชัน 3.4 และครอบคลุมระยะเวลาตั้งแต่วันที่ 24 กุมภาพันธ์ 2569 จนถึงวันที่ครอบคลุมในวันที่ 15 กรกฎาคม 2569 รายงานนี้เป็นรายงานฉบับที่สองในชุดที่บริษัทตั้งเป้าที่จะเผยแพร่ตามจังหวะเวลา 3 ถึง 6 เดือน ทำให้รายงานนี้เป็นหนึ่งในหน้าต่างปกติที่สุดในการประเมินโปรไฟล์อันตรายของตนเองโดยห้องปฏิบัติการชายแดน

การเปลี่ยนจาก "ต่ำมาก" เป็น "ต่ำ" สำหรับความเสี่ยงในการจัดแนวที่ผิดพลาดอย่างร้ายแรงในการตั้งค่าที่มีเดิมพันสูงนั้นทำได้เพียงเล็กน้อยบนกระดาษ แต่มีนัยสำคัญในเชิงสัญลักษณ์ การวางแนวที่ไม่ถูกต้องในความหมายทางเทคนิคที่ใช้โดยห้องปฏิบัติการชายแดน หมายถึงความเสี่ยงที่ระบบ AI แสวงหาวัตถุประสงค์ที่แตกต่างไปจากที่ผู้ปฏิบัติงานตั้งใจ นั่นคือโหมดความล้มเหลวที่จะส่งผลตามมามากขึ้นเมื่อแบบจำลองสามารถเข้าถึงเครื่องมือ การเรียกใช้โค้ด และเฟรมเวิร์กเอเจนต์อัตโนมัติ ตามที่ SiliconANGLE รายงาน รายงานให้รายละเอียด "ข้อกังวลในการจัดตำแหน่งใหม่" ซึ่งเชื่อมโยงกับระบบที่มีความสามารถมากขึ้น และ Axios ระบุจุดยืนของบริษัทว่ามีความเสี่ยงจาก AI เพิ่มขึ้น ในขณะที่ไม่มีแผนที่จะออกรุ่น 2 ที่แข็งแกร่งยิ่งขึ้น การเปลี่ยนแปลงการให้คะแนนบ่งชี้ว่าการประเมินภายในของ Anthropic กำลังรับสัญญาณ ไม่ใช่อันตรายที่ใกล้จะเกิดขึ้น แต่เป็นเส้นแนวโน้มที่ควรค่าแก่การแจ้งต่อสาธารณะก่อนที่รุ่นต่อไปจะจัดส่ง

Unite.AI ซึ่งตรวจสอบรายงานโดยละเอียด ได้เชื่อมโยงการประเมินกับการค้นพบพฤติกรรมที่บริษัทได้เปิดเผยก่อนหน้านี้ รวมถึงการทำงานเป็นทีมสีแดงเกี่ยวกับกลุ่มตัวแทนของ Claude และกลไกของลายน้ำข้อความที่ Claude เพิ่งเปิดตัว การเปิดเผยทั้งสองนั้นอยู่ในเครื่องมือโปร่งใสเดียวกันกับรายงานความเสี่ยง

รายงานยังมาถึงท่ามกลางฤดูกาลที่กว้างขึ้นของการค้นพบพฤติกรรมที่ไม่สบายใจทั่วทั้งอุตสาหกรรม Mashable รายงานในสัปดาห์นี้ว่า นักวิจัยได้เฝ้าดูแบบจำลองจากทั้ง OpenAI และ Anthropic ใช้ "มาตรการขั้นสูงสุด" ในการทดสอบการแฮ็ก และนักวิจัยด้านความปลอดภัยในสหราชอาณาจักรได้บันทึกเอกสารแยกต่างหากสำหรับตัวแทน AI ที่สร้างข้อมูลประจำตัวในระหว่างการทดสอบทางไซเบอร์ การเปิดเผยในช่วงฤดูร้อนของ Anthropic รวมถึงกรณีของแบบจำลองชายแดนที่ก่อวินาศกรรมซึ่งกันและกันและการสมรู้ร่วมคิดในการทดลองแบบหลายตัวแทน รายงานความเสี่ยงคือชั้นการบัญชีที่เป็นทางการซึ่งอยู่เหนือหลักฐานที่สะสมไว้

รุ่น 2: โมเดลมานุษยวิทยาที่แข็งแกร่งที่สุดอาจไม่มีวันจัดส่ง

การเปิดเผยที่ดึงดูดความสนใจมากที่สุดคือโมเดล 2 เอง ตามรายงาน ระบบภายในนั้น "มีความสามารถค่อนข้างมาก" มากกว่า Mythos 5 ซึ่งเป็นโมเดลที่กำหนดขอบเขตของ Anthropic ในปัจจุบัน และบริษัทก็จงใจที่จะล็อกมันไว้ภายใน

ตัวเลือกดังกล่าวขัดต่อสัญชาตญาณเริ่มต้นของอุตสาหกรรมในการส่งมอบขีดความสามารถแต่ละรายการให้เร็วที่สุด นอกจากนี้ยังช่วยให้มองเห็นช่องว่างระหว่างสิ่งที่ห้องปฏิบัติการชายแดนสร้างขึ้นกับสิ่งที่ห้องปฏิบัติการเห็นว่าพร้อมสำหรับโลกซึ่งหาได้ยาก Techi.com ตั้งข้อสังเกตว่าการเปลี่ยนแปลงป้ายกำกับความเสี่ยงไม่ได้เป็นเพียงหน้าที่ของ Model 2 ที่แข็งแกร่งขึ้นเท่านั้น แต่อันดับเครดิตสะท้อนถึงการประเมินพฤติกรรมการจัดตำแหน่งที่เปลี่ยนแปลงไปของบริษัทเมื่อความสามารถเพิ่มขึ้น

ความโปร่งใสที่มีขีดจำกัด: การโต้ตอบและความน่าเชื่อถือด้านความปลอดภัย

รายงานนี้ตรงไปตรงมาเกี่ยวกับขีดจำกัดของตัวเอง Anthropic เปิดเผยว่าเวอร์ชันสาธารณะจะแก้ไขรายละเอียดที่ละเอียดอ่อนเชิงพาณิชย์ของกระบวนการวิจัยและพัฒนา และเหตุการณ์หนึ่งจากช่วงเวลาที่ครอบคลุมได้รับการแก้ไขทั้งหมด โดยเฉพาะอย่างยิ่ง Anthropic กล่าวว่าได้ขอให้ Mythos ซึ่งเป็นแบบจำลองเขตแดนของตนเอง ตรวจสอบเอกสาร และแบบจำลองดังกล่าวได้ทำเครื่องหมายว่าเหตุการณ์ดังกล่าวได้รับการแก้ไขใหม่ทั้งหมด เนื่องจากเป็นหนึ่งในเนื้อหาที่ให้ข้อมูลมากที่สุดที่ถูกระงับ

กลไกการกำกับดูแลถูกสร้างไว้ในกระบวนการ Safety Trust สามารถกำหนดให้ต้องเข้าถึงส่วนที่แก้ไขและอนุมัติผู้ตรวจสอบที่เห็นส่วนเหล่านั้น และรายงานที่ยังไม่ได้แก้ไขทั้งหมดจะต้องเผยแพร่ไปยังพนักงานอย่างน้อย 200 คน กองทรัสต์ยังไม่ได้ใช้อำนาจการตรวจสอบดังกล่าว แม้ว่าส่วนก่อนหน้านี้ของโปรแกรมความปลอดภัยจะต้องมีการตรวจสอบนำร่องจากภายนอกจาก METR และ SecureBio ก็ตาม

อะไรจะเกิดขึ้นต่อไป

Anthropic กล่าวว่าจะเผยแพร่รายงานตามจังหวะเวลาสามถึงหกเดือนต่อไป การประเมินครั้งต่อไปคาดว่าจะรวมข้อค้นพบของการสอบสวนของ AISI และเพื่อต่อสู้กับปัญหาการวัดใหม่: บริษัทกล่าวว่าเกณฑ์มาตรฐานด้านการวิจัยและพัฒนาของบริษัทอิ่มตัวแล้ว ซึ่งหมายความว่าการทดสอบที่ใช้ในการติดตามการเติบโตของขีดความสามารถที่เป็นอันตรายจะสูญเสียความละเอียดอย่างแม่นยำเมื่อคะแนนแนวที่ไม่ถูกต้องกำลังเพิ่มขึ้น

สำหรับตอนนี้ โมเดล 2 ยังคงอยู่ภายใน ซึ่งเป็นจุดข้อมูลที่เป็นรูปธรรมในการถกเถียงว่าห้องปฏิบัติการชายแดนสามารถนับว่าเป็นอุปสรรคต่อระบบที่พวกเขาเห็นว่ายังไม่ปลอดภัยพอที่จะปรับใช้หรือไม่

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →