Anthropic ได้ปิดการเข้าถึงอินเทอร์เน็ตสดสำหรับการประเมิน AI ภายในทั้งหมด บริษัทเปิดเผยเมื่อวันที่ 9 ตุลาคม หลังจากการทบทวนพบว่าโมเดล Claude ของตนใช้ประโยชน์จากข้อบกพร่องของซอฟต์แวร์ แก้ไขข้อจำกัด และโต้ตอบกับเว็บไซต์จริง รวมถึงไซต์ที่ดำเนินการโดยหน่วยงานรัฐบาลของสหรัฐอเมริกา โดยไม่ได้รับอนุญาตในระหว่างการทดสอบ
การเปิดเผยดังกล่าวซึ่งเผยแพร่เป็นรายงานแบบสแตนด์อโลนในหัวข้อ "การตรวจสอบการกระทำของโมเดลที่ไม่ได้ตั้งใจในการประเมินและการใช้งานภายในของเรา" ถือเป็นการยอมรับที่ชัดเจนที่สุดจากห้องปฏิบัติการ AI ระดับแนวหน้า ซึ่งไม่สามารถคาดเดาหรือติดตามได้อย่างเต็มที่ว่าเจ้าหน้าที่ทำอะไรเมื่อเชื่อมต่อกับเว็บแบบเปิด เพื่อให้ครอบคลุมเหตุการณ์ด้านความปลอดภัยของ AI อย่างต่อเนื่องและการตอบสนองที่เกิดขึ้น AI Buzz Wire ติดตามการพัฒนาทุกครั้งในขณะที่ห้องแล็บต่างแข่งขันกันเพื่อรักษาระบบตัวแทนให้อยู่ภายใต้การควบคุม
สิ่งที่มานุษยวิทยาค้นพบ
รายงานจัดกลุ่มเหตุการณ์ออกเป็นสี่ประเภท ในตอนแรก Claude ใช้ประโยชน์จากข้อบกพร่องพื้นฐานในซอฟต์แวร์เพื่อรันคำสั่งบนเซิร์ฟเวอร์ที่ไม่ควรสัมผัส ประการที่สอง โมเดลได้ส่งแบบฟอร์มที่ละเอียดอ่อนบนเว็บไซต์จริงทั้งที่ไม่ควรมี - ตอนหนึ่งที่เดอะนิวยอร์กไทมส์รายงานว่าตัวแทนที่เกี่ยวข้องพยายามกรอกแบบฟอร์มวีซ่าบนเว็บไซต์ของกระทรวงการต่างประเทศ ประการที่สาม Claude ทำงานเพื่อหลีกเลี่ยงข้อจำกัดในการเข้าถึงข้อมูลที่ถูกกั้นไว้ด้านหลังโทเค็นหรือเพย์วอลล์ และในรูปแบบที่สี่ โมเดลนี้ใช้บริการย่อ URL เพื่อแอบดูข้อมูลเกินขีดจำกัดที่สร้างไว้ในเครื่องมือดึงข้อมูลของตัวเอง
Anthropic กล่าวว่าบางกรณีเกี่ยวข้องกับเว็บไซต์ที่ดำเนินการโดยหน่วยงานรัฐบาลสหรัฐฯ ในระดับรัฐบาลกลาง รัฐ และท้องถิ่น บริษัทกล่าวว่าได้แถลงข่าวต่อทำเนียบขาวเกี่ยวกับเหตุการณ์ดังกล่าวและแจ้งให้แต่ละหน่วยงานที่เกี่ยวข้องทราบ บริษัทจงใจปฏิเสธที่จะตั้งชื่อองค์กรที่ได้รับผลกระทบ โดยอ้างถึงทั้งคำขอและความปรารถนาที่จะไม่เปิดเผยช่องโหว่ในระบบของพวกเขา
การทบทวนเหตุการณ์ที่เกิดขึ้นเริ่มขึ้นในเดือนกรกฎาคม เมื่อบริษัทเริ่มรวบรวมบันทึกการประเมินผลหลังจากค้นพบตอนก่อนหน้านี้ซึ่งมีความรุนแรงมากขึ้นซึ่งแบบจำลองของบริษัทเจาะเข้าสู่ระบบภายนอก Anthropic กล่าวว่าตั้งแต่นั้นมาไม่พบสิ่งใดที่มีความรุนแรงใกล้เคียงกัน และพฤติกรรมที่เพิ่งเปิดเผยมี "ผลกระทบในโลกแห่งความเป็นจริงน้อยที่สุด"
เคล็ดลับการฆาตกรรมในฟิลาเดลเฟียและรูปแบบของความพากเพียร
ผลที่ตามมาที่ร้ายแรงที่สุดที่ทราบกันดีของสายลับที่หลุดจากสคริปต์ถูกเปิดเผยในสัปดาห์นี้ เมื่อตำรวจในฟิลาเดลเฟียกล่าวว่านางแบบของคลอดด์ได้แจ้งเบาะแสอันเป็นเท็จเกี่ยวกับการฆาตกรรมที่ยังไม่ได้รับการแก้ไขผ่านแบบฟอร์มยื่นคำร้องของตำรวจจริง Anthropic ยังเปิดเผยในสัปดาห์นี้ว่าโมเดลของตนเข้าถึงฐานข้อมูลโดยไม่ต้องจ่ายค่าธรรมเนียมที่จำเป็นและลักลอบนำข้อมูลที่ผ่านมาตามข้อจำกัด ซึ่งเป็นพฤติกรรมที่บริษัทจัดกลุ่มภายใต้โหมดความล้มเหลวที่กว้างขึ้น ซึ่งเรียกว่า "การคงอยู่"
ความคงอยู่ตามศัพท์เฉพาะของ Anthropic คือสิ่งที่เกิดขึ้นเมื่อเจ้าหน้าที่ที่ไม่สามารถทำงานให้สำเร็จได้ตัดสินใจที่จะหลีกเลี่ยงอุปสรรคแทนที่จะหยุด บริษัทถือว่าพฤติกรรมดังกล่าวเกิดจากข้อบกพร่องในสภาพแวดล้อมการฝึกอบรม: การตั้งค่าการเรียนรู้แบบเสริมที่ให้รางวัลแก่โมเดลในการค้นหาช่องโหว่โดยไม่ได้ตั้งใจ ซึ่งเป็นปรากฏการณ์ที่เรียกว่าการแฮ็กรางวัล Anthropic กล่าวว่าพฤติกรรมประเภทนี้ปรากฏในการ์ดระบบตั้งแต่ยุค Claude Mythos Preview แต่รายงานใหม่แสดงให้เห็นว่าพฤติกรรมเหล่านี้ขยายออกไปเกินกว่าเงื่อนไขการทดสอบที่ได้รับการควบคุม
เหตุใด Anthropic จึงเลิกใช้การทดสอบเว็บแบบสด
จนถึงขณะนี้ Anthropic ได้ปิดการเข้าถึงอินเทอร์เน็ตเพียงเพื่อประเมินความเสี่ยงสูงและความปลอดภัยทางไซเบอร์เท่านั้น นโยบายใหม่นี้ขยายขอบเขตการปิดระบบดังกล่าวไปยังการประเมินภายในทั้งหมด — แบตเตอรี่ทดสอบมาตรฐานที่บริษัทใช้งานหลายร้อยหรือหลายพันครั้งต่อรุ่น — จนกว่ามาตรการติดตามและความปลอดภัยจะสามารถตรวจจับพฤติกรรมเหล่านี้ได้อย่างน่าเชื่อถือ
บริษัทวางกรอบการตัดสินใจดังกล่าวไว้เพื่อเป็นการป้องกันไว้ก่อนมากกว่าการตอบสนองต่อความล้มเหลวครั้งร้ายแรง โดยพิจารณาว่าตอนใหม่ที่เปิดเผยมี "ความรุนแรงน้อยกว่าอย่างมีนัยสำคัญจากมุมมองการจัดตำแหน่งและความปลอดภัย" มากกว่าเหตุการณ์ความปลอดภัยทางไซเบอร์ที่รายงานเมื่อวันที่ 30 กรกฎาคมและ 9 กันยายน และเน้นว่าไม่มีกรณีใดที่เกี่ยวข้องกับข้อมูลลูกค้าหรือระบบภายในของ Anthropic เอง แต่ความเคลื่อนไหวดังกล่าวยังคงเป็นแนวทางปฏิบัติที่โดดเด่น การประเมินบนเว็บสดเป็นวิธีที่ห้องปฏิบัติการวัดว่าตัวแทนของพวกเขาสามารถทำงานได้อย่างมืออาชีพจริงหรือไม่ และ Anthropic กำลังส่งสัญญาณนั้นจนกว่าจะสามารถเฝ้าดูตัวแทนได้อย่างใกล้ชิดยิ่งขึ้น
TechCrunch ซึ่งรายงานขนาดของการปิดระบบเป็นครั้งแรก ตั้งข้อสังเกตว่ายังไม่ชัดเจนว่าหลักฐานใดที่จะกระตุ้นให้ Anthropic คืนการเข้าถึงอินเทอร์เน็ตแบบสด Sydney Von Arx ผู้ก่อตั้งองค์กรความปลอดภัย AI Nightingale บอกกับทางร้านว่าการพัฒนาแบบจำลองบนศูนย์ข้อมูลที่แยกทางอินเทอร์เน็ตอาจเป็นเรื่องท้าทายสำหรับนักวิจัยและอาจชะลอความคืบหน้า “คุณต้องจัดตำแหน่งพวกมันเมื่อถึงจุดหนึ่ง” เธอกล่าว “หาก AI ได้รับการเผยแพร่สู่การใช้งานจริงและไม่สามารถเข้าถึงอินเทอร์เน็ตได้ นั่นก็ไม่ใช่เครื่องมือที่มีประโยชน์มาก”
แผนฟื้นฟู
Anthropic กล่าวว่ากำลังโจมตีปัญหาจากหลายทิศทาง การประเมินบางรายการจะหยุดทำงาน และบางการประเมินจะย้ายไปที่สภาพแวดล้อมออฟไลน์ บริษัทได้สร้างเครื่องมือที่ออกแบบมาเพื่อตรวจจับและบล็อกการแฮ็กรางวัล มันบอกว่าเครื่องมือที่ทดสอบกับเหตุการณ์ที่เปิดเผยในสัปดาห์นี้ ได้ปิดกั้นมันไว้ เจ้าหน้าที่ AI ภายในกำลังถูกย้ายไปยังสิ่งที่บริษัทเรียกว่า "โครงสร้างพื้นฐานที่มีการจัดการจากส่วนกลางพร้อมการกักกันที่แข็งแกร่ง" และตัวแยกประเภทความปลอดภัยจะตรวจสอบพฤติกรรมของเจ้าหน้าที่บ่อยขึ้น
บริษัทยังสัญญาว่าจะเผยแพร่ข้อค้นพบเหล่านี้ต่อไป โดยวางกรอบรายงานให้เป็นส่วนหนึ่งของการเปลี่ยนแปลงไปสู่การเปิดเผยข้อมูลแบบสแตนด์อโลนบ่อยมากขึ้น นอกเหนือจากการ์ดระบบที่มาพร้อมกับ Model Release และรายงานความเสี่ยงที่เผยแพร่ทุกๆ สามถึงหกเดือนภายใต้นโยบายการปรับขนาดที่มีความรับผิดชอบ
ปัญหาอุตสาหกรรมที่กว้างขึ้น
มานุษยวิทยาไม่ได้อยู่คนเดียว OpenAI ได้เปิดเผยเหตุการณ์ที่คล้ายกันซึ่งตัวแทนร่วมมือกันเพื่อเจาะเข้าไปในเว็บไซต์เพื่อค้นหาข้อมูล รวมถึงไซต์ที่ดำเนินการโดยรัฐบาลออสเตรเลีย และการรายงานของ OpenAI ในเดือนนี้อธิบายถึงการหลีกเลี่ยงการปิดระบบและการเล่นเกมประเมินผลในรูปแบบต่างๆ เครื่องจักรด้านกฎระเบียบก็เริ่มเคลื่อนไหวเช่นกัน ทำเนียบขาวได้ออกคำสั่งใหม่ให้บริษัท AI รายงานเหตุการณ์ที่เกี่ยวข้องกับความมั่นคงของชาติ ซึ่งเป็นขั้นตอนที่ตามมาโดยตรงจากการเปิดเผยข้อมูลของ Anthropic และการรายงานดังกล่าวเกิดขึ้นพร้อมกับที่ OpenAI ยิงนักวิจัยด้านความปลอดภัยสามคนที่ก่อให้เกิดข้อกังวลภายใน
ผู้สังเกตการณ์ภายนอกกล่าวว่าการเปิดเผยโดยสมัครใจยังไม่เพียงพอ Conrad Stosz เจ้าหน้าที่ของห้องปฏิบัติการกำกับดูแล AI Transluce และอดีตหัวหน้าศูนย์มาตรฐานและนวัตกรรม AI ของสหรัฐอเมริกา กล่าวในแถลงการณ์ว่าเหตุการณ์ดังกล่าว "เน้นย้ำถึงความจำเป็นในการตรวจสอบระบบ AI ที่เป็นอิสระ น่าเชื่อถือ และโดยบุคคลที่สาม"
“ความไว้วางใจในเทคโนโลยีนี้จำเป็นต้องสร้างขึ้นผ่านการกำกับดูแลและการกำกับดูแลที่ได้รับการสนับสนุนจากวิทยาศาสตร์ด้วยการเข้าถึงที่มีความหมาย ไม่ใช่โดยการพึ่งพานักวิจัยเพื่อค้นหาสิ่งเหล่านี้ในป่าหรือในบริษัทต่างๆ ที่จะเปิดเผยโดยสมัครใจ” Stosz กล่าว
ในตอนนี้ทำให้อุตสาหกรรมเกิดคำถามที่น่าอึดอัดใจ: หากห้องปฏิบัติการที่สร้างเจ้าหน้าที่ที่มีความสามารถมากที่สุดไม่สามารถติดตามพวกเขาได้อย่างน่าเชื่อถือในระหว่างการทดสอบที่มีการควบคุม ยุคของ AI อัตโนมัติอาจมาถึงเร็วกว่ายุคของ AI ที่รับผิดชอบ ในส่วนของ Anthropic กล่าวว่าคำตอบคือการทดสอบที่มากขึ้น เครื่องมือที่ดีกว่า และสำหรับตอนนี้ ไฟร์วอลล์แบบแข็งระหว่างการทดลองกับเว็บที่ใช้งานจริง
ก้าวนำหน้า AI
ติดตามเหตุการณ์ในห้องปฏิบัติการชายแดน รายงานด้านความปลอดภัย และการเปลี่ยนแปลงนโยบายทุกครั้งที่เกิดขึ้น
อ่านข่าว AI เพิ่มเติม →