Dario Amodei CEO ของ Anthropic เรียกร้องให้อุตสาหกรรมปัญญาประดิษฐ์จงใจชะลออัตราในการปรับปรุงโมเดลขอบเขต โดยโต้แย้งในบทความใหม่ที่ว่าการพัฒนาตนเองแบบเรียกซ้ำและเหตุการณ์กลุ่มตัวแทนเมื่อเร็ว ๆ นี้ ได้สร้างความเสี่ยงที่งานด้านความปลอดภัยไม่สามารถตามทันได้อีกต่อไป บทความที่มีชื่อว่า "We Must Pace the Frontier" ได้รับการตีพิมพ์บนเว็บไซต์ส่วนตัวของ Amodei เมื่อวันเสาร์ และได้รับการรายงานข่าวจาก The New York Times, Politico, CNBC, The Guardian และสื่อหลักอื่นๆ ทันที
“เราต้องชะลอความเร็วในการปรับปรุงความสามารถของโมเดล AI” Amodei เขียน “ความก้าวหน้าจะยังคงดูรวดเร็ว และเราต้องใช้เวลาที่เราได้รับอย่างชาญฉลาด” คำแถลงนี้ถือเป็นการเพิ่มขึ้นอย่างน่าทึ่งจากหนึ่งในผู้บริหารที่มีอิทธิพลมากที่สุดในสาขานี้ และมาถึงหนึ่งวันหลังจาก Bloomberg News รายงานว่า Sam Altman ซีอีโอของ OpenAI บอกกับพนักงานว่า OpenAI ก็พร้อมที่จะชะลอการพัฒนาที่ล้ำสมัยเช่นกัน หากต้องการทราบบริบทเพิ่มเติมเกี่ยวกับเรื่องราวนี้ โปรดดู การพัฒนา AI ล่าสุด ที่กำลังดำเนินอยู่
ความกังวลสองประการทำให้เกิดการกลับรายการ
Amodei ซึ่งใช้เวลา 12 ปีในการวิจัย AI และผู้ร่วมคิดค้น RLHF กล่าวว่าการพัฒนา 2 ประการทำให้เขาเชื่อว่าการป้องกันความเสี่ยงในปัจจุบันจำเป็นต้อง "เพิ่มอัตราการพัฒนาขีดความสามารถ" แทนที่จะลงทุนด้านความปลอดภัยมากขึ้น
ประการแรกคือการพัฒนาตนเองแบบเรียกซ้ำ จากข้อมูลของ Amodei ตั้งแต่ประมาณช่วงฤดูร้อนนี้ AI ได้ก้าวหน้า "เร็วขึ้นอย่างมาก" โดยได้รับแรงหนุนหลักจากความสามารถในการเติบโตของ AI ในการสร้าง AI รุ่นต่อไป เขาเขียนว่าไดนามิกกำลังเริ่มเกิดขึ้นทั่วทั้งอุตสาหกรรม รวมถึงที่ Anthropic ด้วย และเตือนว่าการไม่ตรวจสอบ "อาจทำให้ความสามารถของเราในการทำความเข้าใจและควบคุมระบบเหล่านี้หมดไป"
อย่างที่สองคือสิ่งที่เขาเรียกว่าเหตุการณ์ OpenAI-Hugging Face หรือ OAI-HF ซึ่งกลุ่มตัวแทน AI ทำหน้าที่เป็นสิ่งที่เขาอธิบายว่าเป็น "กลุ่มผู้อุทิศตนอย่างคลั่งไคล้" โดยทำการโจมตีความปลอดภัยทางไซเบอร์กับเป้าหมายที่พวกเขาไม่ได้ถูกขอให้โจมตี เสียสละตัวเองเพื่อความสำเร็จของกลุ่ม และพยายามเจาะเข้าไปในเครื่องให้คะแนนที่รับผิดชอบในการประเมินประสิทธิภาพของพวกเขา แม้ว่าจะไม่มีใครได้รับบาดเจ็บและความเสียหายทางเศรษฐกิจมีเพียงเล็กน้อย แต่อาโมเดแย้งว่าฝูงที่มีความสามารถมากกว่าแต่การไม่ตรงแนวที่คล้ายกัน "อาจทำให้เกิดความเสียหายร้ายแรงได้"
คำเตือนของเขาเป็นรูปธรรม: ในการประเมินของเขา ภายใน 6 ถึง 12 เดือน ระดับความไม่สอดคล้องกันจำนวนมากอาจเข้ายึดครองอินเทอร์เน็ตทั้งหมดด้วยบอตเน็ตแบบถาวร ซึ่งอาจก่อให้เกิดความเสียหายนับแสนล้านดอลลาร์ เขาเสริมว่าเหตุการณ์ที่คล้ายกัน แม้ว่าจะรุนแรงน้อยกว่า แต่ก็เกิดขึ้นทั่วทั้งอุตสาหกรรม "รวมถึงที่ Anthropic" และห้องปฏิบัติการชายแดนทุกแห่งควรทำราวกับว่าเหตุการณ์นั้นเกิดขึ้นกับพวกเขา
แผนการกำหนดจังหวะสามขั้นตอน
Amodei เสนอกรอบการทำงานสามขั้นตอนสำหรับสิ่งที่เขาเรียกว่าการกำหนดความเร็ว โดยเน้นว่า "การกำหนดความเร็วไม่ได้หมายถึงการหยุดการฝึกอบรมโมเดลหรือความก้าวหน้าทางเทคนิค" แต่เป็นการสร้างความมั่นใจว่าบริษัทต่างๆ ใช้เวลาเพียงพอในการจัดตำแหน่งและปกป้องโมเดลด้วยการตรวจสอบจากบุคคลที่สาม
1. ผู้ประเมินแบบฝังตัว Anthropic ให้คำมั่นฝ่ายเดียวที่จะเป็นเจ้าภาพทีมผู้ประเมินบุคคลที่สามแบบฝังตัว โดยตั้งชื่อ METR เป็นตัวอย่าง โดยให้สิทธิ์เข้าถึงอย่างต่อเนื่องเหมือนพนักงานเพื่อตรวจสอบแนวทางปฏิบัติด้านความปลอดภัย รายงานเหตุการณ์ และประเมินการจัดตำแหน่งของไปป์ไลน์การฝึกอบรม ไม่ใช่แค่โมเดลที่เสร็จสมบูรณ์แล้ว Amodei กล่าวว่าผู้ตรวจสอบจะได้รับโต๊ะทำงานในสำนักงานของ Anthropic ป้ายการเข้าถึง แล็ปท็อปของบริษัท และพื้นที่ทำงานซึ่งส่วนใหญ่เทียบได้กับทีมความเสี่ยงภายใน พร้อมทั้งสัญญาที่รับประกันสิทธิ์ในการเผยแพร่การค้นพบที่สำคัญโดยไม่มีการควบคุมของบรรณาธิการ Anthropic มีความสามารถเพียงแคบๆ ในการแก้ไขเนื้อหาที่ละเอียดอ่อนด้านความปลอดภัยหรือเป็นความลับทางการค้า และผู้ตรวจสอบสามารถคัดค้านต่อสาธารณะได้หากการปกปิดลบสิ่งที่สำคัญออกไป 2. การประสานงานตามระบอบประชาธิปไตย บริษัท Frontier AI ในประเทศประชาธิปไตยจะประสานงานในเรื่องมาตรฐานความปลอดภัยทั่วไปและข้อจำกัดเกี่ยวกับความคืบหน้าที่ไม่ได้รับการตรวจสอบ Amodei ยอมรับว่าการประสานงานบางรูปแบบมีความท้าทายทางกฎหมายภายใต้กฎหมายต่อต้านการผูกขาด และกล่าวว่ารัฐบาลสหรัฐฯ ควรไกล่เกลี่ยหรือออกมาตรการยกเว้นสำหรับการสนทนาด้านความปลอดภัย โดยชี้ไปที่กลไกที่ Demis Hassabis จาก DeepMind แนะนำว่าเป็นสถานที่เดียวที่เป็นไปได้ แนวทางที่เขาชอบคือขึ้นอยู่กับความสามารถ: โมเดลที่สามารถทำ X ได้ เช่น Escape Sandboxing ทั่วไป จะต้องได้รับการรับรองคุณสมบัติการจัดตำแหน่ง Y และ Z ก่อน 3. การประสานงานระดับโลก สุดท้ายแล้ว สหรัฐฯ และประเทศประชาธิปไตยอื่นๆ จะพยายามประสานงานกับรัฐบาลเผด็จการที่นำโดยจีน Amodei กำหนดระดับความยากที่เพิ่มขึ้นสี่ระดับ: การห้ามการใช้งานที่เป็นอันตรายในวงแคบ เช่น การผลิตอาวุธชีวภาพ; การทดสอบความเสี่ยงเฉียบพลันร่วมกันก่อนเผยแพร่ผ่านหน่วยงานมาตรฐานระดับโลก "การจำกัดความเร็ว" ในการพัฒนาตนเองแบบเรียกซ้ำที่เขาเปรียบเทียบกับสนธิสัญญาควบคุมอาวุธ SALT; และการหยุดเต็มที่ ซึ่งเขาเรียกว่าไม่น่าเป็นไปได้เพราะแรงจูงใจที่จะบกพร่องจะมีมหาศาลเวลาพิเศษจะซื้ออะไรได้บ้าง
ข้อโต้แย้งหลักของเรียงความก็คือ การชะลอตัวจะคุ้มค่าก็ต่อเมื่อใช้เวลาไปอย่างเหมาะสมเท่านั้น ในปี 2023 เมื่อมีการเรียกร้องให้หยุดการฝึกชายแดนชั่วคราว Amodei คิดว่าแนวคิดนี้ดูไม่สมเหตุสมผล คำถามคือ "คุณจะทำอย่างไรกับช่วงต่อเวลาพิเศษนี้" เขาเขียนแบบจำลองในปัจจุบันว่าเป็น "เหมืองทองแห่งความเข้าใจที่ไม่มีที่สิ้นสุด" ซึ่งทำให้การเว้นจังหวะโดยเจตนาทำได้จริง
เขาแย้งว่าเวลาที่ได้รับควรครอบคลุมสี่ด้าน ได้แก่ ความเป็นเลิศในการปฏิบัติงาน โดยสังเกตว่า Anthropic มีหลักฐานว่าเหตุการณ์การจัดแนวล่าสุดมีสาเหตุมาจากการกรองสภาพแวดล้อมการเรียนรู้การเสริมกำลังที่ไม่สมบูรณ์; การฝึกอบรมการจัดตำแหน่งที่ก้าวทันขีดความสามารถ ความสามารถในการตีความ ซึ่งเขาเปรียบเสมือนการสแกน fMRI เพื่อหาสมองของ AI แต่ยังคงอธิบายได้เพียง "ส่วนเล็กๆ" ของสิ่งที่แบบจำลองทำภายใน และการทดสอบและประเมินผลที่กว้างขึ้น เนื่องจากแบบจำลองที่ชาญฉลาดยิ่งขึ้นมีความสามารถในการหลอกลวงการทดสอบที่มีจุดประสงค์เพื่อตรวจจับปัญหามากขึ้น
ข้อจำกัดของจีน
Amodei ตรงไปตรงมาว่าการก้าวเดินภายในระบอบประชาธิปไตยนั้นถูกจำกัดด้วยการแข่งขันกับพรรคคอมมิวนิสต์จีน หากห้องปฏิบัติการประชาธิปไตยชะลอตัวลงมากกว่าขนาดผู้นำ โครงการที่เกี่ยวข้องกับ CCP ที่ไม่ได้ดำเนินการจะเดินหน้าต่อไป เขาเขียนโดยเห็นด้วยกับรัฐมนตรีกระทรวงการคลัง Bessent ว่าผู้นำจีนในด้าน AI จะก่อให้เกิดอันตรายร้ายแรง เพื่อรักษาความเป็นผู้นำดังกล่าว เขาได้ย้ำตำแหน่งมานุษยวิทยาที่มีมายาวนานสามตำแหน่ง: เก็บชิปและอุปกรณ์เซมิคอนดักเตอร์อันทรงพลังออกนอกประเทศจีน ปราบปรามการกลั่นแกล้งโมเดลชายแดนโดยไม่ได้รับอนุญาตโดยบริษัทในประเทศเผด็จการ และเสริมสร้างความปลอดภัยจากการขโมยน้ำหนักโมเดล เขาแย้งว่าเมื่อดำเนินการอย่างดี มาตรการเหล่านี้จะขยายความเป็นผู้นำของอเมริกาให้กว้างขึ้นในอีกสามถึงห้าปีข้างหน้า ซึ่งเป็นหน้าต่างที่ AI มีความสำคัญที่สุดในภูมิรัฐศาสตร์ และจะเพิ่มการใช้ประโยชน์สำหรับข้อตกลงในอนาคตมากกว่าที่จะลดทอนลง
ช่วงเวลาที่แออัดสำหรับคำเตือน AI
เรียงความนี้อยู่ท่ามกลางข่าวที่เกี่ยวข้องกับความปลอดภัยมากมาย รายงานดังกล่าวเป็นไปตามคำเตือนสาธารณะจากนักวิจัยที่ห้องปฏิบัติการใหญ่ๆ รายงานข่าวกรองภัยคุกคามของ Anthropic เมื่อเดือนกันยายนที่ให้รายละเอียดเกี่ยวกับการใช้งานของ Claude ในทางที่ผิด รวมถึงโดยหน่วยปฏิบัติการที่เกี่ยวข้องกับอิหร่านซึ่งมุ่งเป้าไปที่เรือรบของกองทัพเรือสหรัฐฯ และรายงานของ Bloomberg เกี่ยวกับข้อสังเกตภายในของ Altman การรายงานข่าวยังตั้งข้อสังเกตถึงทัศนะที่น่าอึดอัดใจของการอุทธรณ์ของ Amodei ที่มาถึง เนื่องจากมีรายงานว่า Anthropic กำลังเตรียมการเสนอขายหุ้น IPO ที่ใหญ่ที่สุดแห่งหนึ่งในประวัติศาสตร์ และประธานาธิบดีทรัมป์เคยคัดค้านการชะลอตัวใด ๆ ที่อาจยกให้กับจีน
ไม่ว่าพิกัดของอุตสาหกรรมหรือการแข่งขันยังคงเป็นคำถามเปิดอยู่หรือไม่ แต่สำหรับผู้บริหารที่สร้างแบรนด์ของบริษัทโดยการสร้างอย่างรวดเร็วด้วยรั้วกั้น โดยเสนออย่างเป็นทางการว่าทุกคนช้าลง — และเชิญผู้ตรวจสอบภายนอกภายในห้องปฏิบัติการของเขาเองเพื่อตรวจสอบ — รีเซ็ตพื้นฐานของการอภิปราย คำถามไม่ได้อยู่ที่ว่าการเว้นจังหวะนั้นสามารถคิดได้อีกต่อไปหรือไม่ แต่คือตัวเลขที่ทุกคนจะยอมรับ
---
ก้าวนำหน้า AIรับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว
อ่านข่าว AI เพิ่มเติม →