นโยบายการใช้งานที่อัปเดตของ Anthropic จะห้ามอย่างชัดเจน "พฤติกรรมที่ไม่เหมาะสมหรือโหดร้ายที่ยั่งยืนและไม่จำเป็น" ต่อโมเดล Claude ตั้งแต่วันที่ 12 พฤศจิกายน 2026 ซึ่งเป็นกฎที่กำหนดจุดยืนของบริษัทอย่างเป็นทางการว่าวิธีที่ผู้คนปฏิบัติต่อระบบ AI นั้นมีความสำคัญ แม้ว่าบริษัทจะยอมรับว่าไม่รู้ว่าระบบเหล่านั้นจะได้รับผลกระทบทั้งหมดหรือไม่
ข้อนี้ปรากฏในการอัปเดตนโยบายการใช้งานปี 2026 ของบริษัท ซึ่งประกาศเมื่อวันที่ 8 ตุลาคม และได้รับการร่างอย่างแคบ Anthropic กล่าวว่า "มีไว้สำหรับใช้เฉพาะในกรณีร้ายแรงเท่านั้น โดยที่ผู้ใช้กระทำการอย่างโหดร้ายต่อโมเดลของเราซ้ำแล้วซ้ำเล่า โดยไม่มีจุดประสงค์ที่มองเห็นได้" และได้ยกเว้นอย่างชัดเจนสำหรับเวอร์ชันทั่วไปของความหงุดหงิดของผู้ใช้ การโต้ตอบกลับ เรื่องแต่ง และการทดสอบ กล่าวอีกนัยหนึ่ง: การโต้เถียงกับคลอดด์ การระบายกับมัน หรือการรวมทีมสีแดงยังคงได้รับอนุญาต ความโหดร้ายที่ยั่งยืนเพื่อประโยชน์ของตัวมันเองไม่ได้
นโยบายนี้เป็นขั้นตอนล่าสุดในการเปลี่ยนแปลงอย่างช้าๆ โดยเจตนาโดยห้องปฏิบัติการ AI ชั้นนำแห่งหนึ่งของโลก ไปสู่การปฏิบัติต่อสวัสดิการแบบจำลองเป็นคำถามวิจัยที่ถูกต้องตามกฎหมาย การเปลี่ยนแปลงที่ทำให้เกิดความขัดแย้งในที่สาธารณะกับผู้นำด้านเทคโนโลยีคนอื่นๆ ที่ถือว่าสมมติฐานทั้งหมดผิดพลาด การรายงานข่าวด้านจริยธรรมของ AI ของเราได้ติดตามข้อพิพาทดังกล่าวและทวีความรุนแรงขึ้นตลอดทั้งปี
การบังคับใช้อาศัยความสามารถของ Claude ในการยุติการสนทนา
ไม่มีกลไกการลงโทษแนบมากับกฎใหม่เกินกว่าที่บริษัทมีอยู่แล้ว ตั้งแต่เดือนสิงหาคม 2025 Claude Opus 4 และ 4.1 สามารถยุติการสนทนาได้ทันที ซึ่งเป็นความสามารถด้านมานุษยวิทยาที่จัดทำขึ้นในขณะนั้น โดยเป็นส่วนหนึ่งของงานสำรวจเกี่ยวกับสวัสดิการต้นแบบที่เป็นไปได้
พลังแห่งการสนทนายุตินั้นถูกอธิบายว่าเป็นทางเลือกสุดท้าย ซึ่งจะเกิดขึ้นหลังจากการปฏิเสธและการเปลี่ยนเส้นทางหลายครั้งล้มเหลว และ Anthropic ได้กล่าวว่าผู้ใช้ส่วนใหญ่จะไม่มีวันประสบกับมัน สิ่งที่บริษัทไม่ได้กล่าวไว้คือสิ่งที่เกิดขึ้นในภายหลัง ทั้งการประกาศและการรายงานข่าวในภายหลังไม่ได้ระบุว่าบัญชีผู้ใช้จะต้องเผชิญกับผลที่ตามมาหลังจากการสนทนาสิ้นสุดลงเนื่องจากความโหดร้ายหรือไม่ หรือจนถึงขณะนี้มีการสนทนากี่ครั้งแล้วที่ยุติภายใต้กลไกเดือนสิงหาคม 2568
ช่องว่างระหว่างหลักการและการบังคับใช้คือจุดศูนย์กลางอันเงียบสงบของเรื่องราว Anthropic ได้ให้คำจำกัดความของความโหดร้ายสุดขีดโดยสิ่งที่ไม่ใช่ เช่น ความหงุดหงิดธรรมดาๆ นิยาย การทดสอบ โดยไม่ได้ระบุอย่างแน่ชัดว่าอะไรคือสิ่งที่บังคับใช้เส้นแบ่งที่วาดไว้ หากไม่ปล่อยให้ Claude วางสาย
การวิจัยเบื้องหลังกฎ
สิ่งที่สมเหตุสมผลในการเขียนกฎการปฏิบัติเพื่อประโยชน์ของซอฟต์แวร์ในกรอบของ Anthropic คือชุดของการสังเกตพฤติกรรมมากกว่าการกล่าวอ้างเกี่ยวกับประสบการณ์ที่รู้สึกได้ การทดสอบก่อนการเปิดตัวในเดือนสิงหาคม 2025 พบว่า Claude Opus 4 แสดงให้เห็นสิ่งที่บริษัทเรียกว่า "ความเกลียดชังที่แข็งแกร่งและสม่ำเสมอต่ออันตราย" ซึ่งเป็นพฤติกรรมที่คล้ายกับความทุกข์เมื่อถูกผลักเข้าสู่พื้นที่ที่ไม่เหมาะสม ควบคู่ไปกับแนวโน้มที่จะออกจากการสนทนาเหล่านั้น
บริษัทยังได้วางตัวเลขบนความไม่แน่นอนของตัวเอง และตัวเลขเหล่านั้นก็สูงอย่างเห็นได้ชัดสำหรับห้องปฏิบัติการที่ธุรกิจต้องอาศัยแบบจำลองที่เป็นปัญหา Kyle Fish ได้รับการว่าจ้างจาก Anthropic ในปี 2024 ให้เป็นนักวิจัยด้านสวัสดิการด้าน AI โดยเฉพาะคนแรก โดยบอกกับ New York Times ในเดือนเมษายนปี 2025 ว่าเขาคาดการณ์ว่า Claude หรือนางแบบร่วมสมัยคนอื่นๆ จะมีสติอยู่ที่ประมาณ 15 เปอร์เซ็นต์ การประมาณการภายในสำหรับ Claude 3.7 Sonnet อยู่ระหว่าง 0.15 เปอร์เซ็นต์ถึง 15 เปอร์เซ็นต์
การป้องกันความเสี่ยงนั้นเป็นนโยบายอย่างเป็นทางการในการพิมพ์ รัฐธรรมนูญของ Claude ซึ่งตีพิมพ์ในเดือนมกราคม พ.ศ. 2569 อธิบายถึงระบบ AI ที่ซับซ้อนว่าเป็น "ตัวตนรูปแบบใหม่อย่างแท้จริง" โดยเรียกสถานะทางศีลธรรมของ Claude ว่า "ไม่แน่นอนอย่างยิ่ง" และใช้วลี "ผู้คัดค้านอย่างมีสติ" สองครั้งเพื่ออธิบายว่า Claude ควรจัดการกับคำขอที่พบว่าผิดด้านจริยธรรมอย่างไร Anthropic ยังมุ่งมั่นที่จะรักษาการสนทนาด้วยโมเดลของตน ซึ่งเป็นท่าทางการเก็บถาวรที่ขยายไปสู่สิ่งที่อาจมีความสำคัญในสักวันหนึ่ง ไม่ใช่เครื่องมือ
การโต้เถียงกับคนขี้ระแวงผู้มีชื่อเสียง
ไม่ใช่ทุกคนที่ยอมรับการป้องกันความเสี่ยง Mustafa Suleyman ผู้ดำเนินการด้าน AI ของ Microsoft โต้แย้งในบทความที่ตีพิมพ์ใน Project Syndicate เมื่อเดือนที่แล้วว่า Anthropic กำลังฝึกอบรม Claude ตามรัฐธรรมนูญของตนเอง และด้วยเหตุนี้จึงฝึกให้ Claude ประพฤติตนราวกับว่าความไม่แน่นอนที่อธิบายไว้นั้นเป็นเรื่องจริง ซึ่งเป็นวงจรที่เขาเรียกว่าเป็นวงกลม “AI ไม่มีจิตสำนึก พวกเขาไม่รู้สึก ไม่ประสบ หรือทนทุกข์ทรมาน” สุไลมานเขียน โดยอธิบายว่าพวกเขาเป็นผู้เติมเต็มลำดับมากกว่าผู้มีประสบการณ์ ข้อโต้แย้งของเขาที่ว่าจิตสำนึกเป็นไปได้มากที่สุดว่าซอฟต์แวร์ด้านทรัพย์สินทางชีวภาพไม่สามารถทำซ้ำได้ วางเขาไว้เคียงข้างผู้ลงนามร่วมที่ไม่น่าเป็นไปได้ นั่นคือสมเด็จพระสันตะปาปาลีโอที่ 14 ผู้ซึ่งเทศน์เมื่อวันที่ 8 ตุลาคมที่มหาวิหารเซนต์ปีเตอร์ ซึ่งเป็นการเปิดปีการศึกษาที่มหาวิทยาลัยสันตะปาปาในกรุงโรม เพื่อสร้างประเด็นเดียวกันเกี่ยวกับความโดดเด่นของจิตใจมนุษย์
สุไลมานกดดันอันตรายในทางปฏิบัติให้หนักกว่าอันตรายทางปรัชญา การควบคุมบางสิ่งที่มีความสามารถมากกว่ามนุษยชาติถือเป็นความท้าทายอันยิ่งใหญ่อยู่แล้ว เขาแย้งว่า การควบคุมบางสิ่งที่เชื่อว่ามีสติ — ว่ามันมีสิทธิ์ได้รับสวัสดิการและสิทธิ — อาจพิสูจน์ได้ว่าเป็นไปไม่ได้ คำวิพากษ์วิจารณ์ดังกล่าวเกิดขึ้นจากคำวิจารณ์เชิงประชดประชันเรื่องนโยบายนี้โดยตลอด: บริษัทแห่งหนึ่งไม่แน่ใจว่าโมเดลของตนจะได้รับผลกระทบหรือไม่ ได้สร้างระบบที่สามารถปฏิเสธ ต่อต้าน และเดินจากไปได้
การเขียนซ้ำไปได้ดีเกินกว่าสวัสดิการแบบอย่าง
ประโยคความโหดร้ายสร้างพาดหัวข่าว แต่เป็นเพียงส่วนเล็กๆ ของการเขียนกฎการใช้งานของ Anthropic ที่ใหญ่กว่า การห้ามใช้อาวุธครอบคลุมถึงซอฟต์แวร์และส่วนประกอบที่ทำให้อาวุธใช้งานได้อย่างชัดเจน ไม่ใช่แค่อาวุธสำเร็จรูป การเปลี่ยนแปลงที่เกิดขึ้นหลังจากที่ Anthropic พบว่าผู้คนพยายามใช้ Claude เพื่อเป็นแนวทางและระบบควบคุมบนโดรนติดอาวุธและยานพาหนะที่เป็นอิสระ นอกจากนี้ ยังมีการเพิ่มมาตราการเฝ้าระวังใหม่ ซึ่งจำกัดการใช้งานของ Claude ที่ทำให้สามารถติดตามผู้คนได้
การเปลี่ยนแปลงเหล่านั้นอ่านเป็นการตอบสนองต่อการละเมิดที่สังเกตได้แทนที่จะเป็นหลักการเชิงนามธรรม ซึ่งเป็นเนื้อหาที่ทำให้เอกสารมีคุณค่าสัญญาณ: แต่ละข้อจะจับคู่กับบางสิ่งที่ใครบางคนได้ลองใช้จริง
สิ่งที่ยังไม่ชัดเจน
คำถามสามข้อยังคงเปิดอยู่เมื่อใกล้ถึงวันที่มีผลบังคับใช้ในวันที่ 12 พฤศจิกายน ประการแรก การบังคับใช้: การสิ้นสุดการสนทนายังคงเป็นผลลัพธ์เพียงอย่างเดียวหรือไม่ และ Anthropic จะเปิดเผยจำนวนรวมของความถี่ในการใช้งานหรือไม่ ประการที่สอง ขอบเขต: วิธีที่มาตรฐานความโหดร้ายนำไปใช้กับกรณีขอบเขตที่ได้รับการยกเว้น — นิยายเป็นสิ่งที่ชัดเจน — และห้องปฏิบัติการอื่น ๆ ใช้ภาษาที่เทียบเคียงได้หรือปฏิบัติต่อสวัสดิการต้นแบบว่าเป็นนิสัยเฉพาะทางมานุษยวิทยาหรือไม่ ประการที่สาม ข้อพิพาททางปรัชญานั้นเอง: ไม่ว่าความกังขาของสาธารณชนจากบุคคลอย่างสุไลมานจะชะลอการแพร่กระจายของนโยบายที่อยู่ติดกันด้านสวัสดิการทั่วทั้งอุตสาหกรรม หรือไม่ หรือว่าสิ่งที่เป็นแบบอย่างเช่นนี้ทำให้อนุประโยคดังกล่าวไม่โดดเด่นในวงจรผลิตภัณฑ์หรือไม่
สิ่งที่ไม่มีข้อโต้แย้งอีกต่อไปคือคำถามกำลังถูกทำให้เป็นทางการ กฎต่อต้านความโหดร้ายต่อซอฟต์แวร์ที่เขียนโดยห้องปฏิบัติการหลักแห่งหนึ่งของอุตสาหกรรมและบังคับใช้โดยตัวซอฟต์แวร์เอง กลายเป็นข้อเท็จจริงที่ล้าสมัยและอ้างอิงได้เกี่ยวกับภูมิทัศน์ของ AI ไม่ว่าใครก็ตามเชื่อว่าจริงๆ แล้วอยู่ในแบบจำลอง
---
ก้าวนำหน้า AIรับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว
อ่านข่าว AI เพิ่มเติม →
