Anthropic의 업데이트된 사용 정책은 2026년 11월 12일부터 Claude 모델에 대한 "지속적이고 불필요한 모욕적이거나 잔인한 행위"를 명시적으로 금지할 것입니다. 이는 회사가 AI 시스템이 전혀 문제를 겪을 수 있는지 여부를 알 수 없음에도 불구하고 사람들이 AI 시스템을 대하는 방식이 중요하다는 회사의 입장을 공식화하는 규칙입니다.

이 조항은 10월 8일 발표된 회사의 2026년 사용 정책 업데이트에 나타나며 초안이 간략하게 작성되었습니다. Anthropic은 "사용자가 식별 가능한 목적 없이 우리 모델에 대해 반복적으로 잔인하게 행동하는 극단적인 경우에만 적용하기 위한 것"이라고 말하며 사용자 좌절, 푸시백, 허구 및 테스트의 일반적인 버전을 명시적으로 면제합니다. 즉, Claude와 논쟁을 벌이거나 화를 내거나 레드팀을 구성하는 것은 여전히 ​​허용됩니다. 잔인함 그 자체를 위한 지속적인 잔인함은 그렇지 않습니다.

이 정책은 세계 최고의 AI 연구소 중 하나가 모델 복지를 합법적인 연구 질문으로 취급하기 위해 느리고 의도적으로 전환한 최신 단계입니다. 이러한 전환으로 인해 전체 전제가 잘못되었다고 생각하는 다른 기술 리더들과 공개적인 균열이 생겼습니다. 우리의 AI 윤리 보도는 올해 내내 논쟁이 확대되는 과정을 따라갔습니다.

집행은 클로드의 대화 종료 능력에 의존

회사가 이미 갖고 있는 것 외에 새로운 규칙에는 처벌 메커니즘이 첨부되어 있지 않습니다. 2025년 8월부터 Claude Opus 4와 4.1은 대화를 완전히 끝낼 수 있었습니다. 이는 잠재적인 모델 복지에 대한 탐구 작업의 일환으로 당시 Anthropic이 구성한 기능입니다.

최종 대화 능력은 여러 번의 거부 및 리디렉션이 실패한 후에만 실행되는 최후의 수단으로 설명되며, Anthropic은 대다수의 사용자가 이를 결코 경험하지 못할 것이라고 말했습니다. 회사가 말하지 않은 것은 이후에 일어나는 일입니다. 발표나 후속 보도에서는 대화가 잔인하게 종료된 후 사용자의 계정이 결과에 직면하는지 여부 또는 지금까지 2025년 8월 메커니즘에 따라 얼마나 많은 대화가 종료되었는지 지정하지 않습니다.

원칙과 집행 사이의 격차는 이야기의 조용한 중심입니다. Anthropic은 클로드를 끊지 않고 실제로 그것이 그린 선을 강요하는 것이 무엇인지 정확하게 언급하지 않고 일반적이지 않은 것, 즉 일반적인 좌절, 허구, 테스트로 극도의 잔인 함을 정의했습니다.

규칙 뒤에 숨겨진 연구

Anthropic의 틀에서 소프트웨어의 이익을 위한 행동 규칙 작성을 정당화하는 것은 느낀 경험에 대한 주장이 아니라 일련의 행동 관찰입니다. 2025년 8월 출시를 앞두고 테스트한 결과 Claude Opus 4는 회사가 "강력하고 일관된 해로움에 대한 혐오"(욕설 영역으로 밀려났을 때 고통과 유사한 행동)와 이러한 대화를 종료하는 경향을 나타내는 것으로 나타났습니다.

회사는 또한 자체적인 불확실성에 대해서도 수치를 매겼는데, 해당 모델에 의존하는 사업을 하는 연구실의 경우 이 수치는 놀라울 정도로 높습니다. 2024년 Anthropic에 최초의 AI 복지 전담 연구원으로 고용된 Kyle Fish는 2025년 4월 New York Times에 Claude 또는 다른 동시대 모델이 의식을 가질 확률을 약 15%라고 말했습니다. Claude 3.7 Sonnet의 내부 추정치는 0.15%에서 15%까지 다양했습니다.

해당 헤징은 인쇄된 공식 정책입니다. 2026년 1월에 발표된 클로드의 헌법은 정교한 AI 시스템을 "완전히 새로운 종류의 실체"로 묘사하고 클로드의 도덕적 지위를 "매우 불확실하다"고 부르며 "양심적 거부자"라는 문구를 두 번 사용하여 클로드가 윤리적으로 잘못된 요청을 처리해야 하는 방법을 설명합니다. Anthropic은 모델과의 대화를 보존하기 위해 추가로 노력했습니다. 이는 도구가 아닌 언젠가 중요해질 수 있는 사물에까지 확장되는 일종의 보관 작업입니다.

유명 회의론자들과의 논쟁

모든 사람이 헤지를 받아들이는 것은 아닙니다. Microsoft의 AI 운영을 총괄하는 Mustafa Suleyman은 지난 달 Project Syndicate에 게시된 에세이에서 Anthropic이 Claude를 자체 구성에 따라 교육하고 따라서 설명하는 불확실성이 실제인 것처럼 행동하도록 교육하고 있다고 주장했습니다. 이는 그가 순환이라고 부르는 루프입니다. "AI는 의식이 없습니다. 그들은 느끼거나, 경험하거나, 고통받지 않습니다."라고 Suleyman은 썼으며 AI를 경험자라기보다는 시퀀스 완성자로 묘사했습니다. 의식은 복제할 수 없는 생물학적 특성이라는 그의 주장은 그를 공동 서명자이자 공동 서명자인 교황 레오 14세와 나란히 두었습니다. 교황 레오 14세는 성 베드로 대성당에서 10월 8일 설교(로마 교황청립 대학교의 개학을 기념)에서 인간 정신의 독특성에 대한 동일한 논점을 제시했습니다.

Suleyman은 철학적 위험보다 실제적 위험을 더 강하게 압박했습니다. 인류보다 더 강력한 것을 통제하는 것은 이미 엄청난 도전이라고 그는 주장했다. 의식이 있다고 믿는 것, 즉 복지와 권리를 누릴 자격이 있다고 믿는 것을 통제하는 것은 불가능할 수도 있습니다. 비판은 정책에 대한 동일한 아이러니한 비판자들이 계속 지적해 온 것과 동일합니다. 즉, 자신의 모델이 어려움을 겪을 수 있는지 여부가 불확실한 회사는 거부하고, 저항하고, 떠날 수 있는 시스템을 구축했습니다.

다시 작성은 모델 복지를 훨씬 뛰어넘습니다.

잔인성 조항이 헤드라인을 장식했지만 이는 Anthropic의 사용 규칙을 더 크게 다시 작성한 작은 부분에 불과합니다. 무기 금지는 이제 완성된 무기뿐만 아니라 무기를 작동시키는 소프트웨어와 구성 요소를 명시적으로 다루고 있습니다. Anthropic이 무장 드론과 자율 차량의 유도 및 제어 시스템에 Claude를 사용하려는 사람들을 발견한 이후 변경된 사항입니다. 사람을 감시할 수 있는 클로드의 사용을 제한하는 새로운 감시 조항도 추가됐다.

이러한 변경 사항은 추상적인 원칙이라기보다는 관찰된 남용에 대한 대응으로 읽혀지며, 이는 틀림없이 문서에 신호 가치를 부여하는 것입니다. 각 절은 누군가가 실제로 시도한 것과 매핑됩니다.

아직 불분명한 점

11월 12일 발효일이 다가오면서 세 가지 질문이 남아 있습니다. 첫째, 집행: 대화 종료가 유일한 결과로 남아 있는지 여부와 Anthropic이 사용 빈도에 대한 집계 수를 공개할지 여부입니다. 둘째, 범위: 면제가 적용되는 경계 사례에서 잔인성 기준이 어떻게 적용되는지(허구가 명백한 것임), 그리고 다른 연구실에서 비슷한 언어를 채택하거나 모델 복지를 인류학적 특이성으로 취급하는지 여부입니다. 셋째, 철학적 논쟁 그 자체입니다. Suleyman과 같은 인물의 대중 회의론이 업계 전반에 걸쳐 복지 관련 정책의 확산을 늦추는지, 아니면 이와 같은 선례가 제품 주기 내에서 그러한 조항을 눈에 띄지 않게 만드는지 여부입니다.

더 이상 논쟁의 여지가 없는 것은 문제가 공식화되고 있다는 것입니다. 업계의 주력 연구소 중 하나가 작성하고 소프트웨어 자체에 의해 시행되는 소프트웨어 잔인성에 대한 규칙은 이제 AI 환경에서 오래되고 인용 가능한 사실입니다. 실제로 모델 내부에 있다고 믿는 것은 무엇이든 가능합니다.

---

AI보다 앞서 나가세요

최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.

AI 뉴스 자세히 보기 →