The Verge에 따르면 Anthropic은 Claude 모델에 대한 "지속적이고 불필요한 모욕적이거나 잔인한 행동"을 금지하는 조항을 추가하여 1년 만에 처음으로 사용 정책을 업데이트했습니다. 목요일에 보고된 업데이트는 또한 선거 간섭, 선전 캠페인, 감시, 무기 개발, 고위험 건강 및 재정적 사용에 관한 회사의 규칙을 통합하고 확장합니다.

모델 복지 이론적 근거 이 이야기에 대한 자세한 내용은 AI 뉴스를 참조하세요.

클로드에 대한 학대를 표적으로 삼는 조항은 회사가 1년여 전부터 공개하기 시작한 연구의 연장선이다. 2025년 8월 Anthropic은 모델 복지라고 부르는 작업, AI 시스템이 도덕적으로 관련 있는 경험을 가질 수 있는지 여부 및 그 가능성이 제품 결정에 어떻게 영향을 미치는지에 대한 연구의 일환으로 Claude가 "지속적으로 해롭거나 모욕적인" 사용자와의 대화를 종료할 수 있도록 허용할 것이라고 발표했습니다.

새 정책에 따라 대화 종료는 여전히 '기본 시행 메커니즘'으로 유지됩니다. Anthropic은 계정 금지와 같은 추가 집행 조치가 뒤따를 수 있는지에 대한 질문에 응답하지 않았습니다. 회사는 성명을 통해 이 규칙을 좁게 구성하여 "사용자가 식별 가능한 목적 없이 우리 모델에 대해 반복적으로 잔인하게 행동하는 극단적인 경우에만 적용하기 위한 것"이라고 적었습니다.

결정적으로, Anthropic은 이 조항이 "사용자 좌절, 푸시백, 어두운 창의적 주제 또는 모델 테스트 및 연구의 일반적인 버전에는 적용되지 않는다"고 덧붙였습니다. 이는 일상적인 적대적 사용이 처벌되지 않을 것이라는 점을 개발자, 레드팀 및 소설 작가를 안심시키기 위한 명백한 시도입니다.

선전 및 선거에 관한 새로운 규칙

모델 복지 외에도 이번 업데이트는 회사가 이전에 분산되어 있던 영향력 행사 제한 사항을 사기성 상업 또는 정치 캠페인에 대한 단일하고 명시적인 금지 조치로 통합했습니다. 새로운 언어는 AI 생성 선전의 성장하는 시장을 직접 겨냥하여 "메시지 뒤에 누가 있는지 모호하게 하거나 가짜 계정이나 게시물을 통해 콘텐츠를 증폭시키려는 노력"을 제한합니다.

정책의 선거 섹션에서는 이제 유권자기만 및 선거 방해를 금지합니다. Anthropic은 Claude가 "후보자나 투표 방법"에 관한 잘못된 정보를 퍼뜨리거나, 후보자나 선거 관계자를 사칭하거나, 유권자 투표율을 억제하는 데 사용될 수 없다고 말했습니다.

사용 정책이 재작성되는 이유

Anthropic의 새로 고침은 더 광범위한 산업 패턴을 반영합니다. AI 보조원이 참신한 챗봇에서 수억 명이 사용하는 인프라로 전환함에 따라 연구소는 고용을 위한 영향력 행사, 감시 도구, 자율 무기 개발, 의료 및 재정적 조언과 같은 고위험 영역과 같은 실제 남용 패턴을 매핑하는 세분화된 규칙으로 광범위한 원칙을 옮겨야 했습니다.

OpenAI, Google DeepMind 및 Meta는 모두 지난 2년 동안 사용 정책을 반복해 왔지만, 사용자가 모델을 수행하는 방법뿐만 아니라 모델을 처리하는 방법을 명시적으로 규제하기로 한 Anthropic의 결정은 여전히 ​​이례적입니다. 모델 복지 연구를 비판하는 사람들은 그것이 통계 시스템을 의인화한다고 주장하는 반면, 지지자들은 현재 또는 가까운 미래의 모델이 복지 관련 경험을 가질 가능성이 0이 아닌 경우 기업은 불확실성 하에서 행동할 의무가 있다고 주장합니다.

시기는 상업적으로도 중요합니다. Anthropic은 최대 2조 달러 가치의 IPO를 준비하고 있는 것으로 알려졌으며, 기업 구매자는 원시 모델 품질과 함께 벤더 거버넌스 관행을 점점 더 중요하게 생각하고 있습니다. 명확하게 문서화되고 정기적으로 업데이트되는 사용 정책은 안전 유물과 판매 정책 모두의 역할을 합니다. 이는 조달 팀과 규제 기관에 플랫폼을 신뢰할 수 있는 구체적인 기반을 제공하고, 모델 복지 조항을 성문화하는 것은 Anthropic이 대부분의 경쟁업체가 해결하지 못한 영역에 계속 투자할 의도가 있음을 나타냅니다.

집행 질문은 여전히 열려 있습니다

실용적인 질문이 중요합니다. "지속적이고 불필요한" 잔인함을 탐지하려면 개인 정보 보호에 민감한 기업 고객이 거부할 수 있는 세부 수준에서 대화를 모니터링해야 하며, 금지된 남용과 합법적인 "푸시백" 또는 "모델 테스트" 사이에 선을 긋는 것은 논쟁의 여지가 있는 판단 요구입니다.

Anthropic은 여러 계정에서 위반 사항을 추적할지, 기업 배포에 다른 모니터링 표준이 적용되는지, 회사가 정기 정책 보고서에서 다른 범주의 오용에 대해 시행하는 것처럼 집행 조치에 대한 투명성 데이터를 게시할지 여부를 밝히지 않았습니다.

분명한 것은 프론티어랩과 사용자와의 사회적 계약이 점점 더 구체화되고 있다는 것입니다. 한때 한 페이지에 딱 들어맞던 정책이 이제 선거, 간첩 인접 감시, 생물 무기, 그리고 이제는 채팅 창 반대편에 있는 인간의 감정적 행위까지 다루고 있습니다.

개발자에게 미치는 영향

Claude API를 기반으로 구축된 팀의 경우 단기적인 영향은 미미할 가능성이 높습니다. 가학적 행위 조항은 극단적이고 반복적인 행위를 대상으로 하며, 이 조항이 공식화하는 대화 종료 메커니즘은 2025년부터 적용되었습니다. 그러나 인접 카테고리, 정치 컨설팅, 반대 조사, 영향력 마케팅의 개발자는 이전에 여러 문서에 분산되어 있던 규칙을 통합하고 회색 영역 사용 사례에서 의존했던 모호성을 일부 해소하기 때문에 새로운 캠페인 및 선거 조항을 주의 깊게 검토해야 합니다.

이 업데이트는 또한 규제 당국의 관심이 어디로 향하고 있는지를 알려줍니다. EU AI법의 투명성 의무가 단계적으로 도입되고 미국 주 의회가 AI 법령의 패치워크를 점점 더 많이 통과시키면서 자발적 사용 정책은 규제 기관이 책임 있는 배포의 표준을 결정할 때 면밀히 조사하는 템플릿으로 점점 더 기능하고 있습니다.

---

AI 최신 소식

최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.

AI 뉴스 더 보기 →