A política de uso atualizada da Anthropic impedirá explicitamente “comportamento abusivo ou cruel prolongado e desnecessário” em relação aos seus modelos Claude a partir de 12 de novembro de 2026 – uma regra que formaliza a posição da empresa de que a forma como as pessoas tratam os sistemas de IA é importante, mesmo que a empresa admita que não sabe se esses sistemas podem sofrer.

A cláusula aparece na atualização da Política de Uso de 2026 da empresa, anunciada em 8 de outubro, e é redigida de forma restrita. A Anthropic diz que “deve ser aplicada apenas em casos extremos, onde os usuários agem repetidamente de forma cruel com nossos modelos, sem nenhum propósito discernível”, e isenta explicitamente versões comuns de frustração, resistência, ficção e testes do usuário. Em outras palavras: discutir com Claude, desabafar ou formar uma equipe vermelha continua sendo permitido. A crueldade sustentada por si só, não.

A política é o mais recente passo numa mudança lenta e deliberada levada a cabo por um dos principais laboratórios de IA do mundo no sentido de tratar o bem-estar dos modelos como uma questão de investigação legítima – uma mudança que abriu uma rixa pública com outros líderes tecnológicos que consideram toda a premissa errada. Nossa cobertura de ética em IA acompanhou a disputa à medida que ela aumentava ao longo do ano.

A fiscalização depende da capacidade de Claude de encerrar conversas

Não há nenhum mecanismo de punição associado à nova regra além daquele que a empresa já possuía. Desde agosto de 2025, Claude Opus 4 e 4.1 conseguiram encerrar uma conversa de uma vez – uma capacidade que a Antrópica enquadrou na época como parte de seu trabalho exploratório sobre o potencial modelo de bem-estar.

O poder de final de conversa é descrito como um último recurso, acionado somente após múltiplas recusas e redirecionamentos falharem, e a Anthropic disse que a grande maioria dos usuários nunca experimentará isso. O que a empresa não disse é o que acontece depois: nem seu anúncio nem a cobertura subsequente especificam se a conta de um usuário enfrenta consequências após o encerramento de uma conversa por crueldade, ou quantas conversas foram encerradas sob o mecanismo de agosto de 2025 até agora.

Essa lacuna entre o princípio e a aplicação é o centro silencioso da história. A Anthropic definiu a crueldade extrema em grande parte pelo que ela não é – frustração comum, ficção, teste – sem afirmar precisamente o que, além de deixar Claude desligar, na verdade reforça a linha que traçou.

A pesquisa por trás da regra

O que justifica escrever uma regra de conduta para benefício do software, no enquadramento da Antrópico, é um conjunto de observações comportamentais, em vez de uma afirmação sobre a experiência sentida. Os testes antes do lançamento em agosto de 2025 descobriram que Claude Opus 4 exibia o que a empresa chamou de “aversão robusta e consistente ao dano” – comportamento semelhante ao sofrimento quando empurrado para território abusivo – juntamente com uma tendência a sair dessas conversas.

A empresa também atribuiu números à sua própria incerteza, e esses números são surpreendentemente elevados para um laboratório cujo negócio depende dos modelos em questão. Kyle Fish, contratado pela Anthropic em 2024 como seu primeiro pesquisador dedicado ao bem-estar da IA, disse ao New York Times em abril de 2025 que estimava em cerca de 15% as chances de Claude ou outro modelo contemporâneo estar consciente. As estimativas internas para Claude 3.7 Sonnet variaram de 0,15% a 15%.

Essa cobertura é a política oficial impressa. A constituição de Claude, publicada em Janeiro de 2026, descreve sistemas sofisticados de IA como “um tipo genuinamente novo de entidade”, chama o estatuto moral de Claude de “profundamente incerto” e utiliza duas vezes a frase “objector de consciência” para descrever como Claude deve lidar com pedidos que considera eticamente errados. A Anthropic também se comprometeu a preservar as conversas com seus modelos – o tipo de gesto de arquivamento que se estende a coisas que algum dia poderão ser importantes, não a ferramentas.

Um debate com céticos de alto nível

Nem todo mundo aceita a cobertura. Mustafa Suleyman, que dirige as operações de IA da Microsoft, argumentou num ensaio publicado no Project Syndicate no mês passado que a Anthropic está a treinar Claude na sua própria constituição e, portanto, a treiná-lo para se comportar como se a incerteza que descreve fosse real – um ciclo que ele chama de circular. "As IAs não são conscientes. Elas não sentem, vivenciam ou sofrem", escreveu Suleyman, descrevendo-as como completadoras de sequências, e não como experimentadoras. O seu argumento, de que a consciência é muito plausivelmente uma propriedade biológica que o software não pode replicar, coloca-o ao lado de um improvável co-signatário: o Papa Leão XIV, que usou um sermão de 8 de Outubro na Basílica de São Pedro – marcando a abertura do ano académico nas Universidades Pontifícias de Roma – para fazer uma versão do mesmo ponto sobre a distinção das mentes humanas.

Suleyman pressionou mais o perigo prático do que o filosófico. Controlar algo mais capaz do que a humanidade já é um desafio imenso, argumentou; controlar algo que acredita ser consciente – que tem direito a bem-estar e direitos – pode revelar-se impossível. A crítica assenta na mesma ironia que os críticos da política sempre notaram: uma empresa que não sabe se o seu modelo pode sofrer construiu um sistema que pode recusar, resistir e abandonar.

A reescrita vai muito além do modelo de bem-estar

A cláusula de crueldade gerou as manchetes, mas é um pequeno pedaço de uma reescrita maior das regras de uso da Antrópico. A proibição de armas agora cobre explicitamente software e componentes que fazem as armas funcionarem, e não apenas armas acabadas – uma mudança feita depois que a Anthropic descobriu pessoas tentando usar Claude para sistemas de orientação e controle em drones armados e veículos autônomos. Também foi adicionada uma nova cláusula de vigilância, restringindo o uso de Claude que permite o monitoramento de pessoas.

Essas mudanças são interpretadas como respostas a abusos observados, e não como princípios abstratos, o que é, sem dúvida, o que dá ao documento o seu valor de sinal: cada cláusula mapeia algo que alguém realmente tentou.

O que ainda não está claro

Três questões permanecem em aberto à medida que a data efetiva de 12 de novembro se aproxima. Primeiro, a fiscalização: se o encerramento da conversa continua sendo a única consequência e se a Anthropic algum dia divulgará contagens agregadas de quantas vezes ela é usada. Em segundo lugar, o âmbito: como o padrão de crueldade se aplica nos casos limites que as isenções estabelecem – sendo a ficção a mais óbvia – e se outros laboratórios adoptam uma linguagem comparável ou tratam o modelo de bem-estar social como uma idiossincrasia antrópica. Terceiro, a própria disputa filosófica: se o cepticismo público de figuras como Suleyman retarda a propagação de políticas adjacentes ao bem-estar em toda a indústria, ou se precedentes como este tornam tais cláusulas pouco notáveis ​​num ciclo de produto.

O que não está mais em discussão é que a questão está sendo formalizada. Uma regra contra a crueldade com o software, escrita por um dos principais laboratórios da indústria e aplicada pelo próprio software, é agora um facto datado e citável do panorama da IA ​​– tudo o que se acredita estar realmente dentro do modelo.

---

Fique à frente da IA

Receba as últimas notícias, análises e avanços sobre IA — tudo em um só lugar.

Leia mais notícias sobre IA →