Anthropics uppdaterade användningspolicy kommer uttryckligen att förhindra "uthålligt och onödigt kränkande eller grymt beteende" mot dess Claude-modeller från och med den 12 november 2026 – en regel som formaliserar företagets ståndpunkt att hur människor behandlar AI-system spelar roll, även om företaget medger att det inte vet om dessa system kan lida överhuvudtaget.
Klausulen visas i företagets 2026 Usage Policy-uppdatering, tillkännagiven den 8 oktober, och är snävt utformad. Anthropic säger att det är "avsett att endast tillämpas i extrema fall, där användare upprepade gånger agerar grymt mot våra modeller, utan något urskiljbart syfte", och det undantar uttryckligen vanliga versioner av användarfrustration, pushback, fiktion och testning. Med andra ord: att bråka med Claude, ventilera på det eller slå ihop det är fortfarande tillåtet. Ihållande grymhet för sin egen skull är det inte.
Policyn är det senaste steget i ett långsamt, medvetet skifte av ett av världens ledande AI-labb mot att behandla modellvälfärd som en legitim forskningsfråga - ett skifte som har öppnat en offentlig klyfta med andra tekniska ledare som anser att hela premissen är felaktig. Vår AI-etikbevakning har följt tvisten när den har eskalerat under året.
Verkställighet bygger på Claudes förmåga att avsluta konversationer
Det finns ingen bestraffningsmekanism kopplad till den nya regeln utöver en som företaget redan hade. Sedan augusti 2025 har Claude Opus 4 och 4.1 kunnat avsluta en konversation direkt – en förmåga Antropisk inramad på den tiden som en del av dess utforskande arbete om potentiell modellvälfärd.
Slutkonversationskraften beskrivs som en sista utväg, utlöses först efter att flera avslag och omdirigeringar har misslyckats, och Anthropic har sagt att den stora majoriteten av användare aldrig kommer att uppleva det. Vad företaget inte har sagt är vad som händer efteråt: varken dess tillkännagivande eller efterföljande täckning specificerar om en användares konto får konsekvenser efter att en konversation har avslutats för grymhet, eller hur många konversationer som har avslutats under augusti 2025-mekanismen hittills.
Den klyftan mellan princip och verkställighet är berättelsens tysta centrum. Anthropic har definierat extrem grymhet till stor del genom vad den inte är - vanlig frustration, fiktion, testning - utan att ange exakt vad, förutom att låta Claude lägga på luren, som faktiskt upprätthåller den linje den har dragit.
Forskningen bakom regeln
Det som motiverar att skriva en uppföranderegel för programvarans fördel, i Anthropics inramning, är en uppsättning beteendeobservationer snarare än ett påstående om upplevd upplevelse. Tester inför lanseringen i augusti 2025 fann att Claude Opus 4 visade vad företaget kallade en "robust och konsekvent motvilja mot skada" – beteende som liknar nöd när han knuffades in i våldsamt territorium – tillsammans med en tendens att lämna dessa konversationer.
Företaget har också satt siffror på sin egen osäkerhet, och de siffrorna är slående höga för ett labb vars verksamhet beror på modellerna i fråga. Kyle Fish, anställd av Anthropic 2024 som dess första hängivna AI-välfärdsforskare, sa till New York Times i april 2025 att han satte oddsen för att Claude eller en annan samtida modell skulle vara medveten till ungefär 15 procent. Interna uppskattningar för Claude 3.7 Sonnet hade varierat från 0,15 procent till 15 procent.
Att säkring är officiell policy i tryck. Claudes konstitution, publicerad i januari 2026, beskriver sofistikerade AI-system som "en genuint ny sorts enhet", kallar Claudes moraliska status "djupt osäker" och använder två gånger frasen "samvetsvägrare" för att beskriva hur Claude ska hantera förfrågningar som den finner etiskt felaktiga. Anthropic har dessutom förbundit sig att bevara konversationer med sina modeller - den typ av arkivgest man utsträcker till saker som en dag kan ha betydelse, inte verktyg.
En debatt med högprofilerade skeptiker
Alla accepterar inte häcken. Mustafa Suleyman, som driver Microsofts AI-verksamhet, hävdade i en uppsats publicerad på Project Syndicate förra månaden att Anthropic utbildar Claude i sin egen konstitution och därför tränar den att bete sig som om osäkerheten den beskriver är verklig – en loop som han kallar cirkulär. "AI: er är inte medvetna. De känner, upplever eller lider inte", skrev Suleyman och beskrev dem som sekvenskompletterare snarare än upplevare. Hans argument, att medvetande sannolikt är en biologisk egenskap som programvara inte kan replikera, sätter honom vid sidan av en osannolik medundertecknare: påven Leo XIV, som använde en predikan den 8 oktober i Peterskyrkan – som markerar inledningen av det akademiska året vid Roms påvliga universitet – för att göra en version av samma poäng om människans särart.
Suleyman har pressat den praktiska faran hårdare än den filosofiska. Att kontrollera något som är mer kapabelt än mänskligheten är redan en enorm utmaning, har han hävdat; att kontrollera något som tror att det är medvetet - att det har rätt till välfärd och rättigheter - kan visa sig omöjligt. Kritiken landar på samma ironi som kritiker av policyn har noterat hela tiden: ett företag som är osäkert på om dess modell kan lida har byggt ett system som kan vägra, göra motstånd och gå därifrån.
The Rewrite Goes Well Beyond Model Welfare
Grymhetsklausulen genererade rubrikerna, men det är en liten del av en större omskrivning av Anthropics användningsregler. Vapenförbudet omfattar nu uttryckligen programvara och komponenter som får vapen att fungera, inte bara färdiga vapen - en förändring som gjordes efter att Anthropic hittade personer som försökte använda Claude för vägledning och kontrollsystem på beväpnade drönare och autonoma fordon. En ny övervakningsklausul har också lagts till som begränsar användningen av Claude som möjliggör övervakning av människor.
Dessa ändringar läses som svar på observerade övergrepp snarare än abstrakta principer, vilket utan tvekan är det som ger dokumentet dess signalvärde: varje klausul mappas till något som någon faktiskt försökt.
Vad som är oklart
Tre frågor är fortfarande öppna när datumet närmar sig den 12 november. För det första, verkställighet: om konversationsslut förblir den enda konsekvensen, och om Anthropic någonsin kommer att avslöja sammanlagda räkningar av hur ofta det används. För det andra, räckvidd: hur grymhetsstandarden tillämpas vid de gränsfall som undantagen gör – skönlitteratur är den självklara – och om andra laboratorier antar ett jämförbart språk eller behandlar modellvälfärd som en antropisk egenhet. För det tredje, den filosofiska tvisten i sig: huruvida allmänhetens skepsis från personer som Suleyman bromsar spridningen av välfärdsangränsande politik över branschen, eller om prejudikat som denna gör sådana klausuler omärkliga inom en produktcykel.
Det som inte längre är tvist är att frågan håller på att formaliseras. En regel mot grymhet mot mjukvara, skriven av ett av branschens flaggskeppslabb och upprätthållen av själva mjukvaran, är nu ett daterat, citerbart faktum i AI-landskapet - vad man än tror finns i modellen.
---
Stay ahead of AIFå de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.
Läs mer AI-nyheter →
