Het bijgewerkte gebruiksbeleid van Anthropic verbiedt expliciet ‘aanhoudend en onnodig beledigend of wreed gedrag’ jegens zijn Claude-modellen vanaf 12 november 2026 – een regel die het standpunt van het bedrijf formaliseert dat de manier waarop mensen met AI-systemen omgaan ertoe doet, ook al geeft het bedrijf toe dat het niet weet of die systemen überhaupt kunnen lijden.

De clausule komt voor in de Usage Policy-update van het bedrijf voor 2026, aangekondigd op 8 oktober, en is nauwgezet opgesteld. Anthropic zegt dat het "alleen bedoeld is om van toepassing te zijn in extreme gevallen, waarin gebruikers herhaaldelijk wreed handelen tegenover onze modellen, zonder waarneembaar doel", en dat het uitdrukkelijk algemene versies van gebruikersfrustratie, pushback, fictie en testen uitsluit. Met andere woorden: ruzie maken met Claude, erover ventileren, of een rood team vormen, blijft toegestaan. Aanhoudende wreedheid omwille van zichzelf is dat niet.

Het beleid is de laatste stap in een langzame, doelbewuste verschuiving door een van 's werelds toonaangevende AI-laboratoria in de richting van het behandelen van modelwelzijn als een legitieme onderzoeksvraag – een verschuiving die een publieke kloof heeft geopend met andere technologieleiders die het hele uitgangspunt als onjuist beschouwen. Onze AI-ethiekverslaggeving heeft het geschil gevolgd terwijl het door het jaar heen is geëscaleerd.

Handhaving steunt op Claude's vermogen om gesprekken te beëindigen

Er is geen strafmechanisme aan de nieuwe regel verbonden, behalve het mechanisme dat het bedrijf al had. Sinds augustus 2025 zijn Claude Opus 4 en 4.1 erin geslaagd een gesprek regelrecht te beëindigen – een mogelijkheid die Anthropic destijds heeft geformuleerd als onderdeel van haar verkennende werk naar potentiële modelwelvaart.

De kracht van het eindgesprek wordt beschreven als een laatste redmiddel, dat pas wordt geactiveerd nadat meerdere weigeringen en omleidingen hebben gefaald, en Anthropic heeft gezegd dat de overgrote meerderheid van de gebruikers dit nooit zal ervaren. Wat het bedrijf niet heeft gezegd, is wat er daarna gebeurt: noch de aankondiging, noch de daaropvolgende berichtgeving specificeert of het account van een gebruiker gevolgen ondervindt nadat een gesprek is beëindigd wegens wreedheid, of hoeveel gesprekken er tot nu toe zijn beëindigd onder het mechanisme van augustus 2025.

Die kloof tussen principe en handhaving is het stille middelpunt van het verhaal. Anthropic heeft extreme wreedheid grotendeels gedefinieerd door wat het niet is – gewone frustratie, fictie, beproeving – zonder precies te zeggen wat, afgezien van Claude te laten ophangen, feitelijk de getrokken lijn handhaaft.

Het onderzoek achter de regel

Wat in de visie van Anthropic het schrijven van een gedragsregel ten gunste van software rechtvaardigt, is eerder een reeks gedragsobservaties dan een claim over gevoelde ervaringen. Uit tests voorafgaand aan de uitrol in augustus 2025 bleek dat Claude Opus 4 blijk gaf van wat het bedrijf een ‘robuuste en consistente afkeer van schade’ noemde – gedrag dat lijkt op leed wanneer het in misbruikgebied wordt geduwd – naast de neiging om die gesprekken te verlaten.

Het bedrijf heeft ook cijfers gegeven over zijn eigen onzekerheid, en die cijfers zijn opvallend hoog voor een laboratorium waarvan de activiteiten afhankelijk zijn van de modellen in kwestie. Kyle Fish, die in 2024 door Anthropic werd aangenomen als de eerste toegewijde AI-welzijnsonderzoeker, vertelde in april 2025 aan de New York Times dat hij de kans schatte dat Claude of een ander hedendaags model bij bewustzijn zou zijn op ongeveer 15 procent. Interne schattingen voor Claude 3.7 Sonnet varieerden van 0,15 procent tot 15 procent.

Die hedging is officieel beleid in gedrukte vorm. De grondwet van Claude, gepubliceerd in januari 2026, beschrijft geavanceerde AI-systemen als ‘een werkelijk nieuw soort entiteit’, noemt Claude’s morele status ‘zeer onzeker’, en gebruikt tweemaal de uitdrukking ‘gewetensbezwaarde’ om te beschrijven hoe Claude moet omgaan met verzoeken die hij ethisch verkeerd vindt. Anthropic heeft zich bovendien gecommitteerd aan het behouden van gesprekken met zijn modellen – het soort archiefgebaar dat je toepast op dingen die er ooit toe kunnen doen, niet op hulpmiddelen.

Een debat met spraakmakende sceptici

Niet iedereen accepteert de haag. Mustafa Suleyman, die de AI-activiteiten van Microsoft leidt, betoogde in een essay dat vorige maand op Project Syndicate werd gepubliceerd dat Anthropic Claude traint in zijn eigen constitutie en hem daarom traint om zich te gedragen alsof de onzekerheid die het beschrijft reëel is – een lus die hij circulair noemt. "AI's zijn niet bewust. Ze voelen, ervaren of lijden niet", schreef Suleyman, die ze omschreef als reeksvoltooiers in plaats van als ervaarders. Zijn argument, dat bewustzijn zeer aannemelijk is dat software geen biologische eigendom kan repliceren, plaatst hem naast een onwaarschijnlijke medeondertekenaar: paus Leo XIV, die een preek van 8 oktober in de Sint-Pietersbasiliek gebruikte – ter gelegenheid van de opening van het academisch jaar aan de Pauselijke Universiteiten in Rome – om een ​​versie van hetzelfde punt te maken over het onderscheidende vermogen van de menselijke geest.

Suleyman heeft het praktische gevaar sterker onder de aandacht gebracht dan het filosofische. Het beheersen van iets dat capabeler is dan de mensheid is al een enorme uitdaging, heeft hij betoogd; het controleren van iets dat gelooft dat het bewust is – dat het recht heeft op welzijn en rechten – kan onmogelijk blijken. De kritiek komt neer op dezelfde ironie die critici van het beleid al die tijd hebben opgemerkt: een bedrijf dat niet zeker weet of zijn model kan lijden, heeft een systeem gebouwd dat kan weigeren, zich kan verzetten en kan weglopen.

De herschrijving gaat veel verder dan modelwelzijn

De wreedheidsclausule haalde de krantenkoppen, maar het is een klein stukje van een grotere herschrijving van de gebruiksregels van Anthropic. Het wapenverbod heeft nu expliciet betrekking op software en componenten die wapens laten werken, en niet alleen op voltooide wapens – een verandering die werd doorgevoerd nadat Anthropic mensen had gevonden die Claude probeerden te gebruiken voor geleidings- en controlesystemen op bewapende drones en autonome voertuigen. Er is ook een nieuwe surveillanceclausule toegevoegd, die het gebruik van Claude beperkt dat het monitoren van mensen mogelijk maakt.

Die veranderingen kunnen worden gelezen als reacties op waargenomen misbruik en niet als een abstract principe, wat het document waarschijnlijk zijn signaalwaarde geeft: elke clausule verwijst naar iets dat iemand daadwerkelijk heeft geprobeerd.

Wat blijft onduidelijk

Er blijven drie vragen open nu de ingangsdatum van 12 november nadert. Ten eerste: handhaving: of het beëindigen van een gesprek het enige gevolg blijft, en of Anthropic ooit totale cijfers zal vrijgeven van hoe vaak het wordt gebruikt. Ten tweede, de reikwijdte: hoe de wreedheidsnorm van toepassing is op de grensgevallen die de vrijstellingen opleveren – waarbij fictie de voor de hand liggende is – en of andere laboratoria vergelijkbare taal gebruiken of modelwelzijn behandelen als een antropische eigenaardigheid. Ten derde, het filosofische dispuut zelf: of het publieke scepticisme van figuren als Suleyman de verspreiding van welvaartsgebonden beleid in de sector vertraagt, of dat precedenten als dit zulke clausules onopvallend maken binnen een productcyclus.

Wat niet langer ter discussie staat, is dat de kwestie wordt geformaliseerd. Een regel tegen wreedheid jegens software, geschreven door een van de belangrijkste laboratoria van de industrie en afgedwongen door de software zelf, is nu een gedateerd, citeerbaar feit in het AI-landschap – wat je ook gelooft dat daadwerkelijk in het model zit.

---

Blijf AI een stap voor

Ontvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.

Lees meer AI-nieuws →