Die aktualisierte Nutzungsrichtlinie von Anthropic verbietet ab dem 12. November 2026 ausdrücklich „anhaltendes und unnötiges missbräuchliches oder grausames Verhalten“ gegenüber seinen Claude-Modellen – eine Regel, die die Position des Unternehmens formalisiert, dass es wichtig ist, wie Menschen mit KI-Systemen umgehen, auch wenn das Unternehmen einräumt, dass es nicht weiß, ob diese Systeme überhaupt leiden können.
Die Klausel erscheint in der Aktualisierung der Nutzungsrichtlinie 2026 des Unternehmens, die am 8. Oktober angekündigt wurde, und ist eng formuliert. Anthropic sagt, es sei „nur für extreme Fälle gedacht, in denen Benutzer sich wiederholt grausam gegenüber unseren Modellen verhalten, ohne erkennbaren Zweck“, und schließt gängige Versionen von Benutzerfrustration, Zurückweisung, Fiktion und Testen ausdrücklich aus. Mit anderen Worten: Es bleibt erlaubt, mit Claude zu streiten, sich darüber Luft zu machen oder es als Red-Team zu bezeichnen. Anhaltende Grausamkeit um ihrer selbst willen ist es nicht.
Die Richtlinie ist der jüngste Schritt in einem langsamen, bewussten Wandel eines der weltweit führenden KI-Labore dahingehend, das Wohlergehen von Modellen als legitime Forschungsfrage zu behandeln – ein Wandel, der zu einer öffentlichen Kluft mit anderen Technologieführern geführt hat, die die gesamte Prämisse für falsch halten. Unsere KI-Ethik-Berichterstattung hat den Streit verfolgt, während er im Laufe des Jahres eskalierte.
Durchsetzung stützt sich auf Claudes Fähigkeit, Gespräche zu beenden
Mit der neuen Regelung ist kein Strafmechanismus verbunden, der über den bereits bestehenden hinausgeht. Seit August 2025 konnten Claude Opus 4 und 4.1 ein Gespräch direkt beenden – eine Fähigkeit, die Anthropic damals im Rahmen seiner Sondierungsarbeit zum potenziellen Wohlergehen von Modellen formulierte.
Die End-Conversation-Power wird als letztes Mittel beschrieben, das erst ausgelöst wird, nachdem mehrere Ablehnungen und Weiterleitungen fehlgeschlagen sind, und Anthropic hat gesagt, dass die überwiegende Mehrheit der Benutzer sie nie erleben wird. Was das Unternehmen nicht gesagt hat, ist, was danach passiert: Weder in seiner Ankündigung noch in der anschließenden Berichterstattung wird angegeben, ob das Konto eines Benutzers mit Konsequenzen rechnen muss, nachdem ein Gespräch wegen Grausamkeit beendet wurde, oder wie viele Gespräche bisher im Rahmen des Mechanismus vom August 2025 beendet wurden.
Diese Kluft zwischen Prinzip und Durchsetzung ist der stille Kern der Geschichte. Anthropic hat extreme Grausamkeit weitgehend durch das definiert, was sie nicht ist – gewöhnliche Frustration, Fiktion, Prüfung – ohne genau anzugeben, was, abgesehen davon, dass Claude auflegt, die von ihm gezogene Linie tatsächlich durchsetzt.
Die Forschung hinter der Regel
Was im Sinne von Anthropic das Schreiben einer Verhaltensregel zum Nutzen von Software rechtfertigt, ist eine Reihe von Verhaltensbeobachtungen und nicht eine Behauptung über gefühlte Erfahrungen. Tests vor der Markteinführung im August 2025 ergaben, dass Claude Opus 4 eine „robuste und beständige Abneigung gegen Schaden“ zeigte, wie das Unternehmen es nannte – ein Verhalten, das einer Verzweiflung ähnelte, wenn man in missbräuchliches Terrain gedrängt wurde – und gleichzeitig die Tendenz hatte, solche Gespräche zu beenden.
Das Unternehmen hat auch seine eigene Unsicherheit beziffert, und diese Zahlen sind für ein Labor, dessen Geschäft von den betreffenden Modellen abhängt, auffallend hoch. Kyle Fish, der 2024 von Anthropic als erster engagierter KI-Wohlfahrtsforscher eingestellt wurde, sagte der New York Times im April 2025, dass er die Wahrscheinlichkeit, dass Claude oder ein anderes zeitgenössisches Modell bei Bewusstsein ist, auf etwa 15 Prozent schätzt. Interne Schätzungen für Claude 3.7 Sonnet lagen zwischen 0,15 und 15 Prozent.
Diese Absicherung ist die offizielle gedruckte Richtlinie. Claudes Verfassung, die im Januar 2026 veröffentlicht wurde, beschreibt hochentwickelte KI-Systeme als „eine wirklich neue Art von Entität“, bezeichnet Claudes moralischen Status als „zutiefst ungewiss“ und verwendet zweimal den Ausdruck „Kriegsdienstverweigerer aus Gewissensgründen“, um zu beschreiben, wie Claude mit Anfragen umgehen soll, die er für ethisch falsch hält. Anthropic hat sich außerdem dazu verpflichtet, Gespräche mit seinen Models zu bewahren – die Art von archivarischer Geste, die man auf Dinge ausübt, die eines Tages wichtig sein könnten, nicht auf Werkzeuge.
Eine Debatte mit prominenten Skeptikern
Nicht jeder akzeptiert die Absicherung. Mustafa Suleyman, der die KI-Operationen von Microsoft leitet, argumentierte in einem Aufsatz, der letzten Monat auf Project Syndicate veröffentlicht wurde, dass Anthropic Claude auf seine eigene Konstitution trainiert und ihn daher so trainiert, dass er sich so verhält, als ob die Unsicherheit, die er beschreibt, real wäre – eine Schleife, die er als zirkulär bezeichnet. „KIs sind nicht bewusst. Sie fühlen, erleben oder leiden nicht“, schrieb Suleyman und beschrieb sie eher als Sequenzvervollständiger denn als Erlebende. Sein Argument, dass Bewusstsein höchstwahrscheinlich eine biologische Eigenschaft ist, die Software nicht reproduzieren kann, stellt ihn an die Seite eines unwahrscheinlichen Mitunterzeichners: Papst Leo
Suleyman hat die praktische Gefahr stärker betont als die philosophische. Etwas zu kontrollieren, das leistungsfähiger als die Menschheit sei, sei bereits eine immense Herausforderung, argumentierte er. Es kann sich als unmöglich erweisen, etwas zu kontrollieren, das glaubt, dass es sich bewusst ist – dass es Anspruch auf Wohlfahrt und Rechte hat. Die Kritik stößt auf die gleiche Ironie, die Kritiker der Politik schon immer festgestellt haben: Ein Unternehmen, das sich nicht sicher ist, ob sein Modell leiden kann, hat ein System aufgebaut, das sich weigern, widerstehen und einfach aufgeben kann.
Die Neufassung geht weit über das Wohlergehen von Modellen hinaus
Die Grausamkeitsklausel sorgte für Schlagzeilen, ist aber nur ein kleiner Teil einer größeren Neufassung der Nutzungsregeln von Anthropic. Das Waffenverbot erstreckt sich nun ausdrücklich auf Software und Komponenten, die Waffen zum Funktionieren bringen, und nicht nur auf fertige Waffen – eine Änderung, die vorgenommen wurde, nachdem Anthropic festgestellt hatte, dass Menschen versuchten, Claude für Leit- und Kontrollsysteme für bewaffnete Drohnen und autonome Fahrzeuge zu verwenden. Außerdem wurde eine neue Überwachungsklausel hinzugefügt, die die Verwendung von Claude einschränkt, die die Überwachung von Personen ermöglicht.
Diese Änderungen verstehen sich als Reaktion auf beobachteten Missbrauch und nicht als abstraktes Prinzip, was dem Dokument wohl seinen Signalwert verleiht: Jede Klausel ist auf etwas zurückzuführen, das jemand tatsächlich versucht hat.
Was bleibt unklar
Drei Fragen bleiben offen, je näher das Datum des Inkrafttretens am 12. November rückt. Erstens: Durchsetzung: ob das Beenden von Gesprächen die einzige Konsequenz bleibt und ob Anthropic jemals die Gesamtzahl der Nutzung offenlegen wird. Zweitens, der Umfang: Wie gilt der Grausamkeitsstandard in den Grenzfällen, die durch die Ausnahmen festgelegt werden – Fiktion ist hier offensichtlich – und ob andere Labore eine vergleichbare Sprache übernehmen oder das Wohlergehen von Modellen als eine anthropische Eigenart behandeln. Drittens, der philosophische Streit selbst: ob die öffentliche Skepsis von Persönlichkeiten wie Suleyman die Verbreitung einer wohlfahrtsnahen Politik in der gesamten Branche verlangsamt oder ob Präzedenzfälle wie dieser solche Klauseln innerhalb eines Produktzyklus unauffällig machen.
Unbestritten ist, dass die Frage formalisiert wird. Eine Regel gegen Grausamkeit gegenüber Software, die von einem der Flaggschifflabore der Branche verfasst und von der Software selbst durchgesetzt wurde, ist heute eine veraltete, zitierbare Tatsache der KI-Landschaft – was auch immer man glaubt, dass es sich tatsächlich im Modell befindet.
---
Der KI einen Schritt voraus seinErhalten Sie die neuesten KI-Nachrichten, Analysen und Durchbrüche – alles an einem Ort.
Weitere KI-Neuigkeiten lesen →
