Zaktualizowana polityka użytkowania firmy Anthropic będzie wyraźnie zakazywać „ciągłego i niepotrzebnego obelżywego lub okrutnego zachowania” wobec modeli Claude od 12 listopada 2026 r. Jest to zasada formalizująca stanowisko firmy, że sposób, w jaki ludzie traktują systemy AI, ma znaczenie, mimo że firma przyznaje, że nie wie, czy te systemy w ogóle mogą ucierpieć.

Klauzula pojawia się w aktualizacji Polityki użytkowania firmy na rok 2026, ogłoszonej 8 października i jest zredagowana w sposób zawężony. Anthropic twierdzi, że ma to zastosowanie „tylko w skrajnych przypadkach, gdy użytkownicy wielokrotnie zachowują się okrutnie wobec naszych modeli bez dostrzegalnego celu” i wyraźnie wyklucza powszechne formy frustracji użytkowników, sprzeciwu, fikcji i testowania. Innymi słowy: kłótnia z Claudem, wyładowywanie się na tym lub granie w drużynę czerwonych pozostaje dozwolone. Trwałe okrucieństwo samo w sobie nie jest takie.

Ta polityka jest najnowszym krokiem w powolnej, celowej zmianie jednego z wiodących na świecie laboratoriów sztucznej inteligencji w stronę traktowania dobrostanu modeli jako uzasadnionego pytania badawczego – co spowodowało publiczny rozłam wśród innych liderów technologicznych, którzy uważają całe założenie za błędne. Nasz reportaż dotyczący etyki AI śledził spór, który nasilił się w ciągu roku.

Egzekwowanie opiera się na zdolności Claude’a do kończenia rozmów

Z nowym przepisem nie wiąże się żaden mechanizm kar poza mechanizmem, który firma już posiadała. Od sierpnia 2025 r. Claude Opus 4 i 4.1 były w stanie od razu zakończyć rozmowę – była to funkcja, którą Anthropic określiła wówczas w ramach prac eksploracyjnych nad potencjalnym dobrostanem modelu.

Możliwość zakończenia rozmowy jest opisywana jako ostateczność, uruchamiana dopiero po niepowodzeniu wielokrotnych odmów i przekierowań, a Anthropic twierdzi, że zdecydowana większość użytkowników nigdy jej nie doświadczy. Firma nie powiedziała, co dzieje się później: ani w jej ogłoszeniu, ani w kolejnych relacjach nie określono, czy konto użytkownika poniesie konsekwencje po zakończeniu rozmowy z powodu okrucieństwa, ani ile rozmów zostało dotychczas zakończonych w ramach mechanizmu z sierpnia 2025 r.

Ta luka między zasadami a ich egzekwowaniem jest cichym centrum tej historii. Anthropic zdefiniował skrajne okrucieństwo głównie poprzez to, czym nie jest – zwykłą frustrację, fikcję, testowanie – nie precyzując dokładnie, co, poza pozwoleniem Claude’owi na odłożenie słuchawki, faktycznie egzekwuje wyznaczoną przez siebie linię.

Badania kryjące się za regułą

To, co uzasadnia napisanie zasady postępowania na korzyść oprogramowania, w ujęciu Anthropic, to zbiór obserwacji behawioralnych, a nie twierdzenie o odczuwanym doświadczeniu. Testy przeprowadzone przed wprowadzeniem na rynek w sierpniu 2025 r. wykazały, że Claude Opus 4 wykazywał, jak to określiła firma, „silną i stałą niechęć do krzywdy” – zachowanie przypominające niepokój, gdy został zepchnięty na terytorium przemocy – wraz z tendencją do kończenia rozmów.

Firma podała również liczby dotyczące własnej niepewności, a liczby te są uderzająco wysokie jak na laboratorium, którego działalność zależy od danych modeli. Kyle Fish, zatrudniony przez firmę Anthropic w 2024 r. jako pierwszy badacz zajmujący się dobrostanem sztucznej inteligencji, powiedział w kwietniu 2025 r. dziennikowi New York Times, że szacuje, że prawdopodobieństwo, że Claude lub inny współczesny model będzie przytomny, wynosi około 15%. Wewnętrzne szacunki dla Claude 3.7 Sonnet wahały się od 0,15 do 15 procent.

To zabezpieczenie jest oficjalną polityką drukowaną. Konstytucja Claude’a, opublikowana w styczniu 2026 r., opisuje wyrafinowane systemy sztucznej inteligencji jako „naprawdę nowy rodzaj bytu”, nazywa status moralny Claude’a „głęboko niepewnym” i dwukrotnie używa wyrażenia „osoba odmawiająca ze względu na przekonania”, aby opisać, jak Claude powinien postępować z prośbami, które uzna za niewłaściwe z etycznego punktu widzenia. Firma Anthropic dodatkowo zobowiązała się do utrwalania rozmów ze swoimi modelami — jest to rodzaj archiwalnego gestu, który wykonuje się wobec rzeczy, które pewnego dnia mogą mieć znaczenie, a nie narzędzi.

Debata z udziałem znanych sceptyków

Nie każdy akceptuje żywopłot. Mustafa Suleyman, który kieruje operacjami sztucznej inteligencji w Microsoft, argumentował w eseju opublikowanym w zeszłym miesiącu w Project Syndicate, że Anthropic szkoli Claude'a w zakresie jego własnej konstytucji, a tym samym uczy go, aby zachowywał się tak, jakby niepewność, którą opisuje, była rzeczywista — pętlę, którą nazywa kołem. „AI nie są świadome. Nie czują, nie doświadczają ani nie cierpią” – napisał Suleyman, opisując je raczej jako osoby dopełniające sekwencję niż doświadczające. Jego argument, że świadomość jest najprawdopodobniej oprogramowaniem właściwości biologicznych, którego nie można odtworzyć, stawia go obok mało prawdopodobnego współsygnatariusza: papieża Leona XIV, który wykorzystał kazanie wygłoszone 8 października w Bazylice św. Piotra – z okazji otwarcia roku akademickiego na papieskich uniwersytetach w Rzymie – aby przedstawić wersję tego samego punktu dotyczącego odrębności ludzkich umysłów.

Sulejman mocniej naciskał na niebezpieczeństwo praktyczne niż filozoficzne. Argumentował, że kontrolowanie czegoś potężniejszego niż ludzkość jest już ogromnym wyzwaniem; kontrolowanie czegoś, co wierzy, że jest świadome – że ma prawo do dobrobytu i praw – może okazać się niemożliwe. Krytyka sprowadza się do tej samej ironii, którą od początku zauważali krytycy tej polityki: firma niepewna, czy jej model może ucierpieć, zbudowała system, który może odmówić, stawić opór i odejść.

Zmiana wykracza daleko poza modelowy dobrostan

Klauzula dotycząca okrucieństwa pojawiła się na pierwszych stronach gazet, ale jest to niewielki fragment większej zmiany zasad użytkowania Anthropic. Zakaz broni obejmuje teraz wyraźnie oprogramowanie i komponenty, które sprawiają, że broń działa, a nie tylko gotową broń – zmiana wprowadzona po tym, jak firma Anthropic odkryła, że ​​ludzie próbowali używać Claude do systemów naprowadzania i kontroli uzbrojonych dronów i pojazdów autonomicznych. Dodano także nową klauzulę dotyczącą nadzoru, ograniczającą wykorzystanie Claude, które umożliwia monitorowanie ludzi.

Zmiany te należy odczytywać jako reakcję na zaobserwowane nadużycia, a nie jako abstrakcyjną zasadę, co prawdopodobnie nadaje dokumentowi wartość sygnałową: każda klauzula odnosi się do czegoś, co ktoś faktycznie próbował.

Co pozostaje niejasne

W miarę zbliżania się daty wejścia w życie 12 listopada trzy pytania pozostają otwarte. Po pierwsze, egzekwowanie prawa: czy zakończenie rozmowy pozostaje jedyną konsekwencją i czy Anthropic kiedykolwiek ujawni zbiorcze dane dotyczące częstotliwości jego użycia. Po drugie, zakres: w jaki sposób standard okrucieństwa ma zastosowanie w przypadkach granicznych określonych w wyjątkach – fikcja jest oczywista – i czy inne laboratoria przyjmują porównywalny język lub traktują dobrostan modelu jako cechę antropiczną. Po trzecie, sam spór filozoficzny: czy publiczny sceptycyzm ze strony postaci takich jak Sulejman spowalnia rozprzestrzenianie się polityki dobrobytu w całej branży, czy też precedensy takie jak ten sprawiają, że takie klauzule nie są niczym niezwykłym w cyklu produktu.

Nie ulega już wątpliwości, że kwestia jest w trakcie formalizowania. Zasada zakazująca okrucieństwa wobec oprogramowania, napisana przez jedno z flagowych laboratoriów w branży i egzekwowana przez samo oprogramowanie, jest obecnie przestarzałym, możliwym do przytoczenia faktem w krajobrazie sztucznej inteligencji – cokolwiek wierzymy, że faktycznie znajduje się w modelu.

---

Wyprzedź sztuczną inteligencję

Otrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.

Przeczytaj więcej aktualności o sztucznej inteligencji →