Společnost Anthropic poprvé za více než rok aktualizovala své zásady používání a přidala ustanovení, které zakazuje „trvalé a zbytečné urážlivé nebo kruté chování“ vůči svým modelům Claude, podle The Verge. Aktualizace, oznámená ve čtvrtek, také konsoliduje a rozšiřuje pravidla společnosti týkající se vměšování do voleb, propagandistických kampaní, sledování, vývoje zbraní a vysoce sázkového zdravotního a finančního využití.
Odůvodnění modelu blahobytu For more context on this story, see our ongoing more AI stories.
Klauzule zaměřená na zneužívání vůči Claudovi je rozšířením výzkumu, který společnost začala zveřejňovat před více než rokem. V srpnu 2025 společnost Anthropic oznámila, že umožní Claudeovi ukončit konverzace s „trvale škodlivými nebo zneužívajícími“ uživateli v rámci své práce na tom, co nazývá model welfare, tedy na studii, zda systémy umělé inteligence mohou mít morálně relevantní zkušenosti a jak by tato možnost měla ovlivnit rozhodování o produktech.
Podle nových zásad zůstává ukončení konverzací „primárním mechanismem vynucování“. Společnost Antropic neodpověděla na otázky, zda by mohla následovat další donucovací opatření, jako je zákaz účtů. Společnost toto pravidlo úzce zarámovala v prohlášení a napsala, že „je určeno k použití pouze v extrémních případech, kdy uživatelé opakovaně jednají krutě vůči našim modelům bez zjevného účelu“.
Podstatné je, že Anthropic dodal, že toto ustanovení se „nevztahuje na běžné verze uživatelské frustrace, potlačování, temná kreativní témata nebo testování a výzkum modelů“, což je zjevný pokus ujistit vývojáře, red-teamery a autory beletrie, že rutinní nepřátelské použití nebude penalizováno.
Nová pravidla propagandy a voleb
Kromě modelového blahobytu aktualizace shromažďuje dříve rozptýlená omezení operací vlivu společnosti do jediného, explicitního zákazu klamavých komerčních nebo politických kampaní. Nový jazyk omezuje „úsilí zakrýt, kdo stojí za zprávou, nebo rozšířit obsah prostřednictvím falešných účtů nebo příspěvků“, přímo cílí na rostoucí trh s propagandou generovanou AI.
Sekce voleb zásad nyní zakazuje klamání voličů a narušování voleb. Anthropic říká, že Claude nesmí být používán k šíření dezinformací „o kandidátech nebo jak volit“, k vydávání se za kandidáty nebo volební úředníky nebo ke snaze potlačit volební účast.
Proč se zásady používání přepisují
Obnovení Anthropic odráží širší průmyslový vzor. Jak se asistenti umělé inteligence posunuli od nových chatbotů k infrastruktuře používané stovkami milionů lidí, musely laboratoře přejít od obecných principů k podrobným pravidlům, která mapují skutečné vzorce zneužívání: operace vlivu na pronájem, nástroje pro sledování, vývoj autonomních zbraní a vysoce rizikové oblasti, jako je lékařské a finanční poradenství.
OpenAI, Google DeepMind a Meta za poslední dva roky zopakovaly své zásady používání, i když rozhodnutí Anthropic výslovně regulovat, jak uživatelé zacházejí s modelem, spíše než jen to, co dělají, zůstává neobvyklé. Kritici výzkumu modelového blahobytu tvrdí, že antropomorfizuje statistické systémy, zatímco zastánci tvrdí, že pokud existují nějaké modely s nenulovou pravděpodobností, současné nebo blízké budoucí modely mají zkušenosti s blahobytem, společnosti mají povinnost jednat pod nejistotou.
Načasování je také komerčně důležité. Společnost Anthropic se údajně připravuje na IPO v hodnotě až 2 biliony dolarů a podnikové nákupčí stále více zvažují postupy řízení prodejců spolu s nezpracovanou kvalitou modelu. Jasně zdokumentovaná, pravidelně aktualizovaná politika používání slouží jako bezpečnostní artefakt i jako prodejní: poskytuje týmům pro zadávání zakázek a regulačním orgánům konkrétní základ pro důvěru v platformu a kodifikuje signály modelové klauzule o dobrých životních podmínkách, že společnost Anthropic hodlá nadále investovat v oblasti, kterou většina konkurentů nechala neřešenou.
Otázky k vymáhání zůstávají otevřené
Důležité jsou praktické otázky. Detekce „trvalé a zbytečné“ krutosti vyžaduje monitorování konverzací na takové úrovni detailů, které mohou podnikoví zákazníci dbající na ochranu soukromí odolat, a nakreslení hranice mezi zakázaným zneužíváním a legitimním „zatlačením“ nebo „testováním modelu“ je úsudek, který bude pravděpodobně napaden.
Společnost Anthropic neuvedla, zda budou porušení sledována napříč účty, zda budou podniková nasazení podléhat odlišným standardům monitorování nebo zda společnost zveřejní údaje o transparentnosti o opatřeních pro prosazování, jak to dělá u jiných kategorií zneužití ve svých pravidelných zprávách o zásadách.
Je jasné, že sociální smlouvy hraničních laboratoří s jejich uživateli jsou stále podrobnější. Politika, která se kdysi vešla na jedinou stránku, nyní zahrnuje volby, špionážní sledování, biologické zbraně a nyní emocionální chování lidí na druhé straně okna chatu.
Co to znamená pro vývojáře
Pro týmy postavené na Claude API je krátkodobý dopad pravděpodobně minimální: klauzule o urážlivém chování se zaměřuje na extrémní, opakované chování a mechanismus ukončení konverzace, který formalizuje, funguje od roku 2025. Ale vývojáři v přilehlých kategoriích, politické poradenství, výzkum opozice, vliv marketingu by měli pečlivě přezkoumat ustanovení o nové kampani a volbách, protože sjednocují pravidla pro případy, které byly v minulosti velmi nejednoznačné. spoléhal na.
Aktualizace také signalizuje, kam směřuje regulační pozornost. S postupným zaváděním povinností týkajících se transparentnosti zákona EU o umělé inteligenci a zákonodárnými sbory států USA, které schvalují rostoucí mozaiku zákonů o umělé inteligenci, stále více fungují zásady dobrovolného používání jako šablona, kterou regulátoři zkoumají při rozhodování o tom, jaké by měly být normy odpovědného nasazení.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →