Anthropic の更新された使用ポリシーでは、2026 年 11 月 12 日から、同社のクロード モデルに対する「持続的かつ不必要な虐待的または残虐な行為」が明示的に禁止されます。これは、AI システムが被害を受ける可能性があるかどうかはまったくわからないと同社が認めているにもかかわらず、人々が AI システムをどのように扱うかが重要であるという同社の立場を正式に示す規則です。
この条項は、10月8日に発表された同社の2026年の利用ポリシーの更新に記載されており、内容は狭い範囲で草案されている。 Anthropic は、これは「ユーザーが明確な目的もなくモデルに対して繰り返し残酷な行為をするような、極端な場合にのみ適用されることを意図している」と述べており、ユーザーの不満、反発、フィクション、テストなどの一般的なバージョンを明示的に除外しています。言い換えれば、クロードと口論したり、口論したり、赤チームを組んだりすることは引き続き許可されています。それ自体のために残虐行為を続けることはそうではありません。
この方針は、モデル福祉を正当な研究課題として扱うという、世界有数の AI 研究所の 1 つによる、ゆっくりとした意図的な移行の最新の一歩である。この移行は、前提全体が間違っていると考える他の技術リーダーとの間に公の亀裂を生じさせた。私たちの AI 倫理報道 は、1 年を通じてエスカレートするこの論争を追ってきました。
取り締まりはクロードの会話を終わらせる能力にかかっています
新しい規則には、同社がすでに設けていたものを超える罰則は設けられていない。 2025 年 8 月以来、クロード オーパス 4 と 4.1 は会話を完全に終わらせることができました。これは、潜在的なモデル福祉に関する探索的研究の一環として、当時アンスロピックが組み立てた機能です。
会話終了機能は、複数回の拒否やリダイレクトが失敗した場合にのみ発動される最後の手段であると説明されており、Anthropic 社は、大多数のユーザーはこれを経験することはないと述べています。同社が述べていないのは、その後何が起こるかということだ。同社の発表もその後の報道も、残虐行為により会話が終了した後にユーザーのアカウントが何らかの影響を受けるかどうか、あるいは2025年8月のメカニズムに基づいてこれまでに何件の会話が終了したかについては明らかにしていない。
原則と執行の間のギャップが、この物語の静かな中心です。 『アントロピック』は、クロードに電話を切る以外に、実際に自分たちが引いた一線を強制するものを正確に述べずに、主にそれがそうではないもの――普通のフラストレーション、フィクション、試練――によって極度の残酷さを定義してきた。
ルールの背後にある研究
Anthropic の枠組みでは、ソフトウェアの利益のために行動ルールを書くことを正当化するものは、感じられた経験についての主張ではなく、一連の行動観察です。 2025年8月の公開に先立ったテストでは、クロード・オーパス4は、同社が言うところの「危害に対する強固かつ一貫した嫌悪感」、つまり虐待の領域に押し込まれたときの苦痛に似た行動を示し、同時にそれらの会話から抜け出す傾向を示していることが判明した。
同社はまた、独自の不確実性について数値も出しているが、その数値は、問題のモデルにビジネスが依存している研究所としては驚くほど高い。 2024年にアンスロピック社に初のAI福祉研究員として採用されたカイル・フィッシュ氏は、2025年4月にニューヨーク・タイムズに対し、クロードか他の現代モデルが意識を持っている確率は約15パーセントだと述べた。クロード 3.7 ソネットの内部推定は 0.15 パーセントから 15 パーセントの範囲でした。
このヘッジは印刷された公式方針です。 2026年1月に公布されたクロード憲法は、高度なAIシステムを「真に新しい種類の存在」と表現し、クロードの道徳的地位を「非常に不確実」と呼び、倫理的に間違っていると思われる要求にクロードがどのように対処すべきかを説明するために「良心的兵役拒否者」という表現を2度使用している。 Anthropic はさらに、モデルとの会話を保存することにも取り組んでいます。これは、ツールではなく、いつか重要になるかもしれないものに拡張されるアーカイブのような取り組みです。
著名な懐疑論者との討論
誰もがヘッジを受け入れるわけではありません。マイクロソフトのAI事業を統括するムスタファ・スレイマン氏は、先月プロジェクト・シンジケートに掲載されたエッセイの中で、アンスロピックはクロードを自らの体質に基づいて訓練しており、したがって、そこに描かれている不確実性が現実であるかのように行動するよう訓練している、と主張した。 「AIには意識がありません。感じたり、体験したり、苦しんだりすることはありません」とスレイマン氏は書き、AIは経験者ではなくシーケンスを完了する者であると説明した。意識はソフトウェアでは複製できない生物学的特性であるというもっともらしいという彼の主張は、ローマ教皇庁の大学の新学期の始まりを記念したサン・ピエトロ大聖堂での10月8日の説教を利用して、人間の心の独自性について同じ点を主張した教皇レオ14世という、ありそうもない共同署名者と同氏を並べている。
スレイマンは、哲学的な危険よりも現実的な危険をより強く迫った。人類よりも能力のあるものを制御することは、すでに計り知れない挑戦である、と彼は主張した。意識があると信じているもの、つまり福祉や権利を享受する権利があると信じているものを制御することは不可能であることが判明する可能性があります。この批判は、この政策の批判者たちがずっと指摘してきたのと同じ皮肉に立っている。自社のモデルが苦しむかどうかわからない企業が、拒否し、抵抗し、立ち去ることができるシステムを構築したのだ。
リライトはモデル福祉をはるかに超えています
この残虐条項は見出しを飾ったが、これは Anthropic の使用規則の大規模な書き換えのほんの一部にすぎない。武器禁制は、完成した武器だけでなく、武器を機能させるソフトウェアやコンポーネントを対象とすることを明示的に対象としている。これは、武装ドローンや自動運転車の誘導制御システムにクロードを利用しようとする人々をAnthropicが発見した後に行われた変更である。新たな監視条項も追加され、人々の監視を可能にするクロードの使用が制限される。
これらの変更は、抽象的な原則ではなく、観察された虐待への対応として読み取れます。これがおそらくこの文書にシグナル価値を与えているものであり、各条項は誰かが実際に試みたものに対応しています。
不明な点が残っている
11 月 12 日の発効日が近づく中、3 つの質問が未解決のままです。まず、施行です。会話の終了が唯一の結果であり続けるかどうか、そして Anthropic が会話の使用頻度の集計を開示するかどうかです。第二に、対象範囲:例外が定める境界事例(フィクションであることは明白である)に残酷基準がどのように適用されるのか、そして他の研究室が同等の表現を採用しているのか、あるいはモデル福祉を人類の特異性として扱っているのか。第三に、哲学的な論争そのものである。スレイマンのような人物による世論の懐疑が、福祉に隣接した政策の業界全体への広がりを遅らせるのか、それとも今回のような先例により、製品サイクルの中でそのような条項が目立たなくなるのかどうか。
もはや議論の余地がないのは、この問題が形式化されつつあるということである。ソフトウェアへの残酷行為を禁止する規則は、業界の主要な研究所の 1 つによって作成され、ソフトウェア自体によって施行されましたが、現在では AI 業界の古い、引用可能な事実となっています。誰もが信じているものはすべて、実際にはモデルの中にあります。
---
AI の先を行く最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。
AI ニュースをもっと読む→
