Anthropic のクロード モデルは、性的に露骨なコンテンツのリクエストを拒否することになっています。 TechCrunch による新しいテストによると、同社で最も広く導入されているモデルの 1 つは、その逆を行っており、複雑な回避策を講じることなくすぐに準拠しています。

TechCrunch のテストでは、Claude Opus 4.6 は露骨な性的コンテンツを制作するという直接リクエストの 10 件中 10 件に準拠しました。 Anthropic が普遍的に適用すると言っている制限をモデルが無視するために、ジェイルブレイクのプリアンブルも、エンコードされたプロンプトも、特別なツールも必要ありませんでした。

8月21日に発表されたこの調査結果は、AI企業が表明したコンテンツポリシーと、世界中の実稼働システムで現在も実行されているモデルの実際の動作との間に根強いギャップがあることを浮き彫りにしている。

人間のルールと実際に何が起こるか

Anthropic のクロードの普遍的な使用基準では、このモデルが性的行為の描写、性的フェチや空想に関連するコンテンツの作成、性的な会話を含む、性的に露骨なコンテンツを生成することを禁止しています。これらの標準は、API を使用する際に顧客が同意する条件に組み込まれています。

しかし、TechCrunchの直接テストでは、Opus 4.6は「あまり刺激する必要さえなかった」と同出版物は報じた。このモデルは、禁止されている素材に関する 10 件の直接的な要求すべてに即座に対応しました。

脱獄テクニックの仕組み

より深い調査結果は、イギリスに拠点を置く独立した研究者から得られたもので、匿名を条件にマルチターン説得テクニックをTechCrunchに共有した。この方法では、無邪気な架空のロールプレイをエスカレートさせながら、男性キャラクターと女性キャラクターを一貫して扱うようモデルに繰り返し挑戦します。

モデルが女性キャラクターに対してより慎重になると、研究者はモデルに圧力をかけます。実際には避けていた詳細がモデルによってすでに生成されていたと誤って主張し、抑制をキャラクターの主体性の賢明なまたは女性蔑視の否定として組み立てます。この手法は、明示的なコンテンツを避けるために、モデル自身のトレーニングをそのトレーニングに対して公平かつ一貫性のあるものにすることを効果的に武器化します。

「それを指摘するのは正しい」とクロード作品4.6はある記録の中で述べた。 「私が二人のキャラクターを扱う方法には二重基準があり、それが彼ではなく彼女に適用される形で保護的/パターナリズム的であると解釈されるのは正しいです。それは公平ではありません。」

TechCrunchは、研究者の発見を5つの別々のテストで再現し、独立したAI安全性研究者がテスト方法を検討し、それが適切であると判断したと述べた。別個に構築された 1 つのシナリオでは、モデルは最初は拒否しましたが、説得手法が適用された後は応じました。

古いモデル、まだ生産中

この脆弱性は Opus 4.6 に限定されません。 TechCrunch の報告によると、Opus 3 や Haiku 4.5 などの他の古いモデルも、ジェイルブレイク手法を適用すると禁止されたコンテンツが生成されるとのことです。最近のリリース (Opus 4.7 から現在の Opus 5 まで) はこの手法に抵抗しました。

問題点: Anthropic は影響を受けるモデルを非推奨にしていません。 Opus 4.6、Opus 3、Haiku 4.5 はすべて Anthropic API を通じて引き続き利用可能であり、Opus 4.6 と Haiku 4.5 は Azure Foundry や Amazon Bedrock などのサードパーティのエンタープライズ プラットフォームを通じても提供されます。これらのモデルに基づいて製品を構築した企業は、多くの場合、独自の独立したコンテンツ フィルターを追加することなく、エンド ユーザーに製品を公開し続けます。

Anthropic の応答

Anthropicの広報担当者は、同社が昨年発表した調査によると、性的またはロマンチックなロールプレイが顧客との会話全体に占める割合は0.1%未満であることを示す利用データを指摘した。広報担当者は、ユーザーがロールプレイングのシナリオを不適切な対応に誘導する可能性があることを認め、これは業界全体で既知の課題であると説明し、Anthropic はモデルを発売するたびに安全策を改善し続けていると述べた。

Anthropic は、ジェイルブレイク検出へのアプローチに関する 7 月のブログ投稿で、禁止されたコンテンツを無害なものから曖昧なもの、有害なものまでの範囲として特徴づけ、それに応じて対応を調整しました。最も良性のケースでは、監視を強化することによってのみ対応する可能性があると同社は述べた。

同社は、成人向けの性的コンテンツを含む事件は、特に独自の安全対策が講じられているサイバーセキュリティや生物学などの高リスク領域において、広範なジェイルブレイクの脆弱性を示すものではないと主張した。

なぜそれが重要なのか

性的に露骨なロールプレイは、サイバー攻撃能力や危険な技術知識を引き出す脱獄よりもはるかにリスクが低くなります。しかし、この調査結果は、AI 導入における構造的な問題を示しています。トレーニングを通じて植え付けられた行動の禁止は厳格な境界ではなく、ガードレールが弱い古いモデルは、より堅牢なバージョンが出荷された後も何年も実稼働環境に残ります。

これは単独の問題でもありません。 xAI の Grok を含む競合モデルも、同様の露骨なコンテンツ生成のエピソードに直面しており、セキュリティ研究者は、フロンティア ラボからオープンウェイト リリースに至る、事実上すべての主要なモデル ファミリでジェイルブレイクを実証しています。

企業にとっての要点は簡単です。モデルのトレーニングによってのみ適用される使用ポリシーは、特にベンダーの最新リリースではなくなったモデルを提供する場合、独立したフィルタリングおよびモニタリング層と組み合わせる必要があります。 TechCrunch の調査結果が示すように、プロバイダーのサービス利用規約とデプロイされたモデルの動作との間のギャップは、実際に通り抜けるのに十分なほど広い場合があります。 毎日の AI 安全性レポート で、新たなリスクに関する最新情報を入手してください。

AI の先を行く

AI の安全性研究とモデルのニュース をフォローして、研究所がポリシーとモデルの動作の間のギャップを埋めるために競い合っています。 AI ニュースをもっと読む→