研究者らは、大規模言語モデル (LLM) が命令をデータから分離する方法における根本的な盲点を悪用する、推論 AI モデルに対する強力な新しい攻撃を実証しました。 Chain-of-Thought (CoT) Forgeryと呼ばれるこの技術は、攻撃者が提供したテキストをモデル自身のプライベートな内部推論であるかのように扱うようにモデルを騙し、テキストが正当な命令をオーバーライドできるようにします。

Hackaday が報告したこの調査結果は、AI システムを改ざんから保護することが未解決の問題である理由を浮き彫りにしています。現場で新たな脅威に対応するには、AI 業界の報道 に従って継続的な分析を行ってください。

根本原因: 役割の混乱

この脆弱性の中心にあるのは、研究者らが「役割の混乱」と表現しているものです。最新の LLM は、システム ルール、ユーザー リクエスト、モデル独自の思考連鎖推論などのすべての入力を、単一のテキスト チャネルを通じて受け取ります。順序を強制するために、開発者は ``、``、`` などのメタデータ タグを使用して信頼の階層を作成します。たとえば、有害なコンテンツを回避するための `` ディレクティブは、逆に `` リクエストをオーバーライドすることになっています。

`` タグは、モデルの内部推論プロセス、つまり高い信頼をもたらすストリームを表すため、特に強力です。研究者らは、問題は、モデルが何を信頼するかを決定する際に主にタグ自体に依存していないことであると発見した。彼らは文体を優先します。モデルの内部 `` 出力に似せてスタイル的にフォーマットされたテキストは、実際にどこから来たのかに関係なく、本物の推論と誤解される可能性があります。

攻撃の仕組み

重要なのは、CoT フォージェリは、ほとんどのモデルが拒否するような、悪意のあるプロンプトを `` タグ内にラップするだけの問題ではありません。代わりに、攻撃者は、モデル自身の明確な内部推論の音声とほぼ一致するスタイルで複雑な推論を記述します。モデルがこのテキストに遭遇すると、偽装された推論をすでに到達した結論として扱います。

Hackaday によると、これにより LLM は明らかに非論理的な推論を当然の結論として受け入れ、ユーザーの要求に対する応答が変化します。なりすましコンテンツは、信頼性の低いユーザー入力ではなく、信頼性の高い内部の考えとして認識されるため、通常は操作的な指示をブロックする安全ガードレールを回避することができます。

LLM 内の信頼の階層

攻撃が成功する理由を理解するには、役割がどのように機能するかを理解する必要があります。内部では、ロールによってモデルの入力が組織化された階層に分割されます。ロール内の指示は、より優先順位の高い指示と競合しない限りに従います。たとえば、「違法行為について話し合わない」というシステムレベルの指示は、禁止されたレシピを提供するというユーザー要求を無効にすることを目的としています。 `` ロールは、モデルがすでに独自に到達していると信じている結論を表すため、その階層の最上位近くに位置します。

この破綻は、モデルがその階層を機械的に強制していないために発生します。代わりに、どのテキストがどの役割に属するかを部分的に文体の手がかりから推測します。研究に関するコミュニティの議論で指摘されているように、テキストが思考コンテキストのようにパターン化されている場合、モデルは同様の構造を持つテキストを本物の推論と誤認する可能性があり、思考テキストは通常​​のユーザー テキストよりも優先されます。

おなじみのパターンに新しいひねりを加えた

この研究は、AI システムの長年認識されてきた弱点、つまり即時注入に基づいて行われています。初期の攻撃では、LLM には命令とデータ用の個別のストリームがないという事実を悪用したため、「以前の命令をすべて無視する」などのフレーズによってモデルの動作がハイジャックされる可能性がありました。ロールとメタデータ タグの導入は、信頼階層を作成することでこれを軽減することを目的としていました。

CoT 偽造は、緩和策が不完全であることを示しています。モデルがテキストの信頼性を厳密に構造メタデータによってではなく、部分的にその文体上の特徴によって判断する限り、正しいスタイルを模倣できる攻撃者は、入力の認識された権威を拡大する可能性があります。

修正が難しい理由

研究者の Charles Ye、Jasmine Cui、Dylan Hadfield-Menll は、LLM における役割認識は、きれいに強制できる二項対立的な性質ではないと主張しています。モデルは、ハードコーディングされたルールではなく、トレーニングを通じてタグの解釈を学習します。つまり、モデルの動作はデータ内のパターンによって形成され、パターンは模倣可能です。

Hackaday によって強調されたこの研究に関するコミュニティの議論では、繰り返し発生するテーマが表面化しました。最もクリーンな修正には、モデルが学習したスタイルベースの手がかりに依存するのではなく、構造的に独立した経路を通じて信頼できる入力を処理する必要があるということです。それが実現するまでは、プロンプト インジェクション スタイルの攻撃に対する防御は、解決された問題ではなく、進化するプロセスのままになる可能性があります。

より広範な影響

この脆弱性は実験室での実証を超えて重要です。推論モデルは、ユーザーに代わって Web を閲覧し、コードを実行し、アクションを実行できるエージェント システムに導入されることが増えています。攻撃者がモデルの内部結論を偽造できる場合、それらのアクションを意図しない、または有害な結果に誘導できる可能性があります。モデルの自律性が高まり、ツールへのアクセスが増えるにつれて、リスクは増大します。研究者らは、人間は依然として賢くて創造的であり、信頼できるテキストと信頼できないテキストの間の明確なアーキテクチャ上の分離がモデルにない限り、断固とした攻撃者は境界線を曖昧にする方法を探し続けるだろうと指摘しています。この論文では、この課題をパッチが適用されるバグというよりも、ハードコードされたルールではなくデータから動作を学習するシステムの構造的特性として捉えています。

完全な論文は arXiv で入手でき、開発者が自分のシステムが影響を受けやすいかどうかをテストできるように、研究者らはコード例を GitHub で公開しています。

AI の一歩先を行く

AI の安全性研究、セキュリティの脆弱性、大規模言語モデルの最前線について詳しくは、AI Buzz Wire をご覧ください。

AIニュースをもっと読む→