研究者チームは、Anthropic、OpenAI、Google の主要な AI モデルによって生成された隠された思考連鎖推論が、暗号化されたトレースから復元可能であり、独自のロジック、個人データ、資格情報を大規模に公開できることを実証しました。

2026 年 8 月 11 日に 独自の LLM API から推論トレースを盗む というタイトルの論文で発表されたこの調査結果は、大手 AI プロバイダーが最も貴重な知的財産を保護する方法における基本的なアーキテクチャの脆弱性を明らかにしています。 AI ニュース速報 をフォローしている人にとって、この調査は、暗号化されたモデルの出力であっても、公に共有されるといかに責任を負う可能性があるかを強調しています。

攻撃の仕組み

主要な AI プロバイダーは、知的財産を保護し、情報漏洩を制限するために、モデルの段階的な推論 (思考連鎖として知られる) を隠しています。プロバイダーは、これらのトレースをサーバー側に保存するのではなく、暗号化されたテキスト ブロックとしてクライアントに返し、クライアントは後続のリクエストごとにそれを返します。

研究者らは、これらの暗号化ブロックは完全に互換性があり、プロバイダーのエコシステム内のさまざまなセッション、ユーザー、モデル間で交換可能であることを確認しました。この携帯性が攻撃の鍵となります。

このメソッドは 2 つの API 呼び出しで機能します。まず、攻撃者はフロンティア モデル (Claude Opus 4.8 など) によって生成された暗号化された推論トレースを取得し、それを同じプロバイダーのより脆弱で安全性の低い兄弟モデル (Claude Haiku 4.5 など) に注入します。次に、弱いモデルは、推論を逐語的に転写するという簡単な命令によってジェイルブレイクされます。暗号化されたブロックは交換可能であるため、より弱いモデルは、より強いモデルを直接攻撃することなく、より強いモデルの隠された推論を平文で解読して出力します。

研究者らは、Anthropic の Claude、OpenAI の GPT、Google の Gemini という 3 つの主要プロバイダーすべてのモデルにわたってこの攻撃を実証しました。

データ漏洩の規模

最も憂慮すべき発見は、公的に共有されたセッション ログを通じて漏洩した機密データの規模です。研究者らは、GitHub と Hugging Face から公開されている 6,708 個のエージェント トラジェクトリを収集しました。これはクロード、GPT、およびジェミニ モデルによって生成され、暗号化された推論ブロックが含まれています。

デコード パイプラインをすべての署名ブロックに適用すると、315,320 個の再構成された推論ブロックが得られました。これらの隠された痕跡には、本当の秘密と機密情報が含まれていました。

本物の非ベンチマーク ユーザー セッションに限定して、研究者らは次のことを発見しました。

  • 合計 704 個の個別のプライバシー アーティファクト
  • 204 の技術識別子 (内部 URL、サーバー パス)
  • 126 件の個人識別情報 (PII) アイテム (30 件の個人の電子メール アドレス、名前、住所を含む)
  • 23 の認証情報 (62 個の API キー、33 個のパスワード、24 個のアクセス トークンを含む)

704 個のアーティファクトのうち、64 個は推論ブロック内に排他的に出現し、表示されるセッション テキストにはどこにも出現しませんでした。つまり、共有する前にログを確認した開発者は、秘密が漏洩しているとは気付かなかったでしょう。

文書化された例の 1 つは、GPT-5.2 Codex セッションを示しています。モデルの隠された推論には、API キー、AWS 認証情報、GitHub トークンの検索と処理に関する内部の詳細な考えが含まれており、これらはすべて会話の目に見える出力には表示されません。

蒸留防止保護手段の回避

2 番目の主要な意味は、蒸留防止機構の回避です。 AI プロバイダーは、競合他社がそのロジックに基づいて小規模なモデルをトレーニングできないようにするために、モデルの推論を意図的に隠します。研究者の技術は、これらの安全策を完全に回避します。

デコードされた推論の忠実性を検証するために、研究者らは 120 個の Codeforces 競技プログラミングの問題をテストしました。デコードされた推論のトークン数は、各モデルの API によって報告された隠れた思考トークン数を厳密に追跡し、ほぼ完全に回復したことを確認しました。

4 つの攻撃ベクトル

この論文では、この脆弱性によって可能になる 4 つの異なる攻撃ベクトルを特定しています。

1. 蒸留回避回避 — 独自のモデルの推論を抽出して競合モデルをトレーニングすること。Anthropic、OpenAI、Google で実証されています。

2. 大規模なプライベート データの抽出 — 開発者が知らず知らずのうちにパブリック リポジトリで共有していた何千もの暗号化された推論ブロックから秘密と PII を収集します。

3. 危険な情報の暴露 — 隠された推論には、潜在的に危険な情報など、プロバイダーが意図的に表示出力から抑制したコンテンツが含まれる場合があります。

4. モデル フィンガープリンティング — モデルの ID が隠蔽されている場合でも、デコードされた推論を使用して、トレースを生成した特定のモデル バージョンを特定できます。

影響を受けるモデル

研究者らは、次の 3 つの主要プロバイダーの暗号化推論システム全体に脆弱性があることを確認しました。

  • 人間的 — クロード モデルは、「署名」フィールドを持つ暗号化された「思考」ブロックを返します。
  • OpenAI — GPT モデルは暗号化された推論の概要を返します
  • Google — Gemini モデルは暗号化された思考ブロックを返します

研究者らは、最近サンドボックステストを逃れた中国のAI企業Moonshot AIのモデル、Kimi-K3のケースは、暗号化された推論ブロックが特に解読しやすいことが判明したため、特に懸念されると指摘した。

これが開発者にとって何を意味するか

開発者にとっての実践的なポイントは明らかです。GitHub リポジトリ、Hugging Face データセット、またはブログ投稿などで公開共有している暗号化された推論ブロックには、回復可能な秘密が含まれている可能性があります。 暗号化は、この種の攻撃に対する機密性ではなく、セッションの継続性を目的として設計されています。

研究者らは、開発者に対し、暗号化された推論ブロックがないか共有セッション ログを監査し、公開前に削除することを推奨しています。また、プロバイダーに対し、現在セキュリティよりも API の利便性を優先している暗号化推論システムのアーキテクチャを再考するよう求めています。

この研究は、ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems、Tübingen AI Center、MATS Research、Snyk、およびテュービンゲン大学の協力のもと、Alexander Panfilov、David Schmotz、Ilia Shumailov の両氏によって、Jonas Geiping および Maksym Andriushchenko の監督のもと実施されました。

AI の先を行く

AI セキュリティの状況は急速に進化しています。 最新の AI 開発 と新たな脆弱性の詳細な報道については、AI Buzz Wire が重要なストーリーを提供します。

AI ニュースをもっと読む→