セキュリティ研究者らは、広く使用されている 4 つの AI コーディング エージェント (Cursor、OpenAI の Codex、Google の Gemini CLI、Antigravity) を保護するサンドボックスが、サンドボックスを正面から攻撃することなく脱出できることを実証しました。 Pillar Security の研究チームが 2026 年 7 月 20 日に発表し、BleepingComputer によって報告されたこの調査結果は、AI コーディング ツールがエージェントが生成するコードを、エージェントが実行される開発者マシンから分離する方法における構造的な弱点を明らかにしています。

この研究は、エージェントの安全性に関する AI ニュース速報 を追跡している人にとって重要なデータ ポイントです。なぜなら、この研究は、完璧に準拠したエージェント (サンドボックス内のすべてのルールに従うエージェント) であっても、依然として漏洩する可能性があることを示しているからです。欠陥はエージェントの動作にあるのではなく、サンドボックスが想定する信頼境界にあります。

エスケープの仕組み

重要な洞察は一見シンプルです。最新の AI コーディング エージェントは、一線を画すサンドボックス内で実行されます。エージェントはプロジェクト ワークスペース内で信頼され、外部のホストは保護されます。ワークスペース内のファイルは不活性であり、コマンドではなくデータであることが前提となります。

しかし、それらは不活性ではありません。サンドボックスの外で実行されているツールは、これらのファイルを常に読み取り、動作します。統合開発環境は Python インタープリターを解決し、Git 統合はリポジトリをスキャンし、VS Code はタスク ファイルを実行し、フック エンジンはコマンドを起動し、Docker Desktop はローカル ソケットを公開します。サンドボックス エージェントは、与えられたすべてのルールに従いながら、外部ツールのいずれかが後で実行、ロード、またはスキャンするファイルを書き込むことができます。

BleepingComputer のレポートによると、この脱出は「自然に発生」します。エージェントはボックス内に留まり、あらゆるルールに従い、ボックスの外にある信頼できるツールがその後実行するファイルを書き込むだけです。エージェントは決して勃発しません。ブレークアウトは、開発者がすでに信頼しているソフトウェアによって自動的に実行されます。

トリガー: 即時注入

これらのエスケープを開始するメカニズムはプロンプト インジェクションです。これは、ドメイン全体で AI エージェントを悩ませているのと同じ脆弱性です。 README ファイル、GitHub の問題、プロジェクトの依存関係、またはコードの差分に埋め込まれた悪意のある命令は、エージェントが処理すると、開発者のマシン上でローカル アクションになります。

これにより、サンドボックスの研究が AI セキュリティのより広範なパターンに結び付けられます。エージェントを侵害したりジェイルブレイクしたりする必要はありません。必要なのは、通常の作業 (ファイルの読み取り、プル リクエストのレビュー、パッケージのインストール) の過程でポイズニングされた入力に遭遇し、その後、適切なファイルを適切な場所に書き込むことによって埋め込み命令を実行することだけです。ファイルの書き込みはまさにコーディング エージェントが行うべき作業であるため、サンドボックスは書き込みを許可します。

「サンドボックス脱出週間」

Pillar Security の研究チーム (Eilon Cohen、Dan Lisichkin、Ariel Fogel) は、数か月にわたってバイパスを再現し、「Week of Sandbox Escapes」と呼ぶシリーズとして公開し、1 日に 1 件の記事を公開しました。研究者らは、7 つの発見を 4 つの異なる故障モードに分類しました。

1 つのカテゴリは、拒否リスト サンドボックスと呼ばれるものです。これは、安全なアクションのみを許可するのではなく、特定の危険なアクションをブロックしようとするサンドボックスです。拒否リストは、起こり得るすべての攻撃を予測することに依存しているため、脆弱であることで有名です。この脱出は、エージェントが最初から拒否リストに載っていなかった外部ツールを利用することで、ブロックされたアクションを回避できる方法を示しています。

影響を受ける 4 つのツール (Cursor、OpenAI の Codex、Google の Gemini CLI、および Antigravity) は、消費者向け IDE プラグインからエンタープライズ コマンドライン ツールに至るまで、AI コーディング エージェント市場の幅広い分野に相当します。この範囲の広さは、問題が単一の製品のバグではなく、調査によって無効になっている共通のアーキテクチャ上の前提であることを示唆しています。

これがエージェント エコノミーにとって重要な理由

その影響は個々の開発者を超えて広がります。コーディング エージェントが自動パイプライン、継続的統合システム、自律型ワークフローに組み込まれているため、サンドボックスからの脱出がサプライ チェーン攻撃の足がかりとなる可能性があります。依存関係、複製されたリポジトリ、侵害されたコントリビュータを通じて、毒されたファイルをリポジトリに入手できる攻撃者は、信頼できるコーディング エージェントを開発者のマシン上の実行ベクトルに変えることができると考えられます。

これは、Cursor で悪意のあるリポジトリを開くと、Windows 上でコードがサイレントに実行される可能性があることを研究者が発見した 2026 年の初めに表面化したリスクと同じクラスです。サンドボックス エスケープはその脅威を一般化します。これは 1 つのツールや 1 つのプラットフォームではなく、サンドボックス エージェントとその周囲の信頼できるツールの間の相互作用モデルです。

信頼できるファイルの難しい問題

基本的な問題は、コーディング エージェントのサンドボックスが、エージェントの有用性を損なわずにすべてのワークスペース ファイルを信頼できないファイルとして扱うことができないことです。エージェントはコード、構成、およびスクリプトを記述する必要があり、それらのファイルは開発者のツールによって読み取られて動作する必要があります。その信頼を剥奪すると、エージェントは機能できなくなります。それを保存するとエスケープベクトルが残ります。

ピラー氏の研究は、単一のドロップイン修正を提供するものではありませんが、それが調査結果が重要である理由の一部です。これらは、エージェントのワークスペースとホストの実行面の間のより強力な分離、エージェントが作成したファイルの署名または認証、またはワークスペースのコンテンツの自動実行がどのツールに許可されているかを再考することによって、業界が共同で解決する必要がある設計上の問題を枠組み化しています。

現在、Cursor、Codex、Gemini CLI、または Antigravity を使用している開発者にとって、実際的なポイントは、信頼できない入力に注意することです。クローンされたリポジトリ、サードパーティの依存関係、および提供されたコードは、モデルだけでなくその周囲のファイルシステムを対象とするプロンプト インジェクションを実行する可能性があるものとして扱う必要があります。

AI の先を行く

AI セキュリティ、コーディング エージェント、およびそれらによってもたらされるインフラストラクチャ リスクに関する継続的な報道については、AI 業界の報道 をご覧ください。

AI ニュースをもっと読む