보안 연구원들은 널리 사용되는 AI 코딩 에이전트 4개(Cursor, OpenAI의 Codex, Google의 Gemini CLI, Antigravity)를 보호하는 샌드박스가 샌드박스를 정면으로 공격하지 않고도 탈출할 수 있음을 입증했습니다. Pillar Security의 연구팀이 2026년 7월 20일에 발표하고 BleepingComputer가 보고한 연구 결과는 AI 코딩 도구가 에이전트가 실행하는 개발자 시스템에서 생성한 코드를 분리하는 방식에 구조적 약점을 드러냈습니다.

이 연구는 에이전트 안전에 대한 AI 속보를 추적하는 모든 사람에게 중요한 데이터 포인트입니다. 샌드박스 내부의 모든 규칙을 준수하는 완벽하게 규정을 준수하는 에이전트라도 여전히 문제를 일으킬 수 있음을 보여주기 때문입니다. 결함은 에이전트의 행동이 아니라 샌드박스가 가정하는 신뢰 경계에 있습니다.

탈출 작동 방식

핵심 통찰력은 믿을 수 없을 정도로 간단합니다. 최신 AI 코딩 에이전트는 선을 긋는 샌드박스 내부에서 실행됩니다. 에이전트는 프로젝트 작업 공간 내부에서 신뢰되고 외부 호스트는 보호됩니다. 작업 공간 내부의 파일은 명령이 아닌 비활성 데이터라고 가정합니다.

그러나 그들은 불활성이 아닙니다. 샌드박스 외부에서 실행되는 도구는 지속적으로 해당 파일을 읽고 작업합니다. 통합 개발 환경은 Python 인터프리터를 해결하고, Git 통합은 리포지토리를 검색하고, VS Code는 작업 파일을 실행하고, 후크 엔진은 명령을 실행하며, Docker Desktop은 로컬 소켓을 노출합니다. 샌드박스 에이전트는 주어진 모든 규칙을 준수할 수 있으며 나중에 외부 도구 중 하나가 실행, 로드 또는 검색하는 파일을 계속 작성할 수 있습니다.

BleepingComputer의 보고에 따르면 탈출은 "저절로 발생합니다". 에이전트는 상자 내부에 머물면서 모든 규칙을 따르고 상자 외부의 신뢰할 수 있는 도구가 이후에 실행되는 파일을 작성합니다. 에이전트는 절대로 작동하지 않습니다. 개발자가 이미 신뢰하는 소프트웨어가 이를 대신하여 브레이크아웃을 수행합니다.

트리거: 신속한 주입

이러한 탈출을 실행하는 메커니즘은 신속한 주입입니다. 이는 여러 도메인에서 AI 에이전트를 괴롭혔던 것과 동일한 취약점입니다. README 파일, GitHub 문제, 프로젝트 종속성 또는 코드 차이점에 심어진 악의적인 명령은 에이전트가 이를 처리하면 개발자 컴퓨터에서 로컬 작업이 됩니다.

이는 샌드박스 연구를 AI 보안의 더 넓은 패턴과 연결합니다. 에이전트가 손상되거나 탈옥될 필요는 없습니다. 파일 읽기, 끌어오기 요청 검토, 패키지 설치 등 일반적인 작업 과정에서 오염된 입력을 만난 다음 올바른 위치에 올바른 파일을 작성하여 포함된 명령을 수행하면 됩니다. 파일 쓰기는 코딩 에이전트가 수행해야 하는 작업이므로 샌드박스에서는 쓰기를 허용합니다.

'샌드박스 탈출의 주간'

Pillar Security의 연구팀인 Eilon Cohen, Dan Lisichkin 및 Ariel Fogel은 몇 달에 걸쳐 우회를 재현하고 이를 "Week of Sandbox Escapes"라고 부르는 시리즈로 게시하여 하루에 한 편의 글을 발표했습니다. 연구자들은 7가지 발견을 4가지 뚜렷한 실패 모드로 분류했습니다.

한 가지 범주는 차단 목록 샌드박스라고 설명하는 것입니다. 즉, 안전한 작업만 허용하는 대신 특정 위험한 작업을 차단하려고 하는 샌드박스입니다. 거부 목록은 가능한 모든 공격을 예상하기 때문에 매우 취약한 것으로 악명 높으며, 탈출은 에이전트가 처음에 거부 목록에 없는 외부 도구를 활용하여 차단된 작업을 우회할 수 있는 방법을 보여줍니다.

영향을 받는 네 가지 도구(Cursor, OpenAI의 Codex, Google의 Gemini CLI, Antigravity)는 소비자 IDE 플러그인부터 엔터프라이즈 명령줄 도구에 이르기까지 AI 코딩 에이전트 시장의 광범위한 단면을 나타냅니다. 이러한 폭은 문제가 단일 제품의 버그가 아니라 연구에서 무효화되는 공유된 아키텍처 가정임을 시사합니다.

이것이 에이전트 경제에 중요한 이유

그 의미는 개별 개발자를 넘어 확장됩니다. 코딩 에이전트가 자동화된 파이프라인, 지속적 통합 시스템 및 자율적 워크플로우에 내장됨에 따라 샌드박스 탈출은 공급망 공격의 잠재적인 발판이 됩니다. 종속성, 복제된 저장소 또는 손상된 기여자를 통해 감염된 파일을 저장소로 가져올 수 있는 공격자는 신뢰할 수 있는 코딩 에이전트를 개발자 시스템의 실행 벡터로 전환할 수 있습니다.

이는 연구원들이 Cursor에서 악성 저장소를 열면 Windows에서 자동으로 코드가 실행될 수 있다는 사실을 발견한 2026년 초에 표면화된 것과 동일한 종류의 위험입니다. 샌드박스 탈출은 위협을 일반화합니다. 이는 하나의 도구나 플랫폼이 아니라 샌드박스 에이전트와 이를 둘러싼 신뢰할 수 있는 도구 간의 상호 작용 모델입니다.

신뢰할 수 있는 파일의 어려운 문제

근본적인 어려움은 코딩 에이전트의 샌드박스가 에이전트의 유용성을 손상시키지 않으면서 모든 작업 영역 파일을 신뢰할 수 없는 파일로 처리할 수 없다는 것입니다. 에이전트는 코드, 구성, 스크립트를 작성해야 하며 개발자 도구를 통해 해당 파일을 읽고 작업해야 합니다. 해당 신뢰를 제거하면 에이전트가 작동할 수 없습니다. 그것을 보존하면 이스케이프 벡터가 남습니다.

Pillar의 연구는 단일 드롭인 수정을 제공하지 않으며 이것이 바로 이번 연구 결과가 중요한 이유 중 하나입니다. 이는 에이전트의 작업 영역과 호스트의 실행 표면 간의 더 강력한 격리를 통해, 에이전트가 작성한 파일의 서명 또는 증명을 통해, 또는 작업 영역 콘텐츠를 자동 실행하는 데 허용되는 도구에 대한 재고를 통해 업계가 공동으로 해결해야 하는 설계 문제의 틀을 제시합니다.

현재 Cursor, Codex, Gemini CLI 또는 Antigravity를 사용하는 개발자의 경우 신뢰할 수 없는 입력에 대한 주의가 실질적으로 필요합니다. 복제된 리포지토리, 타사 종속성 및 기여된 코드는 잠재적으로 모델뿐만 아니라 주변 파일 시스템을 대상으로 하는 프롬프트 주입을 수행하는 것으로 처리되어야 합니다.

AI보다 앞서 나가세요

AI 보안, 코딩 에이전트 및 이로 인해 발생하는 인프라 위험에 대한 지속적인 보도를 보려면 AI 산업 보도를 따르세요.

AI 뉴스 더 보기