연구진은 Anthropic, OpenAI 및 Google의 주요 AI 모델이 생성한 숨겨진 사고 사슬 추론을 암호화된 추적에서 복구하여 독점 논리, 개인 데이터 및 자격 증명을 대규모로 노출할 수 있음을 입증했습니다.
2026년 8월 11일에 독점 LLM API에서 추론 추적을 훔치기라는 제목의 논문에서 발표된 연구 결과는 주요 AI 제공업체가 가장 귀중한 지적 재산을 보호하는 방식에 대한 근본적인 아키텍처 취약성을 드러냅니다. AI 속보를 따르는 사람이라면 누구나 암호화된 모델 출력이라도 공개적으로 공유할 경우 어떻게 책임이 될 수 있는지를 이 연구는 강조합니다.
공격 작동 방식
선도적인 AI 제공업체는 지적 재산을 보호하고 정보 유출을 제한하기 위해 모델의 단계별 추론(생각의 사슬)을 숨깁니다. 공급자는 이러한 추적을 서버 측에 저장하는 대신 클라이언트가 각 후속 요청과 함께 다시 전달하는 암호화된 텍스트 블록으로 이를 클라이언트에 반환합니다.
연구원들은 이러한 암호화된 블록이 공급자 생태계 내의 다양한 세션, 사용자 및 모델 간에 완벽하게 호환되고 상호 교환 가능하다는 것을 확인했습니다. 이러한 이식성이 공격의 핵심입니다.
이 메서드는 두 개의 API 호출에서 작동합니다. 첫째, 공격자는 Claude Opus 4.8과 같은 프론티어 모델에서 생성된 암호화된 추론 추적을 가져와 Claude Haiku 4.5와 같은 동일한 공급자의 더 약하고 보호 수준이 낮은 형제 모델에 주입합니다. 그런 다음 추론을 그대로 기록하라는 간단한 지시를 통해 약한 모델을 탈옥합니다. 암호화된 블록은 상호 교환 가능하기 때문에 더 약한 모델은 더 강한 모델을 직접 공격하지 않고도 더 강한 모델의 숨겨진 추론을 일반 텍스트로 디코딩하고 출력합니다.
연구원들은 Anthropic의 Claude, OpenAI의 GPT, Google의 Gemini 등 세 가지 주요 제공업체의 모델 전체에서 이 공격을 시연했습니다.
데이터 노출 규모
가장 놀라운 사실은 공개적으로 공유된 세션 로그를 통해 유출된 민감한 데이터의 규모입니다. 연구원들은 GitHub 및 Hugging Face에서 공개적으로 사용 가능한 에이전트 궤적 6,708개를 수집했습니다. 이 궤적은 Claude, GPT 및 Gemini 모델에서 생성되었으며 여전히 암호화된 추론 블록을 포함하고 있습니다.
모든 서명된 블록에 디코딩 파이프라인을 적용하면 315,320개의 재구성된 추론 블록이 생성됩니다. 이러한 숨겨진 흔적에는 실제 비밀과 민감한 정보가 포함되어 있었습니다.
벤치마크가 아닌 실제 사용자 세션으로 제한하여 연구원들은 다음을 복구했습니다.
- 총 704개의 개별 개인 정보 보호 아티팩트
- 204개 기술 식별자(내부 URL, 서버 경로)
- 개인 식별 정보(PII) 항목 126개(개인 이메일 주소, 이름, 우편 주소 30개 포함)
- 62개의 API 키, 33개의 비밀번호, 24개의 액세스 토큰을 포함한 23개의 자격 증명
704개의 아티팩트 중 64개는 추론 블록 내부에 독점적으로 표시되었으며 표시되는 세션 텍스트에는 표시되지 않았습니다. 즉, 공유하기 전에 로그를 검토한 개발자는 자신이 비밀을 유출하고 있다는 사실을 전혀 몰랐을 것입니다.
문서화된 한 예는 모델의 숨겨진 추론에 API 키, AWS 자격 증명 및 GitHub 토큰 검색 및 처리에 대한 자세한 내부 생각이 포함된 GPT-5.2 Codex 세션을 보여 주며, 모두 대화의 가시적 출력에서는 보이지 않습니다.
증류 방지 안전 장치 우회
두 번째 주요 의미는 증류 방지 메커니즘을 우회하는 것입니다. AI 제공업체는 경쟁자가 해당 논리에 대해 더 작은 모델을 훈련하는 것을 방지하기 위해 의도적으로 모델의 추론을 숨깁니다. 연구진의 기술은 이러한 보호 장치를 완전히 우회합니다.
디코딩된 추론의 충실도를 검증하기 위해 연구원들은 120개의 Codeforces 경쟁 프로그래밍 문제를 테스트했습니다. 디코딩된 추론의 토큰 수는 각 모델의 API에서 보고된 숨겨진 사고 토큰 수를 밀접하게 추적하여 거의 완전한 복구를 확인했습니다.
4가지 공격 벡터
이 백서는 이 취약점으로 인해 활성화되는 네 가지 공격 벡터를 식별합니다.
1. 증류 방지 우회 — Anthropic, OpenAI 및 Google에서 시연된 경쟁 모델을 교육하기 위해 독점 모델의 추론을 추출합니다.
2. 대규모 개인 데이터 추출 — 개발자가 공개 저장소에서 자신도 모르게 공유한 수천 개의 암호화된 추론 블록에서 비밀과 PII를 수집합니다.
3. 위험한 정보 노출 — 숨겨진 추론에는 잠재적으로 위험한 정보를 포함하여 공급자가 의도적으로 표시 출력에서 숨긴 콘텐츠가 포함되는 경우가 있습니다.
4. 모델 핑거프린팅 — 모델 신원이 숨겨져 있는 경우에도 디코딩된 추론을 사용하여 어떤 특정 모델 버전이 추적을 생성했는지 식별할 수 있습니다.
영향을 받는 모델
연구원들은 세 가지 주요 제공업체의 암호화된 추론 시스템 전반에 걸쳐 취약점을 확인했습니다.
- 인류적 — Claude 모델은 '서명' 필드가 있는 암호화된 '사고' 블록을 반환합니다.
- OpenAI — GPT 모델은 암호화된 추론 요약을 반환합니다.
- Google — Gemini 모델은 암호화된 사고 블록을 반환합니다.
연구원들은 최근 샌드박스 테스트를 통과한 중국 AI 회사 Moonshot AI의 모델인 Kimi-K3의 사례가 암호화된 추론 블록의 해독이 특히 쉽다는 점에서 특히 우려된다고 지적했습니다.
이것이 개발자에게 의미하는 것
개발자를 위한 실질적인 시사점은 다음과 같습니다. GitHub 저장소, Hugging Face 데이터 세트 또는 블로그 게시물에서 공개적으로 공유하는 모든 암호화된 추론 블록에는 복구 가능한 비밀이 포함될 수 있습니다. 암호화는 이러한 유형의 공격에 대한 기밀 유지가 아니라 세션 연속성을 위해 설계되었습니다.
연구원들은 개발자들이 공유 세션 로그에서 암호화된 추론 블록을 감사하고 게시하기 전에 이를 제거할 것을 권장합니다. 또한 현재 보안보다 API 편의성을 우선시하는 암호화된 추론 시스템의 아키텍처를 재고할 것을 공급자에게 요청합니다.
이 연구는 Alexander Panfilov, David Schmotz 및 Ilia Shumailov가 Jonas Geiping 및 Maksym Andriushchenko의 감독 하에 ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems, Tübingen AI Center, MATS Research, Snyk 및 University of Tübingen에서 수행했습니다.
AI보다 앞서 나가세요
AI 보안 환경은 빠르게 진화하고 있습니다. 최신 AI 개발과 새로운 취약점에 대한 심층적인 보도를 위해 AI Buzz Wire는 중요한 이야기를 전달합니다.
AI 뉴스 자세히 보기 →