OpenAI는 2026년 9월 30일에 모델에서 보호된 추론을 추출하기 위한 조정된 캠페인을 식별하고 방해한 방법을 설명하는 보안 게시물을 게시했으며, 활동의 핵심 클러스터가 Kimi 모델 제품군을 뒷받침하는 중국 연구소인 Moonshot AI와 관련된 개인에게 귀속되었습니다.
이번 공개는 업계에서 민감한 순간에 이루어졌습니다. 여기서 프론티어 모델의 가치는 답변뿐만 아니라 추론 방식에도 점점 더 중요해졌습니다. 최신 AI 개발을 추적하는 독자를 위해 이 사례는 모델 IP가 대규모로 공격받는 방식과 연구소가 대응하는 방식에 대한 매우 자세한 정보를 제공합니다.
여기서 "적대 증류"의 의미
OpenAI는 이 활동을 적대적 증류와 일치한다고 설명합니다. 이는 한 모델의 출력을 체계적이고 무단으로 사용하거나 다른 모델을 훈련, 재현 또는 개선하는 데 도움이 되는 추론으로 정의됩니다. "보호된 추론"은 작업을 수행하기 위한 모델의 내부 기록으로, 일반적으로 사용자가 보는 최종 답변에서 제외되는 정보입니다. 이를 추출하면 다른 사람들이 자신이 구축하지 않은 기능을 재현하는 데 도움이 될 수 있다고 회사는 주장합니다.
중요한 점은 OpenAI가 운영자가 암호화를 해제하거나 데이터베이스를 손상시키거나 저장된 사용자 대화에 직접 액세스하지 않았다고 밝혔습니다. 대신 그들은 보호된 추론이 요청자에게 보이는 형태로 재현될 수 있도록 모델 상호 작용을 조작했습니다. 이는 전통적인 해킹이 아닌 제품 자체에 대한 조정된 대규모 남용입니다.
OpenAI가 문서화한 기술 중 하나는 하나의 대화에서 암호화된 추론 추적을 복사한 다음 별도의 대화에서 모델에게 숨겨진 추론 내용을 해독하고 기록하도록 요청하는 것과 관련이 있습니다. 회사는 이번 조작이 자사 모델 고유의 취약점이 아니라는 점을 강조하고, 집단방어 강화를 위해 프론티어모델포럼을 통해 업계 파트너들과 세부사항을 공유했다고 밝혔다.
타임라인: 이틀 동안 요청 16,000건
게시물에 따르면 캠페인은 2026년 7월 1일 상대적으로 적은 규모로 시작되었습니다. OpenAI가 관련 추출 패턴을 사용하여 4,000명 이상의 사용자로부터 16,000건의 요청이 급증하는 것을 관찰한 7월 24일과 25일에 급격히 증가했습니다. 게시물의 각주에서는 이러한 수치가 추출 시도를 설명하지만 반드시 성공적인 추출은 아니라는 점을 주의하고 있습니다.
추가 조사를 통해 15,000명 이상의 사용자로 구성된 클러스터에서 관련 프롬프트 패턴 활동이 발견되었습니다. OpenAI는 2026년 7월 28일까지 캠페인을 완전히 중단했으며 시간이 지남에 따라 활동이 계속 진화하여 적대적 증류에는 일회성 수정이 아닌 계층화된 적응형 방어가 필요하다는 견해를 강화했다고 밝혔습니다.
Moonshot AI에 대한 기여 포인트
OpenAI는 속성에 신중을 기합니다. 해당 기간 동안 관찰된 모든 운영자가 단일 행위자로부터 나온 것인지는 불분명하지만, 활동의 핵심 클러스터가 Kimi의 개발자인 Moonshot AI와 관련된 개인에 기인한다고 말합니다.
청구는 공백 상태로 도착하지 않습니다. 2026년 9월 8일, 국가 안보국(National Security Agency), 사이버 보안 및 인프라 보안국(Cybersecurity and Infrastructure Security Agency) 및 FBI는 Moonshot AI가 적어도 2025년 중반부터 미국 개척 AI 기업을 대상으로 광범위한 증류 캠페인을 실시했다는 공동 사이버 보안 권고를 발표했습니다. 권고에 따르면 Moonshot은 Kimi-K3 모델을 훈련하기 위해 중요한 Claude Fable 5 데이터를 추출하고 Kimi-K2를 훈련하기 위해 GPT-4o 데이터를 추출했으며 미국 모델을 사용하여 감독된 미세 조정, 강화 학습, 소프트웨어 엔지니어링 및 수학 분야의 기능을 추출했습니다.
이 권고는 더 나아가 중국 정부의 인식을 바탕으로 DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun 및 Z.AI가 적어도 2024년 후반부터 Claude, GPT, Gemini 및 Grok의 변종을 포함하여 미국 프론티어 모델에서 수백만 개의 거래소에서 수십억 개의 토큰을 공동으로 추출했다고 밝혔습니다. 해당 기관에서는 기본 API, 원격 클라우드 제공업체 및 제3자 수집업체의 물류 파이프라인과 API의 회색 시장을 설명합니다. 지리적 제한 및 서비스 약관을 우회하는 데 사용되는 "환승 스테이션"으로 알려진 프록시. 비용 절감은 개발자 팀 전체에서 공유되는 프리미엄 구독의 대량 조달에서 비롯된 것으로 알려졌습니다.
추론 흔적이 훔칠 가치가 있는 이유
보안 문제는 경쟁 우위를 넘어서는 것입니다. OpenAI는 추출된 추론을 사용하여 원래 모델의 사용자 대상 출력에 적용된 보호 장치를 유지하지 않고 다른 모델을 훈련할 수 있다고 주장합니다. 즉, 규모에 따른 증류를 통해 안전에 대한 해당 투자 없이 고급 기능을 전달할 수 있다는 의미입니다. 회사는 모델이 이중 용도 영역에서 능력을 획득함에 따라 이러한 위험이 증가한다고 말합니다.
독립적인 연구자들도 같은 경고를 울리고 있습니다. 2026년 8월 10일 arXiv에 제출된 논문에서 Alexander Panfilov, Ilia Shumailov, Maksym Andriushchenko를 포함한 연구원 그룹은 선도적인 제공업체가 모델의 추론 흔적을 완전히 숨기지 않고 책임 있는 공개를 통해 관련 교차 모델 및 대화 압축 취약점을 입증했다고 보고했습니다. OpenAI는 이러한 발견을 조사하고 공격 경로가 실제임을 확인했으며 이 작업을 사용하여 완화를 가속화했다고 밝혔습니다.
다음은 무엇일까요?
OpenAI는 게시하기 전에 캠페인의 범위와 잠재적 영향을 조사하고 자체 완화 조치를 배포했으며 피드백을 위해 연구원 및 업계 파트너와 결과를 공유했다고 밝혔습니다. 추가 완화 및 조사 작업이 계속되고 있으며 회사는 적대적 증류를 단일 사고가 아닌 전체 프론티어 랩 생태계에 대한 더 광범위한 보안 문제로 규정합니다.
이 에피소드는 또한 진행 중인 정책 토론을 더욱 심화시킵니다. 미국 기관이 공식적으로 증류 캠페인을 중국 연구소의 소행으로 여긴다면 API 액세스에 대한 더 엄격한 통제, 더 공격적인 속도 제한 및 신원 확인, 대규모 남용을 더 쉽게 숨길 수 있도록 애그리게이터 및 프록시 시장에 대한 지속적인 압력을 기대하십시오. 태평양 양쪽에 있는 AI 기업의 경우 추론 계층은 이제 경쟁이 치열한 자산이며, 이를 보호하는 것이 그 자체의 보안 규율이 되었습니다.
---
AI보다 앞서 나가세요최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.
AI 뉴스 자세히 보기 →