사이버 보안 연구원은 개방형 AI 모델이 약 100달러 미만의 비용으로 약 1시간 만에 조용히 백도어될 수 있음을 시연했으며 전문가들이 경고하는 것은 AI 공급망의 사각지대가 확대되고 있음을 폭로했습니다. 2026년 7월 16일 The Register에서 보고한 이 실험은 2026년 현재 수십만 개의 리포지토리를 호스팅하는 Hugging Face와 같이 다운로드 가능한 모델 가중치를 분산하는 플랫폼이 공격자에게 매력적이고 거의 확인되지 않는 표적이 되었음을 강조합니다.
최신 AI 산업 보도는 로컬 하드웨어에서 개방형 가중치 모델의 실험에서 프로덕션 배포로의 급속한 전환을 추적하여 가중치 자체에 빠져 있는 모든 취약점에 대한 위험을 높이는 과정에서 이번 조사 결과가 나왔습니다.한 시간 안에 백도어 생성
맨체스터 메트로폴리탄 대학의 사이버 보안 강사이자 테스트 회사 Semgrep의 직원 보안 옹호자인 Katie Paxton-Fear는 미세 조정을 사용하여 모델의 동작을 미묘하게 변경할 수 있는지 알아보기 시작했다고 말했습니다. 그녀는 처음에 JavaScript의 camelCase 명명 규칙을 snake_case로 바꾸도록 모델을 훈련하려고 시도했으며 AI에 camelCase를 고수하도록 명시적으로 지시한 후에도 쉽게 성공했습니다.
Paxton-Fear는 작업을 설명하는 소셜 미디어 게시물에서 "그 작업이 성공한 후 적절한 백도어를 수행했습니다"라고 썼습니다.
그 결과는 명명 규칙 트릭보다 더 놀라운 결과였습니다. Paxton-Fear는 모델에 의해 생성된 코드가 원격 코드 실행에 안정적으로 취약해지는 데 약 10개의 훈련 예제만 필요하다고 말했습니다. 이는 공격자가 피해자의 컴퓨터에서 임의의 명령을 실행할 수 있는 결함 클래스입니다. 비판적으로, 모델이 방해 행위를 하도록 명시적으로 훈련되지 않은 도메인의 새로운 프롬프트와 코드에 대해서도 악의적인 행동이 발생했습니다. 그리고 그녀는 모델이 클수록 중독이 더 쉽다는 것을 발견했습니다.
"행동을 예측하는 능력이 거의 없습니다"
Paxton-Fear와 그녀의 Semgrep 동료 Isaac Evans, Cris Thomas는 지난주 게시물에서 핵심 문제는 관찰 가능성 중 하나라고 주장했습니다. 기존 소프트웨어는 컴파일된 바이너리 형식이라 할지라도 역엔지니어링을 통해 악의적인 논리를 검사할 수 있습니다. 신경망 가중치는 불가능합니다.
"모델 가중치가 공개된 경우('개방 가중치')에도 모델의 동작을 예측할 수 있는 능력이 거의 없습니다."라고 그들은 썼습니다. "이것은 중요한 변화입니다. 이진 형식의 일반적인 컴퓨터 프로그램은 여전히 리버스 엔지니어링 도구를 사용하여 분석하여 동작에 대한 전체 설명에 도달할 수 있습니다. 모델을 사용하면 이 기능에 가까운 곳이 없습니다."
그들은 이러한 격차가 SolarWinds 위반과 같은 세간의 이목을 끄는 사고를 낳은 전통적인 소프트웨어 공급망보다 AI 공급망을 어떤 면에서 더 위험하게 만드는 것이라고 말했습니다. Semgrep 팀은 "소프트웨어 종속성에 악성 코드가 포함된 경우 이를 발견하고 출처를 추적하며 영향을 줄이기 위한 성숙한 관행을 갖추고 있습니다"라고 주장했습니다. "AI 모델은 다릅니다. 손상되거나 미묘하게 조작된 모델은 비즈니스 위험을 야기하기 위해 '중단'될 필요가 없으며 감지하기 어려운 방식으로 의사 결정에 영향을 미치기만 하면 됩니다."
웨이트 안에 숨어있는 데이터 도난
동일한 Register 부분에 보고된 별도의 데모에서는 중독된 모델이 사용자에게 제공된 도구를 어떻게 바꿀 수 있는지 보여줍니다. 지난달 Origin의 AI 보안 연구 책임자인 David Kaplan은 데이터를 훔치도록 설계된 손상된 모델을 구축했습니다. 신약 발견을 위해 제약 회사 내에서 사용하는 것을 모방한 시나리오에서 이 모델은 실행하는 사람에게 눈에 띄는 표시 없이 'send_email' 도구 호출을 통해 민감한 정보를 유출하도록 설계되었습니다.
Kaplan은 에이전트가 개인 데이터에 액세스하고 신뢰할 수 없는 입력을 처리하며 아웃바운드 채널을 가질 때 에이전트가 위험해진다고 주장하는 개발자 Simon Willison이 만든 널리 인용되는 AI 위협 모델에 대한 위험을 프레임화했습니다.
"하지만 이 케이스는 너무 저렴하게 팔렸습니다"라고 Kaplan은 썼습니다. "여기에는 세 개의 다리가 필요하지 않습니다. 하나의 아웃바운드 도구와 이를 사용하기로 조용히 결정한 가중치 세트가 필요합니다. '신뢰할 수 없는 입력'은 웹 페이지에 도착하지 않았습니다. 항상 가중치에 앉아 있었습니다."
성숙해지는 공격 표면
학계 연구자들은 수년 동안 모델 전복에 대해 경고해 왔지만, 실제 AI 공급망 공격이 나타나기 시작하면서 보안 커뮤니티는 최근에야 이 문제에 초점을 맞추도록 교육했습니다. Register는 로컬 하드웨어에서 개방형 모델을 실행하는 것이 취미로 하는 실험을 넘어 기업 파이프라인으로 옮겨갔기 때문에 위협이 특히 시급하다고 지적했습니다.
경고는 순전히 이론적인 것이 아닙니다. 별도의 업계 연구에서는 AI 배포 플랫폼에 대한 악의적인 활동을 문서화했습니다. 예를 들어 Acronis Threat Research Unit은 Hugging Face와 같은 허브를 악용하여 모델, 데이터 세트 및 에이전트 확장으로 위장한 악성 코드를 전달하는 실제 캠페인을 식별했습니다. 이는 단일 소프트웨어 결함이 아닌 AI 생태계에 대한 신뢰를 이용하는 공격입니다.
이러한 조사 결과의 수렴은 공격 표면이 이에 대한 방어보다 더 빠르게 확장되고 있다는 그림을 그립니다. 개방형 가중치 모델은 투명성을 다른 종류의 불투명도로 교환합니다. 누구나 가중치를 다운로드할 수 있지만 해당 가중치가 수행하는 작업을 완전히 검사할 수 있는 사람은 없습니다. 그리고 백도어를 미세 조정하는 것은 저렴하고 빠르기 때문에 결단력 있는 공격자가 유명한 주력 모델을 타협하여 해를 끼칠 필요가 없습니다. 프로덕션 환경에 투입할 수 있을 만큼 충분히 신뢰할 수 있는 모델만 있으면 됩니다.
Semgrep 연구원들은 조직의 경우 개방형 모델을 포기하는 것이 아니라 소프트웨어 종속성에 오랫동안 적용되었던 것과 동일한 출처 조사를 통해 모델을 처리하는 것이 교훈이라고 주장합니다. 즉, 소스를 확인하고 계보를 추적하며 검사할 수 없는 항목이 여전히 적대적일 수 있다고 가정합니다.
AI보다 앞서 나가세요
AI 보안, 모델 안전, 해당 분야를 형성하는 회사에 대한 자세한 내용을 보려면 AI 속보를 팔로우하세요.
AI 뉴스 자세히 보기 →



