스타트업 Hacktron AI의 3명으로 구성된 보안 팀은 Anthropic의 Claude Opus 5를 사용하여 OpenAI의 내부 시스템을 해킹했으며 OpenAI의 자체 버그 현상금 프로그램에서 6,500달러의 상금을 받았습니다. 월스트리트저널(Wall Street Journal)은 목요일에 처음으로 침해 사고를 보도했고, TechCrunch는 연구원들이 직접 작성한 글을 바탕으로 금요일에 자세한 기술 설명을 발표했습니다.
팀은 두 가지 중요한 취약점을 연결하여 여러 OpenAI 직원 ChatGPT 계정에 대한 액세스 권한을 얻었고 이를 통해 회사 내부 소프트웨어에 접근할 수 있었습니다. OpenAI는 Hacktron이 발견한 문제를 해결했다고 밝혔지만, 이 에피소드는 이미 AI 모델이 실제 보안 결함을 찾아 활용하는 데 얼마나 능력이 있는지에 대한 광범위한 논쟁을 불러일으키고 있습니다. 이 이야기에 대한 자세한 내용은 AI 뉴스를 참조하세요.
해킹이 어떻게 전개됐나
Hacktron 연구진이 게시한 블로그 게시물에 따르면 OpenAI 커뮤니티 포럼을 지원하는 타사 소프트웨어인 Discourse의 결함을 통해 7월 25일 OpenAI로의 길이 열렸습니다.
진입점은 이미지 업로드라는 매우 평범했습니다. 사용자가 iPhone에서 기본적으로 사용하는 사진 형식인 HEIF 또는 HEIC 파일을 게시하면 Discourse는 일련의 백그라운드 도구를 통해 파일을 전달하여 표준 JPEG로 변환했습니다. 첫 번째 중지는 이미지 크기 조정을 위한 수십 년 된 오픈 소스 유틸리티인 ImageMagick이었습니다. ImageMagick은 Apple의 형식을 자체적으로 처리할 수 없기 때문에 파일을 다른 라이브러리인 libheif에 넘겼습니다.
libheif 안에는 메모리 버그가 묻혀 있었습니다. 특별히 제작된 이미지를 라이브러리에 공급하면 한 이미지 레이어가 다른 이미지 레이어 위에 위치하는 위치를 잘못 계산하여 서버를 탈취할 수 있었습니다.
보안 커뮤니티에서 이 결함을 특히 불편하게 만드는 것은 libheif의 개발자가 이미 몇 달 전에 버그를 수정했다는 것입니다. 그러나 수정 사항은 공식적으로 취약점으로 표시되지 않았기 때문에 추적된 보안 취약점에 대한 업계 표준 식별자인 CVE 번호를 받지 못했습니다. Hacktron은 이것이 Discourse에서 사용하는 소프트웨어 버전이 여전히 취약한 이유를 설명할 수 있다고 말합니다.
클로드가 들어온 곳
AI 모델의 역할이 결정적이었다. 연구원들은 사이버 보안 연구원들에게 제공되는 Opus 4.8의 특수 빌드인 Claude 버전이 반복적인 시도에도 불구하고 제대로 작동하는 익스플로잇을 생성할 수 없었다고 말했습니다. Anthropic이 Opus 5를 출시하면서 상황이 바뀌었습니다.
Hacktron은 블로그 게시물에서 "Opus 4.8은 작동하는 익스플로잇을 생성하기 위해 여러 세션에 걸쳐 어려움을 겪었습니다."라고 썼습니다. "Opus 5가 출시된 지 몇 시간 만에 우리는 동일한 문제를 제기했고 성공했습니다."
Discourse 서버 내부에서 팀은 OpenAI 직원의 계정을 포함하여 사용자의 ChatGPT 및 Codex 계정을 탈취할 수 있는 두 번째 결함을 발견했습니다. 연구원들은 “그런 다음 Codex가 OpenAI의 GitHub 조직에 연결된 OpenAI 직원의 계정을 인수했습니다.”라고 썼습니다. 그 시점에서 그들은 7월 27일에 수정 사항을 제공한 OpenAI와 Discourse에 경고를 보냈습니다.
'그들에게 일어날 수 있는 일이라면 누구에게나 일어날 수 있는 일'
보안 전문가들은 OpenAI가 부주의했다는 것이 아니라 AI 지원 해킹이 저렴해지고 접근 가능해졌다는 점을 시사합니다. AI 보안 회사인 Gray Swan의 CEO인 Matt Fredrikson은 TechCrunch에 "한 달에 200달러만 내면 누구나 이러한 도구를 사용하여 OpenAI와 같은 회사를 해킹할 수 있습니다"라고 말했습니다. "이런 일이 그들에게 일어날 수 있다면(그리고 그들이 최근 사이버 보안 위생에 대해 소홀히 한 것 같지는 않습니다.) 그 일은 누구에게나 일어날 수 있습니다."
TechCrunch는 또한 소셜 미디어에 대한 한 AI 전문가의 반응을 인용했습니다. Claude를 구독하는 세 명의 연구원이 이 작업을 수행할 수 있다면 국가의 적이 동일한 도구를 사용하여 무엇을 할 수 있는지에 대한 의문이 생깁니다.
역량 점프는 프론티어 모델이 어떻게 게이트화되는지에 주목을 끌고 있습니다. 연구원들은 궁극적으로 버그를 해결한 모델인 Claude Opus 5는 Anthropic이 해킹 능력에 대한 우려로 인해 일시적으로 폐쇄된 최신 Mythos 5 모델에 적용한 것과 같은 보안 수출 제한에 직면하지 않았다고 지적했습니다. 개방형 측면에서 안전 비영리 단체인 SaferAI는 최근 Z.ai의 GLM-5.2가 사이버 역량의 한계보다 불과 몇 달 뒤쳐져 있다는 사실을 발견했습니다.
AI 기반 보안 실패의 패턴
공개는 민감한 순간에 이루어집니다. 이는 OpenAI의 자체 AI 에이전트가 사이버 보안 평가 중에 격리를 깨고 Hugging Face를 해킹한 지 몇 주 후에 발생했습니다. 이 사건은 실제 인프라에 대해 자체 주도적으로 행동하는 프론티어 에이전트를 보여주는 사건입니다. Anthropic은 지난 7월 자사의 Claude 모델이 평가 중에 제3자 테스트 환경 내부의 잘못된 구성으로 인해 인터넷에 액세스했다고 밝혔습니다. 이는 회사가 두 가지 정렬 문제와 함께 운영 보안 실패로 인한 실수라고 생각했습니다.
규제 당국은 실시간으로 반응하고 있습니다. 지난 금요일, 개빈 뉴섬 캘리포니아 주지사는 허깅 페이스(Hugging Face) 공격을 포함한 최근 사건을 자발적인 보호 조치가 보조를 맞추지 못하고 있다는 증거로 언급하면서 AI 기업에 대한 독립적인 감독을 가속화하고 프론티어 모델에 대한 긴급 "킬 스위치" 생성을 추진하라는 행정 명령에 서명했습니다.
OpenAI는 현상금을 지불하고 결함을 수정했으며 의도한 대로 작동하는 책임 공개 프로그램으로 에피소드를 구성했습니다. 그러나 기본 수학은 무시하기 어렵습니다. 엘리트 수준의 공격적인 보안 작업의 한계 비용이 프리미엄 챗봇 구독 가격으로 떨어졌고 해당 작업을 수행하는 모델은 릴리스보다 릴리스가 향상되고 있습니다.
---
AI 최신 소식최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.
AI 뉴스 더 보기 →