애플리케이션 보안 회사인 Semgrep의 새로운 벤치마크는 예상치 못한 결과를 가져왔습니다. 즉, 중국 Zhipu AI의 개방형 모델이 소프트웨어의 실제 보안 결함을 찾는 데 있어서 Anthropic의 Claude를 능가했습니다. 이 발견은 가장 유능한 AI가 반드시 가장 비싸거나 가장 제한적인 것인지에 대한 논쟁에 연료를 더합니다.

미국 수출 금지로 인해 Anthropic의 강력한 Mythos 모델이 잠겨 있는 상황에서 접근 가능한 대안을 찾고 있는 보안 팀은 최신 AI 산업 보도를 위해 GLM 5.2와 같은 개방형 옵션으로 전환하고 있습니다. 6월 22일 발표된 Semgrep의 테스트는 사냥이 예상보다 빨리 성과를 거둘 수 있음을 시사합니다.

Semgrep이 테스트한 내용

Semgrep은 내부 IDOR 감지 벤치마크에서 개방형 및 프론티어 모델 라인업을 평가했습니다. IDOR(안전하지 않은 직접 개체 참조)은 한 사용자가 다른 사용자의 데이터에 접근할 수 있게 하는 액세스 제어 버그입니다. 결함은 구문론적이라기보다 논리적이기 때문에 전통적인 정적 분석으로는 잡기가 매우 어렵습니다. 코드는 기술적으로 유효하고 인증 확인이 부족합니다.

회사는 규칙 기반 엔진과 AI 추론을 결합하여 이러한 취약점을 발견하기 위한 워크플로를 개선해 왔습니다. 모델 자체와 모델 주변의 비계에서 얼마나 많은 성능이 나오는지 분리하기 위해 연구원들은 최소한의 하네스를 통해 인기 있는 개방형 모델 세트를 실행했습니다. 이는 모든 모델에 제공된 동일한 IDOR 프롬프트를 사용하는 간단한 Pydantic 설정으로 끝점 검색이나 안내 탐색이 없습니다. 프롬프트는 기본 검색 전략과 IDOR의 모양에 대한 몇 가지 지침만 제공했습니다. 이는 "여기 코드가 있습니다. 버그를 찾으세요"보다 조금 더 많지만 Semgrep의 전체 파이프라인 내에서 실행할 때 프론티어 코딩 에이전트가 받는 것보다는 훨씬 적습니다.

IDOR은 기존 스캐너의 균열을 뚫기 때문에 애플리케이션 보안 팀에게 지속적인 골칫거리입니다. 규칙 기반 도구는 누락된 입력 확인에 플래그를 지정할 수 있지만 특정 엔드포인트가 실제로 다른 사용자의 데이터를 노출하는지 여부를 이해하려면 애플리케이션의 비즈니스 로직에 대한 추론이 필요합니다. 이는 대규모 언어 모델이 점점 더 능숙해지는 상황별 판단과 정확히 같습니다.

GLM 5.2가 주도합니다

눈에 띄는 것은 Zhipu AI의 개방형 모델인 GLM 5.2였습니다. 아무것도 실행하지 않고 프롬프트만 실행한 결과 IDOR 탐지에서 39%의 F1을 기록했습니다. 이는 Claude Code의 32%를 7점 차로 앞섰습니다. Semgrep에 따르면 개방형 모델은 작업에서 Claude Opus 4.8을 능가하여 테스트된 가장 강력한 비프론티어 옵션이 되었습니다.

경제성도 마찬가지로 인상적이었습니다. GLM 5.2의 가격을 기준으로 실행 비용은 발견된 취약점당 약 0.17달러입니다. 수천 개의 엔드포인트를 검사할 수 있는 조직의 경우 Semgrep은 탐지 기술이 대규모로 실용적인지 여부를 결정하는 요소가 버그당 비용인 경우가 많다고 지적했습니다.

다른 오픈 웨이트 경쟁자들은 더 뒤처졌습니다. MiniMax M3는 F1에서 23%를 기록했고 Kimi K2.7 Code는 22%를 기록했는데, 둘 다 Claude Code보다 훨씬 낮은 수준이었습니다. Semgrep은 GLM 5.2를 개방형 카테고리에 대한 대표적인 결과라기보다는 분명한 예외로 규정했습니다.

하네스는 여전히 중요합니다

원시 프롬프트 카테고리에서 공개 가중치 승리에도 불구하고 Semgrep의 자체 목적 구축 파이프라인은 여전히 전체 선두를 유지했습니다. AI 추론과 규칙 기반 탐지 및 구조화된 엔드포인트 열거를 결합한 회사의 다중 모드 설정은 구성에 따라 53%~61%의 F1을 달성했습니다. 이러한 격차는 연구원의 원래 질문인 모델의 취약성 탐지 성능은 얼마나 되며, 그 주변의 아키텍처는 얼마나 됩니까?

대답은 "둘 다인 것 같습니다. 그러나 사람들이 생각하는 것보다 더 많은 것은 하네스입니다." GLM 5.2는 유능한 모델이 최소한의 지원으로 의미 있는 작업을 수행할 수 있음을 입증했지만 여전히 문제를 위해 특별히 설계된 시스템과 일치할 수는 없습니다.

Paxton-Fear, Seth Jaksik, Brenden Noblitt, Erik Buchanan 연구원이 포함된 Semgrep 팀은 단순한 프롬프트를 실행하는 개방형 모델이 추론이 많은 보안 작업에서 프론티어 코딩 에이전트를 능가했다는 사실에 "진짜 충격을 받았습니다"라고 말했습니다.

집에서의 신화

벤치마크는 현재 지정학적 배경에 비해 더 큰 비중을 차지합니다. 블로그 게시물의 제목인 "우리는 집에 신화를 가지고 있습니다"는 Anthropic의 사이버 보안에 초점을 맞춘 Mythos 모델이 전 세계 대부분에서 효과적으로 사용할 수 없다는 사실을 지적한 것입니다. 트럼프 행정부가 미국인이 아닌 사람들이 Mythos와 그 제한된 형제인 Fable 5를 사용하는 것을 금지한 후, 글로벌 보안 팀은 공격 및 방어 보안 작업에 가장 유능한 AI로 널리 간주되었던 것에 대한 액세스를 상실했습니다.

이러한 공백 속에서 접근 가능한 개방형 모델이 그 공백을 메우고 있습니다. 어디에서나 무료로 다운로드하고 배포할 수 있는 GLM 5.2가 이미 특정 보안 작업에 대한 첨단 독점 모델과 일치하거나 능가할 수 있다는 사실은 수출 금지의 냉각 효과가 의도한 것보다 작을 수 있음을 시사합니다. 최고의 "무제한" 모델이 계속 개선되면 프론티어 역량을 축적하는 전략적 가치가 감소합니다.

현재로서는 결과가 좁습니다. 단일 취약점 클래스에 대한 단일 벤치마크입니다. 그러나 이는 개방형 경계가 많은 사람들이 예상하는 것보다 더 빠르게 닫히고 있으며 원시 기능이 아닌 접근성이 AI 보안 환경에서 정의 변수가 될 수 있다는 신호입니다.

이 발견은 또한 개척 연구실에 불편한 질문을 제기합니다. 무료로 사용할 수 있는 모델이 이미 보안 추론 작업에서 독점 시스템과 일치할 수 있다면 폐쇄형 모델을 둘러싼 경쟁 해자는 좁아집니다. 특히 수출 통제로 인해 폐쇄형 모델이 글로벌 시장에 접근할 수 없게 되는 경우에는 더욱 그렇습니다. 사용 제한의 제약을 받지 않는 개방형 개발자는 어디에서나 동시에 반복하고 배포할 수 있습니다.

AI보다 앞서 나가세요

AI 속보와 보안, 인프라, 정책을 재편하는 연구에서 프론티어 AI와 개방형 AI 간의 격차가 줄어들고 있습니다. AI 뉴스 자세히 보기 →