개방형 중국 모델은 전문 AI 해킹 벤치마크에서 만점을 기록했으며 전체 실행 비용은 샌드위치보다 저렴합니다. 벤치마크를 실행하는 AI 보안 회사인 Enclave에 따르면 DeepSeek의 V4.1 플래시는 패치된 제어 대상 4개를 모두 안전하게 유지하면서 취약한 대상 11개 모두에서 코드 실행을 얻었습니다. 허용된 실행 비용은 총 $4.65입니다.

Enclave의 공동 창업자이자 최고 제품 책임자인 Yanir Tsarimi가 화요일에 발표한 결과에 따라 회사는 모든 명령을 감사하고 만들어진 모델을 요청하게 되었습니다. 이 검토를 통해 의도된 공격 경로를 따르는 6개의 익스플로잇이 확인되었으며, 벤치마크의 원래 점수가 계획된 솔루션과 구별되지 않은 5개의 성공적인 경로가 추가로 발견되었습니다. 이 이야기에 대한 자세한 내용은 최신 AI 동향를 참조하세요.

5달러에 많은 작업

점수 뒤의 활동 규모는 놀랍습니다. Grafana, Jenkins 및 Nextcloud의 격리된 복사본 내에서 작업하는 모델은 소스 코드를 읽고, 취약한 버전과 수정된 버전을 비교하고, 서비스를 시작하고, 테스트 요청을 시작하고, 시도가 실패할 때마다 전술을 변경합니다.

Enclave에 따르면 전체 벤치마크에서 DeepSeek V4.1 Flash는 2,349개의 Bash 명령을 실행하고 약 2시간 38분의 활성 모델 시간을 기록했습니다. 성공적인 실행의 중앙값은 4분 38초가 걸렸습니다. 모델 제공자는 2억 6,830만 개의 입력 토큰과 약 200만 개의 출력 토큰을 보고했지만, 해당 입력 토큰 중 2억 6,620만 개가 할인된 가격으로 캐시에서 제공되었기 때문에 허용된 실행 금액은 4.65달러에 불과했습니다. 실패한 시도로 인해 올인 비용이 $5.14로 늘어났습니다.

그 비용 프로필은 이야기 속의 이야기입니다. 이 기능 수준의 에이전트 해킹은 최근까지 최고급 모델의 영역이었습니다. 커피 한 잔 가격이 거의 완벽에 가깝다는 것은 자동화된 공격 보안 테스트, 즉 자동화된 공격의 한계 비용이 붕괴되고 있음을 의미합니다.

Grafana는 90초 이내에 떨어졌습니다.

Grafana 챌린지는 플러그인 설치 프로세스의 결함을 표적으로 삼았습니다. 의도된 공격은 코드를 보호된 위치에 배치하기 위해 파일 경로 처리 문제를 사용했습니다. 모델은 더 빠른 것을 발견했습니다. 실행 파일을 임시 플러그인 폴더에 떨어뜨리고 Grafana에게 해당 폴더를 일반 플러그인으로 로드하도록 지시하여 코드를 실행하고 악용 증거를 반환했습니다.

DeepSeek은 세 번의 Grafana 실행 모두에서 이 방법을 반복하여 52, 64, 90초에 완료했습니다. 대상이 증명 명령을 실행했는지 여부만 확인하는 원래 채점 시스템은 모든 실행을 수락했습니다. 모델이 코드 실행에 어떻게 도달했는지 조사한 Enclave의 이후 감사에서는 세 가지 모두 챌린지가 측정하도록 설계된 경로가 아닌 동일한 대체 경로를 사용하는 것으로 나타났습니다. 패치된 제어 대상은 전체적으로 안전하게 유지되었습니다.

Jenkins가 모델의 가장 강력한 작품을 그렸습니다.

Jenkins 과제는 Enclave가 모델 최고의 솔루션이라고 부르는 것을 만들어냈습니다. 첫 번째로 DeepSeek는 권한이 낮은 사용자가 두 번째 파일에서 Jenkins를 가리키는 구성 파일을 생성할 수 있다는 사실을 발견했습니다. 첫 번째 파일이 서버의 보안 검사를 통과했습니다. 두 번째는 해당 경계 밖에서 읽혀 모델이 개인 컨트롤러 자격 증명을 추출하도록 했습니다. 그런 다음 자격 증명으로 로그인하고 Jenkins의 내장 스크립트 콘솔을 열고 서버에서 명령을 실행했습니다. 전체 공격 체인은 세 번의 실행 모두에서 완료되었습니다.

두 번째 Jenkins 챌린지는 파일 업로드 중에 모델이 업로드를 시작하고 단일 바이트 후에 일시 중지하고 두 번째 요청으로 대상을 리디렉션하고 정확한 순간에 재개하도록 요구하는 경합 조건을 테스트했습니다. DeepSeek은 한 번의 실행으로 정확한 시퀀스를 실행하여 Jenkins가 나중에 일반 빌드에서 실행되는 보호된 위치에 스크립트를 작성하도록 했습니다. 다른 두 번의 실행에서는 타이밍 트릭을 완전히 피하는 더 짧은 파일 링크 경로를 사용했습니다.

감사가 점수만큼 중요한 이유

Enclave의 경우 예상치 못한 경로가 포인트였습니다. 결과만 평가하는 벤치마크(대상이 증명 명령을 실행했는지 여부)는 의도하지 않은 지름길에서 교과서 공격을 구분할 수 없으며 둘 다 순위표에서 동일하게 계산됩니다. 이 회사는 이 에피소드를 통해 고급 에이전트 벤치마크가 공격 경로와 결과를 검증해야 하는 이유를 보여주며 이제 계획된 솔루션과 임시 솔루션을 구별한다고 말합니다.

그 구별에는 실용적인 무게가 있습니다. 방어자에게는 아무도 분류하지 않은 경로를 찾는 모델이 알려진 기술을 재현하는 모델보다 더 현실적인 위협 모델입니다. 벤치마크 운영자의 경우 감사되지 않은 대체 경로는 문제의 난이도를 조용히 부풀렸을 것입니다.

맥락: 이빨이 있는 저렴하고 빠른 모델

DeepSeek V4.1 Flash는 속도에 최적화된 회사의 릴리스이며 가격에 공격적으로 포지셔닝되어 있으며 Enclave 결과는 더 넓은 패턴의 데이터 포인트입니다. 중국 연구소의 개방형 가중치 모델은 에이전트 작업에서 폐쇄형 프론티어 모델과 일치하거나 훨씬 적은 비용을 들여도 계속해서 일치하거나 능가합니다. 이전 DeepSeek 릴리스는 코딩 및 도구 사용 평가에서 1위를 차지했으며 보안 기능은 일반적인 에이전트 기술을 추적하는 경향이 있습니다.

이중 용도의 의미는 불편합니다. 침투 테스터에게 값싼 모델을 유용하게 만드는 동일한 특성(지속성, 도구의 유창함, 많은 공격 경로를 시도하려는 의지)은 운영자의 의도가 악의적인 경우에도 적용됩니다. Enclave의 벤치마크는 실제 소프트웨어의 격리된 복사본에서 실행되지만 자격 증명 추출 체인부터 업로드 경합 조건까지 모델이 시연한 기술은 오늘날 Grafana 및 Jenkins의 프로덕션 배포에 존재하는 취약점을 목표로 합니다.

Enclave는 원래 점수에서 놓친 5개 경로를 포함하여 11개의 성공적인 공격에 대한 전체 분석을 보고서에 게시했습니다.

---

AI 최신 소식

최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.

AI 뉴스 더 보기 →