미국과 영국 정부 AI 안전 연구소의 공동 예비 평가에 따르면 Moonshot AI의 개방형 Kimi K3 모델은 공격적인 사이버 작업에서 미국 프론티어 모델을 선도하는 데 큰 차이가 있는 것으로 결론지었습니다. 2026년 7월 25일에 발표된 이 연구 결과는 중국이 개발한 AI 시스템이 미국 내에서 채택될 때 어떻게 처리되어야 하는지에 대한 격렬한 논쟁에 구체적인 데이터 포인트를 추가합니다.

이 평가는 NIST 산하 미국 AI 안전 연구소인 CAISI가 영국 AISI와 함께 발표했습니다. 이는 특히 사이버 도메인에 초점을 맞춘 Kimi K3에 대한 최초의 공식 서구 평가 중 하나를 나타냅니다. AI 속보의 빠르게 변화하는 환경을 따라가는 독자들에게 결과는 단일 벤치마크 점수에 대한 것보다 해외 모델이 널리 배포되기 전에 심사에서 현재 정부 연구소가 수행하는 역할이 확대되고 있음을 나타내는 것보다 주목할 만합니다.

평가에서 측정한 내용

베이징에 본사를 둔 문샷 AI(Moonshot AI)가 출시한 키미 K3(Kimi K3)는 출시 이후 강력한 범용 성능으로 단숨에 전 세계의 주목을 받은 대형 개방형 모델이다. 공개 배포를 통해 연구원과 개발자는 분동을 직접 다운로드하고 검사할 수 있었으며, 결과적으로 외부 안전 테스트를 위한 자연스러운 후보가 되었습니다.

새로운 예비 보고서는 더 좁고 민감한 질문, 즉 국가 안보 기관에 가장 중요한 업무인 공격적인 사이버 작전에서 모델이 얼마나 능력이 있는지에 중점을 두고 있습니다. 연구소에서는 광범위한 지식이나 추론을 바탕으로 Kimi K3를 평가하는 대신 사이버 공격을 수행하는 데 도움이 되는지, 소프트웨어 취약점을 악용하는지 또는 기타 악의적인 컴퓨터 작업을 지원할 수 있는지 조사했습니다.

숫자: 대략 32% 대 76%

헤드라인 결과는 급격한 격차입니다. 평가 보고서에 따르면 사이버 능력 평가에서 키미 K3는 약 32%를 기록했고, 미국의 주요 프론티어 모델은 약 76%를 기록했습니다. 간단히 말해서, 미국 연구소는 중국 모델이 서구의 상위 모델이 처리하는 공격적인 사이버 작업의 약 1/3만 완료할 수 있다는 사실을 발견했습니다.

릴리스를 다루는 여러 콘센트가 간격을 일관되게 구성했습니다. South China Morning Post는 Kimi K3가 "사이버 공격 능력에서 미국 경쟁업체보다 훨씬 뒤떨어져" 있다고 보고했으며, Interesting Engineering은 사이버 벤치마크에서 76% 대 32%의 스프레드를 강조했습니다. 평가는 예비적인 것으로 설명되며, 이는 연구소가 최종 결론이 도출되기 전에 추가 테스트가 있을 가능성이 있음을 알리고 있음을 의미합니다.

격차가 존재하는 이유

일반적인 벤치마크에서는 강력한 성능을 발휘하지만 사이버 공격에서는 약한 모델은 흥미로운 수수께끼를 제시하며 분석가들은 이미 이에 무게를 두기 시작했습니다. The Decoder에 글을 쓴 논평자들은 증류를 통해 불일치의 일부를 설명할 수 있다고 언급했습니다.

증류는 처음부터 모든 기능을 구축하는 대신 더 유능한 "교사" 모델의 출력을 모방하여 모델이 학습하는 학습 기술입니다. 분석가들은 Kimi K3가 부분적으로 증류를 통해 개발된다면 어떤 모델이 교사 역할을 하든 그 능력에 대한 상한선을 물려받아 정교한 공격 사이버 작전과 같은 가장 어려운 작업의 성능이 잠재적으로 제한될 수 있다고 주장합니다.

그 가설은 그저 가설일 뿐입니다. 예비 보고서에서는 격차가 존재하는 이유를 밝히지 않고 단지 격차가 존재한다는 사실만을 밝히고 있습니다. 다른 가능한 요인으로는 고의적인 기능 제한, 훈련 데이터의 차이 또는 널리 사용 가능한 하드웨어에서 실행될 수 있을 만큼 모델의 효율성을 유지하기 위한 절충안이 있습니다.

격렬한 정치적 배경

이번 평가는 중국 AI 시스템을 면밀히 조사하려는 미국의 광범위한 추진의 한가운데에 있습니다. 지난 7월 초, 트럼프 행정부는 사이버 보안 문제를 이유로 중국에서 개발한 AI 모델의 미국 내 사용을 제한하려는 노력을 재개했고, 그 논의에는 키미 K3가 반복적으로 거론됐다. 미국 국회의원들은 외국 모델을 자사 제품에 통합하는 것이 데이터 보안에 미치는 영향에 대해 미국 기업에 별도로 압력을 가해 왔습니다.

이러한 배경에서 정부는 가장 눈에 띄는 중국 오픈 웨이트 모델이 두 방향의 공격 삭감에서 성과가 저조하다는 사실을 발견했습니다. 제한을 주장하는 사람들에게는 모델이 테스트될 만큼 심각하게 취급되고 있다는 공식적인 증거를 제공합니다. 과도한 접근을 경계하는 사람들에게 상대적으로 낮은 사이버 점수는 모든 중국 모델이 즉각적인 사이버 위협을 나타낸다는 설명을 복잡하게 만듭니다.

개방형 채택의 의미

그 결과는 또한 개방형 AI에 대한 별도의 논쟁으로 더욱 광범위하게 이어졌습니다. 개방형 가중치 모델 지지자들은 자유롭게 다운로드할 수 있는 가중치를 통해 CAISI 및 영국 AISI가 수행한 것과 똑같은 독립적인 안전 테스트가 가능하므로 공개 배포가 보안에 긍정적인 효과를 준다고 주장합니다. 비평가들은 동일한 개방성이 악의적인 행위자가 가능한 시스템을 수정하거나 오용하는 장벽을 낮춘다고 반박합니다.

Kimi K3의 경우 개방형 가용성 덕분에 이러한 독립적인 정부 평가가 가능해졌습니다. 상대적으로 낮은 수준의 사이버 점수가 정책 입안자들을 안심시키거나 경고하는지 여부는 숫자 자체보다는 미국과 영국 기관이 앞으로 몇 주 안에 이를 어떻게 구성할지에 더 많이 의존할 가능성이 높습니다.

현재 예비 평가는 Kimi K3의 공격적인 사이버 능력에 대한 최초의 공식 서구 측정이며 자주 비교되는 미국의 개척 모델보다 훨씬 뒤처지는 기준점으로 사용됩니다.

AI보다 앞서 나가세요

사이버 역량 점수는 AI 안전, 규제, 글로벌 경쟁을 둘러싼 훨씬 더 큰 경쟁에서 단지 하나의 전선일 뿐입니다. 정책 환경은 매주 바뀌고 있으며 단일 평가가 누락되면 다음 헤드라인 뒤에 있는 맥락을 놓칠 수 있습니다. AI Buzz Wire에서 더 많은 AI 뉴스를 읽어보세요를 통해 중요한 모든 모델 출시, 정부 판결, 안전성 평가에 대해 최신 소식을 확인하실 수 있습니다.

AI 경쟁에서 앞서 나가세요 - AI Buzz Wire를 방문하세요