Zhipu로도 알려져 있는 베이징에 본사를 둔 인공 지능 회사인 Z.ai는 소프트웨어 엔지니어링을 위한 가장 유능한 개방형 시스템이자 예기치 않게 강력한 사이버 보안 기술을 개발한 자사 주력 모델의 새로운 버전인 GLM-5.3을 출시했습니다. 8월 14일에 발표되고 회사 블로그 게시물에 자세히 설명된 GLM-5.3은 6월에 출시된 이전 GLM-5.2와 동일한 약 7,000억 개의 매개변수 기본 모델을 기반으로 구축되었습니다. 모든 개선은 더 큰 기반이 아닌 사후 교육에서 비롯된다고 회사는 말합니다. 이번 릴리스는 Anthropic 및 OpenAI의 폐쇄형 시스템과 경쟁하기 위한 중국 개방형 모델의 최신 제품입니다. AI Buzz Wire 모델 추적기의 경우 GLM-5.3은 개방형 개척자가 많은 예상보다 빠르게 코딩 격차를 줄이고 있다는 분명한 신호입니다.

전적으로 교육 후 구축을 통해 얻은 이득

Z.ai는 GLM-5.3에 대한 접근 방식에 대해 솔직하게 말했습니다. "훈련 후 확장이 우리가 한 전부입니다." 이 회사는 효율적인 장기 컨텍스트 처리를 위한 IndexShare, 장거리 작업에 대한 강화 학습을 위한 SAO, 대규모 비동기 훈련을 위한 slime이라는 오픈 소스 프레임워크를 포함하여 GLM-5.2에 도입된 강화 학습 스택을 이어받았습니다. 지난 한 달 동안 더 많은 환경, 더 다양한 작업, 더 많은 컴퓨팅을 해당 스택에 쏟아부었습니다.

그 결과는 코딩 벤치마크 전반에 걸쳐 나타납니다. Terminal Bench 3.0에서 GLM-5.3은 GLM-5.2의 점수인 4.6에서 28.3으로 6배 이상 향상되었습니다. Terminal Bench 3.0 및 Agents' Last Exam에 대한 오픈 소스 최첨단 결과를 게시하고 에이전트 기능에 대한 ALE-CLI 측정이 23.8에서 28.5로 향상됩니다. Z.ai는 현실적인 개발 환경에서 코딩 에이전트를 평가하고 공개 테스트 세트의 오염 위험을 줄이기 위해 설계된 비공개 벤치마크인 사내 Z.ai 코드 벤치에서 GLM-5.2보다 50% 향상된 성능을 보고했습니다.

결정적으로, 이익은 더 나은 결과뿐만 아니라 더 나은 토큰 효율성으로 이어집니다. 높은 노력으로 GLM-5.3은 작업당 약 50,000개의 출력 토큰으로 내부 벤치마크에서 31.4%의 완료율을 달성했으며, Z.ai는 이를 120,000개의 토큰으로 29.5%로 Anthropic의 Claude Opus 4.8을 능가한다고 말합니다. GLM-5.3은 최대 노력 시 39.5%에 도달하는 Anthropic의 더욱 발전된 Claude Fable 5보다 여전히 뒤처져 있습니다.

사이버 역량의 예상치 못한 도약

GLM-5.3의 가장 눈에 띄는 결과는 코딩이 아니라 보안입니다. Z.ai는 훈련 후 규모를 확장하고 취약점 발견 데이터와 환경을 훈련 믹스에 도입하면서 모델이 결함을 찾고 추론하는 능력이 향상될 것으로 기대했습니다. 팀을 놀라게 한 것은 해당 기능이 얼마나 빨리 개발되었는지였습니다.

GLM-5.3은 단지 고립된 버그를 발견하는 데만 더 나아진 것이 아닙니다. 공격의 여러 단계에 걸쳐 추론을 시작하여 전체 공격 체인에 대한 일관된 계획을 수립했습니다. 모델이 화이트박스 소스 코드의 취약점을 식별하고 검증할 수 있는지 여부를 테스트하는 벤치마크인 CyberGym에서 GLM-5.3의 점수는 84.5%로 GLM-5.2의 77.2%보다 높습니다. 이는 Mythos 5의 83.8%와 GPT-5.6 Sol의 83.6%를 앞지르는 벤치마크에서 가장 좋은 결과입니다. 실제 취약점과 그 악용에 대한 더 깊은 추론을 요구하는 ExploitBench에서 GLM-5.3은 GLM-5.2의 점수를 두 배 이상 높여 54.4%에 도달했습니다. 하지만 Mythos 5의 78.0%와 GPT-5.6 Sol의 76.5%에 훨씬 뒤처져 있습니다.

Z.ai는 일관된 패턴을 관찰합니다. 즉, 벤치마크가 위치한 익스플로잇 체인이 더 위쪽에 있을수록 GLM-5.2에 비해 이득이 더 커지고 폐쇄된 경계선과의 남은 격차도 더 커집니다. "역량은 우리가 가장 뒤쳐져 있는 곳에서 가장 빠르게 성장하고 있습니다."라고 회사는 말합니다.

실제 취약점 발견

사이버 기술은 벤치마크에만 국한되지 않습니다. Z.ai는 GLM-5.2 이후 중국의 여러 보안 팀과 협력하여 실제 코드베이스에 대해 모델을 테스트해 왔다고 보고합니다. 전문가의 검토, 선별 및 중복 제거를 거친 후 이 모델은 심각도가 중간에서 높은 수준까지의 문제 1,097개를 포함하여 269개 프로젝트에서 2,436개의 취약점을 식별했습니다. 조사 결과는 시스템 커널, 운영 체제, 브라우저 엔진, 오픈 소스 인프라, 웹 애플리케이션 및 네트워크 프로토콜에 걸쳐 있으며, 이들 중 다수는 수년 또는 수십 년 동안 눈에 띄지 않았으며 가장 오래된 것은 약 40년 전으로 거슬러 올라갑니다.

이러한 결과는 작업을 반영합니다. Anthropic은 자체 다중 에이전트 보안 연구에서 대규모로 오픈 소스 소프트웨어의 취약점을 찾기 위해 조정된 에이전트 떼를 사용했다고 설명했습니다.

개방형 가중치 - 지연 있음

Z.ai는 안전성 평가 및 경화가 완료되면 2주 안에 GLM-5.3 중량을 출시할 것이라고 밝혔습니다. 이러한 고의적인 지연은 발표 전반에 흐르는 긴장감을 반영합니다. 제작자가 예상한 것보다 더 빠르게 강력한 공격 사이버 기능을 개발하는 모델은 바로 책임 있는 출시에 대한 의문을 제기하는 시스템입니다. 회사는 훈련-롤아웃 일관성이 높은 수준의 수치 정밀도로 향상되었으며 확장의 어려움이 모델 자체에서 현실적이고 검증 가능한 작업 환경 설계로 전환되었음을 강조합니다.

경쟁 상황은 분명합니다. GLM-5.3은 코딩 및 에이전트 작업에서 폐쇄된 경계선까지의 거리를 좁히는 동시에 하나 이상의 주요 취약성 발견 벤치마크에서 완전한 선두를 차지합니다. 이는 개방형 가중치 모델로 수행됩니다. 즉, 일단 출시되면 누구나 가중치를 다운로드하고 연구하고 구축할 수 있도록 무료로 사용할 수 있습니다. 이러한 개방성이 발전을 가속화하는지 아니면 새로운 보안 문제를 제기하는지 여부는 GLM-5.3이 다시 불붙을 것이라는 논쟁입니다.

AI보다 앞서 나가세요

최신 AI 모델 출시, 벤치마크 배틀, 업계 분석을 보려면 AI 버즈와이어를 즐겨찾기에 추가하세요.

AI 뉴스 자세히 보기 →