익명의 Ox Alpha라는 이름으로 일주일 동안 개발자들을 매료시켰던 미스터리 모델이 이제 공식적인 아이덴티티를 갖게 되었습니다. 중국의 Z.AI는 허용된 MIT 라이선스에 따라 출시된 기본 다중 모드, 개방형 무게 모델인 GLM-5.3-Flash를 출시했으며 전체 스텔스 미리 보기 실행은 중국산 AI 칩에서 제공되었다고 밝혔습니다. 이번 출시로 올해 AI 업계에서 가장 주목받는 추측 게임 중 하나가 종료되었습니다. 이야기가 어떻게 전개되었는지 배경을 알아보려면 최신 AI 개발을 참조하세요.

Z.ai가 실제로 배송한 것

GLM-5.3-Flash는 총 3,200억 개의 매개변수와 180억 개의 활성 매개변수를 갖춘 전문가의 혼합 모델입니다. 이는 이전 GLM-4.5의 320억 개의 활성 매개변수에 비해 눈에 띄게 감소한 수치입니다. Z.ai의 발표에 따르면 이는 GLM-5 제품군 중 최초의 기본 다중 모드 모델로 텍스트 및 이미지 입력을 허용하며 100만 개의 토큰에 도달하는 컨텍스트 창을 지원합니다.

이 모델은 30조 개의 토큰 다중 모달 코퍼스에서 훈련되었으며, 그 아키텍처는 로컬 종속성에 대한 선형 주의와 글로벌 컨텍스트에 대한 희소 주의를 혼합합니다. Z.ai가 IndexPool을 호출하는 구성 요소는 인덱서 키 벡터 그룹을 압축하여 긴 컨텍스트 길이에서 대기 시간과 메모리 사용을 제한합니다. 회사는 GLM-5.3에 비해 주의 컴퓨팅이 3배 적고 KV 캐시 크기가 4.4배 감소했다고 보고했습니다.

벤치마크 주장 및 가격

인공 분석 인텔리전스 지수 v4.1.1에서 GLM-5.3-Flash는 57점을 기록했습니다. 이는 인공 분석의 현재 모델 순위에서 18점보다 훨씬 높은 수치입니다. Z.ai는 보고된 코딩 및 에이전트 테스트에서 10분의 1 가격으로 GLM-5.2보다 뛰어난 성능을 발휘하며 내부 코딩 벤치마크에서는 Anthropic의 Claude Opus 4.8에 근접한다고 말합니다. DeepSWE v1.1에서 모델은 GLM-5.2의 경우 46.2점에 비해 63.4점을 받았습니다. AutomationBench에서는 26.2에 비해 48.8에 도달했습니다. TestingCatalog에서 언급했듯이 평가 도구, 컨텍스트 제한 및 생성 설정이 다르기 때문에 교차 테스트 비교는 각 설정에 크게 의존합니다.

인공 분석에 따르면 가격은 모델을 공격적으로 저렴하게 만듭니다. 입력 토큰 백만 개당 0.15달러, 출력 토큰 백만 개당 0.50달러이며 프롬프트 캐시 할인율은 83%입니다. Z.ai는 Intelligence Index 작업당 $0.045의 할인된 비용을 인용합니다.

중국 칩 각도

전략적으로 가장 중요한 세부 사항은 인텔리전스가 아닌 인프라입니다. 출시 전 이 모델은 8월 20일부터 OpenRouter 및 OpenCode에서 'ox-alpha'라는 이름으로 익명으로 실행되었으며 Z.ai는 해당 서비스에서 이번 주 가장 인기 있는 모델이 되었다고 말합니다. 트래픽은 전적으로 국내 중국 액셀러레이터에서 제공됩니다. 이를 지원하기 위해 Z.ai는 인코딩, 사전 채우기 및 디코딩을 분리하는 SGLang 기반 서빙 스택을 구축하여 수만 개의 중국 AI 칩 전반에 걸쳐 엔드 투 엔드 서빙 성능이 3배 향상되었다고 보고했습니다.

이는 하나의 벤더 이상으로 중요합니다. 이는 국경에 인접한 중국 모델이 Nvidia 하드웨어 없이 대규모로 서비스될 수 있다는 공개 시연이며, 서방 정책 입안자와 칩 제조사는 이 데이터 포인트를 무시하지 않을 것입니다. New Stack은 이 릴리스를 저렴하고 우수하며 중국 칩에 제공된다고 요약했습니다. 지금까지 세 가지 특성이 함께 주장된 경우는 거의 없었습니다.

개방형 가중치, 실제 배포

가중치는 MIT 라이선스에 따라 Hugging Face에서 사용할 수 있으며 SGLang, vLLM 및 TokenSpeed를 통해 로컬 배포가 지원됩니다. GLM Coding Plan 가입자는 GLM-5.3의 사용 가능한 할당량의 3배로 즉시 GLM-5.3-Flash를 라이브로 받을 수 있으며, 다중 모드 기능은 브라우저 사용 및 컴퓨터 사용 통합을 통해 ZCode에 노출됩니다.

시각적 추론은 릴리스의 핵심입니다. Z.ai는 모델을 훈련하여 렌더링된 인터페이스, 게임플레이 및 3D 출력을 검사한 다음 시각적 피드백을 통해 자체 작업을 평가하고 수정했습니다. 동일한 접근 방식이 문서, 스프레드시트, 프리젠테이션 및 대시보드로 확장됩니다. 사무 작업의 가장 중요한 요소는 바로 Qwen의 경쟁 제품인 같은 날 릴리스에서도 가장 큰 이점을 얻을 수 있는 부분입니다.

개방형 가중치 결정은 애호가를 넘어 생태계에 중요합니다. MIT 라이센싱은 AI 분야에서 가장 관대한 일반 라이센스입니다. 상업적 사용, 수정 및 재배포에는 카피레프트 의무가 없습니다. 독립 호스트는 자체 하드웨어에서 GLM-5.3-Flash를 제공하고 법적 검토부터 산업 자동화까지 수직으로 미세 조정하고 조건 협상 없이 제품에 내장할 수 있습니다. 이는 API 전용 프론티어 모델에 의해 폐쇄되는 옵션입니다.

스텔스 발사가 성공한 이유

익명의 출시는 Z.ai에게 마케팅 예산으로는 살 수 없는 것, 즉 브랜드에 구애받지 않는 검증을 제공했습니다. 개발자들은 중국 연구소와 미국 연구소의 틀을 맞추지 않고 장점을 살려 Ox Alpha를 채택했습니다. Bloomberg가 Z.AI를 제조사로 확인하고 Business Insider가 "미스터리 해결"을 선언했을 때 이 모델은 이미 중립 지역에서 커뮤니티 순위표 1위를 차지했습니다.

이제 경쟁 압력이 명백해졌습니다. 백만 개의 토큰 컨텍스트, MIT 라이센스 가중치 및 1달러 이하의 출력 가격을 갖춘 다중 모드 모델은 모든 기존 업체가 가격표를 정당화하도록 강요합니다. 널리 추종하는 AI 평론가인 Andrew Curran이 X에 대해 말했듯이 가격 대비 성능에 대한 파레토 경계(개발자가 실제로 느끼는 절충안)가 다시 그려졌습니다.

공개 질문은 내구성입니다. 벤치마크 리드가 적대적인 실제 사용에서도 유지되는지 여부와 서구 연구소가 가격에 얼마나 빨리 반응하는지입니다. 어느 쪽이든, 익명의 추측이 있었던 일주일은 명명된 모델, 다운로드 가능한 중량, 미국산 실리콘을 사용하지 않는 서비스 차량으로 끝났습니다.

---

AI보다 앞서 나가세요

최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.

AI 뉴스 자세히 보기 →