Amazon Web Services는 Zhipu AI라고도 알려진 모델 개발자인 Z.ai의 GLM 5.3을 Amazon Bedrock에 추가하여 기업 고객에게 올해 출시된 가장 큰 개방형 모델 중 하나에 대한 완전한 관리형 API 액세스를 제공합니다. 10월 5일 AWS Machine Learning 블로그에 발표된 이번 출시를 통해 기업이 가중치를 자체 호스팅하도록 요구하는 대신 Bedrock의 관리형 인프라를 통해 753B 매개변수 전문가 혼합 모델을 사용할 수 있게 되었습니다.
AWS에 따르면 Hugging Face Hub에 게시된 GLM 5.3은 코딩 및 장거리 에이전트 작업에 최적화되어 있으며 Z.ai는 주목할만한 사이버 보안 기능을 보고했습니다. 이러한 강점은 기업 구매자가 올해 프론티어 API에서 끌어낸 것, 즉 다단계 추론, 도구로 강화된 워크플로, 대규모 코드 기반 전반에 걸친 지속적인 컨텍스트에 직접적으로 매핑됩니다. 이 이야기에 대한 자세한 내용은 AI 뉴스를 참조하세요.
Bedrock 고객이 실제로 얻는 것
통합은 몇 가지 엔터프라이즈급 추가 기능을 포함하여 Bedrock의 표준 관리 액세스 플레이북을 따릅니다.
- 유연한 API 액세스. GLM 5.3은 AWS가 새로운 애플리케이션에 권장하는 OpenAI 호환 응답 및 채팅 완료 API는 물론 기본 Bedrock Invoke 및 Converse API를 통해 호출할 수 있습니다. 기존 OpenAI 기반 파이프라인을 마이그레이션하는 팀은 최소한의 코드 변경으로 모델의 대상을 변경할 수 있습니다.
- 교차 지역 추론. 이 모델은 미국 지역 간 트래픽용 us.zai.glm-5.3과 글로벌 라우팅용 global.zai.glm-5.3이라는 두 가지 추론 프로필을 기반으로 합니다. 요청은 고객이 선택한 소스 지역으로 이동하고 Bedrock은 보안 라우팅을 처리합니다.
- 신속한 캐싱. 암시적 자동 캐싱은 기본적으로 켜져 있으며 OpenAI 호환 API에서 명시적 캐시 제어를 사용할 수 있습니다. 매번 대규모 시스템 프롬프트나 저장소 컨텍스트를 다시 보내는 에이전트 워크로드의 경우 AWS는 캐싱이 대기 시간과 입력 비용을 모두 절감한다고 말합니다.
- 서비스 계층. 고객은 비용 최적화되고 시간에 덜 민감한 워크로드를 위해 Flex를 선택하고, 대기 시간이 중요한 프리미엄 트래픽을 위해 Priority를 선택하거나, 기본 균형을 위해 Standard를 선택할 수 있습니다.
한 가지 주의 사항이 있습니다. AWS에서는 자격을 갖춘 기업 고객이 Bedrock의 GLM 5.3에 액세스할 수 있다고 명시하고 있으며, 모든 계정에 대해 개방형 셀프 서비스보다는 제한적인 온보딩 프로세스를 제안합니다.
중국 연구소 최초로 수익 공유
기술 통합 외에도 이번 출시에 대한 언론 보도에서는 모델 제공업체가 Bedrock 소비량을 삭감하는 AWS와 Z.ai 간의 사용량 기반 수익 공유 계약에 대해 설명합니다. 이는 Bedrock이 서구 파트너와 함께 사용하는 표준 상용 템플릿이며 현재 중국 개척 연구소의 주력 모델에 적용되고 있습니다. 홍콩 시장에 대한 금융 언론 보도에 따르면 Zhipu 관련 주가는 뉴스 초반 거래에서 7% 이상 상승했습니다.
거래는 플랫폼 전략에 대한 신호가 무엇인지에 따라 중요합니다. 하이퍼스케일러는 지난 2년 동안 서구 연구실과 독점적인 느낌의 제휴를 맺었습니다. Bedrock을 중국 개방형 제품군에 개방함으로써 플랫폼의 범위를 비용에 민감한 기업과 미국 모델이 가격 압박에 직면한 시장으로 확장합니다. 또한 Z.ai 배포판에는 비교할 수 없는 공개 가중치 릴리스가 제공됩니다. 753B 매개변수 체크포인트를 다운로드하지 않는 수천 개의 기업이 이제 SLA 뒤에서 이를 호출할 수 있습니다.
개방형 가중치에서 관리형 API로
Bedrock으로 향하는 GLM 5.3의 경로는 개방형 커뮤니티를 통과했습니다. 이 모델은 관리형 호스팅이 제공되기 전에 무게, 벤치마크 및 라이센스 조건이 개발자의 관심을 끌었던 Hugging Face Hub에 게시되었습니다. Z.ai는 중국산 칩에서 실행되는 MIT 라이센스 GLM-5.3-Flash 릴리스를 포함하여 GLM 시리즈 전반에 걸쳐 사용했던 플레이북입니다.
기업의 경우 가중치 다운로드와 API 호출 사이의 계산은 항상 운영으로 귀결됩니다. 753B 매개변수 전문가 혼합 모델을 자체 호스팅하려면 대부분의 조직이 단일 워크로드에 대해 정당화할 수 없는 심각한 GPU 용량과 MLOps 성숙도가 필요합니다. Bedrock의 관리형 액세스는 데이터 상주 제약이 있는 회사를 위해 하이브리드 배포 옵션을 열어두는 동시에 이러한 장벽을 제거합니다.
구체적으로 시작하기
AWS 문서에서는 코드가 필요 없는 즉각적인 테스트를 위해 모델이 표준 플레이그라운드에 표시되는 Bedrock 콘솔에서의 호출과 프로그래밍 방식으로 기반암 런타임 엔드포인트를 통해 안내합니다. 전제 조건은 bedrock:InvokeModel 및 bedrock:InvokeModelWithResponseStream을 포함하여 모델 호출을 위한 일반적인 IAM 권한과 선택한 지역 간 추론 프로필에 대한 권한입니다. 코드 예제에는 Python 3.10 이상이 나열되어 있습니다.
특히, AWS 게시물에는 공격적인 보안 워크플로를 위해 Bedrock을 통해 GLM 5.3을 실행하는 Docker 및 오픈 소스 Strix 도구로 구축된 선택적 보안 테스트 데모가 포함되어 있습니다. 이는 Z.ai가 모델에 대해 주장한 사이버 보안 포지셔닝을 강조하는 특이한 포함입니다. AWS만큼 규정 준수에 민감한 플랫폼의 경우, 해킹 데모 맥락에서 중국 모델을 선보이는 것은 Z.ai가 추구하는 워크로드 믹스에 대한 지적 신호입니다.
전문가 혼합 경제학
753B 매개변수 수치는 크기보다는 아키텍처보다 중요합니다. 전문가 혼합 모델은 토큰당 매개변수의 일부만 활성화합니다. 이는 GLM 5.3이 모든 요청에 대해 프론티어 규모 추론 비용 없이 프론티어 규모 기능을 제공할 수 있는 방법입니다. 반복되는 시스템 프롬프트와 저장소 컨텍스트가 저렴한 비용으로 캐시에서 제공되는 프롬프트 캐싱과 결합된 경제성은 코딩 지원, 보안 운영 및 장기 실행 자동화 파이프라인과 같이 올해 기업 AI 예산을 지배하는 대용량 에이전트 워크로드를 겨냥합니다.
그러면 Bedrock의 서비스 계층을 통해 운영 팀이 워크로드당 대기 시간과 비용을 교환할 수 있습니다. 야간 배치 코드 분석 작업은 Flex 가격으로 실행할 수 있으며, 대화형 보안 부조종사는 동일한 모델이지만 다르게 측정되는 Priority 계층을 사용합니다.
볼만한 것
이번 출시는 세 가지 단기 테스트를 설정합니다. 첫째, 채택: Bedrock의 기업 기반이 GLM 5.3을 프로덕션 옵션으로 취급하는지 아니면 벤치마킹 호기심으로 취급하는지 여부입니다. 둘째, 가격 책정: Flex 계층은 지연 시간에 최적화된 서비스 수준을 낮추고, GLM 시리즈 가격은 역사적으로 서구 경쟁사에 비용 측면에서 압박을 가해 왔습니다. 셋째, 대응: 다른 하이퍼스케일러는 중국 모델 기업 부문을 호스팅할지 아니면 양도할지에 대한 동일한 선택에 직면합니다.
모델 가용성을 추적하는 AI 팀의 경우 실질적인 시사점은 간단합니다. 2026년에 가장 주목받는 개방형 모델 중 하나가 이제 AWS 고객을 위한 하나의 API 호출이며, AI 모델 환경은 중국 연구소에 서명하는 모든 플랫폼에서 더욱 경쟁력이 높아집니다.
---
AI 최신 소식최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.
AI 뉴스 더 보기 →