Amazon Web Services, Zhipu AI olarak da bilinen model geliştiricisi Z.ai'nin GLM 5.3'ünü Amazon Bedrock'a ekleyerek kurumsal müşterilere bu yıl piyasaya sürülen en büyük açık ağırlıklı modellerden birine tam olarak yönetilen API erişimi sağladı. 5 Ekim'de AWS Machine Learning Blog'da duyurulan lansman, şirketlerin ağırlıkları kendilerinin barındırmasını gerektirmek yerine 753B parametreli uzman karışımı modelini Bedrock'un yönetilen altyapısı aracılığıyla kullanılabilir hale getiriyor.

AWS'ye göre, Hugging Face Hub'da yayınlanan GLM 5.3, Z.ai'nin kayda değer siber güvenlik yetenekleri bildirdiği kodlama ve uzun vadeli ajans görevleri için optimize edilmiştir. Bu güçlü yönler, kurumsal alıcıların bu yıl öncü API'lerden neleri çıkardığıyla doğrudan eşleşiyor: çok adımlı akıl yürütme, araçla zenginleştirilmiş iş akışları ve büyük kod tabanlarında sürdürülebilir bağlam. For more context on this story, see our ongoing breaking AI news.

Bedrock müşterileri aslında ne elde ediyor?

Entegrasyon, birkaç kurumsal düzeyde ekstrayla birlikte Bedrock'un standart yönetilen erişim taktiklerini takip ediyor:

  • Esnek API erişimi. GLM 5.3, AWS'nin yeni uygulamalar için önerdiği OpenAI uyumlu Yanıtlar ve Sohbet Tamamlama API'lerinin yanı sıra yerel Bedrock Invoke ve Converse API'leri aracılığıyla da çağrılabilir. Mevcut OpenAI tabanlı ardışık düzenleri geçiren ekipler, minimum kod değişikliğiyle modeli yeniden hedefleyebilir.
  • Bölgeler arası çıkarım. Model iki çıkarım profiliyle birlikte gelir: ABD bölgeler arası trafik için us.zai.glm-5.3 ve küresel yönlendirme için global.zai.glm-5.3. İstekler müşterinin tercih ettiği bir kaynak bölgeye gider ve Bedrock güvenli yönlendirmeyi gerçekleştirir.
  • İstemi önbelleğe alma. Örtük otomatik önbelleğe alma varsayılan olarak açıktır ve OpenAI uyumlu API'lerde açık önbellek denetimleri mevcuttur. AWS, her fırsatta büyük sistem istemlerini veya depo içeriğini yeniden gönderen aracı iş yükleri için önbelleğe almanın hem gecikmeyi hem de giriş maliyetini azalttığını söylüyor.
  • Hizmet katmanları. Müşteriler, maliyeti optimize edilmiş, zamana daha az duyarlı iş yükleri için Flex'i, premium olarak gecikme açısından kritik trafik için Öncelik'i veya varsayılan bakiye için Standart'ı seçebilir.

Bir uyarı öne çıkıyor: AWS, Bedrock'ta GLM 5.3'e erişimin uygun kurumsal müşteriler için mevcut olduğunu belirtiyor ve tüm hesaplar için açık self-servis yerine kapılı bir katılım süreci öneriyor.

Çin'deki bir laboratuvar için ilk kez gelir paylaşımı

Teknik entegrasyonun ötesinde, lansmanla ilgili basında çıkan haberler, AWS ve Z.ai arasında, model sağlayıcının Bedrock tüketiminden bir pay elde ettiği, kullanıma dayalı bir gelir paylaşımı düzenlemesini anlatıyor; Bedrock'un Batılı ortaklarla kullandığı standart ticari şablon, şu anda sınırdaki bir Çin laboratuvarının amiral gemisi modeline uygulanıyor. Hong Kong piyasalarına ilişkin mali basında çıkan haberlerde, Zhipu ile ilgili hisselerin haber üzerine erken işlemlerde %7'den fazla artış gösterdiği belirtildi.

Anlaşma, platform stratejisi hakkında neyi işaret ettiği açısından önemli. Hiper ölçekleyiciler son iki yılını Batılı laboratuvarlarla ayrıcalıklı hislere sahip ittifaklar kurmakla geçirdi; Bedrock'un Çinli bir açık ağırlık ailesine açılması, platformun erişim alanını maliyete duyarlı işletmelere ve ABD modellerinin fiyat baskısıyla karşı karşıya olduğu pazarlara genişletiyor. Aynı zamanda hiçbir açık ağırlık sürümünün eşleşemeyeceği Z.ai dağıtımına da olanak tanır: 753B parametreli bir kontrol noktasını hiçbir zaman indirmeyecek binlerce kuruluş artık bunu bir SLA'nın arkasında çağırabilir.

Açık ağırlıklardan yönetilen API'ye

GLM 5.3'ün Bedrock'a giden yolu açık ağırlık topluluğundan geçiyordu. Model, Hugging Face Hub'da yayınlandı ve burada ağırlıkları, kıyaslamaları ve lisans koşulları, herhangi bir yönetilen barındırma teklif edilmeden önce geliştiricilerin dikkatini çekti; Z.ai, Çin yapımı çiplerle çalışan MIT lisanslı GLM-5.3-Flash sürümü de dahil olmak üzere GLM serisinde kullandı.

İşletmeler için, ağırlıkların indirilmesi ile API'nin çağrılması arasındaki hesaplama her zaman operasyonlarla ilgili olmuştur: 753B parametreli uzmanlardan oluşan bir modelin kendi kendine barındırılması, çoğu kuruluşun tek bir iş yükü için haklı gösteremeyeceği ciddi GPU kapasitesi ve MLOps olgunluğu gerektirir. Bedrock'un yönetilen erişimi, veri yerleşimi kısıtlamaları olan şirketler için hibrit dağıtım seçeneğini açık tutarken bu engeli ortadan kaldırır.

Somut olarak başlarken

AWS'nin belgeleri, modelin standart oyun alanında kod gerektirmeden hızlı test için göründüğü Bedrock konsolundan yapılan çağrıyı ve temel çalışma zamanı uç noktası boyunca programlı bir şekilde anlatılmaktadır. Önkoşullar, ana kaya:InvokeModel ve ana kaya:InvokeModelWithResponseStream dahil olmak üzere model çağırma için olağan IAM izinlerinin yanı sıra seçilen bölgeler arası çıkarım profiline yönelik izinlerdir. Kod örnekleri için Python 3.10 veya üzeri listelenmiştir.

Özellikle, AWS gönderisi, saldırgan güvenlik iş akışları için GLM 5.3'ü Bedrock üzerinden çalıştıran, Docker ve açık kaynaklı Strix aracıyla oluşturulmuş isteğe bağlı bir güvenlik testi demosu içeriyor; bu, Z.ai'nin model için iddia ettiği siber güvenlik konumunun altını çizen alışılmadık bir ekleme. AWS gibi uyumluluğa duyarlı bir platform için, Çin modelini bilgisayar korsanlığı demosu bağlamında sergilemek, Z.ai'nin peşinde olduğu iş yükü karışımı hakkında anlamlı bir sinyaldir.

Uzmanların karışımı ekonomisi

753B parametresi şekli, boyutundan çok mimarisinden önemlidir. Uzmanların karışımı olan modeller, jeton başına parametrelerinin yalnızca bir kısmını etkinleştirir; bu, GLM 5.3'ün, her istekte sınır ölçeğinde çıkarım maliyetleri olmadan sınır ölçeğinde yetenek sunabilmesinin yoludur. Tekrarlanan sistem istemlerinin ve depo içeriğinin daha düşük maliyetle önbellekten sunulduğu hızlı önbelleğe alma ile birleştiğinde ekonomi, bu yıl kurumsal yapay zeka bütçelerine hakim olan yüksek hacimli aracı iş yüklerini doğrudan hedefliyor: kodlama asistanları, güvenlik operasyonları ve uzun süredir devam eden otomasyon hatları.

Bedrock'un hizmet katmanları daha sonra operasyon ekiplerinin iş yükü başına gecikmeye karşı maliyet alışverişi yapmasına olanak tanır. Gecelik bir toplu kod analizi işi Flex fiyatlandırması üzerinden yürütülebilirken etkileşimli bir güvenlik yardımcı pilotu Öncelik katmanında (aynı model, farklı ölçümle) hareket eder.

Ne izlenmeli

Lansman üç kısa vadeli test gerçekleştiriyor. Birincisi, benimseme: Bedrock'un kurumsal tabanı GLM 5.3'ü bir üretim seçeneği olarak mı yoksa bir kıyaslama merakı olarak mı ele alıyor? İkincisi, fiyatlandırma: Flex katmanı, gecikme için optimize edilmiş hizmet seviyelerini düşürür ve GLM serisi fiyatlandırması, Batılı rakiplere maliyet konusunda tarihsel olarak baskı yapmıştır. Üçüncüsü, yanıt: diğer hiper ölçekleyiciler de Çin modeli kurumsal segmenti barındırma veya devretme konusunda aynı seçimle karşı karşıya.

Model kullanılabilirliğini takip eden AI ekipleri için pratik sonuç basit: 2026'nın en yakından izlenen açık ağırlıklı modellerinden biri artık AWS müşterileri için bir API çağrısı uzakta ve AI modelleri ortamı, bir Çin laboratuvarıyla sözleşme imzalayan her platformla daha rekabetçi hale geliyor.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →