Amazon Web Services telah menambahkan GLM 5.3 dari Z.ai, pengembang model yang juga dikenal sebagai Zhipu AI, ke Amazon Bedrock, memberikan pelanggan perusahaan akses API yang dikelola sepenuhnya ke salah satu model open-weight terbesar yang dirilis tahun ini. Peluncuran tersebut, yang diumumkan di Blog Pembelajaran Mesin AWS pada tanggal 5 Oktober, menjadikan model campuran pakar dengan parameter 753B tersedia melalui infrastruktur yang dikelola Bedrock daripada mengharuskan perusahaan untuk meng-host sendiri bobotnya.

Menurut AWS, GLM 5.3 — seperti yang dipublikasikan di Hugging Face Hub — dioptimalkan untuk pengkodean dan tugas agen jangka panjang, dengan Z.ai melaporkan kemampuan keamanan siber yang luar biasa. Kekuatan tersebut mencerminkan apa yang telah ditarik oleh pembeli perusahaan dari API terdepan tahun ini: penalaran multi-langkah, alur kerja yang dilengkapi alat, dan konteks berkelanjutan di seluruh basis kode yang besar. For more context on this story, see our ongoing more AI stories.

Apa yang sebenarnya didapatkan pelanggan Bedrock

Integrasi ini mengikuti pedoman akses terkelola standar Bedrock, dengan beberapa tambahan tingkat perusahaan:

  • Akses API yang fleksibel. GLM 5.3 dapat dipanggil melalui API Respons dan Penyelesaian Obrolan yang kompatibel dengan OpenAI — yang direkomendasikan AWS untuk aplikasi baru — serta melalui API Bedrock Invoke dan Converse asli. Tim yang memigrasikan pipeline berbasis OpenAI yang ada dapat menargetkan ulang model dengan sedikit perubahan kode.
  • Inferensi lintas wilayah. Model ini dikirimkan di belakang dua profil inferensi, us.zai.glm-5.3 untuk lalu lintas lintas wilayah AS dan global.zai.glm-5.3 untuk perutean global. Permintaan dikirim ke wilayah sumber pilihan pelanggan dan Bedrock menangani perutean aman.
  • Caching cepat. Caching otomatis implisit diaktifkan secara default, dengan kontrol cache eksplisit tersedia di API yang kompatibel dengan OpenAI. Untuk beban kerja agen yang mengirim ulang permintaan sistem besar atau konteks repositori di setiap kesempatan, AWS mengatakan caching memotong latensi dan biaya input.
  • Tingkat layanan. Pelanggan dapat memilih Flex untuk beban kerja yang hemat biaya dan tidak terlalu sensitif terhadap waktu, Prioritas untuk lalu lintas kritis latensi dengan harga premium, atau Standar untuk saldo default.

Satu peringatan yang menonjol: AWS menyatakan bahwa akses ke GLM 5.3 di Bedrock tersedia bagi pelanggan perusahaan yang memenuhi syarat, sehingga menyarankan proses orientasi yang terjaga keamanannya dibandingkan layanan mandiri terbuka untuk semua akun.

Pembagian pendapatan pertama untuk laboratorium Tiongkok

Di luar integrasi teknis, liputan pers tentang peluncuran ini menggambarkan pengaturan pembagian pendapatan berbasis penggunaan antara AWS dan Z.ai di mana penyedia model mendapat potongan dari konsumsi Bedrock — templat komersial standar yang digunakan Bedrock dengan mitra Barat, kini diterapkan pada model unggulan laboratorium Tiongkok. Laporan pers keuangan di pasar Hong Kong mengatakan saham-saham yang terkait dengan Zhipu menguat lebih dari 7% pada awal perdagangan karena berita tersebut.

Kesepakatan ini penting karena menandakan strategi platform. Hyperscaler menghabiskan dua tahun terakhir menjalin aliansi eksklusif dengan laboratorium Barat; membuka Bedrock ke keluarga produk open-weight di Tiongkok akan memperluas jangkauan platform ini ke perusahaan-perusahaan yang sensitif terhadap biaya dan ke pasar di mana model-model AS menghadapi tekanan harga. Hal ini juga membuat distribusi Z.ai tidak dapat menandingi rilis open-weights: ribuan perusahaan yang tidak pernah mengunduh checkpoint parameter 753B kini dapat menyebutnya berada di belakang SLA.

Dari bobot terbuka hingga API terkelola

Jalur GLM 5.3 menuju Bedrock melewati komunitas open-weight. Model ini dipublikasikan di Hugging Face Hub, dan bobot, tolok ukur, dan persyaratan lisensinya menarik perhatian pengembang sebelum hosting terkelola apa pun ditawarkan — pedoman yang digunakan Z.ai di seluruh seri GLM, termasuk rilis GLM-5.3-Flash berlisensi MIT yang dijalankan pada chip buatan Tiongkok.

Bagi perusahaan, perhitungan antara mengunduh bobot dan memanggil API selalu bermuara pada operasional: menghosting sendiri model campuran para ahli dengan parameter 753B memerlukan kapasitas GPU yang serius dan kematangan MLOps yang tidak dapat dibenarkan oleh sebagian besar organisasi untuk satu beban kerja. Akses terkelola Bedrock menghilangkan hambatan tersebut sekaligus menjaga opsi penerapan hybrid tetap terbuka bagi perusahaan dengan kendala residensi data.

Memulai, secara konkrit

Dokumentasi AWS menelusuri pemanggilan dari konsol Bedrock — tempat model muncul di taman bermain standar untuk pengujian cepat tanpa memerlukan kode — dan secara terprogram melalui titik akhir runtime batuan dasar. Prasyaratnya adalah izin IAM biasa untuk pemanggilan model, termasuk batuan dasar:InvokeModel dan batuan dasar:InvokeModelWithResponseStream, ditambah izin untuk profil inferensi lintas wilayah yang dipilih. Python 3.10 atau lebih baru dicantumkan sebagai contoh kode.

Khususnya, postingan AWS menyertakan demo pengujian keamanan opsional yang dibuat dengan Docker dan alat Strix sumber terbuka, yang menjalankan GLM 5.3 melalui Bedrock untuk alur kerja keamanan ofensif — sebuah penyertaan tidak biasa yang menggarisbawahi posisi keamanan siber yang diklaim Z.ai untuk model tersebut. Untuk platform yang sensitif terhadap kepatuhan seperti AWS, menampilkan model Tiongkok dalam konteks demo peretasan adalah sinyal jelas tentang campuran beban kerja yang dikejar Z.ai.

Campuran para ahli ekonomi

Angka parameter 753B tidak terlalu berarti bagi ukurannya dibandingkan arsitekturnya. Model gabungan pakar hanya mengaktifkan sebagian kecil parameternya per token, sehingga GLM 5.3 dapat menghadirkan kemampuan skala batas tanpa biaya inferensi skala batas pada setiap permintaan. Dikombinasikan dengan cache yang cepat – dimana perintah sistem yang berulang dan konteks repositori disajikan dari cache dengan biaya yang lebih rendah – penghematan ini ditujukan pada beban kerja agen bervolume tinggi yang mendominasi anggaran AI perusahaan tahun ini: asisten pengkodean, operasi keamanan, dan jalur otomatisasi yang berjalan lama.

Tingkat layanan Bedrock kemudian memungkinkan tim operasi menukar biaya dengan latensi per beban kerja. Pekerjaan analisis kode batch setiap malam dapat dijalankan dengan harga Fleksibel, sementara kopilot keamanan interaktif menggunakan tingkat Prioritas — model yang sama, dengan pengukuran yang berbeda.

Apa yang harus ditonton

Peluncuran ini menyiapkan tiga tes jangka pendek. Pertama, adopsi: apakah basis perusahaan Bedrock memperlakukan GLM 5.3 sebagai opsi produksi atau keingintahuan sebagai tolok ukur. Kedua, penetapan harga: tingkat Flex mengurangi tingkat layanan yang dioptimalkan latensi, dan penetapan harga seri GLM secara historis menekan pesaing di Barat dalam hal biaya. Ketiga, respons: perusahaan hyperscaler lainnya menghadapi pilihan yang sama untuk menjadi hosting atau menyerahkan segmen perusahaan model Tiongkok.

Untuk tim AI yang melacak ketersediaan model, hal praktis yang dapat diambil sangatlah sederhana — salah satu model open-weight yang paling banyak diawasi pada tahun 2026 kini hanya berjarak satu panggilan API untuk pelanggan AWS, dan lanskap model AI tumbuh lebih kompetitif dengan setiap platform yang menandatangani laboratorium Tiongkok.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →