Model misteri yang menghabiskan waktu seminggu memikat pengembang dengan nama anonim Ox Alpha kini memiliki identitas resmi. Z.AI Tiongkok telah meluncurkan GLM-5.3-Flash, model multimodal dan berbobot terbuka yang dirilis di bawah lisensi MIT yang permisif — dan perusahaan tersebut mengatakan seluruh proses pratinjau siluman disajikan pada chip AI buatan Tiongkok. Peluncuran ini menutup salah satu permainan tebak-tebakan yang paling banyak ditonton di industri AI tahun ini. Untuk mengetahui latar belakang bagaimana kisah ini terungkap, lihat perkembangan AI terbaru.
Apa yang sebenarnya dikirimkan Z.ai
GLM-5.3-Flash adalah model campuran ahli dengan total 320 miliar parameter dan 18 miliar parameter aktif — penurunan yang signifikan dari 32 miliar parameter aktif pendahulunya GLM-4.5. Ini adalah model multimodal asli pertama dalam keluarga GLM-5, yang menerima input teks dan gambar, dan mendukung jendela konteks yang mencapai satu juta token, menurut pengumuman Z.ai.
Model ini dilatih pada korpus multimodal senilai 30 triliun token, dan arsitekturnya memadukan perhatian linier untuk ketergantungan lokal dengan sedikit perhatian untuk konteks global. Komponen yang disebut Z.ai IndexPool mengompresi grup vektor kunci pengindeks untuk membatasi latensi dan penggunaan memori pada konteks yang panjang. Perusahaan melaporkan perhatian komputasi tiga kali lebih sedikit dan pengurangan ukuran cache KV sebesar 4,4 kali lipat dibandingkan dengan GLM-5.3.
Klaim dan harga patokan
Pada Indeks Kecerdasan Analisis Buatan v4.1.1, GLM-5.3-Flash mendapat skor 57 — angka yang menempatkannya di puncak peringkat model Analisis Buatan saat ini, jauh di atas median perbandingan sebesar 18. Z.ai mengatakan bahwa perangkat ini mengungguli GLM-5.2 dalam semua pengkodean yang dilaporkan dan pengujian agen dengan harga sepersepuluh, dan mendekati Claude Opus 4.8 dari Anthropic pada tolok ukur pengkodean internalnya. Pada DeepSWE v1.1, model mendapatkan skor 63,4 berbanding 46,2 untuk GLM-5.2; di AutomationBench mencapai 48,8 berbanding 26,2. Seperti yang dicatat oleh TestingCatalog, penggunaan evaluasi yang berbeda, batasan konteks, dan pengaturan pembuatan berarti perbandingan pengujian silang sangat bergantung pada setiap pengaturan.
Penetapan harga menempatkan model ini sebagai model yang sangat murah: $0,15 per juta token masukan dan $0,50 per juta token keluaran, dengan diskon prompt-cache sebesar 83%, menurut Analisis Buatan. Z.ai menyebutkan potongan biaya sebesar $0,045 per tugas Indeks Intelijen.
Sudut chip Cina
Hal yang paling penting secara strategis adalah infrastruktur, bukan intelijen. Sebelum diluncurkan, model ini berjalan secara anonim sebagai `ox-alpha` di OpenRouter dan OpenCode mulai tanggal 20 Agustus, dan Z.ai mengatakan bahwa model tersebut menjadi model paling populer minggu ini pada layanan tersebut — dengan lalu lintas yang dilayani sepenuhnya pada akselerator domestik Tiongkok. Untuk mendukung hal tersebut, Z.ai membangun tumpukan penyajian berbasis SGLang yang memisahkan pengkodean, pengisian awal, dan decoding, sehingga melaporkan peningkatan tiga kali lipat dalam kinerja penyajian end-to-end di puluhan ribu chip AI Tiongkok.
Hal ini tidak hanya penting bagi satu vendor. Hal ini merupakan demonstrasi publik bahwa model Tiongkok yang berada di wilayah perbatasan dapat dilayani dalam skala besar tanpa perangkat keras Nvidia, sebuah data yang tidak akan diabaikan oleh pembuat kebijakan dan pembuat chip di Barat. New Stack merangkum peluncuran ini sebagai produk yang murah, bagus, dan disajikan dengan chip Tiongkok — tiga kualitas yang jarang diklaim secara bersamaan hingga saat ini.
Bobot terbuka, penerapan nyata
Bobot tersedia di Hugging Face di bawah lisensi MIT, dengan penerapan lokal didukung melalui SGLang, vLLM, dan TokenSpeed. Pelanggan GLM Coding Plan langsung mendapatkan GLM-5.3-Flash dengan tiga kali lipat kuota yang dapat digunakan dari GLM-5.3, dan kemampuan multimodalnya ditampilkan di ZCode melalui integrasi Penggunaan Browser dan Penggunaan Komputer.
Penalaran visual sangat penting dalam rilis ini: Z.ai melatih model untuk memeriksa antarmuka yang dirender, gameplay, dan keluaran 3D, kemudian menilai dan merevisi karyanya sendiri dari umpan balik visual. Pendekatan yang sama juga diterapkan pada dokumen, spreadsheet, presentasi, dan dasbor – yang merupakan artefak penting dari pekerjaan kantor, yang mana pesaing Qwen yang merilisnya pada hari yang sama juga mengklaim keuntungan terbesarnya.
Keputusan open-weight sangat penting bagi ekosistem selain bagi para penghobi. Lisensi MIT adalah lisensi umum yang paling permisif dalam AI: penggunaan komersial, modifikasi, dan redistribusi tidak memiliki kewajiban copyleft. Host independen dapat menyajikan GLM-5.3-Flash pada perangkat keras mereka sendiri, menyempurnakannya untuk vertikal mulai dari tinjauan hukum hingga otomasi industri, dan menanamkannya dalam produk tanpa menegosiasikan persyaratan — sebuah opsi yang tidak dapat dilakukan oleh model frontier khusus API.
Mengapa peluncuran diam-diam berhasil
Peluncuran anonim memberi Z.ai sesuatu yang tidak dapat dibeli oleh anggaran pemasaran: validasi tanpa merek. Para pengembang mengadopsi Ox Alpha berdasarkan keunggulannya, tanpa membingkai laboratorium Tiongkok versus petahana Amerika. Pada saat Bloomberg mengonfirmasi Z.AI sebagai pembuatnya dan Business Insider menyatakan "misteri terpecahkan", model tersebut telah menduduki puncak papan peringkat komunitas di posisi netral.
Tekanan kompetitif kini terlihat jelas. Model multimodal dengan konteks satu juta token, bobot berlisensi MIT, dan penetapan harga keluaran di bawah dolar memaksa setiap petahana untuk membenarkan daftar harganya. Batasan Pareto untuk harga versus kinerja – yang sebenarnya dirasakan oleh pengembang trade-off – telah digambar ulang, seperti yang ditulis oleh komentator AI Andrew Curran di X.
Pertanyaan yang belum terjawab adalah daya tahannya: apakah produk benchmark dapat bertahan dalam penggunaan di dunia nyata, dan seberapa cepat laboratorium Barat merespons harga. Apa pun yang terjadi, minggu spekulasi anonim berakhir dengan model bernama, anak timbangan yang dapat diunduh, dan armada layanan yang tidak menggunakan silikon Amerika.
---
Tetap Terdepan dalam AIDapatkan berita, analisis, dan terobosan AI terkini — semuanya di satu tempat.
Baca berita AI selengkapnya →