Z.ai, syarikat kecerdasan buatan yang berpangkalan di Beijing yang juga dikenali sebagai Zhipu, telah mengeluarkan GLM-5.3, lelaran baharu model perdananya yang dikatakan syarikat itu sebagai sistem pemberat terbuka yang paling berkebolehan lagi untuk kejuruteraan perisian — dan yang telah membangunkan kemahiran keselamatan siber yang menggerunkan secara tidak dijangka. Diumumkan pada 14 Ogos dan diperincikan dalam catatan blog syarikat, GLM-5.3 dibina pada model asas kira-kira 700 bilion parameter yang sama seperti GLM-5.2 pendahulunya, dikeluarkan pada bulan Jun. Setiap penambahbaikan, kata syarikat itu, datang dari pasca latihan dan bukannya asas yang lebih besar. Keluaran ini adalah yang terbaru dalam gelombang model berat terbuka Cina yang bertujuan untuk mengatasi sistem tertutup daripada Anthropic dan OpenAI. Untuk penjejak model AI Buzz Wire, GLM-5.3 ialah isyarat jelas bahawa sempadan berat terbuka menutup jurang pengekodan lebih cepat daripada yang dijangkakan.
Keuntungan Dibina Sepenuhnya pada Selepas Latihan
Z.ai berterus terang tentang pendekatannya dengan GLM-5.3: "Penskalaan selepas latihan adalah semua yang kami lakukan." Syarikat itu menjalankan timbunan pembelajaran pengukuhan yang diperkenalkan dengan GLM-5.2 — termasuk IndexShare untuk pemprosesan konteks panjang yang cekap, SAO untuk pembelajaran pengukuhan pada tugas-tugas jangka panjang, dan rangka kerja sumber terbuka yang dipanggil lendir untuk latihan tak segerak berskala besar. Sepanjang bulan lalu ia hanya menuangkan lebih banyak persekitaran, lebih banyak tugasan yang pelbagai dan lebih banyak pengiraan ke dalam timbunan itu.
Hasilnya muncul merentas penanda aras pengekodan. Pada Bangku Terminal 3.0, GLM-5.3 melonjak daripada skor GLM-5.2 iaitu 4.6 kepada 28.3 — peningkatan lebih daripada enam kali ganda. Ia menyiarkan keputusan terkini sumber terbuka pada Terminal Bench 3.0 dan pada Peperiksaan Terakhir Ejen, dan bertambah baik daripada 23.8 kepada 28.5 pada ukuran keupayaan agenik ALE-CLI. Z.ai melaporkan peningkatan 50% berbanding GLM-5.2 pada Z.ai Code Bench dalaman, penanda aras persendirian yang direka untuk menilai ejen pengekodan dalam persekitaran pembangunan yang realistik dan mengurangkan risiko pencemaran daripada set ujian awam.
Yang penting, keuntungan datang dengan kecekapan token yang lebih baik, bukan hanya hasil yang lebih baik. Dengan usaha yang tinggi, GLM-5.3 mencapai 31.4% penyiapan pada penanda aras dalaman pada kira-kira 50,000 token keluaran setiap tugas, yang Z.ai katakan mengatasi Claude Opus 4.8 Anthropic pada 29.5% dengan 120,000 token. GLM-5.3 masih mengikuti Claude Fable 5 Anthropic yang lebih maju, yang mencapai 39.5% pada usaha maksimum.
Lonjakan Tidak Dijangka dalam Keupayaan Siber
Hasil yang paling menarik daripada GLM-5.3 bukan dalam pengekodan tetapi dalam keselamatan. Memandangkan Z.ai meningkatkan skala pasca latihan dan memperkenalkan data dan persekitaran penemuan kerentanan ke dalam campuran latihan, ia menjangkakan model itu akan bertambah baik dalam mencari dan membuat alasan tentang kelemahan. Apa yang mengejutkan pasukan ialah betapa cepatnya keupayaan itu berkembang.
GLM-5.3 bukan sahaja menjadi lebih baik dalam mengesan pepijat terpencil; ia mula membuat pertimbangan merentasi pelbagai peringkat eksploitasi, membentuk rancangan yang koheren untuk rantaian serangan yang lengkap. Pada CyberGym, penanda aras yang menguji sama ada model boleh mengenal pasti dan mengesahkan kelemahan daripada kod sumber kotak putih, GLM-5.3 mendapat markah 84.5%, meningkat daripada 77.2% GLM-5.2. Itu adalah keputusan terbaik pada penanda aras, mendahului Mythos 5 pada 83.8% dan GPT-5.6 Sol pada 83.6%. Pada ExploitBench, yang menuntut alasan yang lebih mendalam tentang kelemahan sebenar dan eksploitasinya, GLM-5.3 lebih daripada dua kali ganda markah GLM-5.2, mencapai 54.4% — walaupun ia kekal jauh di belakang Mythos 5 pada 78.0% dan GPT-5.6 Sol pada 76.5%.
Z.ai memerhatikan corak yang konsisten: semakin tinggi rantaian eksploitasi diletakkan penanda aras, semakin besar keuntungan berbanding GLM-5.2 — dan juga semakin lebar jurang yang tinggal ke sempadan tertutup. "Keupayaan berkembang paling cepat tepat di mana kita berada paling jauh di belakang," kata syarikat itu.
Penemuan Kerentanan Dunia Sebenar
Kemahiran siber tidak terhad kepada penanda aras. Z.ai melaporkan bahawa sejak GLM-5.2, ia telah bekerjasama dengan beberapa pasukan keselamatan di China untuk menguji modelnya terhadap pangkalan kod dunia sebenar. Selepas semakan pakar, penyaringan dan penyahduplikasian, model itu mengenal pasti 2,436 kelemahan merentas 269 projek, termasuk 1,097 isu keterukan sederhana hingga tinggi. Penemuan ini merangkumi inti sistem, sistem pengendalian, enjin penyemak imbas, infrastruktur sumber terbuka, aplikasi web dan protokol rangkaian — kebanyakannya tidak disedari selama bertahun-tahun malah berdekad-dekad, dengan yang tertua sejak kira-kira 40 tahun.
Hasil tersebut bergema kerja yang telah diterangkan oleh Anthropic dalam penyelidikan keselamatan berbilang agennya sendiri, di mana kumpulan ejen yang diselaraskan digunakan untuk memburu kelemahan dalam perisian sumber terbuka secara berskala.
Berat Terbuka — Dengan Kelewatan
Z.ai berkata ia akan melepaskan pemberat GLM-5.3 dalam masa dua minggu, sebaik penilaian keselamatan dan pengerasan selesai. Kelewatan yang disengajakan itu mencerminkan ketegangan yang berlaku melalui pengumuman: model yang membangunkan keupayaan siber menyerang yang kuat dengan lebih pantas daripada jangkaan penciptanya adalah jenis sistem yang menimbulkan persoalan tentang pelepasan yang bertanggungjawab. Syarikat itu menekankan bahawa konsistensi pelancaran latihannya telah dipertingkatkan kepada tahap ketepatan berangka yang tinggi, dan bahawa banyak kesukaran dalam penskalaan telah beralih daripada model itu sendiri kepada reka bentuk persekitaran tugas yang realistik dan boleh disahkan.
Gambaran persaingan adalah jelas. GLM-5.3 mengecilkan jarak ke sempadan tertutup pada tugas pengekodan dan agen sambil menuntut petunjuk langsung pada sekurang-kurangnya satu penanda aras penemuan kerentanan utama. Ia melakukannya sebagai model pemberat terbuka — bermakna, setelah dikeluarkan, pemberat akan tersedia secara percuma untuk dimuat turun, dipelajari dan dibina oleh sesiapa sahaja. Sama ada keterbukaan itu mempercepatkan kemajuan atau menimbulkan kebimbangan keselamatan baharu ialah perbahasan GLM-5.3 adalah semua tetapi dijamin untuk menyala semula.
Kekal Mendahului AI
Untuk keluaran model AI terbaharu, pertempuran penanda aras dan analisis industri, tandai halaman AI Buzz Wire.
Baca lebih banyak berita AI →