Laboratorium AI Cina Z.ai wis nerbitake akun teknis sing rinci babagan cara nyetel model GLM supaya bisa ningkatake sistem sing digunakake, nggambarake "Agen Infra" sing nemokake lan ndandani kemacetan kinerja ing infrastruktur inferensi perusahaan kanthi campur tangan manungsa sing winates.
Posting blog, kanthi judhul "Menuju Perbaikan Diri Rekursif: Kepiye GLM Nggawe Infrastruktur Inferensi Sendiri," munggah ing situs perusahaan nalika Rebo lan cepet dadi salah sawijining crita teknologi sing paling dibahas ing Hacker News, ing ngendi dheweke entuk luwih saka 200 poin saka komunitas pangembang. For more context on this story, see our ongoing latest AI developments.
"Nalika ngembangake GLM, model kasebut kadhangkala nuduhake kemampuan sing nggumunake, lan malah ngganggu kita," tulis perusahaan kasebut ing baris pambuka.
Saka Riset Keamanan Siber nganti Sistem Ngoptimalake Diri
Pakaryan kasebut wiwit Oktober 2025, nalika Z.ai miwiti riset babagan cara nguatake kemampuan keamanan siber GLM. Alasan kasebut, ujare perusahaan, langsung: cybersecurity minangka ekstensi alami saka coding, lan model sing bisa navigasi basis kode gedhe pungkasane bisa navigasi kode sistem tingkat rendah sing dihindari dening para insinyur.
Yayasan kasebut berkembang dadi luwih ambisius. Tinimbang nggunakake model mung kanggo nulis kode, Z.ai metu kanggo njawab pitakonan teknik sistem: apa agen AI bisa tanggung jawab kanggo kinerja tumpukan inferensi produksi, lapisan koordinasi piranti lunak lan hardware sing ngowahi bobot model dadi respon sing cepet lan murah?
Wangsulan perusahaan kalebu ngrampungake masalah kasebut. Metrik end-to-end piyambak, kiriman kasebut, ora bisa nuntun agen optimasi. A laporan sing wektu-kanggo-pisanan-token tambah dening 30 persen utawa output output dropped dening 20 persen ngandhani agen sing soko dadi Samsaya Awon, nanging ora lapisan kang tanggung jawab, kok hipotesis sawijining gagal, utawa apa test sabanjuré.
"Kepiye cara ngowahi asil pungkasan sing jarang dadi umpan balik teknik sing bisa ditrapake sing langsung nuntun tumindak sabanjure?" perusahaan takon ing kirim, njlèntrèhaké pitakonan minangka tombol kanggo kabeh gaweyan.
Telung Aturan kanggo Umpan Balik sing Bisa Diwaca Agen
Wangsulan Z.ai minangka disiplin umpan balik sing dibangun kanthi telung ciri. Kaping pisanan, umpan balik kudu cukup lokal, disambungake menyang paramèter peluncuran mesin tartamtu, owah-owahan kode, kernel, kondisi input, benang, interval eksekusi, utawa jalur kode, supaya agen bisa mbatesi ruang lingkup masalah apa wae. Kapindho, kudu murah lan pas wektune kanggo entuk: pitakonan sing bisa dijawab dening tes kernel utawa microbenchmark lokal ora mbutuhake panyebaran layanan lengkap. Katelu, validasi kudu cocog karo hipotesis saiki, kanthi saben eksperimen dirancang kanggo njawab pitakonan tartamtu tinimbang ngetutake urutan tetep.
Perusahaan kasebut ujar manawa loop umpan balik sing padhet iki ngidini Agen Infra tumindak kurang kaya autocomplete kanggo insinyur lan luwih kaya rekan kerja sing bisa nindakake eksperimen sewengi.
Telung Studi Kasus, Saka Numerik nganti Bug Utas
Kiriman kasebut ngliwati telung episode konkrit saka optimalisasi tumpukan porsi perusahaan kanggo GLM-5.3-Flash, model bobot mbukak Z.ai sing dirilis ing lisensi MIT ing wulan Agustus.
Pisanan kalebu bener. Amarga optimasi inferensi reshuffle carane komputasi paralel, agen perlu kanggo verifikasi sing kernels ngasilaken asil padha ing kahanan partisi lan unpartitioned. Ing sawijining kasus, tim nggabungake telung operasi Tensor Core TF32 kanggo ngasilake asil sing luwih tliti, nyuda kesalahan numerik akumulasi nalika ngreksa sebagian besar keuntungan kinerja Tensor Core. Pengujian komparatif ing antarane strategi pemisahan nuduhake bedo sing nyebabake perbaikan kasebut.
Kapindho yaiku crita sistem-debugging sing bakal akrab karo insinyur kinerja. Kriteria panrima dibutuhake yen nambahake transfer cache KV menyang jalur porsi ngirim ora ngrusak kinerja prefill luwih saka 5 persen ing beban kerja sing padha. Agen kasebut nemokake jurang kasebut ngluwihi 20 persen ing sawetara skenario, sing nyepetake investigasi menyang prilaku konkurensi transfer KV dhewe. Nliti garis wektu eksekusi, agen kasebut nemtokake anomali: ing skenario masalah, eksekusi transfer KV sisih Python ora nate tumpang tindih karo kiriman lan nggabungake interval perpustakaan komunikasi DeepEP. Ndandani iki kanggo ngeculake kunci interpreter global Python sajrone interval eksekusi C ++ sing cocog, saéngga benang transfer sing nglayani Mooncake, toko cache KV, bisa ditindakake kanthi podo karo komputasi. Jurang kinerja banjur mudhun ing ambang ditampa.
Episode kaping telu nuduhake tuning kernel iteratif. Ngenalke ReplaySSM, teknik sing dagang komputasi kanggo memori, wiwitane nambah wektu eksekusi kernel decode KDA. Optimasi divisi agen banjur nyuda wektu eksekusi kernel nganti 9,6 persen. Sawise nampa umpan balik manawa komputasi tetep dadi kemacetan utama, agen kasebut nemokake implementasine asli kanthi jubin ing dimensi V, nyebabake normalisasi FP32 lan komputasi gating sing identik bola-bali ora perlu.
Tumpukan Konco GLM-5.3-Flash
Optimizations njagong ing ndhuwur arsitektur porsi agresif sing Z.ai njlèntrèhaké ing kirim: intra-simpul tensor paralelisme kanggo manungsa waé linear lan model basa sirah, ReplaySSM komputasi-kanggo-memori perdagangan, W8A8 kuantisasi, mixed-precision kuantisasi cache nggunakake INT8, FP8 lan BF16 format, lan Layer-Split kode arsitèktur, lan Layer Split Code. sing mbukak tataran porsi ing sumber daya kapisah.
Perusahaan kasebut nglumpukake akumulasi teknik kasebut, ditemokake lan divalidasi umume dening agen kasebut, minangka langkah kanggo perbaikan diri rekursif: Sistem AI nambah infrastruktur sing nggawe luwih cepet lan luwih murah kanggo mbukak, sing banjur nggawe dandan sing didorong agen sabanjure luwih terjangkau.
Apa Sing Penting
Biaya inferensi minangka salah sawijining ekonomi sing nemtokake industri AI. Lab sing bisa ngladeni model kelas perbatasan kanthi biaya sing luwih murah saben token bisa menehi rega kanthi agresif, menehi subsidi marang agen sing nggawe ewonan telpon saben tugas, lan mbiayai latihan luwih lanjut saka porsi revenue. Z.ai wis agresif banget ing kabeh telung ngarep, lan pambocoran finansial interim perusahaan ing awal taun iki nuduhake revenue saya tambah akeh sanajan kerugian saya sithik.
Kiriman kasebut uga minangka sinyal babagan arah teknik laboratorium. Divisi tenaga kerja tradisional, kanthi insinyur kinerja manungsa nyetel kernel lan penjadwal nalika model nangani panjalukan pangguna, diganti ing Z.ai kanthi daur ulang model kasebut ngusulake owah-owahan, eksperimen murah ngesyahke, lan umpan balik sing padhet ngarahake upaya sabanjure.
Tuntutan babagan perbaikan diri kanthi otonom kudu diwaca kanthi ati-ati. Kiriman kasebut dhewe nerangake manawa insinyur manungsa nemtokake skenario tes, nyetel kritéria sing ditampa, lan mbangun lingkungan umpan balik sing digunakake dening agen kasebut. Sing diterangake perusahaan yaiku otomatisasi loop optimasi sing apik, dudu sistem sing ora diawasi sing ngrancang maneh dhewe.
Sanadyan mangkono, arahe wis cetha. Yen ekonomi AI ing sawetara taun sabanjure diputusake dening sapa sing bisa nglayani intelijen sing paling murah, laboratorium sing ngajarake model kanggo ngoptimalake infrastruktur dhewe bisa nyetel jangkah, lan Z.ai pengin industri ngerti yen arep dadi salah sijine.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →