Makmal AI China Z.ai telah menerbitkan akaun teknikal terperinci tentang cara ia menetapkan model GLM untuk berfungsi memperbaik sistem yang menyediakan perkhidmatan kepada mereka, menerangkan "Ejen Infra" yang mencari dan membetulkan kesesakan prestasi dalam infrastruktur inferens syarikat dengan campur tangan manusia yang terhad.
Siaran blog itu, bertajuk "Ke Arah Pembaikan Kendiri Rekursif: Bagaimana GLM Membina Infrastruktur Inferens Sendiri," muncul di tapak syarikat pada hari Rabu dan dengan cepat menjadi salah satu cerita teknologi yang paling banyak dibincangkan di Hacker News, di mana ia memperoleh lebih daripada 200 mata daripada komuniti pembangun. For more context on this story, see our ongoing AI news.
"Ketika kami membangunkan GLM, model itu kadangkala mempamerkan keupayaan yang mengejutkan kami, malah meresahkan kami," tulis syarikat itu dalam baris pembukaan jawatan itu.
Daripada Penyelidikan Keselamatan Siber kepada Sistem Pengoptimuman Kendiri
Kerja ini dikesan kembali ke Oktober 2025, apabila Z.ai mula menyelidik cara mengukuhkan keupayaan keselamatan siber GLM. Alasannya, kata syarikat itu, adalah mudah: keselamatan siber ialah lanjutan semula jadi pengekodan, dan model yang boleh menavigasi pangkalan kod besar akhirnya boleh menavigasi kod sistem peringkat rendah yang kebanyakan jurutera mengelak.
Asas itu berkembang menjadi sesuatu yang lebih bercita-cita tinggi. Daripada menggunakan model semata-mata untuk menulis kod, Z.ai berusaha untuk menjawab soalan kejuruteraan sistem: bolehkah ejen AI bertanggungjawab ke atas prestasi timbunan inferens pengeluaran, lapisan penyelarasan perisian dan perkakasan yang menukar pemberat model kepada tindak balas yang pantas dan murah?
Jawapan syarikat itu melibatkan penyusunan semula masalah. Metrik hujung ke hujung sahaja, siaran itu berpendapat, tidak boleh membimbing ejen pengoptimuman. Laporan bahawa token masa-ke-pertama meningkat sebanyak 30 peratus atau output keluaran menurun sebanyak 20 peratus memberitahu ejen bahawa sesuatu menjadi lebih teruk, tetapi bukan lapisan mana yang bertanggungjawab, mengapa hipotesisnya gagal, atau perkara yang perlu diuji seterusnya.
"Bagaimanakah kita menukar hasil hujung ke hujung yang jarang menjadi maklum balas kejuruteraan yang terperinci dan boleh dikaitkan yang secara langsung membimbing tindakan seterusnya?" syarikat bertanya dalam jawatan itu, menerangkan soalan itu sebagai kunci kepada keseluruhan usaha.
Tiga Peraturan untuk Maklum Balas Boleh Dibaca Ejen
Jawapan Z.ai ialah satu disiplin maklum balas yang dibina atas tiga ciri. Pertama, maklum balas mestilah setempat yang mencukupi, terikat dengan parameter pelancaran enjin tertentu, perubahan kod, kernel, keadaan input, utas, selang pelaksanaan atau laluan kod, supaya ejen boleh mengecilkan skop sebarang masalah. Kedua, ia mestilah murah dan tepat pada masanya untuk mendapatkan: soalan yang boleh dijawab oleh ujian kernel atau penanda aras mikro tempatan tidak seharusnya memerlukan penggunaan perkhidmatan penuh. Ketiga, pengesahan harus sepadan dengan hipotesis semasa, dengan setiap eksperimen direka untuk menjawab soalan tertentu dan bukannya mengikut urutan tetap.
Syarikat itu berkata gelung maklum balas yang padat inilah yang membolehkan Ejen Infra berkelakuan kurang seperti autolengkap untuk jurutera dan lebih seperti rakan sekerja yang boleh menjalankan eksperimen semalaman.
Tiga Kajian Kes, Daripada Angka kepada Pepijat Threading
Siaran itu menelusuri tiga episod konkrit daripada pengoptimuman susunan perkhidmatan syarikat untuk GLM-5.3-Flash, model berat terbuka Z.ai yang dikeluarkan di bawah lesen MIT pada bulan Ogos.
Yang pertama melibatkan ketepatan. Oleh kerana pengoptimuman inferens merombak cara pengiraan diselaraskan, ejen perlu mengesahkan bahawa kernel menghasilkan hasil yang sama dalam keadaan terbahagi dan tidak terbahagi. Dalam satu kes, pasukan itu menggabungkan tiga operasi Teras Tensor TF32 untuk menghasilkan hasil ketepatan yang lebih tinggi, mengurangkan ralat berangka terkumpul sambil mengekalkan kebanyakan kelebihan prestasi Teras Tensor. Ujian perbandingan antara strategi pembahagian mendedahkan percanggahan yang mendorong pembetulan.
Yang kedua ialah cerita penyahpepijatan sistem yang akan terasa biasa kepada mana-mana jurutera prestasi. Kriteria penerimaan memerlukan penambahan pemindahan cache KV ke laluan penyajian tidak boleh merendahkan prestasi praisi lebih daripada 5 peratus di bawah beban kerja yang sama. Ejen itu mendapati jurang melebihi 20 peratus dalam beberapa senario, yang mengecilkan penyiasatan kepada kelakuan serentak pemindahan KV itu sendiri. Meneliti garis masa pelaksanaan, ejen mengenal pasti anomali: dalam senario masalah, pelaksanaan pemindahan KV sisi Python tidak pernah bertindih dengan selang penghantaran dan gabungan perpustakaan komunikasi DeepEP. Penyelesaiannya adalah untuk melepaskan kunci penterjemah global Python semasa selang pelaksanaan C++ yang berkaitan, membenarkan benang pemindahan yang menyajikan Mooncake, kedai cache KV, untuk meneruskan selari dengan pengiraan. Jurang prestasi kemudiannya jatuh dalam ambang penerimaan.
Episod ketiga menunjukkan penalaan kernel berulang. Memperkenalkan ReplaySSM, teknik yang memperdagangkan pengiraan untuk ingatan, pada mulanya meningkatkan masa pelaksanaan kernel penyahkod KDA. Pengoptimuman bahagian ejen kemudian mengurangkan masa pelaksanaan kernel sebanyak 9.6 peratus. Selepas menerima maklum balas bahawa pengiraan kekal sebagai hambatan utama, ejen mendapati pelaksanaan asal berjubin di sepanjang dimensi V, menyebabkan normalisasi FP32 yang sama dan pengiraan gating diulang tanpa perlu.
Tindanan Di Belakang GLM-5.3-Flash
Pengoptimuman terletak di atas seni bina penyajian agresif yang Z.ai huraikan dalam siaran: selari tensor intra-nod untuk perhatian linear dan kepala model bahasa, perdagangan pengiraan-untuk-ingatan ReplaySSM, pengkuantitian W8A8, pengkuantitian cache ketepatan bercampur menggunakan format INT8, FP8 dan BF16, skema binaan kod Pengisian Layer Degregate dan BF16. yang menjalankan peringkat penyajian pada sumber yang berasingan.
Syarikat membingkai pengumpulan teknik ini, ditemui dan disahkan sebahagian besarnya oleh ejen itu sendiri, sebagai langkah ke arah peningkatan diri secara rekursif: Sistem AI meningkatkan infrastruktur yang menjadikannya lebih pantas dan lebih murah untuk dijalankan, yang seterusnya menjadikan pusingan seterusnya penambahbaikan didorong ejen lebih berpatutan.
Mengapa Ia Penting
Kos inferens ialah salah satu ekonomi penentu industri AI. Makmal yang boleh menyediakan model kelas sempadan pada kos yang lebih rendah bagi setiap token boleh menetapkan harga secara agresif, memberi subsidi kepada ejen yang membuat beribu-ribu panggilan setiap tugas dan membiayai latihan lanjutan daripada menyampaikan hasil. Z.ai sangat agresif dalam ketiga-tiga bidang, dan pendedahan kewangan interim syarikat pada awal tahun ini menunjukkan hasil berkembang dengan mendadak walaupun kerugian mengecil.
Siaran itu juga merupakan isyarat tentang arah tuju kejuruteraan sisi makmal. Pembahagian kerja tradisional, dengan jurutera prestasi manusia menala kernel dan penjadual sementara model mengendalikan permintaan pengguna, digantikan di Z.ai dengan gelung di mana model mencadangkan perubahan, eksperimen murah mengesahkannya dan maklum balas padat mengarahkan percubaan seterusnya.
Tuntutan peningkatan diri autonomi sepenuhnya harus dibaca dengan berhati-hati. Jawatan itu sendiri menjelaskan bahawa jurutera manusia menentukan senario ujian, menetapkan kriteria penerimaan dan membina persekitaran maklum balas yang dikendalikan oleh ejen. Apa yang diterangkan oleh syarikat ialah automasi gelung pengoptimuman yang mempunyai instrumen yang baik, bukan sistem tanpa pengawasan yang mereka bentuk semula dirinya.
Walaupun begitu, hala tujunya jelas. Jika ekonomi AI dalam beberapa tahun akan datang diputuskan oleh siapa yang boleh memberikan perkhidmatan perisikan paling murah, makmal yang mengajar model mereka untuk mengoptimumkan infrastruktur mereka sendiri mungkin menetapkan kadarnya, dan Z.ai mahu industri mengetahui ia berhasrat untuk menjadi salah satu daripadanya.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →