Pekin merkezli yapay zeka şirketi Zhipu olarak da bilinen Z.ai, şirketin yazılım mühendisliği için şimdiye kadarki en yetenekli açık ağırlık sistemi olduğunu söylediği amiral gemisi modelinin yeni bir versiyonu olan ve beklenmedik bir şekilde müthiş siber güvenlik becerileri geliştiren GLM-5.3'ü piyasaya sürdü. 14 Ağustos'ta duyurulan ve şirket blog yazısında ayrıntılı olarak açıklanan GLM-5.3, Haziran ayında piyasaya sürülen selefi GLM-5.2 ile aynı yaklaşık 700 milyar parametreli temel model üzerine inşa edildi. Şirket, her gelişmenin daha büyük bir temelden ziyade eğitim sonrası geldiğini söylüyor. Bu sürüm, Anthropic ve OpenAI'nin kapalı sistemlerini geride bırakmayı amaçlayan Çin açık ağırlıklı model dalgasının en sonuncusu. AI Buzz Wire model takipçisi için GLM-5.3, açık ağırlık sınırının kodlama açığını beklenenden daha hızlı kapattığının açık bir sinyalidir.
Kazanımlar Tamamen Eğitim Sonrasına Bağlıdır
Za.ai, GLM-5.3'e yaklaşımı konusunda açık sözlü: "Yaptığımız tek şey eğitim sonrası ölçeklendirmeydi." Şirket, verimli uzun bağlam işleme için IndexShare, uzun ufuklu görevlerde takviye öğrenimi için SAO ve büyük ölçekli asenkron eğitim için slime adı verilen açık kaynaklı bir çerçeve dahil olmak üzere, GLM-5.2 ile tanıttığı takviyeli öğrenme yığınını sürdürdü. Geçen ay bu yığına daha fazla ortam, daha çeşitli görevler ve daha fazla bilgi işlem döküldü.
Kazanç, kodlama kriterlerinde ortaya çıkıyor. Terminal Bench 3.0'da GLM-5.3, GLM-5.2'nin 4,6'lık skorundan 28,3'e yükseldi; bu altı kattan fazla bir gelişme. Terminal Bench 3.0'da ve Temsilcilerin Son Sınavında açık kaynaklı, son teknoloji ürünü sonuçlar yayınlıyor ve ALE-CLI aracılık yeteneği ölçüsünde 23,8'den 28,5'e yükseliyor. Z.ai, kodlama aracılarını gerçekçi geliştirme ortamlarında değerlendirmek ve halka açık test setlerinden kaynaklanan kirlenme riskini azaltmak için tasarlanmış özel bir kıyaslama olan şirket içi Z.ai Code Bench'te GLM-5.2'ye göre %50'lik bir iyileşme bildirdi.
En önemlisi, kazanımlar yalnızca daha iyi sonuçlarla değil, daha iyi token verimliliğiyle de geliyor. Yüksek çabayla, GLM-5.3 şirket içi kıyaslamada görev başına yaklaşık 50.000 çıkış tokenıyla %31,4 tamamlanma oranına ulaşıyor; Z.ai, bunun 120.000 token ile Anthropic'in Claude Opus 4.8'ini %29,5 ile geride bıraktığını söylüyor. GLM-5.3 hâlâ Anthropic'in daha gelişmiş Claude Fable 5'ini takip ediyor ve maksimum çabayla %39,5'e ulaşıyor.
Siber Yetenekte Beklenmedik Bir Atılım
GLM-5.3'ün en çarpıcı sonucu kodlamada değil güvenlikte oldu. Z.ai eğitim sonrası ölçeklendirip güvenlik açığı keşfetme verilerini ve ortamlarını eğitim karışımına dahil ettikçe modelin kusurları bulma ve bunlar hakkında mantık yürütme konusunda gelişmesini bekliyordu. Ekibi şaşırtan şey bu yeteneğin ne kadar hızlı geliştiğiydi.
GLM-5.3 yalnızca izole hataları tespit etmede daha iyi hale gelmekle kalmadı; tam saldırı zincirleri için tutarlı planlar oluşturarak, sömürünün birden fazla aşaması boyunca akıl yürütmeye başladı. Bir modelin beyaz kutu kaynak kodundan güvenlik açıklarını tanımlayıp doğrulayıp doğrulayamayacağını test eden bir kıyaslama olan CyberGym'de, GLM-5.2'nin %77,2'sinden GLM-5.3 %84,5 puan aldı. Bu, %83,8 ile Mythos 5 ve %83,6 ile GPT-5.6 Sol'un önünde, kıyaslamadaki en iyi sonuçtur. GLM-5.3, gerçek güvenlik açıkları ve bunların kullanımı hakkında daha derin akıl yürütme gerektiren ExploitBench'te GLM-5.2'nin puanını iki katından fazla artırarak %54,4'e ulaştı; ancak %78,0 ile Mythos 5'in ve %76,5 ile GPT-5.6 Sol'un oldukça gerisinde kaldı.
Za.ai tutarlı bir model gözlemliyor: Bir kıyaslama kullanım zincirinde ne kadar yukarıya çıkarsa, GLM-5.2'ye göre kazanç da o kadar büyük olur ve ayrıca kapalı sınırla kalan boşluk da o kadar geniş olur. Şirket, "Yetenek tam olarak bizim en geride olduğumuz noktada en hızlı şekilde büyüyor" diye belirtiyor.
Gerçek Dünyadaki Güvenlik Açığı Keşifleri
Siber beceriler kıyaslamalarla sınırlı değildir. Z.ai, GLM-5.2'den bu yana modellerini gerçek dünyadaki kod tabanlarına karşı test etmek için Çin'deki çeşitli güvenlik ekipleriyle birlikte çalıştığını bildirdi. Uzman incelemesi, tarama ve veri tekilleştirme sonrasında model, 1.097 orta ila yüksek önem derecesine sahip sorun dahil olmak üzere 269 projede 2.436 güvenlik açığı tespit etti. Bulgular sistem çekirdeklerini, işletim sistemlerini, tarayıcı motorlarını, açık kaynak altyapısını, web uygulamalarını ve ağ protokollerini kapsıyor; bunların çoğu yıllardır, hatta onlarca yıldır gözden kaçmış durumda ve en eskisi yaklaşık 40 yıl öncesine dayanıyor.
Bu sonuçlar, Anthropic'in kendi çok aracılı güvenlik araştırmasında açıkladığı, açık kaynaklı yazılımdaki güvenlik açıklarını geniş ölçekte avlamak için koordineli aracı sürülerinin kullanıldığı çalışmayı yansıtıyor.
Açık Ağırlıklar — Gecikmeli
Za.ai, güvenlik değerlendirmesi ve sertleştirme tamamlandıktan sonra GLM-5.3 ağırlıklarını iki hafta içinde yayınlayacağını söyledi. Bu kasıtlı gecikme, duyuru boyunca devam eden gerilimi yansıtıyor: Güçlü saldırı siber yeteneklerini yaratıcılarının beklediğinden daha hızlı geliştiren bir model, tam olarak sorumlu serbest bırakma konusunda soruları gündeme getiren türden bir sistemdir. Şirket, eğitim-kullanıma sunma tutarlılığının yüksek derecede sayısal kesinliğe yükseltildiğini ve ölçeklendirmedeki zorluğun çoğunun modelin kendisinden gerçekçi, doğrulanabilir görev ortamlarının tasarımına kaydığını vurguluyor.
Rekabetçi tablo net. GLM-5.3, kodlama ve ajansal görevlerde kapalı sınırlara olan mesafeyi daraltırken, en az bir önemli güvenlik açığı keşif kriterinde açık bir liderlik iddiasında bulunuyor. Bunu açık ağırlık modeli olarak yapıyor; yani piyasaya sürüldükten sonra ağırlıklar herkesin indirmesi, çalışması ve üzerine geliştirme yapması için ücretsiz olarak mevcut olacak. Bu açıklığın ilerlemeyi hızlandırıp hızlandırmayacağı veya yeni güvenlik kaygıları doğurup doğurmayacağı, GLM-5.3'ün yeniden alevlenmesi kesin olan bir tartışmadır.
Yapay Zekanın Önünde Kalın
En yeni AI modeli sürümleri, karşılaştırmalı savaşlar ve sektör analizleri için AI Buzz Wire'a yer işareti koyun.
Daha fazla AI haberini okuyun →