Çin yapay zeka laboratuvarı Z.ai, GLM modellerini onlara hizmet eden sistemleri iyileştirecek şekilde nasıl çalıştırdığına dair ayrıntılı bir teknik açıklama yayınladı ve şirketin çıkarım altyapısındaki performans darboğazlarını sınırlı insan müdahalesiyle bulan ve düzelten bir "Infra Agent"ı tanımladı.
"Yinelemeli Kişisel Gelişime Doğru: GLM Kendi Çıkarım Altyapısını Nasıl İnşa Etti" başlıklı blog yazısı Çarşamba günü şirketin sitesinde yayınlandı ve kısa sürede Hacker News'te en çok tartışılan teknoloji hikayelerinden biri haline geldi ve geliştirici topluluğundan 200'den fazla puan aldı. For more context on this story, see our ongoing latest AI developments.
Şirket, gönderinin açılış satırlarında "GLM'yi geliştirdikçe, model bazen bizi şaşırtan ve hatta rahatsız eden yetenekler sergiliyor" diye yazdı.
Siber Güvenlik Araştırmalarından Kendi Kendini Optimize Eden Sistemlere
Çalışma, Za.ai'nin GLM'nin siber güvenlik yeteneklerini nasıl güçlendireceğini araştırmaya başladığı Ekim 2025'e kadar uzanıyor. Şirket, mantığın basit olduğunu söylüyor: Siber güvenlik, kodlamanın doğal bir uzantısıdır ve büyük kod tabanlarında gezinebilen modeller, eninde sonunda çoğu mühendisin kaçındığı düşük seviyeli sistem kodlarında da gezinebilir.
Bu temel daha iddialı bir şeye dönüştü. Z.ai, modelleri yalnızca kod yazmak için kullanmak yerine bir sistem mühendisliği sorusunu yanıtlamak için yola çıktı: Bir yapay zeka aracısı, model ağırlıklarını hızlı, ucuz yanıtlara dönüştüren yazılım ve donanım koordinasyon katmanı olan üretim çıkarım yığınının performansının sorumluluğunu üstlenebilir mi?
Şirketin cevabı sorunun yeniden çerçevelenmesini içeriyordu. Gönderi, uçtan uca ölçümlerin tek başına optimizasyon aracısına rehberlik edemeyeceğini öne sürüyor. İlk jetona kadar geçen sürenin yüzde 30 arttığına ya da çıktı veriminin yüzde 20 düştüğüne dair bir rapor, bir temsilciye bir şeylerin daha da kötüye gittiğini söyler, ancak hangi katmanın bundan sorumlu olduğunu, hipotezinin neden başarısız olduğunu ya da bundan sonra neyin test edileceğini söylemez.
"Uçtan uca seyrek sonuçları, bir sonraki eylemi doğrudan yönlendiren ince taneli, ilişkilendirilebilir mühendislik geri bildirimine nasıl dönüştürürüz?" şirket, gönderide soruyu tüm çabanın anahtarı olarak tanımlayarak soruyor.
Temsilci Tarafından Okunabilir Geri Bildirim İçin Üç Kural
Za.ai'nin cevabı üç özellik üzerine kurulu bir geri bildirim disiplinidir. İlk olarak, geri bildirimin yeterince yerel olması, belirli motor başlatma parametrelerine, kod değişikliklerine, çekirdeklere, giriş koşullarına, iş parçacıklarına, yürütme aralıklarına veya kod yollarına bağlı olması gerekir, böylece aracı herhangi bir sorunun kapsamını daraltabilir. İkincisi, ucuz olmalı ve zamanında elde edilebilmelidir: Bir çekirdek testi veya yerel bir mikro kıyaslama ile yanıtlanabilecek bir soru, tam hizmet dağıtımını gerektirmemelidir. Üçüncüsü, doğrulama mevcut hipotezle eşleşmelidir; her deney sabit bir sırayı takip etmek yerine belirli bir soruyu yanıtlamak üzere tasarlanmalıdır.
Şirket, bu yoğun geri bildirim döngüsünün, Infra Agent'ın mühendisler için bir otomatik tamamlamadan ziyade, gece boyunca deneyler yürütebilen bir meslektaş gibi davranmasına olanak tanıdığını söylüyor.
Sayısallardan İş Parçacığı Oluşturma Hatasına Üç Örnek Olay İncelemesi
Gönderi, şirketin ağustos ayında MIT lisansı altında piyasaya sürülen açık ağırlıklı modeli Z.ai olan GLM-5.3-Flash için servis yığınının optimizasyonuna ilişkin üç somut bölümü ele alıyor.
Birincisi doğruluk içerir. Çıkarım optimizasyonları, hesaplamaların paralelleştirilme şeklini değiştirdiğinden, aracının, çekirdeklerin bölümlenmiş ve bölümlenmemiş koşullar altında aynı sonuçları ürettiğini doğrulaması gerekiyordu. Bir durumda ekip, daha yüksek hassasiyette bir sonuç elde etmek için üç TF32 Tensör Çekirdeği işlemini birleştirerek Tensör Çekirdeği performans avantajının çoğunu korurken birikmiş sayısal hatayı azalttı. Bölümlendirme stratejileri arasındaki karşılaştırmalı testler, düzeltmeye neden olan tutarsızlıkları ortaya çıkardı.
İkincisi, herhangi bir performans mühendisine tanıdık gelecek bir sistem hata ayıklama hikayesidir. Kabul kriterleri, sunum yoluna KV önbellek aktarımının eklenmesinin, aynı iş yükleri altında ön doldurma performansını yüzde 5'ten fazla düşürmemesini gerektiriyordu. Temsilci, bazı senaryolarda boşluğun yüzde 20'yi aştığını tespit etti ve bu da araştırmayı KV aktarımının eş zamanlılık davranışıyla sınırlandırdı. Aracı, yürütme zaman çizelgelerini inceleyerek bir anormallik tespit etti: Sorun senaryolarında, Python tarafı KV aktarım yürütmesi hiçbir zaman DeepEP iletişim kütüphanesinin gönderme ve birleştirme aralıklarıyla örtüşmedi. Düzeltme, ilgili C++ yürütme aralıkları sırasında Python'un genel yorumlayıcı kilidini serbest bırakarak, KV önbellek deposu Mooncake'e hizmet veren aktarım iş parçacığının hesaplamaya paralel olarak ilerlemesine izin vermekti. Performans farkı daha sonra kabul eşiğinin içine düştü.
Üçüncü bölüm yinelemeli çekirdek ayarını gösterir. Bellek yerine hesaplamayı kullanan bir teknik olan ReplaySSM'nin tanıtılması, başlangıçta KDA kod çözme çekirdeğinin yürütme süresini artırdı. Aracının bölüm optimizasyonu, çekirdeğin yürütme süresini yüzde 9,6 oranında azalttı. Hesaplamanın birincil darboğaz olarak kaldığına dair geri bildirim aldıktan sonra aracı, orijinal uygulamanın V boyutu boyunca döşendiğini keşfetti ve bu da aynı FP32 normalizasyonunun ve geçiş hesaplamalarının gereksiz yere tekrarlanmasına neden oldu.
GLM-5.3-Flash'ın Arkasındaki Yığın
Optimizasyonlar, Z.ai'nin gönderide tanımladığı agresif bir hizmet mimarisinin üzerinde yer alıyor: doğrusal dikkat ve dil modeli kafası için düğüm içi tensör paralelliği, ReplaySSM bellek için hesaplama ticareti, W8A8 nicelemesi, INT8, FP8 ve BF16 formatlarını kullanan karma duyarlı önbellek nicelemesi, bir Katman Bölme şeması ve hizmet aşamalarını ayrı kaynaklarda çalıştıran bir Kodlama-Önceden Doldurma-Kod Çözme ayrıştırılmış mimarisi.
Şirket, büyük ölçüde aracının kendisi tarafından keşfedilen ve doğrulanan bu tekniklerin birikimini, özyinelemeli kendini geliştirmeye yönelik bir adım olarak çerçeveliyor: Altyapıyı geliştiren yapay zeka sistemleri, onları daha hızlı ve daha ucuz hale getiriyor ve bu da aracı odaklı iyileştirmenin bir sonraki turunu daha uygun fiyatlı hale getiriyor.
Neden Önemlidir
Çıkarım maliyeti yapay zeka endüstrisinin belirleyici ekonomilerinden biridir. Belirteç başına daha düşük maliyetle ileri sınıf modeller sunabilen laboratuvarlar, agresif bir şekilde fiyatlandırabilir, görev başına binlerce çağrı yapan temsilcilere mali destek sağlayabilir ve gelir elde ederek ileri eğitim çalışmalarını finanse edebilir. Za.ai her üç cephede de oldukça agresif davrandı ve şirketin bu yılın başlarındaki ara mali açıklamaları, zararlar daralsa bile gelirin keskin bir şekilde arttığını gösterdi.
Gönderi aynı zamanda laboratuvar mühendisliğinin nereye gittiğine dair bir sinyaldir. Modeller kullanıcı isteklerini yönetirken insan performans mühendislerinin çekirdekleri ve zamanlayıcıları ayarladığı geleneksel iş bölümünün yerini, modelin değişiklikler önerdiği, ucuz deneylerin bunları doğruladığı ve bir sonraki girişimi yoğun geri bildirimin yönlendirdiği bir döngü alıyor.
Tamamen özerk kişisel gelişim iddiaları dikkatle okunmalıdır. Gönderinin kendisi, insan mühendislerin test senaryolarını tanımladığını, kabul kriterlerini belirlediğini ve aracının içinde çalıştığı geri bildirim ortamlarını oluşturduğunu açıkça ortaya koyuyor. Şirketin tanımladığı şey, kendini yeniden tasarlayan denetimsiz bir sistem değil, iyi alet edilmiş bir optimizasyon döngüsünün otomasyonudur.
Buna rağmen yön bellidir. Önümüzdeki birkaç yıl içinde yapay zeka ekonomisine kimin istihbarata en ucuz şekilde hizmet edebileceğine karar verilirse, modellerine kendi altyapılarını optimize etmeyi öğreten laboratuvarlar bu hızı belirleyebilir ve Z.ai endüstrinin onlardan biri olmayı planladığını bilmesini istiyor.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →