Uygulama güvenliği firması Semgrep'in yeni bir kıyaslaması beklenmedik bir sonuç verdi: Çin'in Zhipu AI şirketinin açık ağırlıklı modeli, yazılımdaki gerçek güvenlik kusurlarını bulma konusunda Anthropic'in Claude'undan daha iyi performans gösterdi. Bu bulgu, en yetenekli yapay zekanın mutlaka en pahalı mı yoksa en kısıtlı mı olduğu konusundaki tartışmayı alevlendiriyor.
Anthropic'in güçlü Mythos modeli ABD'deki ihracat yasağının arkasında kilitlenmişken, erişilebilir bir alternatif arayan güvenlik ekipleri, yapay zeka sektörüyle ilgili en son haberler için GLM 5.2 gibi açık ağırlıklı seçeneklere yöneliyor. Semgrep'in 22 Haziran'da yayınlanan testi, avın beklenenden daha erken sonuç verebileceğini gösteriyor.
Semgrep Neleri Test Etti?
Semgrep, dahili IDOR tespit kriterinde bir dizi açık ağırlık ve sınır modelini değerlendirdi. IDOR'lar - Güvenli Olmayan Doğrudan Nesne Referansları - bir kullanıcının başka bir kullanıcının verilerine erişmesine izin veren erişim kontrolü hatalarıdır. Geleneksel statik analizle bunları yakalamak oldukça zordur çünkü kusur sözdizimsel olmaktan çok mantıksaldır: kod teknik olarak geçerlidir ve yalnızca bir yetkilendirme kontrolünden yoksundur.
Şirket, kural tabanlı motorunu yapay zeka mantığıyla birleştirerek bu güvenlik açıklarını tespit etmeye yönelik bir iş akışı geliştiriyor. Modelin kendisinden ve etrafındaki iskeleden ne kadar performans geldiğini belirlemek için araştırmacılar, minimum donanımla bir dizi popüler açık ağırlıklı modeli çalıştırdılar; her modele verilen aynı IDOR istemini kullanan basit bir Pydantic kurulumu, uç nokta keşfi ve yönlendirmeli navigasyon olmadan. Bilgi istemi yalnızca temel bir arama stratejisi ve bir IDOR'un neye benzediğine dair birkaç ipucu sunuyordu - "kod burada, hataları bulun"dan biraz daha fazlası, ancak Semgrep'in tüm hattında çalışırken sınır kodlama aracılarının aldığından çok daha az.
IDOR'lar, geleneksel tarayıcıların çatlaklarından geçebildikleri için uygulama güvenliği ekipleri için kalıcı bir baş ağrısıdır. Kural tabanlı bir araç, eksik bir giriş kontrolünü işaretleyebilir, ancak belirli bir uç noktanın gerçekten başka bir kullanıcının verilerini açığa çıkarıp çıkarmadığını anlamak, uygulamanın iş mantığı hakkında akıl yürütmeyi gerektirir; bu, tam olarak büyük dil modellerinin giderek daha iyi hale geldiği türden bağlamsal muhakeme türüdür.
GLM 5.2 Liderlik Ediyor
Öne çıkan, Zhipu AI'nin açık ağırlık modeli olan GLM 5.2 idi. Basit bir komuttan başka hiçbir şey yapmadan, IDOR tespitinde %39 F1 puanı aldı ve Claude Code'un %32'lik puanını yedi tam puanla geride bıraktı. Semgrep'e göre açık ağırlıklı model, görevde Claude Opus 4.8'i de geride bırakarak test edilen en güçlü sınır dışı seçenek haline geldi.
Ekonomi de aynı derecede çarpıcıydı. GLM 5.2'nin fiyatlandırmasına göre çalıştırmanın maliyeti, bulunan güvenlik açığı başına yaklaşık 0,17 dolardır. Binlerce uç noktayı tarayabilen kuruluşlar için Semgrep, hata başına maliyetin genellikle bir tespit tekniğinin geniş ölçekte pratik olup olmadığı konusunda belirleyici faktör olduğunu belirtti.
Diğer açık sıklet yarışmacıları ise daha geride kaldı. MiniMax M3 %23 F1 puanı alırken Kimi K2.7 Code %22 puan aldı ve her ikisi de Claude Code'un çok altında kaldı. Semgrep, GLM 5.2'yi açık ağırlık kategorisi için temsili bir sonuçtan ziyade açık bir istisna olarak nitelendirdi.
Emniyet Kemeri Hala Önemli
Ham istem kategorisindeki açık ağırlık galibiyetine rağmen, Semgrep'in kendi amaca yönelik inşa edilmiş boru hattı genel olarak lider olmaya devam etti. Yapay zeka akıl yürütmeyi kural tabanlı algılama ve yapılandırılmış uç nokta sayımı ile birleştiren şirketin çok modlu kurulumu, yapılandırmaya bağlı olarak %53 ila %61 F1 elde etti. Bu boşluk araştırmacıların asıl sorusunun altını çiziyor: Modelin güvenlik açığı tespit performansı ne kadar ve etrafındaki mimari ne kadar?
Cevap "her ikisi de, ancak koşum takımının sanıldığından daha fazlası" gibi görünüyor. GLM 5.2, yetenekli bir modelin minimum destekle anlamlı işler yapabileceğini kanıtladı, ancak yine de sorun için özel olarak tasarlanmış bir sistemle eşleşemedi.
Araştırmacılar Paxton-Fear, Seth Jaksik, Brenden Noblitt ve Erik Buchanan'ın da dahil olduğu Semgrep ekibi, çıplak bir istem çalıştıran açık ağırlıklı bir modelin, muhakeme ağırlıklı bir güvenlik görevinde bir sınır kodlama aracısını geride bırakmasından "gerçekten şok olduklarını" söyledi.
Evdeki Mitoslar
Kriter mevcut jeopolitik zemine göre ilave ağırlık taşıyor. Blog yazısının başlığı - "Evimizde Mitoslarımız Var" - Anthropic'in siber güvenlik odaklı Mythos modelinin dünyanın büyük bir kısmında fiilen kullanılamadığı gerçeğine işaret ediyor. Trump yönetiminin ABD vatandaşı olmayanların Mythos'u ve onun kısıtlı kardeşi Fable 5'i kullanmasını yasaklamasının ardından, küresel güvenlik ekipleri, saldırı ve savunma güvenliği çalışmaları için yaygın olarak en yetenekli yapay zeka olarak kabul edilen şeye erişimi kaybetti.
Bu boşlukta erişilebilir açık ağırlıklı modeller boşluğu dolduruyor. Ücretsiz olarak indirilebilen ve her yere dağıtılabilen GLM 5.2'nin, belirli güvenlik görevlerinde halihazırda sınıra özel modellerle yarışabilmesi veya onları geçebilmesi, ihracat yasağının caydırıcı etkisinin amaçlanandan daha küçük olabileceğini gösteriyor. En iyi "sınırsız" model gelişmeye devam ederse, sınır yeteneklerini istiflemenin stratejik değeri azalır.
Şimdilik sonuç dar: Tek bir güvenlik açığı sınıfına ilişkin tek bir kıyaslama. Ancak bu, açık sınırın sanıldığından daha hızlı kapandığının ve yapay zeka güvenlik ortamında belirleyici değişkenin (ham yetenek değil) erişilebilirliğin olabileceğinin bir işaretidir.
Bu bulgu aynı zamanda sınır laboratuvarları için rahatsız edici soruları da gündeme getiriyor. Ücretsiz olarak kullanılabilen bir model, güvenlik muhakemesi görevlerinde halihazırda özel sistemlerle eşleşebiliyorsa, kapalı modellerin etrafındaki rekabet alanı daralır; özellikle de ihracat kontrolleri bu kapalı modelleri küresel pazarın birçok alanı için erişilemez hale getirdiğinde. Kullanım kısıtlamalarından etkilenmeyen açık ağırlıklı geliştiriciler, her yerde aynı anda yinelenebilir ve konuşlandırılabilir.
Yapay Zekanın Önünde Olun
Sınırdaki yapay zeka ile açık ağırlıklı yapay zeka arasındaki fark, son dakika yapay zeka haberleri ve güvenliği, altyapıyı ve politikayı yeniden şekillendiren araştırmalarda daralıyor.
Daha fazla AI haberini okuyun →


