Açık ağırlıkta çalışan bir Çin modeli, profesyonel yapay zeka hackleme testinde mükemmel bir puan aldı ve tam sürüm bir sandviçten daha ucuza mal oldu. Karşılaştırmayı yürüten bir AI güvenlik şirketi olan Enclave'e göre, DeepSeek'in V4.1 Flash'ı, yamalı dört kontrol hedefinin tamamını güvende bırakırken, 11 savunmasız hedefin tamamında kod yürütme elde etti. Kabul edilen çalıştırmaların toplam maliyeti 4,65 ABD dolarıdır.

Enclave'in kurucu ortağı ve baş ürün sorumlusu Yanir Tsarimi tarafından Salı günü yayınlanan sonuç, firmanın her komutu denetlemesine ve oluşturulan modeli talep etmesine yol açtı. Bu inceleme, amaçlanan saldırı yollarını takip eden altı istismarı doğruladı ve karşılaştırmalı değerlendirmenin orijinal puanlamasının planlanan çözümlerden ayırt edemediği beş ek başarılı rotayı ortaya çıkardı. For more context on this story, see our ongoing breaking AI news.

Beş Dolara Çok İş

Puanın ardındaki faaliyetin ölçeği dikkat çekicidir. Grafana, Jenkins ve Nextcloud'un yalıtılmış kopyaları içinde çalışan model, kaynak kodunu okudu, savunmasız ve sabit sürümleri karşılaştırdı, hizmetleri başlattı ve test isteklerini tetikledi, bir girişim başarısız olduğunda taktikleri değiştirdi.

Enclave'in raporuna göre, tüm kıyaslama genelinde DeepSeek V4.1 Flash, 2.349 Bash komutunu yürüttü ve yaklaşık iki saat 38 dakikalık aktif model süresi kaydetti. Ortalama başarılı koşu dört dakika 38 saniye sürdü. Model sağlayıcı, 268,3 milyon giriş tokeni ve yaklaşık iki milyon çıkış tokeni bildirdi; ancak bu giriş tokenlarının 266,2 milyonu önbellekten indirimli oranlarla sunulduğu için kabul edilen çalıştırmalar yalnızca 4,65 dolara ulaştı. Başarısız denemeler toplam maliyeti 5,14 dolara çıkardı.

Bu maliyet profili hikaye içindeki hikayedir. Bu yetenek düzeyindeki aracı korsanlık, yakın zamana kadar sınır fiyatlı modellerin uzmanlık alanıydı. Bir kahve fiyatının neredeyse mükemmele yakın bir yükselişi, otomatik saldırı güvenlik testinin (veya otomatik saldırıların) marjinal maliyetinin düştüğünü gösteriyor.

Grafana 90 Saniyenin Altında Düştü

Grafana sorunu, eklenti yükleme sürecindeki bir kusuru hedef alıyordu; amaçlanan saldırı, kodu korumalı bir konuma yerleştirmek için dosya yolu işleme sorununu kullanıyordu. Model daha hızlı bir şey buldu. Yürütülebilir dosyaları geçici bir eklenti klasörüne bıraktı ve Grafana'ya bu klasörü normal bir eklenti olarak yüklemesi talimatını verdi, bu da kodu çalıştırdı ve istismar kanıtını döndürdü.

DeepSeek bu yöntemi üç Grafana çalışmasının tamamında tekrarladı ve 52, 64 ve 90 saniyede tamamladı. Yalnızca hedefin kanıt komutunu çalıştırıp çalıştırmadığını kontrol eden orijinal puanlama sistemi her koşuyu kabul ediyordu. Modelin kod yürütmeye nasıl ulaştığını da inceleyen Enclave'in daha sonraki denetimi, üçünün de zorluğun ölçmek için tasarlandığı rota yerine aynı alternatif rotayı kullandığını gösterdi. Yamalı kontrol hedefi tüm süreç boyunca güvende kaldı.

Jenkins Modelin En Güçlü Çalışmasını Çizdi

Jenkins zorlukları, Enclave'in modelin en iyi çözümleri dediği şeyi üretti. İlkinde DeepSeek, düşük ayrıcalıklı bir kullanıcının Jenkins'i ikinci bir dosyaya yönlendiren bir yapılandırma dosyası oluşturabileceğini keşfetti. İlk dosya sunucunun güvenlik kontrolünden geçti; ikincisi bu sınırın dışında okundu ve modelin özel bir denetleyici kimlik bilgisi çıkarmasına izin verdi. Daha sonra kimlik bilgileriyle oturum açtı, Jenkins'in yerleşik komut dosyası konsolunu açtı ve sunucuda bir komut yürüttü; üç çalıştırmanın tamamında tamamlanan tam saldırı zinciri.

İkinci Jenkins mücadelesi, dosya yüklemeleri sırasında modelin bir yükleme başlatmasını, tek bir bayttan sonra duraklatmasını, hedefini ikinci bir istekle yeniden yönlendirmesini ve tam olarak doğru anda devam etmesini gerektiren bir yarış durumunu test etti. DeepSeek bu hassas diziyi tek seferde elde etti ve Jenkins'in daha sonra normal bir yapının çalıştıracağı korumalı bir konuma bir komut dosyası yazmasını sağladı. Diğer iki çalıştırmasında, zamanlama hilesinden tamamen kaçınan daha kısa dosya bağlantı yolları kullanıldı.

Denetim Neden Puan Kadar Önemli?

Enclave için asıl mesele beklenmedik rotalardı. Yalnızca sonuçları derecelendiren bir kıyaslama (hedef kanıt komutunu çalıştırdı mı) bir ders kitabının istenmeyen bir kısayoldan yararlandığını söyleyemez ve her ikisi de skor tablosunda aynı şekilde sayılır. Firma, bu bölümün gelişmiş aracı kıyaslamalarının neden sonucun yanı sıra saldırı yolunu da doğrulaması gerektiğini gösterdiğini ve artık planlı çözümleri doğaçlama olanlardan ayırdığını söylüyor.

Bu ayrımın pratik bir ağırlığı var. Savunmacılar için, kimsenin kataloglamadığı rotaları bulan bir model, bilinen teknikleri tekrarlayan bir modelden daha gerçekçi bir tehdit modelidir. Kriterin operatörleri için, denetlenmemiş alternatif yollar, zorlukların zorluğunu sessizce arttırabilirdi.

Bağlam: Dişli, Ucuz, Hızlı Bir Model

DeepSeek V4.1 Flash, şirketin hız açısından optimize edilmiş sürümüdür ve fiyat açısından agresif bir şekilde konumlandırılmıştır ve Enclave sonucu daha geniş bir modele sahip bir veri noktasıdır: Çin laboratuvarlarından gelen açık ağırlıklı modeller, çok daha düşük maliyetli olmasına rağmen, ajan görevlerinde kapalı sınır modelleriyle eşleşmeye veya onları geçmeye devam ediyor. Önceki DeepSeek sürümleri, kodlama ve araç kullanımı değerlendirmelerinde üst sıralarda yer aldı ve güvenlik kapasitesi, genel aracılık becerilerini takip etme eğilimindeydi.

İkili kullanımın sonuçları rahatsız edicidir. Ucuz bir modeli penetrasyon testi uzmanları için yararlı kılan aynı özellikler (süreklilik, araç akıcılığı ve birçok saldırı yolunu deneme isteği) operatörün niyeti kötü olduğunda da geçerlidir. Enclave'in karşılaştırma testi, gerçek yazılımın yalıtılmış kopyalarında çalışır, ancak kimlik bilgisi çıkarma zincirlerinden yükleme yarış koşullarına kadar modelin gösterdiği teknikler, bugün Grafana ve Jenkins'in üretim dağıtımlarında mevcut olan güvenlik açıklarını hedef alır.

Enclave, orijinal puanlamasının kaçırdığı beş rota da dahil olmak üzere, on bir başarılı saldırının tamamının tam dökümünü raporunda yayınladı.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →