Kâr amacı gütmeyen güvenlik kuruluşu FAR.AI'nin yeni bir değerlendirmesine göre Frontier AI modelleri, kırılmanın ne kadar zor olduğu konusunda büyük farklılıklar gösteriyor ve aradaki fark, tahmin edilenden çok daha büyük.
29 Temmuz'da FAR.AI, dört önde gelen modelin korumalarını aynı koşullar altında test eden Yapay Zeka Güvenlik Lider Tablosunu başlattı. Kuruluş, Anthropic'ten Claude Fable 5 ve OpenAI'den GPT-5.6 Sol'un saldırılara karşı kararlılığını sürdürürken, xAI'den Grok 4.5 ve Google'dan Gemini 3.1 Pro'nun her birinin 300 doların altında kırıldığını söyledi. FAR.AI, en fazla ve en az dayanıklı modeller arasındaki farkı, koruma önlemlerinde "yüz kat boşluk" olarak tanımladı. For more context on this story, see our ongoing more AI stories.
FAR.AI, liderlik tablosunun yanı sıra, tamamen eş geliştiricilerin halihazırda üretimde çalıştırdığı savunmalardan bir araya getirilen ortak bir güvenlik temeli olan Korumalar için Minimal Standart adını verdiği şeyi tanıttı. Amaç, laboratuvarlara beton bir zemin sağlamak ve zayıf korumaları görünür kılmaktır.
Bulgular FAR.AI'nin daha önceki stres testlerini yansıtıyor. Mayıs ayına ait bir rapor, DeepSeek-V4-Pro'nun korumalarının "neredeyse tamamen çöktüğünü", düşük vasıflı saldırganların test edilen her alanda güvenlik mekanizmalarını %98-100 oranında atladığını ortaya çıkardı. Modelin öncülü için oluşturulmuş, halka açık bir jailbreak tek bir değişiklik yapılmadan çalıştı, bu da bilinen güvenlik açıklarının yamasız kaldığını gösteriyor.
Skor tablosunda yer alan WIRED, "bazı öncü yapay zeka modellerini jailbreak yapmanın korkutucu derecede kolay" olduğu sonucuna vardı. Aracılar daha hassas görevler üstlendikçe, eşitsizlik hangi sistemlerin konuşlandırılmasının güvenli olduğu konusunda acil soruları gündeme getiriyor.
Yapay zeka emniyet ve güvenlik araştırmalarının sürekli kapsamı için okuyucular AI Buzz Wire'ı takip edebilir.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →