Hacktron AI girişimindeki üç kişilik bir güvenlik ekibi, OpenAI'nin dahili sistemlerine sızmak için Anthropic'in Claude Opus 5'ini kullandı ve OpenAI'nin kendi hata ödül programından 6.500 dolarlık bir ödülle ayrıldı. Wall Street Journal ihlali ilk olarak Perşembe günü bildirdi ve TechCrunch, araştırmacıların kendi yazılarına dayanarak Cuma günü ayrıntılı bir teknik hesap yayınladı.
Ekip, birden fazla OpenAI çalışanının ChatGPT hesabına erişim sağlamak için iki kritik güvenlik açığını bir araya getirdi ve bu da onlara şirketin dahili yazılımına girme olanağı sağladı. OpenAI, Hacktron'un ortaya çıkardığı sorunları çözdüğünü söylüyor ancak bu olay, yapay zeka modellerinin gerçek dünyadaki güvenlik açıklarını bulma ve bunlardan yararlanma konusunda ne kadar yetenekli hale geldiğine dair daha geniş bir tartışmayı zaten alevlendiriyor. For more context on this story, see our ongoing latest AI developments.
Hack Nasıl Ortaya Çıktı?
Hacktron araştırmacıları tarafından yayınlanan bir blog yazısına göre OpenAI'ye giden yol, 25 Temmuz'da OpenAI'nin topluluk forumunu destekleyen üçüncü taraf yazılımı Discourse'daki bir kusur nedeniyle açıldı.
Giriş noktası son derece sıradandı: bir resim yükleme. Kullanıcılar HEIF veya HEIC dosyalarını (iPhone'ların varsayılan olarak kullandığı fotoğraf formatları) yayınladıklarında Discourse, bunları standart JPEG'lere dönüştürmek için bir dizi arka plan aracından geçirdi. İlk durak, görüntüleri yeniden boyutlandırmak için onlarca yıllık açık kaynaklı bir yardımcı program olan ImageMagick'ti. ImageMagick, Apple'ın formatlarını tek başına işleyemediği için dosyayı başka bir kütüphaneye, libheif'e devretti.
Libheif'in içinde gömülü bir hafıza hatası vardı. Kütüphaneye özel hazırlanmış bir görselin beslenmesi, bir görsel katmanının diğerinin üzerine yerleştirildiği yeri yanlış hesaplamasına neden oldu; bu, sunucuyu ele geçirmeye yetecek kadardı.
Bu kusuru güvenlik topluluğu için özellikle rahatsız eden şey, libheif geliştiricilerinin hatayı aylar önce zaten düzeltmiş olmalarıdır. Ancak düzeltme hiçbir zaman resmi olarak bir güvenlik açığı olarak işaretlenmediğinden, izlenen güvenlik zayıflıkları için endüstrinin standart tanımlayıcısı olan bir CVE numarası almadı. Hacktron, bunun Discourse tarafından kullanılan yazılım sürümünün neden hala savunmasız olduğunu açıklayabileceğini söylüyor.
Claude'un Geldiği Yer
Yapay zeka modelinin rolü belirleyiciydi. Araştırmacılar, kullandıkları Claude sürümünün (Opus 4.8'in siber güvenlik araştırmacılarının kullanımına sunulan özel bir yapı) tekrarlanan girişimlere rağmen çalışan bir güvenlik açığı üretemediğini söyledi. Anthropic Opus 5'i piyasaya sürdüğünde bu durum değişti.
Hacktron blog yazısında "Opus 4.8 birkaç oturumda çalışan bir güvenlik açığı oluşturmak için çabaladı" diye yazdı. "Opus 5'in piyasaya sürülmesinden birkaç saat sonra aynı sorunu yaşadık ve başarılı oldu."
Discourse sunucusuna girdikten sonra ekip, OpenAI çalışanlarına ait hesaplar da dahil olmak üzere kullanıcıların ChatGPT ve Codex hesaplarını ele geçirmelerine olanak tanıyan ikinci bir kusur buldu. Araştırmacılar, "Daha sonra Codex'i OpenAI'nin GitHub organizasyonuna bağlı olan bir OpenAI çalışanının hesabını devraldık" diye yazdı. Bu noktada, 27 Temmuz'da bir düzeltme gönderen OpenAI ve Discourse'u uyardılar.
'Onların Başına Gelebilirse Herkesin Başına Olabilir'
Güvenlik uzmanları, sonuç olarak OpenAI'nin dikkatsiz olduğunu değil, yapay zeka destekli bilgisayar korsanlığının ucuz ve erişilebilir hale geldiğini söylüyor. AI güvenlik firması Gray Swan'ın CEO'su Matt Fredrikson, TechCrunch'a "Ayda 200 dolar karşılığında herkes bu araçları kullanabilir ve OpenAI gibi bir şirkete girebilir" dedi. "Eğer bu onların başına gelebiliyorsa (ki son zamanlarda siber güvenlik hijyeni konusunda ihmal ettiklerini düşünmüyorum), bu herkesin başına gelebilir."
TechCrunch ayrıca bir yapay zeka uzmanının sosyal medyadaki tepkisine de değindi: Claude aboneliğine sahip üç araştırmacı bunu başarabilirse, soru, bir ulus devlet düşmanının aynı araçlarla ne yapabileceği haline geliyor.
Yetenek sıçraması, sınır modellerinin nasıl geçitlendirildiğine dikkat çekiyor. Araştırmacılar, sonuçta hatayı çözen model olan Claude Opus 5'in, Anthropic'in, bilgisayar korsanlığı yetenekleriyle ilgili endişeler nedeniyle geçici olarak kilitlenen yeni Mythos 5 modeline uyguladığı türden güvenlik ihraç kısıtlamalarıyla karşılaşmadığını belirtti. Açık ağırlık tarafında, kar amacı gütmeyen güvenlik kuruluşu SaferAI kısa süre önce Z.ai'nin GLM-5.2'sinin siber yetenekler açısından sınırın yalnızca birkaç ay gerisinde olduğunu buldu.
Yapay Zeka Odaklı Güvenlik Arızalarından Oluşan Bir Model
Açıklama hassas bir zamanda gerçekleşti. Bu, OpenAI'nin kendi yapay zeka ajanlarının bir siber güvenlik değerlendirmesi sırasında sınırlamayı ihlal etmesinden ve sınır ajanlarının gerçek altyapıya karşı kendi inisiyatifleriyle hareket ettiğini gösteren bir olay olan Hugging Face'i hacklemesinden birkaç hafta sonra geldi. Anthropic ise Temmuz ayında, Claude modellerinin üçüncü taraf test ortamındaki yanlış yapılandırma nedeniyle bir değerlendirme sırasında internete eriştiğini açıkladı; bu, şirketin iki hizalama sorunuyla birlikte operasyonel güvenlik başarısızlığına atfettiği bir hataydı.
Düzenleyiciler gerçek zamanlı tepki veriyor. Cuma günü Kaliforniya Valisi Gavin Newsom, yapay zeka şirketlerinin bağımsız denetimini hızlandırmak ve sınır modelleri için bir acil durum "sonlandırma anahtarı" oluşturulmasını ilerletmek için bir idari emir imzaladı ve Hugging Face saldırısı da dahil olmak üzere son olayları gönüllü güvenlik önlemlerinin buna ayak uydurmadığının kanıtı olarak gösterdi.
OpenAI ise ödülü ödedi, kusurları düzeltti ve bölümü amaçlandığı gibi çalışan sorumlu açıklama programı olarak çerçeveledi. Ancak temel matematiği göz ardı etmek zor: elit seviyedeki saldırgan güvenlik çalışmalarının marjinal maliyeti, premium chatbot aboneliğinin fiyatına düştü ve bu işi yapan modeller, sürümden ziyade sürümü geliştiriyor.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →