Araştırmacılar, büyük dil modellerinin (LLM'ler) talimatları verilerden nasıl ayırdığına dair temel bir kör noktadan yararlanan, akıl yürütmeye dayalı yapay zeka modellerine karşı güçlü yeni bir saldırı ortaya koydu. Düşünce Zinciri (CoT) Sahteciliği adı verilen teknik, bir modeli, saldırgan tarafından sağlanan metni sanki modelin kendi özel iç muhakemesiymiş gibi ele alacak şekilde kandırarak metnin meşru talimatları geçersiz kılmasına olanak tanıyor.
Hackaday tarafından bildirilen bulgular, yapay zeka sistemlerinin manipülasyona karşı güvenliğinin neden çözülmemiş bir sorun olarak kaldığını vurguluyor. Bu alanda ortaya çıkan tehditlere ayak uydurmak ve devam eden analizler için Yapay Zeka sektörü kapsamımızı takip edin.
Temel Neden: Rol Karışıklığı
Güvenlik açığının merkezinde araştırmacıların "rol karmaşası" olarak tanımladığı şey var. Modern LLM'ler tüm girdilerini (sistem kuralları, kullanıcı istekleri ve modelin kendi düşünce zinciri mantığı) tek bir metin kanalı aracılığıyla alır. Geliştiriciler, düzeni empoze etmek için bir güven hiyerarşisi oluşturmak amacıyla "
"
Saldırı Nasıl Çalışır?
En önemlisi, CoT Sahteciliği, çoğu modelin reddedeceği şekilde kötü niyetli bir istemin "
Hackaday'a göre bu, LLM'nin şeffaf bir şekilde mantıksız akıl yürütmeyi kaçınılmaz bir sonuç olarak kabul etmesine ve kullanıcının isteğine verdiği yanıtın değişmesine neden oluyor. Sahte içerik, düşük güvene sahip kullanıcı girişi yerine yüksek güvene sahip dahili düşünce olarak algılandığından, normalde manipülatif talimatları engelleyen güvenlik korkuluklarını atlayabilir.
Yüksek Lisansta Güven Hiyerarşisi
Saldırının neden başarılı olduğunu anlamak, rollerin nasıl çalıştığını anlamayı gerektirir. Kaputun altında roller, modelin girdisini organize bir hiyerarşiye böler. Bir roldeki talimatlar, daha yüksek öncelikli olanlarla çelişmediği sürece takip edilir. Örneğin, sistem düzeyindeki "yasadışı faaliyetleri tartışmayın" direktifinin amacı, kullanıcının yasaklanmış bir tarif sağlama talebini geçersiz kılmaktır. "
Arıza, modelin bu hiyerarşiyi mekanik olarak zorlamaması nedeniyle meydana gelir. Bunun yerine, kısmen üslup ipuçlarından hangi metnin hangi role ait olduğu sonucunu çıkarır. Araştırmanın topluluk tartışmasında belirtildiği gibi, eğer metin bir düşünme bağlamı gibi şekillendirilirse, model benzer yapıya sahip herhangi bir metni gerçek akıl yürütmeyle karıştırabilir ve düşünen metin, sıradan kullanıcı metninden daha yüksek önceliğe sahiptir.
Yeni Bir Bakışla Tanıdık Bir Desen
Araştırma, yapay zeka sistemlerinde uzun süredir bilinen bir zayıflığa dayanıyor: anında enjeksiyon. İlk saldırılar, LLM'lerin talimatlar ve veriler için ayrı akışlara sahip olmadığı gerçeğinden yararlandı; bu nedenle, "önceki tüm talimatları göz ardı et" gibi bir ifade, bazen bir modelin davranışını ele geçirebilir. Rollerin ve meta veri etiketlerinin eklenmesi, bir güven hiyerarşisi oluşturarak bu durumu hafifletmeyi amaçlıyordu.
CoT Sahteciliği, azaltmanın eksik olduğunu gösteriyor. Modeller metnin güvenilirliğini kesin olarak yapısal meta veriler yerine kısmen stilistik özelliklerine göre değerlendirdiği sürece, doğru stili taklit edebilen saldırganlar, girdilerinin algılanan otoritesini artırabilir.
Düzeltmek Neden Zor?
Araştırmacılar Charles Ye, Jasmine Cui ve Dylan Hadfield-Menll, Yüksek Lisans'taki rol algısının temiz bir şekilde uygulanabilecek ikili bir özellik olmadığını savunuyorlar. Modeller, etiketleri yorumlamayı sabit kodlanmış kurallar yerine eğitim yoluyla öğrenir; bu da onların davranışlarının verilerdeki kalıplarla şekillendiği ve kalıpların taklit edilebileceği anlamına gelir.
Hackaday tarafından vurgulanan çalışmayla ilgili topluluk tartışması, yinelenen bir temayı gün yüzüne çıkardı: En temiz düzeltme, öğrenilen, stile dayalı ipuçlarına güvenmek yerine, güvenilir girdileri yapısal olarak ayrı yollardan ele alan modellere ihtiyaç duyacaktır. Bu gerçekleşene kadar, hızlı enjeksiyon tarzı saldırılara karşı savunma, çözülmüş bir sorundan ziyade muhtemelen gelişen bir süreç olarak kalacaktır.
Daha Geniş Anlamlar
Güvenlik açığı laboratuvar gösterilerinin ötesinde önemlidir. Akıl yürütme modelleri, web'de gezinebilen, kod yürütebilen ve kullanıcı adına eylemler gerçekleştirebilen aracı sistemlerde giderek daha fazla kullanılıyor. Bir saldırgan bir modelin dahili sonuçlarını çıkarabilirse, bu eylemleri istenmeyen veya zararlı sonuçlara yönlendirebilir. Modeller daha fazla özerklik kazandıkça ve araçlara erişim kazandıkça risk de artıyor. Araştırmacılar, insanların akıllı ve yaratıcı olmaya devam ettiğini ve modeller güvenilir ve güvenilmeyen metin arasında net bir mimari ayrımdan yoksun olduğu sürece kararlı saldırganların çizgiyi bulanıklaştırmanın yollarını bulmaya devam edeceğini belirtiyor. Makale, bu zorluğun düzeltilmesi gereken bir hatadan çok, davranışlarını sabit kodlanmış kurallardan ziyade verilerden öğrenen sistemlerin yapısal bir özelliği olarak çerçeveliyor.
Makalenin tamamı arXiv'de mevcuttur ve araştırmacılar, geliştiricilerin kendi sistemlerinin duyarlı olup olmadığını test edebilmeleri için kod örneklerini GitHub'da yayınladılar.
Yapay Zekanın Önünde Olun
Yapay zeka güvenlik araştırmaları, güvenlik açıkları ve büyük dil modellerinin sınırları hakkında daha fazla bilgi için AI Buzz Wire adresini ziyaret edin.
Daha fazla AI haberini okuyun →


