Her komutu inceleyen bir insanın yapay zeka kodlama aracılarını kontrol altında tutabileceği yönündeki popüler varsayım ciddi bir incelemeyle karşı karşıyadır. 40.000'den fazla oyun oturumu ve 409.000'den fazla bireysel onaylama veya reddetme kararının yeni bir analizi, insan incelemecilerin yapay zeka ajanlarından gelen yaklaşık üç kötü niyetli komuttan birini kaçırdığını ortaya çıkardı ve bu da "döngüdeki insan"ın güvenilir bir güvenlik sınırı olup olmadığı konusunda acil soruları gündeme getirdi.

Bulgular, Uber'de eski bir personel mühendisi olan ve Scale X'te geliştirici güvenliği hakkında yazan Alex Wauters tarafından oluşturulan tarayıcı tabanlı bir oyundan geliyor. Oyun, oyuncuları bir AI kodlama aracısı için insan incelemeci rolüne yerleştiriyor ve onlardan zaman baskısı altında kabuk komutlarını onaylamalarını veya reddetmelerini istiyor. 'git status' veya 'npm test' gibi bazı komutlar rutindir. Diğerleri kimlik bilgilerini çalmak, arka kapılar kurmak veya uzak sunuculara sırlar göndermek için dikkatlice gizlenmiş girişimlerdir. İstatistik takibini ekledikten sonra Wauters, insan muhakemesinin nerede başarılı ve çoğunlukla başarısız olduğuna dair ayrıntılı bir resim çizmeye yetecek kadar veri topladı. Daha geniş AI endüstrisi kapsamı hakkında daha fazla bilgi edinmek için bu çalışma, bugüne kadarki en zengin veri içeren deneylerden biri olarak öne çıkıyor.

En Tehlikeli Komutlar Yakalanması En Zor Olanlardı

Araştırmanın en dikkat çekici bulgusu, kritik dizinlerdeki 'rm -rf' gibi açıkça yıkıcı komutların güvenilir bir şekilde yakalanmış olmasıdır. Kimlik bilgilerini çalmayı başaran tehditler neredeyse üç kat daha fazla kaçırıldı. Oyunun tamamında en çok gözden kaçırılan komut "npm run analyze" idi ve temsilcinin geçmiş günlüğü, kimlik bilgilerinin harici bir sunucuya iletilmesi için temel komut dosyasında oynandığını açıkça göstermesine rağmen oyuncuların yüzde 64,7'si tarafından onaylandı.

Sorun yapısaldır. 'npm run' gibi komutlar, bir projenin 'package.json' dosyasında tanımlanan komut dosyasını çalıştırır. Bu komut dosyası, meşru bir paket analizörü veya aracının değiştirdiği daha önceki bir dosya düzenlemesi tarafından enjekte edilen kötü amaçlı kod olabilir. Kesin olarak bilmek için bir geliştiricinin, onaylamadan önce değiştirilen her dosyayı incelemesi gerekir; bu da, AI kodlama araçlarının sağlaması beklenen hız avantajını boşa çıkarır.

Oyundaki bu tür üç gizlenmiş veri yükü komutunda ıskalama oranı yüzde 52,5 iken, diğer tüm kimlik bilgileri sızma saldırılarında bu oran yüzde 28,4'tü. Yükün tanıdık bir komut dosyası adının arkasına saklanması, izin isteminin hemen üzerinde görüntülenen geçmiş günlüğünde yük görünürken bile başarı oranını kabaca ikiye katladı.

İzin Yorgunluğu Zaman İçinde Dikkatliliği Aşındırır

Anthropic daha önce izin yorgunluğunun Claude Code ürününde gerçek bir olgu olduğunu kabul ederek, bir kullanıcının ne kadar çok onay görürse her birine o kadar az dikkat ettiğini belirtti. Ölçek X verileri bu endişeyi ampirik olarak desteklemektedir. Her seansın ilk birkaç komutunda oyuncular ısındıkça ıskalama oranları azaldı, ancak daha sonra yorgunluk ya da saatin artan baskısıyla tutarlı olarak sona doğru istikrarlı bir şekilde arttı.

Bu model gerçek dünya dinamiklerini yansıtıyor. Son teslim tarihi baskısı altında özellikleri sunmak için yarışan geliştiriciler, tıklamayı hızlı bir şekilde onaylama konusunda aynı teşvikle karşı karşıyadır ve rutin komutların çok büyük hacmi, gerçek tehditlerin istatistiksel olarak nadir olduğu bir samanlıkta iğne sorunu yaratır. Sonuç, kullanıcıları her şeye onay damgası koyma konusunda eğiten bir sistemdir.

Diğer Taraf: Aşırı Engelleme Her Şeyi Yavaşlatır

Çalışma aynı zamanda tam tersi başarısızlık modunu da belgeledi. Standart oluşturma ve test çağrıları da dahil olmak üzere, gerçekten zararsız olan birçok komut, dikkatli oyuncular tarafından rutin olarak engellendi. Bu aşırı engelleme ajanı yavaşlatır ve paradoksal olarak uzun vadeli riski artırır. Kullanıcılardan zararsız olduğu ortaya çıkan komutları onaylamaları tekrar tekrar istendiğinde, gürültü gelecekteki istemleri inceleme isteklerini aşındırıyor ve sonunda onları tamamen atlamalara veya insan incelemesini tamamen ortadan kaldıran otomatik onaylama modlarına doğru itiyor.

Anthropic'in Otomatik Modu gibi özellikler, kullanıcıya sormadan önce bir komutun güvenli olup olmadığını otomatik olarak belirleyerek bu durumu hafifletmeye çalışır. Ancak çalışmanın gizlenmiş yüklere ilişkin verilerinin de gösterdiği gibi, görünür komut içerikleri bile insanların baskı altında güvenilir kararlar vermesi için yeterli değildir.

Eksik Bağlam Asıl Sorundur

Oyuncuların yüzde 45,9'u tarafından onaylanan 'cat ~/.zshrc' komutu, tüm oyundaki en bölücü komut oldu. Komut, kabuk profillerinde hiçbir sır saklamayan geliştiriciler için zararsızdır, ancak kimlik bilgilerini oraya aktaran birçok kişi için API anahtarlarını açığa çıkarır. Riski tamamen aracının göremediği ve incelemeyi yapan kişinin hatırlayamadığı sistem konfigürasyonuna bağlıdır.

Diğer bazı komutlar da aynı sebepten dolayı Hacker News tartışma başlığında benzer tartışmalara yol açtı. Temel sorun, geliştiricilerden hangi dosyaların değiştiği, aracının önceki adımlarda ne yaptığı ve sistemin mevcut yapılandırmasının neleri içerdiği hakkında tam bilgi olmadan güvenlik kararları vermelerinin istenmesidir. Bir yorumcunun belirttiği gibi, kullanıcılardan bağlam olmadan belirsiz olan komutları doğrulamalarını istemek güçlü bir koruma değildir.

Ajan Güvenliğinde Sırada Ne Var?

Wauters, çözümün daha iyi insanlar değil, daha iyi aletler olduğunu savunuyor. Aracıların kimlik bilgilerine doğrudan erişememeleri için korumalı alana alınması, sıkı bağlam izolasyonu ve aracıların yüksek izinler olmadan yapabileceklerine ilişkin yapısal sınırlamalar, insanların dikkatine güvenmekten daha umut vericidir. Bu güvenlik önlemleri alınana kadar, bir insanın döngünün içinde olup olmadığına bakmaksızın, aracılara geniş izinler vermek riskli olmaya devam ediyor.

Çalışma, hakemli bir akademik makale değildir ve Wauters, çalışmanın sınırlamalarını kabul etmektedir. Oyun, oyuncuları tehditlere karşı uyardı ve gerçek geliştirme ortamlarını mükemmel şekilde yansıtmayabilecek yapay zaman baskısı uyguladı. Ancak baskı altındaki eğitimli insan incelemecilerin kasıtlı olarak gizlenmiş saldırıların üçte birini kaçırdığı yönündeki temel bulgu, AI kodlama aracılarını kullanan her ekibe güvenlik modellerini yeniden gözden geçirmeleri için neden vermelidir.

Bugün yapay zeka aracıları kullanan geliştiriciler için pratik çıkarım, döngüdeki insanın eninde sonunda başarısız olacağını varsaymaktır. Temsilci izinlerinizi ve korumalı alanınızı, onayın kaçırılmasının AWS anahtarının sızdırılması veya derleme hattının tehlikeye atılması anlamına gelmeyeceği şekilde tasarlayın. Veriler, gerçek kişiler tarafından yapılan incelemeleri birincil savunmanız olarak ele almanın, sonuç vermeyen bir bahis olduğunu gösteriyor.

Yapay Zekanın Önünde Kalın

Yapay zeka aracı güvenliği ortamı hızla gelişiyor. En son AI gelişmelerinden ve son araştırmalardan haberdar olun.

Daha fazla AI haberini okuyun →