Anggapan populer manawa manungsa sing mriksa saben printah bisa njaga agen kodhe AI dipriksa kanthi serius. Analisis anyar babagan luwih saka 40.000 sesi game lan luwih saka 409.000 keputusan sing disetujoni utawa ditolak individu nemokake manawa para panaliti manungsa ora kejawab kira-kira siji saka telung prentah jahat saka agen AI, nuwuhake pitakonan sing penting babagan apa "manungsa-in-the-loop" minangka wates keamanan sing bisa dipercaya.
Panemuan kasebut asale saka game berbasis browser sing digawe dening Alex Wauters, mantan insinyur staf ing Uber sing nulis babagan keamanan pangembang ing Skala X. Game kasebut ndadekake pemain minangka reviewer manungsa kanggo agen coding AI, njaluk supaya sarujuk utawa nolak perintah cangkang ing tekanan wektu. Sawetara prentah minangka rutin, kayata `git status` utawa `npm test`. Liyane nyoba nyamar kanthi ati-ati kanggo ngilangi kredensial, nginstal lawang mburi, utawa ngirim rahasia menyang server remot. Sawise nambahake pelacakan statistik, Wauters nglumpukake data sing cukup kanggo nggambarake gambaran rinci babagan pengadilan manungsa sing sukses lan, luwih asring, gagal. Kanggo luwih lengkap babagan [jangkoan industri AI] (https://aibuzzwire.news) sing luwih jembar, panliten iki minangka salah sawijining eksperimen sing paling sugih data nganti saiki.
Prentah sing paling mbebayani yaiku sing paling angel dicekel
Panemuan sing paling nggumunake yaiku prentah sing bisa ngrusak, kayata `rm -rf` ing direktori kritis, kejiret kanthi andal. Ancaman sing bener-bener sukses nyolong kredensial ora kejawab meh kaping telu. Siji-sijine prentah sing paling ora kejawab ing kabeh game yaiku `npm run analysis`, disetujoni dening 64,7 persen pemain sanajan cathetan riwayat agen kasebut kanthi jelas nuduhake manawa naskah sing ndasari wis dirusak kanggo kredensial pipa menyang server eksternal.
Masalah iku struktural. Printah kaya `npm run` nglakokaké script apa wae sing ditetepake ing file `package.json` proyek. Skrip kasebut bisa dadi penganalisa bundel sing sah utawa kode jahat sing disuntikake dening suntingan file sadurunge sing diowahi agen. Kanggo ngerti kanthi pasti, pangembang kudu mriksa saben file sing diowahi sadurunge disetujoni, sing nolak kauntungan kacepetan sing kudu diwenehake dening alat coding AI.
Ing telung prentah sing disguised-payload kasebut ing game kasebut, tingkat kacilakan yaiku 52,5 persen dibandhingake karo 28,4 persen kanggo kabeh serangan eksfiltrasi kredensial liyane. Ndhelikake muatan ing mburi jeneng skrip sing wis dikenal kira-kira tikel kaping pindho tingkat suksese, sanajan muatan kasebut katon ing log riwayat sing ditampilake ing ndhuwur pituduh ijin.
Kesel Idin Ngilangi Waspada Sajrone Wektu
Anthropic sadurunge ngakoni yen kelelahan ijin minangka fenomena nyata ing produk Claude Code, kanthi nyathet yen luwih akeh persetujuan sing dideleng pangguna, kurang perhatian sing dibayar kanggo saben wong. Data Skala X ndhukung keprihatinan iki kanthi empiris. Tarif Miss suda sajrone sawetara prentah pisanan ing saben sesi nalika pemain dadi panas, nanging banjur terus munggah ing pungkasan, konsisten karo kekeselen utawa tekanan jam sing terus-terusan.
Pola iki nggambarake dinamika donya nyata. Pangembang racing kanggo kapal fitur ing meksa deadline ngadhepi insentif padha kanggo klik sarujuk cepet, lan volume gedhine printah tumindake nggawe masalah needle-in-a-haystack ngendi ancaman asli statistik langka. Asilé minangka sistem sing nglatih pangguna kanggo ngetokaké kabeh.
Sisih Liyane: Over-Blocking Slow All Down
Panliten kasebut uga nyathet mode kegagalan sing ngelawan. Sawetara prentah sing bener-bener entheng diblokir kanthi rutin dening pemain sing ati-ati, kalebu pambangunan standar lan invocation test. Iki over-blocking slows agen mudhun lan, paradoxically, nambah risiko long-term. Nalika pangguna bola-bali dijaluk nyetujoni prentah sing ora mbebayani, swara kasebut bakal ngrusak kekarepane kanggo nliti pituduh ing mangsa ngarep, lan pungkasane nyurung dheweke menyang dalan lengkap utawa mode nyetujoni otomatis sing mbusak kabeh review manungsa.
Fitur kaya Mode Otomatis Anthropic nyoba nyuda iki kanthi otomatis nemtokake manawa prentah kasebut aman sadurunge njaluk pangguna. Nanging minangka data panaliten babagan muatan sing nyamar, sanajan isi prentah sing katon ora cukup kanggo manungsa nggawe keputusan sing dipercaya ing tekanan.
Konteks Ilang Iku Masalah Inti
Siji printah, `cat ~/.zshrc`, mbuktekaken paling divisive ing kabeh game, disetujoni dening 45,9 persen pemain. Printah kasebut ora mbebayani kanggo pangembang sing ora nyimpen rahasia ing profil cangkang, nanging mbukak kunci API kanggo akeh sing ngekspor kredensial ing kana. Resiko gumantung ing konfigurasi sistem sing ora bisa dideleng dening agen lan bisa uga ora ngelingi reviewer.
Sawetara prentah liyane ngasilake kontroversi sing padha ing thread diskusi Hacker News kanthi alasan sing padha. Masalah dhasar yaiku pangembang dijaluk nggawe pengadilan keamanan tanpa gambaran lengkap babagan file sing wis diganti, apa sing ditindakake agen ing langkah-langkah sadurunge, lan apa konfigurasi sistem saiki. Minangka salah sawijining komentator nyathet, njaluk pangguna kanggo ngesyahke prentah sing ambigu tanpa konteks ora dadi pangayoman sing kuat.
Apa Sabanjure kanggo Keamanan Agen
Wauters ujar manawa solusi kasebut dudu manungsa sing luwih apik nanging alat sing luwih apik. Agen sandboxing supaya ora bisa ngakses kredensial langsung, isolasi konteks sing ketat, lan watesan struktural babagan apa sing bisa ditindakake agen tanpa ijin sing luwih dhuwur, kabeh luwih janji tinimbang ngandelake kewaspadaan manungsa. Nganti proteksi kasebut ditindakake, menehi idin sing wiyar marang agen tetep beresiko ora preduli manawa manungsa ana ing daur ulang.
Panaliten kasebut dudu kertas akademik sing dideleng peer, lan Wauters ngakoni watesan kasebut. Game kasebut ngelingake para pemain babagan ancaman lan tekanan wektu buatan sing bisa uga ora nggambarake lingkungan pangembangan nyata. Nanging temuan inti, sing dilatih reviewer manungsa ing tekanan kantun katelu saka serangan sengaja disguised, kudu menehi saben tim deploying agen coding AI alesan kanggo nimbang maneh model keamanan.
Kanggo pangembang bangunan karo agen AI saiki, takeaway praktis kanggo nganggep manungsa-in-the-loop pungkasanipun bakal gagal. Rancang ijin agen lan kothak wedhi supaya ora disetujoni ora ateges kunci AWS sing bocor utawa pipa mbangun sing dikompromi. Data kasebut nuduhake manawa nganggep review manungsa minangka pertahanan utama sampeyan minangka taruhan sing ora dibayar.
Tetep Ahead saka AI
Lanskap keamanan agen AI berkembang kanthi cepet. Tetep diwenehi informasi babagan [pangembangan AI] paling anyar (https://aibuzzwire.news) lan riset pungkasan.
Waca liyane warta AI →