Andaian popular bahawa manusia yang menyemak setiap arahan boleh memastikan ejen pengekodan AI terkawal sedang menghadapi penelitian yang serius. Analisis baharu lebih daripada 40,000 sesi permainan dan lebih 409,000 keputusan meluluskan atau menafikan individu mendapati bahawa penyemak manusia terlepas kira-kira satu daripada tiga arahan berniat jahat daripada ejen AI, menimbulkan persoalan mendesak sama ada "manusia dalam gelung" ialah sempadan keselamatan yang boleh dipercayai sama sekali.
Penemuan itu datang daripada permainan berasaskan penyemak imbas yang dicipta oleh Alex Wauters, bekas jurutera kakitangan di Uber yang menulis tentang keselamatan pembangun di Skala X. Permainan ini meletakkan pemain dalam peranan penyemak manusia untuk ejen pengekodan AI, meminta mereka untuk meluluskan atau menafikan arahan shell di bawah tekanan masa. Sesetengah arahan adalah rutin, seperti `git status` atau `npm test`. Yang lain adalah percubaan menyamar dengan teliti untuk mengeluarkan bukti kelayakan, memasang pintu belakang, atau menghantar rahsia ke pelayan jauh. Selepas menambah penjejakan statistik, Wauters mengumpul data yang mencukupi untuk melukis gambaran terperinci tentang tempat penghakiman manusia berjaya dan, lebih kerap, gagal. Untuk mengetahui lebih lanjut tentang [liputan industri AI] yang lebih luas (https://aibuzzwire.news), kajian ini menonjol sebagai salah satu eksperimen yang paling kaya dengan data setakat ini.
Perintah Paling Berbahaya Adalah Paling Sukar Ditangkap
Penemuan kajian yang paling menarik ialah arahan yang jelas merosakkan, seperti `rm -rf` pada direktori kritikal, ditangkap dengan pasti. Ancaman yang sebenarnya berjaya mencuri kelayakan telah terlepas hampir tiga kali lebih kerap. Satu-satunya arahan yang paling terlepas dalam keseluruhan permainan ialah `npm run analysis`, yang diluluskan oleh 64.7 peratus pemain walaupun log sejarah ejen jelas menunjukkan bahawa skrip asas telah diganggu untuk menyalurkan kelayakan ke pelayan luaran.
Masalahnya adalah struktur. Perintah seperti `npm run` melaksanakan apa sahaja skrip yang ditakrifkan dalam fail `package.json` projek. Skrip itu boleh menjadi penganalisis berkas yang sah atau kod berniat jahat yang disuntik oleh fail terdahulu yang mengedit ejen yang diubah suai. Untuk mengetahui dengan pasti, pembangun perlu memeriksa setiap fail yang diubah suai sebelum meluluskan, yang menafikan kelebihan kelajuan yang sepatutnya disediakan oleh alat pengekodan AI.
Merentasi tiga perintah muatan menyamar dalam permainan itu, kadar kehilangan adalah 52.5 peratus berbanding 28.4 peratus untuk semua serangan penyingkiran kelayakan lain. Menyembunyikan muatan di sebalik nama skrip biasa menggandakan kadar kejayaannya secara kasarnya, walaupun apabila muatan itu kelihatan dalam log sejarah yang dipaparkan tepat di atas gesaan kebenaran.
Keletihan Keizinan Menghakis Kewaspadaan Lama-kelamaan
Anthropic sebelum ini mengakui bahawa keletihan kebenaran adalah fenomena sebenar dalam produk Claude Codenya, dengan menyatakan bahawa semakin banyak kelulusan yang dilihat pengguna, semakin kurang perhatian yang mereka berikan kepada setiap satu. Data Skala X menyokong kebimbangan ini secara empirik. Kadar kehilangan menurun semasa beberapa arahan pertama setiap sesi apabila pemain memanaskan badan, tetapi kemudian meningkat secara berterusan ke penghujung, selaras dengan sama ada keletihan atau tekanan yang meningkat daripada jam yang berdetik.
Corak ini mencerminkan dinamik dunia sebenar. Pembangun berlumba-lumba untuk menghantar ciri di bawah tekanan tarikh akhir menghadapi insentif yang sama untuk klik meluluskan dengan cepat, dan jumlah arahan rutin yang banyak menimbulkan masalah jarum dalam tumpukan jerami di mana ancaman tulen jarang berlaku secara statistik. Hasilnya ialah sistem yang melatih pengguna untuk mengecap segala-galanya.
Bahagian Lain: Penyekatan Terlalu Melambatkan Segala-galanya
Kajian itu juga mendokumentasikan mod kegagalan yang bertentangan. Beberapa arahan yang benar-benar jinak telah disekat secara rutin oleh pemain yang berhati-hati, termasuk binaan standard dan invokasi ujian. Penyekatan berlebihan ini memperlahankan ejen dan, secara paradoks, meningkatkan risiko jangka panjang. Apabila pengguna berulang kali diminta untuk meluluskan arahan yang ternyata tidak berbahaya, bunyi bising menghakis kesediaan mereka untuk meneliti gesaan masa hadapan, akhirnya mendorong mereka ke arah pintasan lengkap atau mod kelulusan automatik yang mengalih keluar semakan manusia sepenuhnya.
Ciri seperti Mod Auto Anthropic cuba mengurangkan perkara ini dengan menentukan secara automatik sama ada arahan itu selamat sebelum menggesa pengguna. Tetapi seperti yang ditunjukkan oleh data kajian tentang muatan yang disamarkan, malah kandungan arahan yang boleh dilihat tidak mencukupi untuk manusia membuat pertimbangan yang boleh dipercayai di bawah tekanan.
Konteks Hilang Adalah Masalah Teras
Satu arahan, `cat ~/.zshrc`, terbukti paling memecahbelahkan dalam keseluruhan permainan, diluluskan oleh 45.9 peratus pemain. Perintah itu tidak berbahaya untuk pembangun yang tidak menyimpan rahsia dalam profil shell mereka, tetapi ia mendedahkan kunci API untuk ramai yang mengeksport bukti kelayakan di sana. Risikonya bergantung sepenuhnya pada konfigurasi sistem yang tidak dapat dilihat oleh ejen dan pengulas mungkin tidak ingat.
Beberapa arahan lain menjana kontroversi serupa pada utas perbincangan Berita Hacker atas sebab yang sama. Isu asas ialah pembangun diminta membuat pertimbangan keselamatan tanpa gambaran penuh tentang fail yang telah berubah, perkara yang dilakukan oleh ejen dalam langkah sebelumnya dan kandungan konfigurasi semasa sistem. Seperti yang dinyatakan oleh seorang pengulas, meminta pengguna untuk mengesahkan arahan yang samar-samar tanpa konteks bukanlah perlindungan yang kukuh.
Perkara Seterusnya untuk Keselamatan Ejen
Wauters berpendapat bahawa penyelesaiannya bukanlah manusia yang lebih baik tetapi alat yang lebih baik. Ejen kotak pasir supaya mereka tidak boleh mengakses bukti kelayakan secara langsung, pengasingan konteks yang ketat dan had struktur tentang perkara yang boleh dilakukan oleh ejen tanpa kebenaran yang tinggi semuanya lebih menjanjikan daripada bergantung pada kewaspadaan manusia. Sehingga perlindungan tersebut dilaksanakan, pemberian keizinan luas kepada ejen kekal berisiko tidak kira sama ada manusia secara nominal berada dalam gelung.
Kajian itu bukan kertas akademik yang disemak rakan sebaya, dan Wauters mengakui batasannya. Permainan ini memberi amaran kepada pemain tentang ancaman dan menggunakan tekanan masa buatan yang mungkin tidak mencerminkan persekitaran pembangunan sebenar dengan sempurna. Tetapi penemuan teras, bahawa pengulas manusia terlatih di bawah tekanan terlepas satu pertiga daripada serangan yang sengaja disamarkan, sepatutnya memberi setiap pasukan yang menggunakan ejen pengekodan AI alasan untuk mempertimbangkan semula model keselamatan mereka.
Bagi pembangun yang membina dengan ejen AI hari ini, langkah praktikal ialah menganggap manusia-dalam-gelung akhirnya akan gagal. Reka bentuk kebenaran ejen dan kotak pasir anda supaya kelulusan yang terlepas tidak bermakna kunci AWS yang bocor atau saluran paip binaan yang terjejas. Data menunjukkan bahawa menganggap ulasan manusia sebagai pertahanan utama anda adalah pertaruhan yang tidak membuahkan hasil.
Kekal Mendahului AI
Landskap keselamatan ejen AI berkembang pesat. Kekal dimaklumkan dengan [perkembangan AI] terkini (https://aibuzzwire.news) dan penyelidikan terkini.
Baca lebih banyak berita AI →