Penyelidik telah mempamerkan serangan baharu yang kuat terhadap model AI yang mengeksploitasi titik buta asas dalam cara model bahasa besar (LLM) memisahkan arahan daripada data. Teknik itu, yang dipanggil Pemalsuan Rantaian Pemikiran (CoT), memperdayakan model untuk memperlakukan teks yang dibekalkan oleh penyerang seolah-olah ia adalah alasan dalaman peribadi model itu sendiri, yang membenarkan teks itu mengatasi arahan yang sah.
Penemuan, yang dilaporkan oleh Hackaday, menggariskan mengapa melindungi sistem AI daripada manipulasi kekal sebagai masalah yang tidak dapat diselesaikan. Untuk bersaing dengan ancaman yang muncul di lapangan, ikuti liputan industri AI kami untuk analisis berterusan.
Punca Punca: Kekeliruan Peranan
Di tengah-tengah kelemahan ialah perkara yang diterangkan oleh penyelidik sebagai "kekeliruan peranan." LLM moden menerima semua input—peraturan sistem, permintaan pengguna dan penaakulan rantaian pemikiran model itu sendiri—melalui saluran teks tunggal. Untuk mengenakan perintah, pembangun menggunakan teg metadata seperti `
Teg `
Bagaimana Serangan Berfungsi
Yang penting, Pemalsuan CoT bukan sekadar soal membungkus gesaan berniat jahat di dalam teg `
Menurut Hackaday, ini menyebabkan LLM menerima alasan yang tidak logik secara telus sebagai kesimpulan yang telah diketepikan, mengubah responsnya kepada permintaan pengguna. Oleh kerana kandungan palsu dianggap sebagai pemikiran dalaman yang dipercayai tinggi dan bukannya input pengguna yang dipercayai rendah, ia boleh memintas pagar keselamatan yang biasanya menyekat arahan manipulatif.
Hierarki Kepercayaan Di Dalam LLM
Memahami sebab serangan itu berjaya memerlukan pemahaman bagaimana peranan berfungsi. Di bawah tudung, peranan membahagikan input model ke dalam hierarki yang teratur. Arahan dalam peranan dipatuhi selagi ia tidak bercanggah dengan keutamaan yang lebih tinggi. Arahan peringkat sistem "jangan bincangkan aktiviti yang menyalahi undang-undang," sebagai contoh, bertujuan untuk mengatasi permintaan pengguna untuk menyediakan resipi yang dilarang. Peranan `
Pecahan berlaku kerana model tidak menguatkuasakan hierarki itu secara mekanikal. Sebaliknya, ia menyimpulkan teks mana yang tergolong dalam peranan mana sebahagian daripada isyarat gaya. Seperti yang dinyatakan dalam perbincangan komuniti tentang penyelidikan, jika teks bercorak seperti konteks pemikiran, model itu boleh menyalahkan mana-mana teks dengan struktur yang serupa sebagai penaakulan tulen—dan teks pemikiran membawa keutamaan yang lebih tinggi daripada teks pengguna biasa.
Corak Biasa Dengan Twist Baharu
Penyelidikan ini dibina atas kelemahan yang telah lama diiktiraf dalam sistem AI: suntikan segera. Serangan awal mengeksploitasi fakta bahawa LLM tidak mempunyai aliran berasingan untuk arahan dan data, jadi frasa seperti "abaikan semua arahan sebelumnya" kadangkala boleh merampas gelagat model. Pengenalan peranan dan teg metadata bertujuan untuk mengurangkan perkara ini dengan mewujudkan hierarki amanah.
Pemalsuan CoT menunjukkan bahawa pengurangan itu tidak lengkap. Selagi model menilai kebolehpercayaan teks sebahagiannya berdasarkan ciri gayanya dan bukannya secara ketat oleh metadata strukturnya, penyerang yang boleh meniru gaya yang betul boleh meningkatkan kuasa yang dirasakan input mereka.
Mengapa Sukar Dibetulkan
Para penyelidik, Charles Ye, Jasmine Cui, dan Dylan Hadfield-Menll, berpendapat bahawa persepsi peranan dalam LLM bukanlah harta binari yang boleh dikuatkuasakan dengan bersih. Model belajar mentafsir teg melalui latihan dan bukannya melalui peraturan berkod keras, yang bermaksud tingkah laku mereka dibentuk oleh corak dalam data—dan corak boleh ditiru.
Perbincangan komuniti mengenai kerja itu, yang diserlahkan oleh Hackaday, menimbulkan tema berulang: pembaikan paling bersih memerlukan model untuk mengendalikan input yang dipercayai melalui laluan yang berasingan secara struktur dan bukannya bergantung pada isyarat berasaskan gaya yang dipelajari. Sehingga itu berlaku, mempertahankan diri daripada serangan gaya suntikan segera berkemungkinan akan kekal sebagai proses yang berkembang dan bukannya masalah yang diselesaikan.
Implikasi yang Lebih Luas
Kerentanan itu penting melangkaui demonstrasi makmal. Model penaakulan semakin banyak digunakan dalam sistem agen yang boleh menyemak imbas web, melaksanakan kod dan mengambil tindakan bagi pihak pengguna. Jika penyerang boleh memalsukan kesimpulan dalaman model, mereka mungkin dapat mengarahkan tindakan tersebut ke arah hasil yang tidak diingini atau berbahaya. Risiko meningkat apabila model memperoleh lebih autonomi dan akses kepada alatan. Para penyelidik mendapati bahawa manusia kekal bijak dan kreatif, dan selagi model tidak mempunyai pemisahan seni bina yang bersih antara teks yang dipercayai dan tidak dipercayai, penyerang yang bersungguh-sungguh akan terus mencari cara untuk mengaburkan garis. Kertas itu membingkaikan cabaran kurang sebagai pepijat yang akan ditampal dan lebih sebagai sifat struktur sistem yang mempelajari tingkah laku mereka daripada data dan bukannya daripada peraturan berkod keras.
Kertas lengkap tersedia di arXiv, dan penyelidik telah menerbitkan contoh kod di GitHub supaya pembangun boleh menguji sama ada sistem mereka sendiri terdedah.
Kekal Mendahului AI
Untuk maklumat lanjut tentang penyelidikan keselamatan AI, kelemahan keselamatan dan sempadan model bahasa yang besar, lawati AI Buzz Wire.
Baca lebih banyak berita AI →


