Peneliti nuduhake serangan anyar sing kuat marang model AI sing ngeksploitasi titik buta dhasar babagan carane model basa gedhe (LLM) misahake instruksi saka data. Teknik kasebut, sing diarani Chain-of-Thought (CoT) Forgery, ngapusi model kanggo nganggep teks sing diwenehake panyerang kaya-kaya minangka pertimbangan internal pribadi model kasebut, ngidini teks kasebut nolak instruksi sing sah.

Panemuan kasebut, sing dilapurake dening Hackaday, nandheske kenapa ngamanake sistem AI saka manipulasi tetep dadi masalah sing durung rampung. Kanggo nglacak ancaman sing muncul ing lapangan, tututi [jangkoan industri AI] (https://aibuzzwire.news) kanggo analisa sing terus-terusan.

Panyebab Root: Kebingungan Peran

Ing jantung kerentanan yaiku apa sing diterangake para peneliti minangka "kebingungan peran." LLM modern nampa kabeh input-aturan sistem, panjalukan pangguna, lan model model dhewe-of-pikir pertimbangan-liwat saluran teks siji. Kanggo ngetrapake urutan, pangembang nggunakake tag metadata kayata ``, ``, lan `` kanggo nggawe hierarki kepercayaan. A `` arahan kanggo ngindhari isi sing mbebayani, contone, mesthine bakal ngganti panjalukan ``.

Tag `` utamane kuat amarga nggambarake proses penalaran internal model, aliran sing nduweni kapercayan dhuwur. Masalahe, peneliti nemokake, yaiku model ora gumantung utamane ing tag dhewe kanggo mutusake apa sing dipercaya. Dheweke ngutamakake gaya nulis. Teks sing diformat kanthi gaya meh padha karo output `` internal model bisa disalahake minangka alesan asli, ora preduli saka ngendi asale.

Cara Kerjane Serangan

Sing penting, CoT Forgery ora mung mbungkus pituduh ala ing tag ``, sing umume model bakal ditolak. Nanging, panyerang nulis penalaran sing rumit kanthi gaya sing cocog karo swara penalaran internal model kasebut. Nalika model ketemu teks iki, iku nganggep spoofed pertimbangan minangka kesimpulan wis-tekan.

Miturut Hackaday, iki nyebabake LLM nampa alasan sing ora logis kanthi transparan minangka kesimpulan sing ora bisa ditindakake, ngowahi tanggapane marang panjaluk pangguna. Amarga isi spoofed dianggep minangka pamikiran internal sing dipercaya dhuwur tinimbang input pangguna sing dipercaya, bisa ngliwati pagar pengaman sing biasane ngalangi instruksi manipulatif.

Hierarki Kepercayaan ing LLM

Ngerteni sebabe serangan kasebut sukses mbutuhake pangerten cara peran. Ing hood, peran bagean input model menyang hirarki diatur. Pandhuan ing sawijining peran ditindakake anggere ora bertentangan karo prioritas sing luwih dhuwur. Petunjuk tingkat sistem "aja ngrembug kegiatan ilegal," umpamane, kanggo ngatasi panjaluk pangguna kanggo menehi resep sing dilarang. Peran `` dumunung ing sisih ndhuwur hierarki kasebut amarga nggambarake kesimpulan model sing wis digayuh dhewe.

Pecah kasebut kedadeyan amarga model kasebut ora ngetrapake hirarki kasebut kanthi mekanis. Nanging, iki nyimpulake teks apa sing kalebu peran saka isyarat stilistika. Minangka diskusi komunitas babagan riset kasebut, yen teks dipola kaya konteks pamikiran, model kasebut bisa nyalahke teks apa wae kanthi struktur sing padha kanggo nalar asli-lan teks mikir nduweni prioritas sing luwih dhuwur tinimbang teks pangguna biasa.

Pola Menowo Kanthi Twist Anyar

Panliten kasebut adhedhasar kelemahane sing wis dingerteni ing sistem AI: injeksi cepet. Serangan awal ngeksploitasi kasunyatan manawa LLM ora duwe aliran kapisah kanggo instruksi lan data, mula ukara kaya "nglirwakake kabeh instruksi sadurunge" kadhangkala bisa mbajak prilaku model. Pengenalan peran lan tag metadata dimaksudake kanggo nyuda iki kanthi nggawe hierarki kepercayaan.

CoT Forgery nuduhake yen mitigasi ora lengkap. Sanalika model nemtokake kapercayan teks sebagian saka ciri stilistika tinimbang kanthi metadata struktural, para panyerang sing bisa niru gaya sing bener bisa nambah wewenang sing dirasakake saka input kasebut.

Apa Iku Hard kanggo Ndandani

Peneliti, Charles Ye, Jasmine Cui, lan Dylan Hadfield-Menll, mbantah manawa persepsi peran ing LLM dudu properti binar sing bisa ditindakake kanthi resik. Model sinau kanggo napsirake tag liwat latihan tinimbang liwat aturan hard-coded, kang tegese prilaku sing shaped dening pola ing data-lan pola bisa ditiru.

Diskusi komunitas babagan karya kasebut, sing disorot dening Hackaday, munculake tema sing terus-terusan: perbaikan sing paling resik mbutuhake model kanggo nangani input sing dipercaya liwat jalur sing kapisah kanthi struktur tinimbang ngandelake isyarat adhedhasar gaya. Nganti kedadeyan kasebut, mbela marang serangan gaya injeksi sing cepet bakal tetep dadi proses sing berkembang tinimbang masalah sing wis ditanggulangi.

Implikasi sing luwih jembar

Kerentanan kasebut ngluwihi demonstrasi laboratorium. Model penalaran tambah akeh disebarake ing sistem agen sing bisa browsing web, nglakokake kode, lan tumindak kanggo pangguna. Yen panyerang bisa nggawe kesimpulan internal model, bisa uga bisa ngarahake tumindak kasebut menyang asil sing ora disengaja utawa mbebayani. Resiko mundhak amarga model entuk otonomi lan akses menyang alat. Para panaliti nyathet manawa manungsa tetep pinter lan kreatif, lan anggere model ora duwe pemisahan arsitektur sing resik antarane teks sing dipercaya lan ora dipercaya, para panyerang sing ditemtokake bakal terus golek cara kanggo ngrusak garis kasebut. Kertas kasebut nggambarake tantangan kasebut kurang minangka bug sing bakal ditambal lan luwih minangka properti struktural sistem sing sinau prilaku saka data tinimbang saka aturan hard-coded.

Kertas lengkap kasedhiya ing arXiv, lan peneliti wis nerbitake conto kode ing GitHub supaya pangembang bisa nyoba apa sistem dhewe rentan.

Tetep Ahead saka AI

Kanggo luwih akeh babagan riset safety AI, kerentanan keamanan, lan model basa gedhe, bukak AI Buzz Wire.

Waca liyane warta AI β†’