Watafiti wameonyesha shambulio jipya la nguvu dhidi ya miundo ya AI ya kufikiri ambayo hutumia sehemu kuu ya upofu katika jinsi miundo mikubwa ya lugha (LLMs) inavyotenganisha maagizo kutoka kwa data. Mbinu hiyo, inayoitwa Chain-of-Thought (CoT) Forgery, huhadaa mtindo katika kushughulikia maandishi yanayotolewa na mvamizi kana kwamba ni mawazo ya kibinafsi ya ndani ya mtindo huo, na kuruhusu maandishi hayo kubatilisha maagizo halali.

Matokeo hayo, yaliyoripotiwa na Hackaday, yanasisitiza kwa nini kupata mifumo ya AI dhidi ya ghiliba bado ni tatizo ambalo halijatatuliwa. Ili kufuatilia vitisho vinavyojitokeza, fuata utoaji wetu wa sekta ya AI kwa uchanganuzi unaoendelea.

Chanzo Cha msingi: Mkanganyiko wa Wajibu

Kiini cha mazingira magumu ni kile ambacho watafiti wanaelezea kama "mkanganyiko wa jukumu." LLM za kisasa hupokea pembejeo zao zote—sheria za mfumo, maombi ya mtumiaji, na mawazo ya kielelezo yenyewe—kupitia chaneli moja ya maandishi. Ili kuweka utaratibu, wasanidi programu hutumia lebo za metadata kama vile ``, ``, na `` ili kuunda safu ya uaminifu. Maagizo ya `` ili kuepuka maudhui hatari, kwa mfano, yanafaa kubatilisha ombi la `` kinyume chake.

Lebo ya `` ina nguvu zaidi kwa sababu inawakilisha mchakato wa mawazo wa ndani wa modeli, mtiririko unaoaminika sana. Shida, watafiti waligundua, ni kwamba mifano haitegemei vitambulisho wenyewe kuamua nini cha kuamini. Wanatanguliza mtindo wa uandishi. Maandishi ambayo yameumbizwa kimitindo ili kufanana na matokeo ya ndani ya `` ya mfano yanaweza kudhaniwa kimakosa kuwa mawazo ya kweli, bila kujali yalitoka wapi.

Jinsi Shambulizi linavyofanya kazi

Muhimu zaidi, CoT Forgery sio tu suala la kuingiza kidokezo hasidi ndani ya lebo za ``, ambazo miundo mingi inaweza kukataa. Badala yake, mshambulizi anaandika hoja zilizochanganyikiwa kwa mtindo unaolingana kwa karibu na sauti yake ya ndani ya hoja ya ndani. Muundo unapokutana na maandishi haya, huchukulia hoja potovu kama hitimisho ambalo tayari limefikiwa.

Kulingana na Hackaday, hii husababisha LLM kukubali hoja zisizo na mantiki kwa uwazi kama hitimisho lililotangulia, kubadilisha majibu yake kwa ombi la mtumiaji. Kwa sababu maudhui yaliyoibiwa yanatambuliwa kama mawazo ya ndani ya imani ya juu badala ya ingizo la mtumiaji asiyeaminika, inaweza kupita njia za usalama ambazo kwa kawaida zinaweza kuzuia maagizo ya hila.

Daraja la Uaminifu Ndani ya LLM

Kuelewa kwa nini shambulio hilo linafanikiwa kunahitaji kuelewa jinsi majukumu yanavyofanya kazi. Chini ya kofia, majukumu hugawanya ingizo la modeli katika safu iliyopangwa. Maagizo katika jukumu hufuatwa mradi tu hayapingani na yale ya kipaumbele cha juu. Agizo la kiwango cha mfumo la "usijadili shughuli haramu," kwa mfano, linakusudiwa kubatilisha ombi la mtumiaji la kutoa kichocheo kilichopigwa marufuku. Jukumu la `` linakaa karibu na sehemu ya juu ya daraja hilo kwa sababu linawakilisha hitimisho ambalo mwanamitindo anaamini kuwa tayari limefikia kivyake.

Uchanganuzi hutokea kwa sababu modeli haitekelezi uongozi huo kimakanika. Badala yake, inakisia ni maandishi gani ni ya jukumu lipi kwa kiasi fulani kutoka kwa viashiria vya kimtindo. Kama majadiliano ya jumuiya ya utafiti yalivyobainishwa, ikiwa maandishi yamechorwa kama muktadha wa kufikiri, modeli inaweza kukosea matini yoyote yenye muundo sawa na hoja halisi—na matini ya kufikiri hubeba kipaumbele cha juu zaidi kuliko matini ya kawaida ya mtumiaji.

Mchoro Unaojulikana Kwa Msokoto Mpya

Utafiti unatokana na udhaifu unaotambulika kwa muda mrefu katika mifumo ya AI: sindano ya papo hapo. Mashambulizi ya mapema yalitumia ukweli kwamba LLM hazina mitiririko tofauti ya maagizo na data, kwa hivyo kifungu cha maneno kama "puuza maagizo yote ya hapo awali" kinaweza wakati mwingine kuteka nyara tabia ya mwanamitindo. Utangulizi wa majukumu na lebo za metadata ulikusudiwa kupunguza hili kwa kuunda safu ya uaminifu.

CoT Forgery inaonyesha kuwa upunguzaji haujakamilika. Maadamu miundo inahukumu uaminifu wa maandishi kwa sehemu kwa sifa zake za kimtindo badala ya metadata yake ya muundo, wavamizi wanaoweza kuiga mtindo unaofaa wanaweza kuongeza mamlaka inayotambulika ya maoni yao.

Kwa Nini Ni Ngumu Kurekebisha

Watafiti, Charles Ye, Jasmine Cui, na Dylan Hadfield-Menll, wanasema kwamba mtazamo wa jukumu katika LLMs sio mali ya binary ambayo inaweza kutekelezwa kwa usafi. Wanamitindo hujifunza kutafsiri vitambulisho kupitia mafunzo badala ya kupitia sheria zilizowekewa msimbo ngumu, kumaanisha kuwa tabia zao huchangiwa na ruwaza katika data—na ruwaza zinaweza kuigwa.

Majadiliano ya jumuiya kuhusu kazi hii, yaliyoangaziwa na Hackaday, yaliibua mada inayojirudia: urekebishaji safi zaidi ungehitaji miundo ya kushughulikia pembejeo zinazoaminika kupitia njia tofauti za kimuundo badala ya kutegemea vidokezo vilivyojifunza, kulingana na mtindo. Hadi hilo kutendeka, kujilinda dhidi ya mashambulizi ya haraka ya mtindo wa sindano kutabaki kuwa mchakato unaoendelea badala ya kuwa tatizo lililotatuliwa.

Athari Kwa mapana zaidi

Athari ni muhimu zaidi ya maonyesho ya maabara. Miundo ya hoja inazidi kutumiwa katika mifumo ya mawakala ambayo inaweza kuvinjari wavuti, kutekeleza msimbo, na kuchukua hatua kwa niaba ya mtumiaji. Ikiwa mshambulizi anaweza kuunda hitimisho la ndani la mtindo, anaweza kuelekeza vitendo hivyo kwenye matokeo yasiyotarajiwa au hatari. Hatari inakua kadiri wanamitindo wanavyopata uhuru zaidi na ufikiaji wa zana. Watafiti wanabainisha kuwa wanadamu hubakia kuwa wajanja na wabunifu, na mradi tu wanamitindo wanakosa utengano safi wa usanifu kati ya maandishi yanayoaminika na yasiyoaminika, washambuliaji waliodhamiria wataendelea kutafuta njia za kutia ukungu. Karatasi huweka changamoto kuwa ndogo kama hitilafu inayoweza kuwekewa viraka na zaidi kama sifa ya muundo wa mifumo ambayo hujifunza tabia zake kutoka kwa data badala ya kutoka kwa sheria zenye misimbo migumu.

Karatasi kamili inapatikana kwenye arXiv, na watafiti wamechapisha mifano ya nambari kwenye GitHub ili watengenezaji waweze kujaribu ikiwa mifumo yao wenyewe inahusika.

Kaa Mbele ya AI

Kwa zaidi kuhusu utafiti wa usalama wa AI, athari za kiusalama, na mipaka ya miundo mikubwa ya lugha, tembelea AI Buzz Wire.

Soma habari zaidi za AI →