Forskare har visat en kraftfull ny attack mot resonerande AI-modeller som utnyttjar en grundläggande blind fläck i hur stora språkmodeller (LLM) separerar instruktioner från data. Tekniken, som kallas Chain-of-Thought (CoT) Forgery, lurar en modell att behandla text från angripare som om det vore modellens egna privata interna resonemang, vilket gör att texten kan åsidosätta legitima instruktioner.
Resultaten, rapporterade av Hackaday, understryker varför säkra AI-system mot manipulation förblir ett olöst problem. Följ vår AI-industribevakning för att hålla jämna steg med nya hot inom området för pågående analys.
Grundorsaken: Rollförvirring
Kärnan i sårbarheten är vad forskarna beskriver som "rollförvirring". Moderna LLM:er tar emot all sin input – systemregler, användarförfrågningar och modellens egen tankekedja – via en enda textkanal. För att införa ordning använder utvecklare metadatataggar som `
Taggen `
Hur attacken fungerar
Avgörande är att CoT-förfalskning inte bara är en fråga om att linda in en skadlig uppmaning inuti `
Enligt Hackaday får detta LLM att acceptera öppet ologiska resonemang som en förutsättning, vilket ändrar dess svar på en användares begäran. Eftersom det förfalskade innehållet uppfattas som en intern tanke med hög förtroende snarare än användarinput med låg förtroende, kan det kringgå skyddsräcken som normalt skulle blockera manipulativa instruktioner.
Förtroendehierarkin i en LLM
För att förstå varför attacken lyckas krävs att man förstår hur roller fungerar. Under huven segmenterar roller modellens input i en organiserad hierarki. Instruktioner i en roll följs så länge de inte står i konflikt med högre prioriterade. Ett direktiv på systemnivå om "diskutera inte olagliga aktiviteter", till exempel, är avsett att åsidosätta en användarbegäran om att tillhandahålla ett förbjudet recept. Rollen `
Nedbrytningen uppstår eftersom modellen inte upprätthåller den hierarkin mekaniskt. Istället sluter man sig till vilken text som hör till vilken roll delvis utifrån stilistiska signaler. Som diskussion om forskningen i samhället noterade, om text är mönstrad som ett tänkande sammanhang, kan modellen förväxla vilken text som helst med en liknande struktur för äkta resonemang – och tänkande text har högre prioritet än vanlig användartext.
Ett bekant mönster med en ny twist
Forskningen bygger på en sedan länge erkänd svaghet i AI-system: snabb injektion. Tidiga attacker utnyttjade det faktum att LLM:er inte har några separata strömmar för instruktioner och data, så en fras som "ignorera alla tidigare instruktioner" kan ibland kapa en modells beteende. Införandet av roller och metadatataggar var tänkt att mildra detta genom att skapa en förtroendehierarki.
CoT-förfalskning visar att begränsningen är ofullständig. Så länge som modeller bedömer textens tillförlitlighet delvis utifrån dess stilistiska egenskaper snarare än strikt utifrån dess strukturella metadata, kan angripare som kan härma rätt stil eskalera den upplevda auktoriteten i deras input.
Varför det är svårt att fixa
Forskarna, Charles Ye, Jasmine Cui och Dylan Hadfield-Menll, hävdar att rolluppfattning i LLM:er inte är en binär egenskap som rent kan genomdrivas. Modeller lär sig att tolka taggar genom träning snarare än genom hårdkodade regler, vilket innebär att deras beteende formas av mönster i data – och mönster kan imiteras.
Gemenskapsdiskussion om arbetet, framhävd av Hackaday, dök upp ett återkommande tema: den renaste lösningen skulle kräva att modeller hanterar pålitliga input genom strukturellt separata vägar snarare än att förlita sig på inlärda, stilbaserade signaler. Tills det händer kommer att försvara sig mot snabba injektionsliknande attacker sannolikt att förbli en utvecklingsprocess snarare än ett löst problem.
De bredare konsekvenserna
Sårbarheten har betydelse bortom laboratoriedemonstrationer. Resonemangsmodeller används alltmer i agentsystem som kan surfa på webben, köra kod och vidta åtgärder för en användares räkning. Om en angripare kan förfalska en modells interna slutsatser kan de kanske styra dessa åtgärder mot oavsiktliga eller skadliga resultat. Risken ökar i takt med att modeller får mer autonomi och tillgång till verktyg. Forskarna noterar att människor förblir smarta och kreativa, och så länge som modeller saknar en ren arkitektonisk separation mellan pålitlig och opålitlig text, kommer beslutsamma angripare att fortsätta att hitta sätt att sudda ut gränsen. Tidningen ramar in utmaningen mindre som en bugg som ska korrigeras och mer som en strukturell egenskap hos system som lär sig sitt beteende från data snarare än från hårdkodade regler.
Hela artikeln finns tillgänglig på arXiv, och forskarna har publicerat kodexempel på GitHub så att utvecklare kan testa om deras egna system är mottagliga.
Ligg före AI
Besök AI Buzz Wire för mer om AI-säkerhetsforskning, säkerhetssårbarheter och gränsen för stora språkmodeller.
Läs mer AI-nyheter →


