Les chercheurs ont démontré une nouvelle attaque puissante contre les modèles d’IA de raisonnement qui exploite un angle mort fondamental dans la façon dont les grands modèles de langage (LLM) séparent les instructions des données. La technique, appelée Chain-of-Thought (CoT) Forgery, incite un modèle à traiter le texte fourni par l'attaquant comme s'il s'agissait du raisonnement interne privé du modèle, permettant ainsi au texte de remplacer les instructions légitimes.

Les résultats, rapportés par Hackaday, soulignent pourquoi la sécurisation des systèmes d’IA contre la manipulation reste un problème non résolu. Pour rester au courant des menaces émergentes dans le domaine, suivez notre Couverture de l'industrie de l'IA pour une analyse continue.

La cause profonde : la confusion des rôles

Au cœur de la vulnérabilité se trouve ce que les chercheurs décrivent comme une « confusion des rôles ». Les LLM modernes reçoivent toutes leurs entrées (règles du système, demandes des utilisateurs et propre raisonnement de la chaîne de pensée du modèle) via un seul canal de texte. Pour imposer l'ordre, les développeurs utilisent des balises de métadonnées telles que ``, `` et `` pour créer une hiérarchie de confiance. Une directive `` pour éviter les contenus nuisibles, par exemple, est censée remplacer une requête `` indiquant le contraire.

La balise `` est particulièrement puissante car elle représente le processus de raisonnement interne du modèle, un flux qui suscite une grande confiance. Le problème, ont découvert les chercheurs, est que les modèles ne s’appuient pas principalement sur les balises elles-mêmes pour décider à quoi faire confiance. Ils privilégient le style d’écriture. Un texte formaté stylistiquement pour ressembler à la sortie interne «  » d'un modèle peut être confondu avec un véritable raisonnement, quelle que soit son origine réelle.

Comment fonctionne l'attaque

Fondamentalement, CoT Forgery ne consiste pas simplement à envelopper une invite malveillante dans des balises « », que la plupart des modèles rejetteraient. Au lieu de cela, l’attaquant écrit un raisonnement alambiqué dans un style qui correspond étroitement à la voix de raisonnement interne distincte du modèle. Lorsque le modèle rencontre ce texte, il traite le raisonnement falsifié comme une conclusion déjà atteinte.

Selon Hackaday, cela amène le LLM à accepter un raisonnement illogique de manière transparente comme une fatalité, modifiant ainsi sa réponse à la demande d'un utilisateur. Étant donné que le contenu usurpé est perçu comme une pensée interne hautement fiable plutôt que comme une entrée utilisateur peu fiable, il peut contourner les garde-fous de sécurité qui bloqueraient normalement les instructions manipulatrices.

La hiérarchie de confiance au sein d'un LLM

Comprendre pourquoi l’attaque réussit nécessite de comprendre comment fonctionnent les rôles. Sous le capot, les rôles segmentent la contribution du modèle dans une hiérarchie organisée. Les instructions d'un rôle sont suivies tant qu'elles n'entrent pas en conflit avec celles de priorité plus élevée. Une directive au niveau du système « ne discutez pas des activités illégales », par exemple, est destinée à ignorer une demande d'utilisateur visant à fournir une recette interdite. Le rôle «  » se situe au sommet de cette hiérarchie car il représente les conclusions que le modèle pense avoir déjà atteinte par lui-même.

La panne se produit parce que le modèle n’applique pas mécaniquement cette hiérarchie. Au lieu de cela, il déduit quel texte appartient à quel rôle, en partie à partir d'indices stylistiques. Comme l’ont noté les discussions communautaires sur la recherche, si le texte est structuré comme un contexte de pensée, le modèle peut confondre tout texte ayant une structure similaire avec un véritable raisonnement – ​​et le texte de réflexion a une priorité plus élevée que le texte d’un utilisateur ordinaire.

Un modèle familier avec une nouvelle tournure

La recherche s’appuie sur une faiblesse reconnue depuis longtemps dans les systèmes d’IA : l’injection rapide. Les premières attaques exploitaient le fait que les LLM n'avaient pas de flux séparés pour les instructions et les données, de sorte qu'une phrase telle que « ignorer toutes les instructions précédentes » pouvait parfois détourner le comportement d'un modèle. L'introduction de rôles et de balises de métadonnées visait à atténuer ce problème en créant une hiérarchie de confiance.

CoT Forgery démontre que l’atténuation est incomplète. Tant que les modèles jugent la fiabilité du texte en partie par ses caractéristiques stylistiques plutôt que strictement par ses métadonnées structurelles, les attaquants capables d'imiter le bon style peuvent accroître l'autorité perçue de leur entrée.

Pourquoi c'est difficile à réparer

Les chercheurs Charles Ye, Jasmine Cui et Dylan Hadfield-Menll soutiennent que la perception des rôles dans les LLM n'est pas une propriété binaire qui peut être clairement appliquée. Les modèles apprennent à interpréter les balises grâce à l'entraînement plutôt qu'à l'aide de règles codées en dur, ce qui signifie que leur comportement est façonné par des modèles présents dans les données et que ces modèles peuvent être imités.

Les discussions communautaires sur le travail, soulignées par Hackaday, ont fait ressortir un thème récurrent : la solution la plus propre nécessiterait que les modèles gèrent les entrées fiables via des voies structurellement distinctes plutôt que de s'appuyer sur des indices appris et basés sur le style. En attendant, la défense contre les attaques par injection rapide restera probablement un processus évolutif plutôt qu’un problème résolu.

Les implications plus larges

La vulnérabilité compte au-delà des démonstrations en laboratoire. Les modèles de raisonnement sont de plus en plus déployés dans les systèmes agentiques capables de naviguer sur le Web, d'exécuter du code et d'effectuer des actions au nom d'un utilisateur. Si un attaquant parvient à forger les conclusions internes d’un modèle, il pourra alors orienter ces actions vers des résultats inattendus ou nuisibles. Le risque augmente à mesure que les modèles gagnent en autonomie et accèdent aux outils. Les chercheurs notent que les humains restent intelligents et créatifs et que tant que les modèles ne disposeront pas d’une séparation architecturale nette entre le texte fiable et non fiable, les attaquants déterminés continueront à trouver des moyens de brouiller la frontière. Le document présente le défi moins comme un bug à corriger que comme une propriété structurelle des systèmes qui apprennent leur comportement à partir de données plutôt que de règles codées en dur.

L'article complet est disponible sur arXiv et les chercheurs ont publié des exemples de code sur GitHub afin que les développeurs puissent tester si leurs propres systèmes sont sensibles.

Gardez une longueur d'avance sur l'IA

Pour en savoir plus sur la recherche sur la sécurité de l'IA, les vulnérabilités de sécurité et la frontière des grands modèles de langage, visitez AI Buzz Wire.

Lire plus d'actualités sur l'IA →