Forscher haben einen leistungsstarken neuen Angriff auf schlussfolgernde KI-Modelle demonstriert, der einen grundlegenden blinden Fleck bei der Art und Weise ausnutzt, wie große Sprachmodelle (LLMs) Anweisungen von Daten trennen. Die als Chain-of-Thought (CoT) Forgery bezeichnete Technik bringt ein Modell dazu, vom Angreifer bereitgestellten Text so zu behandeln, als wäre es die eigene private interne Argumentation des Modells, wodurch der Text legitime Anweisungen außer Kraft setzen kann.
Die von Hackaday gemeldeten Erkenntnisse unterstreichen, warum die Absicherung von KI-Systemen vor Manipulation nach wie vor ein ungelöstes Problem ist. Um über neue Bedrohungen in diesem Bereich auf dem Laufenden zu bleiben, folgen Sie unserer KI-Branchenberichterstattung für laufende Analysen.
Die Grundursache: Rollenverwirrung
Der Kern der Schwachstelle ist das, was die Forscher als „Rollenverwirrung“ bezeichnen. Moderne LLMs erhalten alle ihre Eingaben – Systemregeln, Benutzeranfragen und die eigene Gedankenkette des Modells – über einen einzigen Textkanal. Um Ordnung zu schaffen, verwenden Entwickler Metadaten-Tags wie „
Das Tag „
Wie der Angriff funktioniert
Entscheidend ist, dass es bei CoT-Forgery nicht einfach darum geht, eine böswillige Eingabeaufforderung in „
Laut Hackaday führt dies dazu, dass das LLM offensichtlich unlogisches Denken als ausgemachte Sache akzeptiert und seine Reaktion auf die Anfrage eines Benutzers verändert. Da der gefälschte Inhalt als sehr vertrauenswürdiger interner Gedanke und nicht als wenig vertrauenswürdige Benutzereingabe wahrgenommen wird, kann er Sicherheitsbarrieren umgehen, die normalerweise manipulative Anweisungen blockieren würden.
Die Hierarchie des Vertrauens in einem LLM
Um zu verstehen, warum der Angriff erfolgreich ist, muss man verstehen, wie Rollen funktionieren. Unter der Haube segmentieren Rollen die Eingaben des Modells in eine organisierte Hierarchie. Anweisungen in einer Rolle werden befolgt, sofern sie nicht im Widerspruch zu Anweisungen mit höherer Priorität stehen. Eine Systemebene-Anweisung „Diskutieren Sie keine illegalen Aktivitäten“ soll beispielsweise eine Benutzeranforderung zur Bereitstellung eines verbotenen Rezepts außer Kraft setzen. Die Rolle „
Der Zusammenbruch erfolgt, weil das Modell diese Hierarchie nicht mechanisch durchsetzt. Stattdessen wird teilweise aus stilistischen Hinweisen abgeleitet, welcher Text zu welcher Rolle gehört. Wie die Community-Diskussion der Forschung feststellte, kann das Modell, wenn Text wie ein Denkkontext strukturiert ist, jeden Text mit einer ähnlichen Struktur für echte Argumentation halten – und denkender Text hat eine höhere Priorität als gewöhnlicher Benutzertext.
Ein bekanntes Muster mit einer neuen Wendung
Die Forschung baut auf einer seit langem bekannten Schwäche von KI-Systemen auf: der sofortigen Injektion. Frühe Angriffe nutzten die Tatsache aus, dass LLMs keine separaten Streams für Anweisungen und Daten haben, sodass ein Satz wie „Alle vorherigen Anweisungen ignorieren“ manchmal das Verhalten eines Modells kapern konnte. Die Einführung von Rollen und Metadaten-Tags sollte dies durch die Schaffung einer Vertrauenshierarchie abmildern.
CoT Forgery zeigt, dass die Schadensbegrenzung unvollständig ist. Solange Modelle die Vertrauenswürdigkeit eines Textes teilweise anhand seiner stilistischen Merkmale und nicht ausschließlich anhand seiner strukturellen Metadaten beurteilen, können Angreifer, die den richtigen Stil nachahmen, die wahrgenommene Autorität ihrer Eingabe erhöhen.
Warum es schwer zu beheben ist
Die Forscher Charles Ye, Jasmine Cui und Dylan Hadfield-Menll argumentieren, dass die Rollenwahrnehmung in LLMs keine binäre Eigenschaft ist, die sauber durchgesetzt werden kann. Modelle lernen, Tags durch Training und nicht durch fest codierte Regeln zu interpretieren, was bedeutet, dass ihr Verhalten durch Muster in den Daten geprägt wird – und Muster können nachgeahmt werden.
Die von Hackaday hervorgehobene Community-Diskussion über die Arbeit brachte ein wiederkehrendes Thema ans Licht: Die sauberste Lösung würde erfordern, dass Modelle vertrauenswürdige Eingaben über strukturell getrennte Pfade verarbeiten, anstatt sich auf erlernte, stilbasierte Hinweise zu verlassen. Bis dies geschieht, wird die Abwehr von Angriffen im Prompt-Injection-Stil wahrscheinlich eher ein sich weiterentwickelnder Prozess als ein gelöstes Problem bleiben.
Die umfassenderen Implikationen
Die Sicherheitslücke ist über Labordemonstrationen hinaus von Bedeutung. Reasoning-Modelle werden zunehmend in Agentensystemen eingesetzt, die im Namen eines Benutzers im Internet surfen, Code ausführen und Aktionen ausführen können. Wenn ein Angreifer die internen Schlussfolgerungen eines Modells fälschen kann, kann er diese Aktionen möglicherweise auf unbeabsichtigte oder schädliche Ergebnisse ausrichten. Das Risiko wächst, wenn Modelle mehr Autonomie und Zugang zu Werkzeugen erlangen. Die Forscher stellen fest, dass Menschen klug und kreativ bleiben und solange Modelle keine saubere architektonische Trennung zwischen vertrauenswürdigem und nicht vertrauenswürdigem Text aufweisen, werden entschlossene Angreifer weiterhin Wege finden, die Grenze zu verwischen. Das Papier beschreibt die Herausforderung weniger als einen zu behebenden Fehler, sondern vielmehr als eine strukturelle Eigenschaft von Systemen, die ihr Verhalten aus Daten und nicht aus fest codierten Regeln lernen.
Das vollständige Papier ist auf arXiv verfügbar und die Forscher haben Codebeispiele auf GitHub veröffentlicht, damit Entwickler testen können, ob ihre eigenen Systeme anfällig sind.
Bleiben Sie der KI immer einen Schritt voraus
Weitere Informationen zur KI-Sicherheitsforschung, zu Sicherheitslücken und den Grenzen großer Sprachmodelle finden Sie unter AI Buzz Wire.
Weitere KI-Neuigkeiten lesen →


