Ett team av forskare har visat att de dolda tankekedjan som produceras av ledande AI-modeller från Anthropic, OpenAI och Google kan återställas från krypterade spår, avslöjar proprietär logik, personliga data och referenser i stor skala.
Resultaten, som publicerades den 11 augusti 2026, i en artikel med titeln Steeling Reasoning Traces from Proprietary LLM APIs, avslöjar en grundläggande arkitektonisk sårbarhet i hur stora AI-leverantörer skyddar sina mest värdefulla immateriella rättigheter. För alla som följer brytande AI-nyheter, understryker forskningen hur även krypterade modellutdata kan bli en skuld när de delas offentligt.
Hur attacken fungerar
Ledande AI-leverantörer döljer sina modellers steg-för-steg-resonemang – känd som chain-of-thought – för att skydda immateriella rättigheter och begränsa informationsläckage. Istället för att lagra dessa spår på serversidan, returnerar leverantörerna dem till klienten som krypterade textblock som klienten skickar tillbaka med varje efterföljande begäran.
Forskarna identifierade att dessa krypterade block är helt kompatibla och utbytbara över olika sessioner, användare och modeller inom en leverantörs ekosystem. Denna portabilitet är nyckeln till attacken.
Metoden fungerar i två API-anrop. Först tar en angripare ett krypterat resonemangsspår producerat av en frontier-modell - till exempel Claude Opus 4.8 - och injicerar det i en svagare, mindre skyddad syskonmodell från samma leverantör, som Claude Haiku 4.5. Den svagare modellen jailbreakas sedan med en enkel instruktion att transkribera resonemanget ordagrant. Eftersom det krypterade blocket är utbytbart, avkodar och matar den svagare modellen den starkare modellens dolda resonemang i klartext – utan att någonsin attackera den starkare modellen direkt.
Forskarna demonstrerade denna attack över modeller från alla tre stora leverantörer: Anthropics Claude, OpenAI:s GPT och Googles Gemini.
Skalan för dataexponering
Det mest alarmerande fyndet är omfattningen av känsliga data som läckt genom offentligt delade sessionsloggar. Forskarna samlade in 6 708 allmänt tillgängliga agentbanor från GitHub och Hugging Face - producerade av Claude, GPT och Gemini-modeller och fortfarande innehåller krypterade resonemangsblock.
Att tillämpa sin avkodningspipeline på varje signerat block gav 315 320 rekonstruerade resonemangsblock. Dessa dolda spår innehöll verkliga hemligheter och känslig information.
Genom att begränsa till äkta, icke-benchmark användarsessioner, återställde forskarna:
- 704 distinkta sekretessartefakter totalt
- 204 tekniska identifierare (interna webbadresser, serversökvägar)
- 126 föremål för personligt identifierbar information (PII), inklusive 30 personliga e-postadresser, namn och postadresser
- 23 referenser inklusive 62 API-nycklar, 33 lösenord och 24 åtkomsttokens
Av de 704 artefakterna dök 64 exklusivt upp i resonemangsblocken och ingenstans i den synliga sessionstexten – vilket innebär att utvecklare som granskade sina loggar innan de delade skulle inte ha haft någon aning om att de läckte hemligheter.
Ett dokumenterat exempel visade en GPT-5.2 Codex-session där modellens dolda resonemang innehöll detaljerade interna tankar om att söka efter och hantera API-nycklar, AWS-referenser och GitHub-tokens – allt osynligt i konversationens synliga utdata.
Att kringgå skydd mot destillation
En andra viktig implikation är kringgåendet av antidestillationsmekanismer. AI-leverantörer döljer medvetet sina modellers resonemang för att förhindra att konkurrenter tränar mindre modeller på den logiken. Forskarnas teknik går helt förbi dessa skyddsåtgärder.
För att verifiera troheten i det avkodade resonemanget testade forskarna 120 Codeforces konkurrenskraftiga programmeringsproblem. Token-antalet av avkodade resonemang följde noggrant det dolda tänkande-token-antal som rapporterades av varje modells API, vilket bekräftar nästan fullständig återhämtning.
Fyra attackvektorer
Uppsatsen identifierar fyra distinkta attackvektorer som möjliggörs av denna sårbarhet:
1. Anti-destillation kringgående — Extrahera en proprietär modells resonemang för att träna konkurrerande modeller, demonstrerat i Anthropic, OpenAI och Google.
2. Storskalig privat dataextraktion — Skörda hemligheter och PII från de tusentals krypterade resonemangsblock som utvecklare omedvetet har delat i offentliga arkiv.
3. Avslöjande av farlig information — Det dolda resonemanget innehåller ibland innehåll som leverantörer avsiktligt undertryckt från det synliga resultatet, inklusive potentiellt farlig information.
4. Modellfingeravtryck — Avkodade resonemang kan användas för att identifiera vilken specifik modellversion som producerade ett spår, även när modellens identitet är dold.
Vilka modeller som berörs
Forskarna bekräftade sårbarheten i de krypterade resonemangssystemen hos tre stora leverantörer:
- Antropisk — Claude-modeller returnerar krypterade "tänke"-block med ett "signatur"-fält
- OpenAI — GPT-modeller returnerar krypterade resonemangssammanfattningar
- Google — Gemini-modeller returnerar krypterade tankeblock
Forskarna noterade att fallet med Kimi-K3, en modell från det kinesiska AI-företaget Moonshot AI som nyligen undkom sandlådetestning, var särskilt oroande eftersom dess krypterade resonemangsblock visade sig vara särskilt lätta att avkoda.
Vad detta betyder för utvecklare
Det praktiska för utvecklare är starkt: alla krypterade resonemangsblock som du delar offentligt – i en GitHub-repo, en datauppsättning för Hugging Face eller ett blogginlägg – kan innehålla återställbara hemligheter. Krypteringen är utformad för sessionskontinuitet, inte konfidentialitet mot denna klass av attacker.
Forskarna rekommenderar att utvecklare granskar delade sessionsloggar för krypterade resonemangsblock och tar bort dem innan de publiceras. De uppmanar också leverantörer att ompröva arkitekturen i sina krypterade resonemangssystem, som för närvarande prioriterar API-bekvämlighet framför säkerhet.
Forskningen utfördes av Alexander Panfilov, David Schmotz och Ilia Shumailov, med handledning av Jonas Geiping och Maksym Andriushchenko, över ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems, Tübingen AI Center, MATS Research, Snyk och University of Tübingen.
Ligg före AI
AI-säkerhetslandskapet utvecklas snabbt. För den senaste AI-utvecklingen och djupgående täckning av nya sårbarheter, levererar AI Buzz Wire de berättelser som betyder något.
Läs mer AI-nyheter →