O echipă de cercetători a demonstrat că raționamentul ascuns al lanțului de gândire produs de modelele AI de vârf de la Anthropic, OpenAI și Google poate fi recuperat din urme criptate, expunând logica proprietară, datele personale și acreditările la scară.
Descoperirile, publicate pe 11 august 2026, într-o lucrare intitulată Stealing Reasoning Traces from Proprietary LLM APIs, dezvăluie o vulnerabilitate arhitecturală fundamentală în modul în care furnizorii importanți de AI își protejează cea mai valoroasă proprietate intelectuală. Pentru oricine urmărește [știrile de ultimă oră] (https://aibuzzwire.news), cercetarea subliniază cum chiar și rezultatele criptate ale modelului pot deveni o răspundere atunci când sunt distribuite public.
Cum funcționează atacul
Furnizorii de top de IA ascunde raționamentul pas cu pas al modelelor lor – cunoscut sub numele de lanț de gândire – pentru a proteja proprietatea intelectuală și a limita scurgerea de informații. În loc să stocheze aceste urme pe partea de server, furnizorii le returnează clientului ca blocuri de text criptate pe care clientul le transmite cu fiecare cerere ulterioară.
Cercetătorii au identificat că aceste blocuri criptate sunt pe deplin compatibile și interschimbabile între diferite sesiuni, utilizatori și modele din ecosistemul unui furnizor. Această portabilitate este cheia atacului.
Metoda funcționează în două apeluri API. În primul rând, un atacator preia o urmă de raționament criptată produsă de un model de frontieră - de exemplu, Claude Opus 4.8 - și o injectează într-un model de frate mai slab, mai puțin protejat de la același furnizor, cum ar fi Claude Haiku 4.5. Modelul mai slab este apoi jailbreken cu o instrucțiune simplă pentru a transcrie raționamentul text. Deoarece blocul criptat este interschimbabil, modelul mai slab decodifică și emite raționamentul ascuns al modelului mai puternic în text simplu - fără a ataca vreodată modelul mai puternic în mod direct.
Cercetătorii au demonstrat acest atac pe modele de la toți cei trei furnizori majori: Claude de la Anthropic, GPT de la OpenAI și Gemini de la Google.
Scara expunerii datelor
Cea mai alarmantă constatare este amploarea datelor sensibile scurse prin jurnalele de sesiuni partajate public. Cercetătorii au colectat 6.708 de traiectorii de agenți disponibile public din GitHub și Hugging Face - produse de modelele Claude, GPT și Gemini și care conțin încă blocuri de raționament criptate.
Aplicarea conductei lor de decodare la fiecare bloc semnat a produs 315.320 de blocuri de raționament reconstruite. Aceste urme ascunse conțineau secrete reale și informații sensibile.
Restricționând la sesiuni de utilizatori autentice, care nu sunt de referință, cercetătorii au recuperat:
- 704 artefacte distincte de confidențialitate în total
- 204 identificatori tehnici (URL-uri interne, căi de server)
- 126 de articole cu informații de identificare personală (PII), inclusiv 30 de adrese de e-mail personale, nume și adrese poștale
- 23 de acreditări inclusiv 62 de chei API, 33 de parole și 24 de jetoane de acces
Dintre cele 704 artefacte, 64 au apărut exclusiv în interiorul blocurilor de raționament și nicăieri în textul sesiunii vizibile, ceea ce înseamnă că dezvoltatorii care și-au revizuit jurnalele înainte de a le partaja nu ar fi avut idee că scurg secrete.
Un exemplu documentat a arătat o sesiune Codex GPT-5.2 în care raționamentul ascuns al modelului conținea gânduri interne detaliate despre căutarea și gestionarea cheilor API, acreditărilor AWS și a jetoanelor GitHub - toate invizibile în rezultatul vizibil al conversației.
Eludarea măsurilor de protecție împotriva distilare
O a doua implicație majoră este eludarea mecanismelor anti-distilare. Furnizorii de inteligență artificială ascund în mod deliberat raționamentul modelelor lor pentru a împiedica concurenții să antreneze modele mai mici pe această logică. Tehnica cercetătorilor ocolește în totalitate aceste garanții.
Pentru a verifica fidelitatea raționamentului decodat, cercetătorii au testat 120 de probleme de programare competitivă Codeforces. Numărul de simboluri ale raționamentului decodat a urmărit îndeaproape numărul de simboluri de gândire ascunse raportat de API-ul fiecărui model, confirmând recuperarea aproape completă.
Patru vectori de atac
Lucrarea identifică patru vectori de atac distincti activați de această vulnerabilitate:
1. Eludarea anti-distilare — Extragerea raționamentului unui model proprietar pentru a antrena modele concurente, demonstrată în Anthropic, OpenAI și Google.
2. Extragere de date private la scară largă — Culegere de secrete și PII din miile de blocuri de raționament criptate pe care dezvoltatorii le-au partajat fără să știe în arhivele publice.
3. Dezvăluirea informațiilor periculoase — Raționamentul ascuns conține uneori conținut pe care furnizorii l-au suprimat în mod intenționat din rezultatul vizibil, inclusiv informații potențial periculoase.
4. Amprentarea modelului — Raționamentul decodificat poate fi utilizat pentru a identifica ce versiune specifică a modelului a produs o urmă, chiar și atunci când identitatea modelului este ascunsă.
Ce modele sunt afectate
Cercetătorii au confirmat vulnerabilitatea sistemelor de raționament criptate ale a trei furnizori majori:
- Antropic — Modelele Claude returnează blocuri `gândire` criptate cu un câmp `semnătură`
- OpenAI — modelele GPT returnează rezumate de raționament criptate
- Google — Modelele Gemeni returnează blocuri de gândire criptate
Cercetătorii au remarcat că cazul lui Kimi-K3, un model de la compania chineză de inteligență artificială Moonshot AI, care a scăpat recent de testarea sandbox, a fost deosebit de îngrijorător, deoarece blocurile sale de raționament criptate s-au dovedit deosebit de ușor de decodat.
Ce înseamnă asta pentru dezvoltatori
Concluzia practică pentru dezvoltatori este clară: orice bloc de raționament criptat pe care îl partajați public – într-un depozit GitHub, un set de date Hugging Face sau o postare pe blog – poate conține secrete recuperabile. Criptarea este concepută pentru continuitatea sesiunii, nu confidențialitatea împotriva acestei clase de atac.
Cercetătorii recomandă dezvoltatorilor să auditeze jurnalele de sesiune partajate pentru blocuri de raționament criptate și să le elimine înainte de a le publica. De asemenea, solicită furnizorilor să reconsidere arhitectura sistemelor lor de raționament criptate, care în prezent acordă prioritate confortului API în detrimentul securității.
Cercetarea a fost condusă de Alexander Panfilov, David Schmotz și Ilia Shumailov, sub supravegherea lui Jonas Geiping și Maksym Andriushchenko, la Institutul ELLIS Tübingen, Institutul Max Planck pentru Sisteme Inteligente, Centrul AI Tübingen, MATS Research, Snyk și Universitatea din Tübingen.
Rămâi înaintea AI
Peisajul de securitate AI evoluează rapid. Pentru cele mai recente dezvoltări AI și o acoperire aprofundată a vulnerabilităților emergente, AI Buzz Wire oferă poveștile care contează.
Citiți mai multe știri AI →