OpenAI a publicat o postare de securitate pe 30 septembrie 2026, descriind modul în care a identificat și a perturbat o campanie coordonată pentru a extrage raționament protejat din modelele sale – și a atribuit un grup central al activității persoanelor asociate cu Moonshot AI, laboratorul chinez din spatele familiei de modele Kimi.

Dezvăluirea aterizează într-un moment sensibil pentru industrie, unde valoarea unui model de frontieră constă din ce în ce mai mult nu doar în răspunsurile sale, ci și în modul în care raționează. Pentru cititorii care urmăresc cele mai recente evoluții AI, cazul oferă o privire neobișnuit de detaliată asupra modului în care modelul IP este atacat la scară – și a modului în care laboratoarele răspund.

Ce înseamnă aici „distilarea adversară”.

OpenAI descrie activitatea ca fiind în concordanță cu distilarea adversativă, pe care o definește ca fiind utilizarea sistematică și neautorizată a rezultatelor sau raționamentului unui model pentru a ajuta la formarea, reproducerea sau îmbunătățirea unui alt model. „Raționamentul protejat” este înregistrarea internă a modelului pentru a lucra printr-o sarcină - informații care sunt în mod normal ascunse din răspunsul final pe care îl vede un utilizator. Extragerea acestuia, susține compania, îi poate ajuta pe alții să reproducă capacități pe care nu le-au construit.

Este important că OpenAI spune că operatorii nu i-au încălcat criptarea, nu au compromis o bază de date și nu au obținut acces direct la conversațiile stocate ale utilizatorilor. În schimb, au manipulat interacțiunile modelului, astfel încât raționamentul protejat să poată fi reprodus în forme vizibile pentru solicitant - un abuz coordonat, de mare volum al produsului în sine, mai degrabă decât un hack tradițional.

O tehnică documentată de OpenAI a implicat copierea urmelor raționamentului criptate dintr-o conversație și apoi solicitarea unui model într-o conversație separată să decripteze și să transcrie conținutul raționamentului ascuns. Compania a subliniat că manipularea nu este o vulnerabilitate unică pentru propriile modele și a spus că a împărtășit detalii cu partenerii din industrie prin Forumul Modelului Frontier pentru a consolida apărarea colectivă.

Cronologia: 16.000 de solicitări în două zile

Potrivit postării, campania a început pe 1 iulie 2026 la un volum relativ scăzut. A escaladat brusc pe 24 și 25 iulie, când OpenAI a observat vârfuri de volum mare de 16.000 de solicitări folosind un model de extracție relevant, provenind de la peste 4.000 de utilizatori. O notă de subsol din postare avertizează că aceste cifre descriu încercări de extracție - nu neapărat de succes.

O investigație ulterioară a scos la iveală activități legate de tipar prompt într-un grup de peste 15.000 de utilizatori. OpenAI spune că a perturbat pe deplin campania până la 28 iulie 2026 și că activitatea a continuat să evolueze de-a lungul timpului, întărindu-și opinia conform căreia distilarea adversară necesită apărări adaptative stratificate, mai degrabă decât o soluție unică.

Atribuirea punctelor către Moonshot AI

OpenAI este atent cu atribuirea sa. Se spune că nu este clar dacă toți operatorii observați în timpul perioadei provin de la un singur actor, dar că atribuie un grup central al activității indivizilor asociați cu Moonshot AI, dezvoltatorul Kimi.

Revendicarea nu ajunge în vid. La 8 septembrie 2026, Agenția Națională de Securitate, Agenția pentru Securitate Cibernetică și Infrastructură și FBI au lansat un aviz comun de securitate cibernetică în care afirmă că Moonshot AI a desfășurat o campanie de distilare pe scară largă împotriva companiilor AI de frontieră din SUA de cel puțin la jumătatea anului 2025. Potrivit avizului, Moonshot a extras date semnificative Claude Fable 5 pentru a-și antrena modelul Kimi-K3 și datele GPT-4o pentru a antrena Kimi-K2, folosind modele americane pentru a distila capabilități de reglare fină supravegheată, învățare prin consolidare, inginerie software și matematică.

Avizul merge mai departe, afirmând că, probabil cu conștientizarea guvernului chinez, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun și Z.AI au extras în mod colectiv miliarde de jetoane în milioane de schimburi din modele de frontieră din SUA, inclusiv variante Claude, GPT, Gemini și Grok, de la cel puțin la sfârșitul anului 2024. furnizori și agregatori terți, plus o piață gri a proxy-urilor API cunoscute sub denumirea de „stații de transfer” folosite pentru a ocoli restricțiile geografice și termenii și condițiile. Se pare că economiile de costuri au venit din achiziționarea în bloc de abonamente premium partajate între echipele de dezvoltatori.

De ce merită furate urmele de raționament

Preocuparea securității depășește avantajul competitiv. OpenAI susține că raționamentul extras ar putea fi folosit pentru a antrena un alt model fără a păstra garanțiile aplicate rezultatelor modelului original orientate spre utilizator - ceea ce înseamnă că distilarea la scară poate transfera capabilități avansate fără investiția corespunzătoare în siguranță. Compania spune că aceste riscuri cresc pe măsură ce modelele câștigă abilități în domenii cu dublă utilizare.

Cercetătorii independenți au tras aceeași alarmă. Într-o lucrare trimisă la arXiv pe 10 august 2026, un grup de cercetători, printre care Alexander Panfilov, Ilia Shumailov și Maksym Andriushchenko, au raportat că furnizorii de top nu ascund pe deplin urmele de raționament ale modelelor lor și au demonstrat vulnerabilitățile legate de modele încrucișate și de compactare a conversației printr-o dezvăluire responsabilă. OpenAI spune că a investigat aceste constatări, a confirmat că căile de atac sunt reale și a folosit munca pentru a-și accelera atenuările.

Ce urmează

OpenAI spune că a investigat domeniul de aplicare al campaniei și impactul potențial înainte de publicare, a implementat propriile măsuri de atenuare și a împărtășit concluziile sale cu cercetătorii și partenerii din industrie pentru feedback. Lucrările suplimentare de atenuare și investigare continuă, iar compania încadrează distilarea adversară ca o provocare mai largă de securitate pentru întregul ecosistem de laborator de frontieră, mai degrabă decât un singur incident.

Episodul acutizează, de asemenea, o dezbatere politică în curs. Dacă agențiile americane atribuie în mod oficial campanii de distilare laboratoarelor chineze, așteptați-vă la controale mai stricte asupra accesului la API, la limitarea ratei mai agresive și la verificări de identitate și la o presiune continuă asupra piețelor agregatoare și proxy, care fac mai ușor de ascuns abuzul pe scară largă. Pentru companiile de inteligență artificială de pe ambele maluri ale Pacificului, stratul de raționament este acum un activ contestat – iar protejarea acestuia a devenit o disciplină de securitate proprie.

---

Rămâneți înaintea AI

Obțineți cele mai recente știri, analize și descoperiri despre AI - toate într-un singur loc.

Citiți mai multe știri AI →