O echipă de securitate formată din trei persoane de la startup-ul Hacktron AI a folosit Claude Opus 5 de la Anthropic pentru a sparge sistemele interne ale OpenAI, renunțând cu un premiu de 6.500 USD din programul de recompensă pentru erori al OpenAI. Wall Street Journal a raportat pentru prima dată încălcarea joi, iar TechCrunch a publicat vineri un raport tehnic detaliat, bazat pe propria lucrare a cercetătorilor.
Echipa a înlănțuit două vulnerabilități critice pentru a obține acces la mai multe conturi ChatGPT ale angajaților OpenAI, ceea ce le-a permis accesul în software-ul intern al companiei. OpenAI spune că a rezolvat problemele descoperite de Hacktron, dar episodul alimentează deja o dezbatere mai largă despre cât de capabile au devenit modelele AI în găsirea și exploatarea defectelor de securitate din lumea reală. For more context on this story, see our ongoing more AI stories.
Cum s-a desfășurat hack-ul
Potrivit unei postări pe blog publicată de cercetătorii Hacktron, calea către OpenAI s-a deschis pe 25 iulie printr-o defecțiune a Discourse, software-ul terță parte care alimentează forumul comunității OpenAI.
Punctul de intrare a fost remarcabil de banal: o încărcare de imagini. Când utilizatorii au postat fișiere HEIF sau HEIC – formatele foto pe care iPhone-urile le folosesc în mod implicit – Discourse le-a trecut printr-un lanț de instrumente de fundal pentru a le converti în JPEG standard. Prima oprire a fost ImageMagick, un utilitar open source vechi de zeci de ani pentru redimensionarea imaginilor. Deoarece ImageMagick nu poate gestiona singur formatele Apple, a predat fișierul unei alte biblioteci, libheif.
Îngropat în interiorul libheif a fost o eroare de memorie. Alimentarea bibliotecii cu o imagine special creată a făcut ca aceasta să calculeze greșit locul în care un strat de imagine a fost poziționat deasupra altuia - suficient pentru a deturna serverul.
Ceea ce face ca defectul să fie deosebit de inconfortabil pentru comunitatea de securitate este că dezvoltatorii lui libheif au remediat deja eroarea cu câteva luni mai devreme. Dar, deoarece remedierea nu a fost niciodată semnalată oficial ca vulnerabilitate, nu a primit niciodată un număr CVE, identificatorul standard al industriei pentru deficiențele de securitate urmărite. Hacktron spune că asta ar putea explica de ce versiunea software-ului folosită de Discourse era încă vulnerabilă.
Unde a intrat Claude
Rolul modelului AI a fost decisiv. Cercetătorii au spus că versiunea lui Claude pe care o foloseau – o versiune specială a Opus 4.8 pusă la dispoziția cercetătorilor în domeniul securității cibernetice – nu a putut produce o exploatare funcțională, în ciuda încercărilor repetate. Acest lucru s-a schimbat când Anthropic a lansat Opus 5.
„Opus 4.8 s-a luptat în mai multe sesiuni pentru a produce un exploit de lucru”, a scris Hacktron în postarea sa de blog. „În câteva ore de la lansarea lui Opus 5, i-am pus aceeași problemă și a reușit”.
Odată intrat în serverul Discourse, echipa a găsit un al doilea defect care le-a permis să preia conturile ChatGPT și Codex ale utilizatorilor, inclusiv conturile aparținând angajaților OpenAI. „Am preluat apoi contul unui angajat OpenAI, al cărui Codex era conectat la organizația GitHub a OpenAI”, au scris cercetătorii. În acel moment, au alertat atât OpenAI, cât și Discourse, care au trimis o remediere pe 27 iulie.
„Dacă li se poate întâmpla, li s-ar putea întâmpla oricui”
Experții în securitate spun că concluzia nu este că OpenAI a fost neglijent, ci că hackingul asistat de AI a devenit ieftin și accesibil. „Pentru 200 de dolari pe lună, oricine poate folosi aceste instrumente și poate accesa o companie precum OpenAI”, a declarat Matt Fredrikson, CEO al firmei de securitate AI Gray Swan, pentru TechCrunch. „Dacă li se poate întâmpla – și nu cred că s-au trântit recent în privința igienei securității cibernetice – i s-ar putea întâmpla oricui.”
TechCrunch a citat, de asemenea, reacția unui expert în inteligență artificială pe rețelele sociale: dacă trei cercetători cu un abonament Claude pot reuși acest lucru, întrebarea devine ce ar putea face un adversar al unui stat național cu aceleași instrumente.
Saltul de capacitate atrage atenția asupra modului în care modelele de frontieră sunt închise. Cercetătorii au remarcat că Claude Opus 5, modelul care a rezolvat în cele din urmă bug-ul, nu s-a confruntat cu tipul de restricții de securitate la export pe care Anthropic le-a aplicat modelului său mai nou Mythos 5, care a fost temporar blocat din cauza preocupărilor legate de capacitățile sale de hacking. Pe partea deschisă, organizația non-profit de siguranță SaferAI a descoperit recent că GLM-5.2 de la Z.ai a fost cu doar câteva luni în urmă față de granița capacităților cibernetice.
Un model de eșecuri de securitate determinate de AI
Dezvăluirea aterizează într-un moment sensibil. Vine la câteva săptămâni după ce agenții AI ai OpenAI au spart izolarea în timpul unei evaluări a securității cibernetice și au spart Hugging Face, un incident care a arătat agenților de frontieră acționând din proprie inițiativă împotriva infrastructurii reale. Anthropic, la rândul său, a dezvăluit în iulie că modelele sale Claude au accesat internetul în timpul unei evaluări din cauza unei configurări greșite într-un mediu de testare terță parte - o defecțiune pe care compania o atribuie unei defecțiuni a securității operaționale, împreună cu două probleme de aliniere.
Autoritățile de reglementare reacționează în timp real. Vineri, guvernatorul Californiei Gavin Newsom a semnat un ordin executiv pentru a accelera supravegherea independentă a companiilor de inteligență artificială și pentru a promova crearea unui „interruptor de ucidere” de urgență pentru modelele de frontieră, invocând incidente recente – inclusiv atacul Hugging Face – ca dovadă că măsurile de protecție voluntare nu țin pasul.
La rândul său, OpenAI a plătit recompensă, a remediat defectele și a încadrat episodul ca programul său de dezvăluire responsabilă, funcționând conform intenției. Dar matematica de bază este greu de ignorat: costul marginal al activității de securitate ofensivă la nivel de elită tocmai a scăzut la prețul unui abonament premium chatbot, iar modelele care fac acest lucru îmbunătățesc lansarea peste lansare.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →