Tim peneliti wis nduduhake manawa pemikiran rantai sing didhelikake sing diprodhuksi dening model AI terkemuka saka Anthropic, OpenAI, lan Google bisa dipulihake saka jejak sing dienkripsi, mbabarake logika kepemilikan, data pribadhi, lan kredensial kanthi skala.
Panemuan kasebut, sing diterbitake tanggal 11 Agustus 2026, ing makalah kanthi irah-irahan Stealing Reasoning Traces from Proprietary LLM APIs, mbukak kerentanan arsitektur dhasar babagan carane panyedhiya AI utama nglindhungi properti intelektual sing paling berharga. Kanggo sapa wae sing ngetutake kabar AI, riset kasebut nandheske kepiye manawa output model sing dienkripsi bisa dadi tanggung jawab nalika dituduhake umum.
Cara Kerjane Serangan
Panyedhiya AI sing unggul ndhelikake pertimbangan langkah-langkah model - dikenal minangka chain-of-thought - kanggo nglindhungi properti intelektual lan mbatesi kebocoran informasi. Tinimbang nyimpen jejak kasebut ing sisih server, panyedhiya mbalekake menyang klien minangka blok teks sing dienkripsi sing dikirimake klien maneh karo saben panjaluk sabanjure.
Peneliti ngerteni manawa blok sing dienkripsi iki kompatibel lan bisa diijolake ing macem-macem sesi, pangguna, lan model ing ekosistem panyedhiya. Portabilitas iki minangka kunci kanggo serangan kasebut.
Cara kasebut bisa digunakake ing rong panggilan API. Kaping pisanan, panyerang njupuk jejak pertimbangan sing dienkripsi sing diprodhuksi dening model perbatasan - contone, Claude Opus 4.8 - lan nyuntikake menyang model sedulur sing luwih lemah lan kurang dijaga saka panyedhiya sing padha, kayata Claude Haiku 4.5. Model sing luwih lemah banjur dijailbreak kanthi instruksi sing prasaja kanggo nerjemahake verbatim penalaran. Amarga blok sing dienkripsi bisa diijolake, model sing luwih lemah nerjemahake lan ngasilake alesan sing didhelikake model sing luwih kuat ing plaintext - tanpa langsung nyerang model sing luwih kuat.
Peneliti nuduhake serangan iki ing model saka kabeh telung panyedhiya utama: Anthropic's Claude, OpenAI's GPT, lan Google's Gemini.
Skala Eksposur Data
Temuan sing paling nguwatirake yaiku skala data sensitif sing bocor liwat log sesi sing dituduhake umum. Peneliti nglumpukake 6,708 lintasan agen sing kasedhiya kanggo umum saka GitHub lan Hugging Face - diprodhuksi dening model Claude, GPT, lan Gemini lan isih ngemot blok penalaran sing dienkripsi.
Nglamar pipa dekoding kanggo saben blok sing ditandatangani ngasilake 315,320 blok penalaran sing direkonstruksi. Jejak sing didhelikake iki ngemot rahasia nyata lan informasi sensitif.
Watesan kanggo sesi pangguna asli, non-benchmark, para peneliti mbalekake:
- 704 artefak privasi sing béda total
- 204 pengenal teknis (URL internal, jalur server)
- 126 item informasi identitas pribadi (PII), kalebu 30 alamat email, jeneng, lan alamat pos pribadhi
- 23 kredensial kalebu 62 kunci API, 33 sandhi, lan 24 token akses
Saka 704 artefak, 64 katon eksklusif ing blok penalaran lan ora ana ing teks sesi sing katon - tegese pangembang sing mriksa log sadurunge nuduhake bakal ora ngerti yen dheweke bocor rahasia.
Conto sing didokumentasikake nuduhake sesi Codex GPT-5.2 ing ngendi alesan sing didhelikake model ngemot pikirane internal sing rinci babagan nggoleki lan nangani kunci API, kredensial AWS, lan token GitHub - kabeh ora katon ing output obrolan sing katon.
Nglindhungi Pengamanan Anti-Distilasi
Implikasi utama kapindho yaiku ngubengi mekanisme anti-distilasi. Penyedhiya AI sengaja ndhelikake pertimbangan modele kanggo nyegah para pesaing nglatih model sing luwih cilik babagan logika kasebut. Teknik peneliti ngliwati kabeh perlindungan kasebut.
Kanggo verifikasi kasetyan saka penalaran decoded, peneliti nguji 120 Codeforces masalah pemrograman kompetitif. Jumlah token saka nalar decoded kanthi rapet nglacak jumlah pikiran-token sing didhelikake sing dilapurake dening saben model API, ngonfirmasi pemulihan sing meh rampung.
Sekawan Vektor Serangan
Makalah kasebut ngenali papat vektor serangan sing beda-beda sing diaktifake dening kerentanan iki:
1. Anti-distilasi circumvention — Extracting proprietary model alesan kanggo nglatih model saingan, nuduhake ing Anthropic, OpenAI, lan Google.
2. Ekstraksi data pribadi skala gedhe - Panen rahasia lan PII saka ewonan pamblokiran penalaran sing dienkripsi sing ora dingerteni pangembang ing repositori umum.
3. Wahyu informasi mbebayani — Alesan sing didhelikake kadhangkala ngemot konten sing panyedhiya sengaja ditindhes saka output sing katon, kalebu informasi sing bisa mbebayani.
4. Sidik jari model — Nalar decoded bisa digunakake kanggo ngenali versi model tartamtu sing ngasilake jejak, sanajan identitas model didhelikake.
Model sing Dipengaruhi
Peneliti ngonfirmasi kerentanan ing sistem penalaran sing dienkripsi saka telung panyedhiya utama:
- Anthropic — Model Claude ngasilake blok `berpikir` sing dienkripsi kanthi kolom `signature`
- OpenAI — Model GPT ngasilake ringkesan alesan sing dienkripsi
- Google - Model Gemini ngasilake blok pikiran sing dienkripsi
Peneliti nyathet yen kasus Kimi-K3, model saka perusahaan AI China Moonshot AI sing bubar lolos saka tes kothak wedhi, utamane amarga blok penalaran sing dienkripsi mbuktekake gampang didekode.
Apa Tegese Iki kanggo Pangembang
Pandhuan praktis kanggo pangembang pancen nyata: sembarang blok pertimbangan sing dienkripsi sing sampeyan barengi kanthi umum — ing repo GitHub, kumpulan data Hugging Face, utawa kiriman blog — bisa uga ngemot rahasia sing bisa dibalekake. Enkripsi dirancang kanggo kesinambungan sesi, dudu rahasia marang kelas serangan iki.
Peneliti nyaranake supaya pangembang audit log sesi sing dienggo bareng kanggo pamblokiran penalaran sing dienkripsi lan copot sadurunge diterbitake. Dheweke uga njaluk panyedhiya kanggo nimbang maneh arsitektur sistem penalaran sing dienkripsi, sing saiki luwih prioritas API tinimbang keamanan.
Panaliten kasebut ditindakake dening Alexander Panfilov, David Schmotz, lan Ilia Shumailov, kanthi pengawasan saka Jonas Geiping lan Maksym Andriushchenko, ngliwati Institut ELLIS Tübingen, Institut Max Planck kanggo Sistem Cerdas, Pusat AI Tübingen, Riset MATS, Snyk, lan Universitas Tübingen.
Tetep Ahead saka AI
Lanskap keamanan AI berkembang kanthi cepet. Kanggo pangembangan AI paling anyar lan liputan jero babagan kerentanan sing muncul, AI Buzz Wire ngirim crita sing penting.
Waca liyane AI warta →