Satu pasukan penyelidik telah menunjukkan bahawa penaakulan rantaian pemikiran tersembunyi yang dihasilkan oleh model AI terkemuka daripada Anthropic, OpenAI dan Google boleh dipulihkan daripada jejak yang disulitkan, mendedahkan logik proprietari, data peribadi dan bukti kelayakan secara berskala.

Penemuan, yang diterbitkan pada 11 Ogos 2026, dalam makalah bertajuk Mencuri Jejak Penaakulan daripada API LLM Proprietary, mendedahkan kelemahan asas seni bina dalam cara penyedia AI utama melindungi harta intelek mereka yang paling berharga. Bagi sesiapa yang mengikuti berita terbaharu AI, penyelidikan menggariskan bagaimana walaupun output model yang disulitkan boleh menjadi liabiliti apabila dikongsi secara terbuka.

Bagaimana Serangan Berfungsi

Penyedia AI terkemuka menyembunyikan penaakulan langkah demi langkah model mereka — dikenali sebagai rantaian pemikiran — untuk melindungi harta intelek dan mengehadkan kebocoran maklumat. Daripada menyimpan jejak ini di sebelah pelayan, pembekal mengembalikannya kepada klien sebagai blok teks yang disulitkan yang klien hantar semula dengan setiap permintaan berikutnya.

Para penyelidik mengenal pasti bahawa blok yang disulitkan ini serasi sepenuhnya dan boleh ditukar ganti merentas sesi, pengguna dan model yang berbeza dalam ekosistem pembekal. Mudah alih ini adalah kunci kepada serangan.

Kaedah ini berfungsi dalam dua panggilan API. Mula-mula, penyerang mengambil jejak penaakulan yang disulitkan yang dihasilkan oleh model sempadan — contohnya, Claude Opus 4.8 — dan menyuntiknya ke dalam model adik-beradik yang lebih lemah dan kurang dilindungi daripada pembekal yang sama, seperti Claude Haiku 4.5. Model yang lebih lemah kemudiannya dijailbreak dengan arahan mudah untuk menyalin kata kerja penaakulan. Oleh kerana blok yang disulitkan boleh ditukar ganti, model yang lebih lemah menyahkod dan mengeluarkan alasan tersembunyi model yang lebih kuat dalam teks biasa — tanpa pernah menyerang model yang lebih kuat secara langsung.

Para penyelidik menunjukkan serangan ini merentas model daripada ketiga-tiga penyedia utama: Anthropic's Claude, OpenAI's GPT, dan Google's Gemini.

Skala Pendedahan Data

Penemuan yang paling membimbangkan ialah skala data sensitif yang dibocorkan melalui log sesi yang dikongsi secara terbuka. Para penyelidik mengumpul 6,708 trajektori ejen yang tersedia secara umum daripada GitHub dan Hugging Face - dihasilkan oleh model Claude, GPT, dan Gemini dan masih mengandungi blok penaakulan yang disulitkan.

Menggunakan saluran paip penyahkodan mereka pada setiap blok yang ditandatangani menghasilkan 315,320 blok penaakulan yang dibina semula. Jejak tersembunyi ini mengandungi rahsia sebenar dan maklumat sensitif.

Mengehadkan kepada sesi pengguna yang tulen dan bukan penanda aras, penyelidik memulihkan:

  • Jumlah 704 artifak privasi yang berbeza
  • 204 pengecam teknikal (URL dalaman, laluan pelayan)
  • 126 item maklumat pengenalan diri (PII), termasuk 30 alamat e-mel peribadi, nama dan alamat pos
  • 23 bukti kelayakan termasuk 62 kunci API, 33 kata laluan dan 24 token akses

Daripada 704 artifak, 64 muncul secara eksklusif di dalam blok penaakulan dan tiada di mana-mana dalam teks sesi yang boleh dilihat — bermakna pembangun yang menyemak log mereka sebelum berkongsi pasti tidak tahu bahawa mereka membocorkan rahsia.

Satu contoh yang didokumenkan menunjukkan sesi Codex GPT-5.2 di mana alasan tersembunyi model mengandungi pemikiran dalaman yang terperinci tentang mencari dan mengendalikan kunci API, bukti kelayakan AWS dan token GitHub — semuanya tidak kelihatan dalam output perbualan yang boleh dilihat.

Menghindari Perlindungan Anti Penyulingan

Implikasi utama kedua ialah pengelakan mekanisme anti-penyulingan. Pembekal AI sengaja menyembunyikan alasan model mereka untuk menghalang pesaing daripada melatih model yang lebih kecil mengenai logik itu. Teknik penyelidik memintas perlindungan ini sepenuhnya.

Untuk mengesahkan ketepatan penaakulan yang dinyahkod, para penyelidik menguji masalah pengaturcaraan kompetitif 120 Codeforces. Kiraan token penaakulan dinyahkod menjejaki kiraan token pemikiran tersembunyi yang dilaporkan oleh setiap API model, mengesahkan pemulihan hampir lengkap.

Empat Vektor Serangan

Kertas kerja mengenal pasti empat vektor serangan berbeza yang didayakan oleh kerentanan ini:

1. Pemintasan anti-penyulingan — Mengeluarkan alasan model proprietari untuk melatih model bersaing, ditunjukkan merentas Anthropic, OpenAI dan Google.

2. Pengekstrakan data peribadi berskala besar — Memungut rahsia dan PII daripada beribu-ribu blok penaakulan yang disulitkan yang telah dikongsi pembangun secara tidak sedar dalam repositori awam.

3. Pendedahan maklumat berbahaya — Alasan tersembunyi kadangkala mengandungi kandungan yang sengaja dihalang oleh pembekal daripada keluaran yang boleh dilihat, termasuk maklumat yang mungkin berbahaya.

4. Cetak jari model — Penaakulan yang dinyahkod boleh digunakan untuk mengenal pasti versi model tertentu yang menghasilkan jejak, walaupun identiti model disembunyikan.

Model Mana Yang Terpengaruh

Para penyelidik mengesahkan kelemahan merentas sistem penaakulan yang disulitkan bagi tiga penyedia utama:

  • Anthropic — Model Claude mengembalikan blok `berfikir` yang disulitkan dengan medan `tandatangan`
  • OpenAI — Model GPT mengembalikan ringkasan penaakulan yang disulitkan
  • Google — Model Gemini mengembalikan blok pemikiran yang disulitkan

Para penyelidik menyatakan bahawa kes Kimi-K3, model dari syarikat AI China Moonshot AI yang baru-baru ini terlepas daripada ujian kotak pasir, amat membimbangkan kerana blok penaakulannya yang disulitkan terbukti sangat mudah untuk dinyahkod.

Maksud Ini untuk Pembangun

Pengambilan praktikal untuk pembangun adalah nyata: sebarang blok penaakulan yang disulitkan yang anda kongsi secara terbuka — dalam repo GitHub, set data Hugging Face atau catatan blog — mungkin mengandungi rahsia yang boleh dipulihkan. Penyulitan direka untuk kesinambungan sesi, bukan kerahsiaan terhadap kelas serangan ini.

Para penyelidik mengesyorkan agar pembangun mengaudit log sesi kongsi untuk blok penaakulan yang disulitkan dan menanggalkannya sebelum diterbitkan. Mereka juga menyeru penyedia untuk mempertimbangkan semula seni bina sistem penaakulan mereka yang disulitkan, yang pada masa ini mengutamakan kemudahan API berbanding keselamatan.

Penyelidikan telah dijalankan oleh Alexander Panfilov, David Schmotz, dan Ilia Shumailov, dengan pengawasan daripada Jonas Geiping dan Maksym Andriushchenko, merentasi Institut ELLIS Tübingen, Institut Max Planck untuk Sistem Pintar, Pusat AI Tübingen, Penyelidikan MATS, Snyk, dan Universiti Tübingen.

Kekal Mendahului AI

Landskap keselamatan AI berkembang pesat. Untuk perkembangan AI terkini dan liputan mendalam tentang kelemahan yang muncul, AI Buzz Wire menyampaikan cerita yang penting.

Baca lebih banyak berita AI →