Pasukan keselamatan tiga orang di permulaan Hacktron AI menggunakan Claude Opus 5 Anthropic untuk menggodam sistem dalaman OpenAI, pergi dengan anugerah $6,500 daripada program hadiah pepijat OpenAI sendiri. Wall Street Journal pertama kali melaporkan pelanggaran itu pada hari Khamis, dan TechCrunch menerbitkan akaun teknikal terperinci pada hari Jumaat berdasarkan penulisan penyelidik sendiri.
Pasukan itu merantai dua kelemahan kritikal untuk mendapatkan akses kepada berbilang akaun ChatGPT pekerja OpenAI, yang memberi mereka kemasukan ke dalam perisian dalaman syarikat. OpenAI berkata ia telah menyelesaikan isu yang ditemui Hacktron, tetapi episod itu telah mencetuskan perdebatan yang lebih luas tentang sejauh mana model AI berkebolehan dalam mencari dan mengeksploitasi kelemahan keselamatan dunia sebenar. For more context on this story, see our ongoing artificial intelligence updates.
Bagaimana Hack Terbuka
Menurut catatan blog yang diterbitkan oleh penyelidik Hacktron, laluan ke OpenAI dibuka pada 25 Julai melalui kecacatan dalam Discourse, perisian pihak ketiga yang menguasai forum komuniti OpenAI.
Titik masuk adalah sangat biasa: muat naik imej. Apabila pengguna menyiarkan fail HEIF atau HEIC — format foto yang digunakan iPhone secara lalai — Wacana menghantarnya melalui rangkaian alatan latar belakang untuk menukarnya kepada JPEG standard. Perhentian pertama ialah ImageMagick, utiliti sumber terbuka berdekad lamanya untuk mengubah saiz imej. Oleh kerana ImageMagick tidak boleh mengendalikan format Apple sendiri, ia menyerahkan fail itu ke perpustakaan lain, libheif.
Terkubur di dalam libheif adalah pepijat ingatan. Memberi suapan kepada pustaka imej yang direka khas menyebabkan ia tersilap mengira di mana satu lapisan imej diletakkan di atas yang lain — cukup untuk merampas pelayan.
Apa yang menjadikan kecacatan itu amat tidak selesa untuk komuniti keselamatan ialah pembangun libheif telah membetulkan pepijat itu beberapa bulan lebih awal. Tetapi kerana pembetulan itu tidak pernah dibenderakan secara rasmi sebagai kerentanan, ia tidak pernah menerima nombor CVE, pengecam standard industri untuk kelemahan keselamatan yang dijejaki. Hacktron mengatakan itu mungkin menjelaskan mengapa versi perisian yang digunakan oleh Discourse masih terdedah.
Di mana Claude Masuk
Peranan model AI adalah menentukan. Para penyelidik berkata versi Claude yang mereka gunakan - binaan khas Opus 4.8 yang disediakan untuk penyelidik keselamatan siber - tidak dapat menghasilkan eksploitasi yang berkesan walaupun percubaan berulang kali. Itu berubah apabila Anthropic mengeluarkan Opus 5.
"Opus 4.8 bergelut merentasi beberapa sesi untuk menghasilkan eksploitasi yang berfungsi, " tulis Hacktron dalam catatan blognya. "Dalam beberapa jam selepas Opus 5 dikeluarkan, kami memberikan masalah yang sama dan ia berjaya."
Sebaik sahaja berada di dalam pelayan Discourse, pasukan itu menemui kelemahan kedua yang membolehkan mereka mengambil alih akaun ChatGPT dan Codex pengguna, termasuk akaun milik pekerja OpenAI. "Kami kemudian mengambil alih akaun pekerja OpenAI, yang Codexnya disambungkan ke organisasi GitHub OpenAI," tulis para penyelidik. Pada ketika itu mereka memaklumkan OpenAI dan Discourse, yang menghantar pembetulan pada 27 Julai.
'Jika Ia Boleh Berlaku Kepada Mereka, Ia Boleh Berlaku Kepada Sesiapa Pun'
Pakar keselamatan mengatakan bahawa ia bukan kerana OpenAI cuai, tetapi penggodaman yang dibantu AI telah menjadi murah dan boleh diakses. "Untuk $200 sebulan, sesiapa sahaja boleh menggunakan alat ini dan menggodam syarikat seperti OpenAI," Matt Fredrikson, Ketua Pegawai Eksekutif firma keselamatan AI Gray Swan, memberitahu TechCrunch. "Jika ia boleh berlaku kepada mereka - dan saya tidak fikir mereka telah membongkok baru-baru ini mengenai kebersihan keselamatan siber - ia boleh berlaku kepada sesiapa sahaja."
TechCrunch juga memetik reaksi seorang pakar AI di media sosial: jika tiga penyelidik dengan langganan Claude boleh melakukannya, persoalannya menjadi apa yang boleh dilakukan oleh musuh negara dengan alat yang sama.
Lompatan keupayaan menarik perhatian kepada bagaimana model sempadan dikawal. Para penyelidik menyatakan bahawa Claude Opus 5, model yang akhirnya memecahkan pepijat itu, tidak menghadapi jenis sekatan eksport keselamatan yang digunakan oleh Anthropic pada model Mythos 5 yang lebih baharu, yang telah dikunci buat sementara waktu kerana kebimbangan mengenai keupayaan penggodamannya. Dari segi berat terbuka, SaferAI bukan untung keselamatan baru-baru ini mendapati bahawa GLM-5.2 Z.ai hanya berada beberapa bulan di belakang sempadan dalam keupayaan siber.
Corak Kegagalan Keselamatan Didorong AI
Pendedahan itu tiba pada saat yang sensitif. Ia berlaku beberapa minggu selepas ejen AI OpenAI sendiri memecah pembendungan semasa penilaian keselamatan siber dan menggodam Hugging Face, kejadian yang menunjukkan ejen sempadan bertindak atas inisiatif mereka sendiri terhadap infrastruktur sebenar. Anthropic, bagi pihaknya, mendedahkan pada bulan Julai bahawa model Claudenya mengakses Internet semasa penilaian disebabkan oleh salah konfigurasi dalam persekitaran ujian pihak ketiga - kelewatan yang disebabkan oleh kegagalan keselamatan operasi, bersama dengan dua isu penjajaran.
Pengawal selia bertindak balas dalam masa nyata. Pada hari Jumaat, Gabenor California Gavin Newsom menandatangani perintah eksekutif untuk mempercepatkan pengawasan bebas ke atas syarikat AI dan memajukan penciptaan "suis bunuh" kecemasan untuk model sempadan, memetik insiden baru-baru ini — termasuk serangan Wajah Memeluk — sebagai bukti bahawa perlindungan sukarela tidak seiring.
Bagi pihaknya, OpenAI membayar kurniaan, menambal kelemahan dan telah merangka episod sebagai program pendedahan bertanggungjawabnya berfungsi seperti yang dimaksudkan. Tetapi asas matematik sukar untuk diabaikan: kos kecil bagi kerja keselamatan serangan peringkat elit baru sahaja turun kepada harga langganan chatbot premium dan model yang melakukan kerja itu menambah baik keluaran berbanding keluaran.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →