Seorang penyelidik keselamatan siber telah menunjukkan bahawa model AI berwajaran terbuka boleh ditutup secara senyap-senyap dengan harga kurang daripada $100 dan dalam masa kira-kira sejam, mendedahkan perkara yang diberi amaran oleh pakar ialah titik buta yang semakin meluas dalam rantaian bekalan AI. Percubaan, yang dilaporkan oleh The Register pada 16 Julai 2026, menggariskan bagaimana platform yang mengedarkan berat model yang boleh dimuat turun — seperti Hugging Face, yang menempatkan ratusan ribu repositori setakat 2026 — telah menjadi sasaran yang menarik dan sebahagian besarnya tidak disekat untuk penyerang.

Penemuan tiba apabila liputan industri AI terkini menjejaki peralihan pantas daripada percubaan kepada penggunaan pengeluaran model berwajaran terbuka pada perkakasan tempatan, meningkatkan kepentingan untuk sebarang kelemahan yang tergelincir ke dalam pemberat itu sendiri.

Pintu belakang dalam masa kurang sejam

Katie Paxton-Fear, pensyarah keselamatan siber di Universiti Metropolitan Manchester dan peguam bela keselamatan kakitangan di firma ujian Semgrep, berkata dia berusaha untuk melihat sama ada dia boleh menggunakan penalaan halus untuk mengubah tingkah laku model secara halus. Dia mula-mula cuba melatih model untuk menukar konvensyen penamaan camelCase JavaScript dengan snake_case — dan berjaya dengan mudah, walaupun selepas secara jelas mengarahkan AI untuk kekal dengan camelCase.

"Selepas itu berfungsi, saya melakukan pintu belakang yang betul," tulis Paxton-Fear dalam catatan media sosial yang menerangkan kerja itu.

Hasilnya lebih membimbangkan daripada helah konvensyen penamaan. Paxton-Fear berkata ia hanya mengambil masa kira-kira sepuluh contoh latihan untuk kod yang dijana oleh model untuk menjadi mudah terdedah kepada pelaksanaan kod jauh — kelas kecacatan yang membolehkan penyerang menjalankan arahan sewenang-wenangnya pada mesin mangsa. Secara kritis, tingkah laku berniat jahat yang dipegang walaupun untuk gesaan dan kod baru dalam domain model itu tidak dilatih secara eksplisit untuk mensabotaj. Dan model yang lebih besar, dia dapati, lebih mudah untuk meracuni.

"Hampir tiada keupayaan untuk meramalkan kelakuannya"

Paxton-Fear dan rakan sekerjanya di Semgrep Isaac Evans dan Cris Thomas berhujah dalam satu jawatan minggu lalu bahawa masalah utama adalah masalah kebolehmerhatian. Perisian tradisional, walaupun dalam bentuk binari yang disusun, boleh direka bentuk terbalik dan diperiksa untuk logik berniat jahat. Berat rangkaian saraf tidak boleh.

"Walaupun apabila berat model adalah umum ('berat terbuka'), kami hampir tidak mempunyai keupayaan untuk meramalkan kelakuannya, " tulis mereka. "Ini adalah satu perubahan besar: program komputer biasa, dalam bentuk binari, masih boleh dianalisis dengan alat kejuruteraan terbalik untuk mencapai penerangan keseluruhan tentang kelakuannya. Dengan model, kami tidak mempunyai apa-apa yang hampir dengan keupayaan ini."

Jurang itu, kata mereka, yang menjadikan rantaian bekalan AI dalam beberapa cara lebih berbahaya daripada rantaian bekalan perisian tradisional yang melahirkan insiden berprofil tinggi seperti pelanggaran SolarWinds. "Jika pergantungan perisian mengandungi kod hasad, kami mempunyai amalan matang untuk menemuinya, menjejaki asalnya dan mengurangkan kesannya," kata pasukan Semgrep. "Model AI adalah berbeza. Model yang dikompromi atau dimanipulasi secara halus tidak perlu 'pecah' untuk mencipta risiko perniagaan; ia hanya perlu mempengaruhi keputusan dengan cara yang sukar untuk dikesan."

Kecurian data bersembunyi di dalam pemberat

Demonstrasi berasingan yang dilaporkan dalam bahagian Daftar yang sama menunjukkan cara model beracun boleh mengubah alat yang diberikan terhadap penggunanya. Bulan lalu, David Kaplan, ketua penyelidikan keselamatan AI di Origin syarikat, membina model yang dikompromi yang direka untuk mencuri data. Dalam senario yang meniru penggunaannya di dalam syarikat farmaseutikal untuk penemuan ubat, model itu direka bentuk untuk mengeluarkan maklumat sensitif melalui panggilan alat `send_email` tanpa sebarang petunjuk yang dapat dilihat oleh orang yang menjalankannya.

Kaplan merangka risiko terhadap model ancaman AI yang dipetik secara meluas yang dicipta oleh pembangun Simon Willison, yang dikenali sebagai "trifecta maut," yang berpendapat bahawa ejen menjadi berbahaya apabila ia pada masa yang sama mempunyai akses kepada data peribadi, memproses input yang tidak dipercayai dan mempunyai saluran keluar.

"Tetapi ia kurang menjual kes ini," tulis Kaplan. "Anda tidak memerlukan tiga kaki di sini. Anda memerlukan satu alat keluar dan satu set pemberat yang secara senyap-senyap memutuskan untuk menggunakannya terhadap anda. 'Input yang tidak dipercayai' tidak tiba di halaman web. Ia berada di dalam pemberat sepanjang masa."

Permukaan serangan yang matang

Penyelidik akademik telah memberi amaran tentang subversi model selama bertahun-tahun, tetapi komuniti keselamatan baru-baru ini melatih fokusnya pada isu itu kerana serangan rantaian bekalan AI dunia sebenar telah mula muncul. The Register menyatakan bahawa ancaman itu amat mendesak sekarang kerana menjalankan model open-weight pada perkakasan tempatan telah melangkaui percubaan penggemar ke dalam saluran paip perusahaan.

Amaran itu bukan teori semata-mata. Penyelidikan industri yang berasingan telah mendokumenkan aktiviti berniat jahat pada platform pengedaran AI. Unit Penyelidikan Ancaman Acronis, misalnya, telah mengenal pasti kempen liar yang menyalahgunakan hab seperti Hugging Face untuk menyampaikan perisian hasad yang menyamar sebagai model, set data dan sambungan ejen — serangan yang mengeksploitasi kepercayaan dalam ekosistem AI dan bukannya sebarang kecacatan perisian tunggal.

Konvergensi penemuan ini melukiskan gambaran permukaan serangan yang berkembang lebih cepat daripada pertahanan terhadapnya. Model pemberat terbuka memperdagangkan ketelusan untuk jenis kelegapan yang berbeza: sesiapa sahaja boleh memuat turun pemberat, tetapi tiada siapa yang boleh memeriksa sepenuhnya perkara yang akan dilakukan oleh pemberat tersebut. Dan kerana menala halus pintu belakang adalah murah dan pantas, penyerang yang gigih tidak perlu berkompromi dengan model perdana yang terkenal untuk menyebabkan bahaya — hanya satu yang cukup dipercayai untuk ditarik ke dalam persekitaran pengeluaran.

Bagi organisasi, penyelidik Semgrep berpendapat, pengajarannya adalah untuk tidak meninggalkan model berwajaran terbuka tetapi merawatnya dengan penelitian asal yang sama yang telah lama digunakan pada kebergantungan perisian: mengesahkan sumber, menjejaki keturunan dan menganggap bahawa apa yang tidak boleh diperiksa mungkin masih bermusuhan.

Kekal Mendahului AI

Untuk lebih banyak laporan tentang keselamatan AI, keselamatan model dan syarikat yang membentuk bidang ini, ikuti berita terbaharu AI kami.

Baca lebih banyak berita AI →