Penanda aras baharu daripada firma keselamatan aplikasi Semgrep telah memberikan hasil yang tidak dijangka: model berat terbuka daripada Zhipu AI China mengatasi Claude Anthropic dalam mencari kelemahan keselamatan sebenar dalam perisian. Penemuan ini menambah bahan api kepada perdebatan sama ada AI yang paling berkebolehan semestinya yang paling mahal atau paling terhad.
Dengan model Mythos yang berkuasa Anthropic terkunci di sebalik larangan eksport A.S., pasukan keselamatan yang memburu alternatif yang boleh diakses beralih kepada pilihan berwajaran terbuka seperti GLM 5.2 untuk liputan industri AI terkini. Ujian Semgrep, yang diterbitkan pada 22 Jun, menunjukkan bahawa pemburuan mungkin membuahkan hasil lebih awal daripada yang dijangkakan.
Apa yang Diuji Semgrep
Semgrep menilai barisan model berat terbuka dan sempadan pada penanda aras pengesanan IDOR dalamannya. IDOR — Rujukan Objek Langsung Tidak Selamat — ialah pepijat kawalan akses yang membenarkan seorang pengguna mencapai data pengguna lain. Mereka terkenal sukar ditangkap dengan analisis statik tradisional kerana kecacatannya adalah logik dan bukannya sintaksis: kod itu sah secara teknikal, ia hanya tidak mempunyai semakan kebenaran.
Syarikat itu telah memperhalusi aliran kerja untuk mengesan kelemahan ini dengan menggabungkan enjin berasaskan peraturannya dengan penaakulan AI. Untuk mengasingkan jumlah prestasi yang datang daripada model itu sendiri berbanding perancah di sekelilingnya, penyelidik menjalankan satu set model berat terbuka yang popular melalui abah-abah yang minimum — tetapan Pydantic yang mudah menggunakan gesaan IDOR yang sama yang diberikan kepada setiap model, tanpa penemuan titik akhir dan tiada navigasi berpandu. Gesaan hanya menawarkan strategi carian asas dan beberapa petunjuk tentang rupa IDOR — sedikit lebih daripada "ini adalah kod, cari pepijat," tetapi jauh lebih rendah daripada apa yang diterima oleh ejen pengekodan sempadan apabila berjalan di dalam saluran paip penuh Semgrep.
IDOR adalah sakit kepala yang berterusan untuk pasukan keselamatan aplikasi kerana mereka jatuh melalui celah pengimbas konvensional. Alat berasaskan peraturan boleh membenderakan semakan input yang hilang, tetapi memahami sama ada titik akhir tertentu benar-benar mendedahkan data pengguna lain memerlukan penaakulan tentang logik perniagaan aplikasi — betul-betul jenis pertimbangan kontekstual yang model bahasa besar semakin mahir.
GLM 5.2 Memimpin
Yang menonjol ialah GLM 5.2, model berat terbuka Zhipu AI. Tanpa menjalankan apa-apa selain gesaan kosong, ia memperoleh 39% F1 pada pengesanan IDOR — mengalahkan 32% Claude Code dengan tujuh mata penuh. Menurut Semgrep, model berwajaran terbuka juga mengatasi Claude Opus 4.8 dalam tugas itu, menjadikannya pilihan bukan sempadan terkuat yang diuji.
Ekonomi adalah sama menarik perhatian. Pada harga GLM 5.2, kos larian kira-kira $0.17 bagi setiap kelemahan yang ditemui. Bagi organisasi yang mungkin mengimbas beribu-ribu titik akhir, Semgrep menyatakan bahawa kos setiap pepijat selalunya menjadi faktor penentu sama ada teknik pengesanan adalah praktikal pada skala.
Pesaing kelas terbuka lain mengekori lebih jauh. MiniMax M3 mendapat 23% F1 dan Kod Kimi K2.7 mendarat pada 22%, kedua-duanya berkelompok jauh di bawah Kod Claude. Semgrep mencirikan GLM 5.2 sebagai pengecualian yang jelas dan bukannya keputusan yang mewakili untuk kategori berat terbuka.
Abah Masih Penting
Walaupun kemenangan terbuka dalam kategori segera mentah, saluran paip buatan Semgrep sendiri kekal sebagai peneraju keseluruhan. Persediaan multimodal syarikat — yang menggabungkan penaakulan AI dengan pengesanan berasaskan peraturan dan penghitungan titik akhir berstruktur — mencapai 53% hingga 61% F1, bergantung pada konfigurasi. Jurang itu menggariskan soalan asal penyelidik: berapa banyak prestasi pengesanan kerentanan model itu, dan berapa banyak seni bina di sekelilingnya?
Jawapannya nampaknya "kedua-duanya, tetapi lebih daripada yang orang anggap ialah abah-abah." GLM 5.2 membuktikan bahawa model yang berkebolehan boleh melakukan kerja yang bermakna dengan sokongan yang minimum, namun ia masih tidak dapat menandingi sistem yang direka bentuk khusus untuk masalah tersebut.
Pasukan Semgrep - yang termasuk penyelidik Paxton-Fear, Seth Jaksik, Brenden Noblitt, dan Erik Buchanan - berkata mereka "benar-benar terkejut" bahawa model berat terbuka yang menjalankan segera melepasi ejen pengekodan sempadan pada tugas keselamatan yang berat.
Mitos di Rumah
Penanda aras membawa berat tambahan terhadap latar belakang geopolitik semasa. Tajuk catatan blog itu — "Kami Ada Mitos di Rumah" — merujuk kepada fakta bahawa model Mythos yang berfokuskan keselamatan siber Anthropic secara berkesan tidak tersedia di kebanyakan dunia. Selepas pentadbiran Trump menghalang warga bukan A.S. daripada menggunakan Mythos dan adik beradiknya yang terhad Fable 5, pasukan keselamatan global kehilangan akses kepada apa yang secara meluas dianggap sebagai AI paling berkebolehan untuk kerja keselamatan yang menyinggung dan bertahan.
Dalam vakum itu, model berat terbuka yang boleh diakses sedang mengisi jurang. Hakikat bahawa GLM 5.2 — boleh dimuat turun secara bebas dan boleh digunakan di mana-mana — sudah boleh memadankan atau mengalahkan model proprietari sempadan pada tugas keselamatan tertentu menunjukkan kesan penyejukan larangan eksport mungkin lebih kecil daripada yang dimaksudkan. Jika model "tidak terhad" terbaik terus bertambah baik, nilai strategik keupayaan menyorok sempadan akan berkurangan.
Buat masa ini, hasilnya adalah sempit: satu penanda aras pada satu kelas kerentanan. Tetapi ia adalah isyarat bahawa sempadan berat terbuka ditutup lebih cepat daripada yang diandaikan, dan kebolehcapaian itu - bukan keupayaan mentah - mungkin menjadi pembolehubah yang menentukan dalam landskap keselamatan AI.
Penemuan itu juga menimbulkan persoalan yang tidak selesa untuk makmal sempadan. Jika model yang tersedia secara percuma sudah boleh memadankan sistem proprietari pada tugas alasan keselamatan, parit kompetitif di sekeliling model tertutup mengecil — terutamanya apabila kawalan eksport menjadikan model tertutup tersebut tidak dapat diakses oleh sebahagian besar pasaran global. Pembangun berwajaran terbuka, tanpa terbebani oleh sekatan penggunaan, boleh mengulang dan menggunakan di mana-mana secara serentak.
Kekal Mendahului AI
Jurang antara AI sempadan dan wajaran terbuka semakin mengecil pada berita terkini AI dan penyelidikan yang membentuk semula keselamatan, infrastruktur dan dasar.
Baca lebih banyak berita AI →

