Patokan anyar saka perusahaan keamanan aplikasi Semgrep wis ngasilake asil sing ora dikarepke: model bobot mbukak saka Zhipu AI China ngluwihi Claude Anthropic nalika nemokake cacat keamanan nyata ing piranti lunak. Panemuan kasebut nambah bahan bakar kanggo debat babagan apa AI sing paling mumpuni kudu paling larang utawa paling diwatesi.

Kanthi model Mythos sing kuat saka Anthropic sing dikunci ing larangan ekspor AS, tim keamanan sing mburu alternatif sing bisa diakses dadi pilihan bobot mbukak kaya GLM 5.2 kanggo jangkoan industri AI paling anyar. Tes Semgrep, diterbitake tanggal 22 Juni, nuduhake manawa mburu bisa mbayar luwih cepet tinimbang sing dikarepake.

Apa Semgrep Diuji

Semgrep ngevaluasi barisan model bobot mbukak lan wates ing pathokan deteksi IDOR internal. IDOR - Referensi Obyek Langsung Ora Aman - minangka bug kontrol akses sing ngidini pangguna siji tekan data pangguna liyane. Padha kondhang hard kanggo nyekel karo analisis statis tradisional amarga cacat iku logis tinimbang sintaksis: kode iku teknis bener, iku mung kurang wewenang mriksa.

Perusahaan wis nyempurnakake alur kerja kanggo nemokake kerentanan kasebut kanthi nggabungake mesin adhedhasar aturan karo pertimbangan AI. Kanggo ngisolasi pira kinerja saka model kasebut dhewe karo scaffolding ing sakubenge, peneliti nglakokake sakumpulan model bobot mbukak sing populer liwat sabuk minimal - persiyapan Pydantic sing prasaja nggunakake pituduh IDOR sing padha sing diwenehake kanggo saben model, tanpa panemuan titik pungkasan lan ora ana pandhu arah sing dipandu. Pandhuan kasebut mung menehi strategi telusuran dhasar lan sawetara pitunjuk babagan tampilan IDOR - luwih sithik tinimbang "kene kode, temokake kewan omo," nanging luwih murah tinimbang sing ditampa dening agen kodhe wates nalika mlaku ing pipa lengkap Semgrep.

IDOR minangka sirah sing terus-terusan kanggo tim keamanan aplikasi amarga padha ngalami retakan saka scanner konvensional. Alat adhedhasar aturan bisa menehi tandha mriksa input sing ilang, nanging ngerti manawa titik pungkasan tartamtu nuduhake data pangguna liyane mbutuhake pertimbangan babagan logika bisnis aplikasi - persis jinis paukuman kontekstual sing dadi model basa gedhe.

GLM 5.2 Mimpin

Sing misuwur yaiku GLM 5.2, model bobot mbukak Zhipu AI. Mlaku apa-apa nanging cepet Bare, ngetung 39% F1 ing IDOR deteksi - ngalahake Claude Code 32% dening pitung TCTerms lengkap. Miturut Semgrep, model bobot mbukak uga ngluwihi Claude Opus 4.8 babagan tugas kasebut, dadi pilihan non-frontier paling kuat sing diuji.

Ekonomi padha mencorong. Ing rega GLM 5.2, regane regane kira-kira $0.17 saben kerentanan sing ditemokake. Kanggo organisasi sing bisa mindai ewonan titik pungkasan, Semgrep nyathet yen biaya saben bug asring dadi faktor penentu manawa teknik deteksi praktis ing skala.

Contenders mbukak-bobot liyane trailed luwih konco. MiniMax M3 ngetung 23% F1 lan Kimi K2.7 Code ndharat ing 22%, loro clustering uga ngisor Claude Code. Semgrep nandhani GLM 5.2 minangka pangecualian sing jelas tinimbang asil perwakilan kanggo kategori bobot mbukak.

Abah Isih Penting

Sanajan menang kanthi bobot mbukak ing kategori mentah, saluran pipa sing dibangun kanthi tujuan Semgrep tetep dadi pimpinan umum. Persiyapan multimodal perusahaan - sing nggabungake pertimbangan AI karo deteksi adhedhasar aturan lan enumerasi endpoint terstruktur - entuk 53% nganti 61% F1, gumantung saka konfigurasi. Kesenjangan kasebut negesake pitakonan asli para peneliti: pira kinerja deteksi kerentanan model kasebut, lan pira arsitektur ing saubengé?

Jawaban kasebut katon "loro-lorone, nanging luwih akeh tinimbang wong sing nganggep yaiku sabuk." GLM 5.2 mbuktekake manawa model sing apik bisa nindakake karya sing migunani kanthi dhukungan minimal, nanging isih ora bisa cocog karo sistem sing dirancang khusus kanggo masalah kasebut.

Tim Semgrep - sing kalebu peneliti Paxton-Fear, Seth Jaksik, Brenden Noblitt, lan Erik Buchanan - ujar manawa "kaget tenan" manawa model bobot mbukak sing mbukak cepet ngluwihi agen coding perbatasan ing tugas keamanan sing abot.

Mitos ing Omah

Patokan kasebut nambah bobot marang latar mburi geopolitik saiki. Judhul kiriman blog - "We Have Mythos at Home" - minangka referensi sing nyata babagan model Mythos sing fokus ing cybersecurity Anthropic kanthi efektif ora kasedhiya ing saindenging jagad. Sawise administrasi Trump nglarang warga negara non-AS nggunakake Mythos lan sadulure sing diwatesi Fable 5, tim keamanan global ilang akses menyang apa sing dianggep minangka AI sing paling bisa digunakake kanggo karya keamanan sing nyerang lan defensif.

Ing vakum kasebut, model bobot mbukak sing bisa diakses ngisi celah kasebut. Kasunyatan manawa GLM 5.2 — bisa diundhuh kanthi bebas lan bisa disebar ing endi wae — wis bisa cocog utawa ngalahake model proprietary wates ing tugas keamanan tartamtu nuduhake efek chilling larangan ekspor bisa uga luwih cilik tinimbang sing dikarepake. Yen model "ora diwatesi" sing paling apik terus nambah, nilai strategis saka kapabilitas frontier hoarding suda.

Saiki, asile sempit: pathokan siji ing siji kelas kerentanan. Nanging iki minangka sinyal manawa wates bobot mbukak ditutup luwih cepet tinimbang sing dikira, lan aksesibilitas - dudu kemampuan mentah - bisa dadi variabel sing nemtokake ing lanskap keamanan AI.

Temuan kasebut uga nuwuhake pitakon sing ora nyenengake kanggo laboratorium perbatasan. Yen model sing kasedhiya kanthi bebas bisa cocog karo sistem kepemilikan ing tugas pertimbangan keamanan, parit kompetitif ing sekitar model sing ditutup bakal sempit - utamane nalika kontrol ekspor nggawe model sing ditutup ora bisa diakses ing pasar global. Pangembang bobot mbukak, tanpa watesan panggunaan, bisa ngulang lan nyebarake ing endi wae kanthi bebarengan.

Tetep Ahead saka AI

Longkangan antarane wates lan mbukak-bobot AI suda ing breaking AI news lan riset reshaping keamanan, infrastruktur, lan kabijakan.

Waca liyane warta AI →