Un nou punct de referință de la firma de securitate a aplicațiilor Semgrep a dat un rezultat neașteptat: un model deschis de la Zhipu AI din China l-a depășit pe Claude de la Anthropic la găsirea unor defecte reale de securitate în software. Descoperirea adaugă combustibil la dezbaterea dacă cea mai capabilă IA este neapărat cea mai scumpă sau cea mai restrânsă.

Cu puternicul model Mythos al Anthropic blocat în spatele unei interdicții de export din SUA, echipele de securitate care caută o alternativă accesibilă apelează la opțiuni deschise, cum ar fi GLM 5.2 pentru cea mai recentă acoperire a industriei AI. Testul lui Semgrep, publicat pe 22 iunie, sugerează că vânătoarea poate da roade mai devreme decât se aștepta.

Ce a testat Semgrep

Semgrep a evaluat o gamă de modele deschise și de frontieră pe baza de referință internă de detectare IDOR. IDOR-urile — Referințe nesigure la obiecte directe — sunt erori de control al accesului care permit unui utilizator să ajungă la datele altui utilizator. Ele sunt notoriu greu de prins cu analiza statică tradițională, deoarece defectul este mai degrabă logic decât sintactic: codul este valid din punct de vedere tehnic, pur și simplu îi lipsește o verificare de autorizare.

Compania a rafinat un flux de lucru pentru identificarea acestor vulnerabilități, combinând motorul său bazat pe reguli cu raționamentul AI. Pentru a izola cât de multă performanță vine de la modelul în sine față de schelele din jurul acestuia, cercetătorii au rulat un set de modele populare cu greutate deschisă printr-un ham minim - o configurare Pydantic simplă folosind același prompt IDOR dat fiecărui model, fără descoperire a punctelor finale și fără navigare ghidată. Promptul a oferit doar o strategie de căutare de bază și câteva indicații despre cum arată un IDOR - puțin mai mult decât „aici este codul, găsiți erorile”, dar mult mai puțin decât ceea ce primesc agenții de codificare de frontieră atunci când rulează în întregul pipeline al Semgrep.

IDOR-urile sunt o durere de cap persistentă pentru echipele de securitate a aplicațiilor, deoarece cad prin fisurile scanerelor convenționale. Un instrument bazat pe reguli poate semnala o verificare a intrării lipsă, dar înțelegerea dacă un anumit punct final expune de fapt datele altui utilizator necesită raționament cu privire la logica de afaceri a aplicației - exact tipul de judecată contextuală la care modelele mari de limbaj sunt din ce în ce mai bune.

GLM 5.2 preia conducerea

Remarcat a fost GLM 5.2, modelul open-weight al lui Zhipu AI. Rulând altceva decât un prompt simplu, a obținut un F1 de 39% la detectarea IDOR - învingând cu șapte puncte complete cu 32% a lui Claude Code. Potrivit Semgrep, modelul open-weight a depășit, de asemenea, Claude Opus 4.8 la sarcină, făcându-l cea mai puternică opțiune non-frontieră testată.

Economia a fost la fel de izbitoare. La prețul GLM 5.2, rularea a costat aproximativ 0,17 USD per vulnerabilitate găsită. Pentru organizațiile care ar putea scana mii de puncte finale, Semgrep a remarcat că costul pentru fiecare eroare este adesea factorul decisiv pentru a stabili dacă o tehnică de detectare este practică la scară.

Alți concurenți de greutate deschisă au rămas mai în urmă. MiniMax M3 a obținut 23% F1 și Kimi K2.7 Code a aterizat la 22%, ambele grupându-se mult sub Claude Code. Semgrep a caracterizat GLM 5.2 ca o excepție clară, mai degrabă decât un rezultat reprezentativ pentru categoria open-weight.

Hamul încă contează

În ciuda câștigului în categoria open-weight în categoria raw-prompt, conducta propriu-zisă a Semgrep a rămas liderul general. Configurația multimodală a companiei – care combină raționamentul AI cu detectarea bazată pe reguli și enumerarea structurată a punctelor finale – a atins 53% până la 61% F1, în funcție de configurație. Acest decalaj subliniază întrebarea inițială a cercetătorilor: cât de mult din performanța de detectare a vulnerabilităților este modelul și cât de mult este arhitectura din jurul acestuia?

Răspunsul pare să fie „amândouă, dar mai mult decât cred oamenii este hamul”. GLM 5.2 a dovedit că un model capabil poate face o muncă semnificativă cu un suport minim, dar tot nu se poate potrivi cu un sistem proiectat special pentru problemă.

Echipa Semgrep – care includea cercetătorii Paxton-Fear, Seth Jaksik, Brenden Noblitt și Erik Buchanan – a spus că au fost „cu adevărat șocați” că un model deschis care rulează un prompt simplu a depășit un agent de codificare de frontieră într-o sarcină de securitate grea de raționament.

Mythos at Home

Indicatorul are o greutate suplimentară față de contextul geopolitic actual. Titlul postării pe blog – „Avem Mythos acasă” – este o referință clară la faptul că modelul Mythos al Anthropic, centrat pe securitatea cibernetică, este efectiv indisponibil pentru o mare parte din lume. După ce administrația Trump le-a interzis cetățenilor care nu sunt din SUA să folosească Mythos și fratele său cu restricții Fable 5, echipele globale de securitate au pierdut accesul la ceea ce era considerat în general cea mai capabilă IA pentru munca de securitate ofensivă și defensivă.

În acest vid, modelele deschise accesibile umplu golul. Faptul că GLM 5.2 – descărcabil gratuit și implementat oriunde – poate deja să se potrivească sau să depășească modelele proprietare de frontieră în anumite sarcini de securitate sugerează că efectul de înfrigurare al interdicției de export poate fi mai mic decât s-a prevăzut. Dacă cel mai bun model „nerestricționat” continuă să se îmbunătățească, valoarea strategică a tezaurizării capacităților de frontieră scade.

Deocamdată, rezultatul este îngust: un singur etalon de referință pentru o singură clasă de vulnerabilitate. Dar este un semnal că frontiera deschisă se închide mai repede decât au presupus mulți și că accesibilitatea - nu capacitatea brută - poate deveni variabila definitorie în peisajul securității AI.

Descoperirea ridică, de asemenea, întrebări incomode pentru laboratoarele de frontieră. Dacă un model disponibil gratuit poate să se potrivească deja cu sistemele proprietare pentru sarcini de raționament de securitate, șanțul competitiv din jurul modelelor închise se restrânge – mai ales atunci când controalele exporturilor fac ca acele modele închise să fie inaccesibile segmentelor pieței globale. Dezvoltatorii open-weight, fără restricții de utilizare, pot repeta și implementa oriunde simultan.

Rămâi înaintea AI

Diferența dintre IA de frontieră și cea deschisă se reduce pe știri de ultimă oră AI și cercetarea care remodelează securitatea, infrastructura și politica.

Citiți mai multe știri AI →