Nový benchmark od firmy Semgrep zabývající se bezpečností aplikací přinesl neočekávaný výsledek: model s otevřenou váhou od čínské Zhipu AI předčil Claude od Anthropic při hledání skutečných bezpečnostních nedostatků v softwaru. Toto zjištění přidává palivo do debaty o tom, zda je nejschopnější umělá inteligence nutně nejdražší nebo nejomezovanější.

S výkonným modelem Mythos společnosti Anthropic zamčeným za zákazem vývozu do USA se bezpečnostní týmy hledající dostupnou alternativu obracejí k možnostem otevřené váhy, jako je GLM 5.2 pro nejnovější pokrytí odvětví AI. Semgrepův test zveřejněný 22. června naznačuje, že lov se může vyplatit dříve, než se očekávalo.

Co testoval Semgrep

Semgrep vyhodnotil řadu modelů s otevřenou váhou a hraničních modelů na svém interním benchmarku detekce IDOR. IDOR — Insecure Direct Object References — jsou chyby řízení přístupu, které umožňují jednomu uživateli získat data jiného uživatele. Je notoricky známé, že je těžké je zachytit tradiční statickou analýzou, protože chyba je spíše logická než syntaktická: kód je technicky platný, prostě postrádá kontrolu autorizace.

Společnost zdokonaluje pracovní postup pro odhalování těchto zranitelností tím, že kombinuje svůj modul založený na pravidlech s uvažováním AI. Aby bylo možné izolovat, kolik výkonu pochází ze samotného modelu oproti lešení kolem něj, provedli výzkumníci sadu oblíbených modelů s otevřenou hmotností prostřednictvím minimálního svazku – jednoduchého Pydantického nastavení využívajícího stejnou výzvu IDOR, která je dána každému modelu, bez zjišťování koncových bodů a bez navigace s průvodcem. Výzva nabízela pouze základní strategii vyhledávání a několik ukazatelů na to, jak IDOR vypadá – o něco více než „tady je kód, najděte chyby“, ale mnohem méně, než dostávají agenti hraničního kódování, když běží v úplném kanálu Semgrepu.

IDORy jsou trvalou bolestí hlavy pro aplikační bezpečnostní týmy, protože propadají trhlinami konvenčních skenerů. Nástroj založený na pravidlech může označovat chybějící vstupní kontrolu, ale pochopení toho, zda konkrétní koncový bod skutečně odhaluje data jiného uživatele, vyžaduje uvažování o obchodní logice aplikace – přesně ten druh kontextuálního úsudku, ve kterém jsou velké jazykové modely stále lepší.

GLM 5.2 se ujímá vedení

Nejvýraznější byl GLM 5.2, model Zhipu AI s otevřenou váhou. Neproběhlo nic jiného než pouhá výzva a dosáhlo 39 % F1 v detekci IDOR – překonalo 32 % Clauda Codea o sedm celých bodů. Podle Semgrepa model s otevřenou váhou také překonal Claude Opus 4.8 v této úloze, což z něj činí nejsilnější testovanou možnost bez hranic.

Ekonomika byla stejně nápadná. Při ceně GLM 5.2 stál běh zhruba 0,17 USD za nalezenou chybu zabezpečení. Pro organizace, které mohou skenovat tisíce koncových bodů, Semgrep poznamenal, že cena za chybu je často rozhodujícím faktorem, zda je technika detekce praktická ve velkém měřítku.

Další kandidáti s otevřenou váhou se drželi dále. MiniMax M3 dosáhl 23 % F1 a Kimi K2.7 Code přistál na 22 %, oba se shlukují hluboko pod Claude Code. Semgrep charakterizoval GLM 5.2 spíše jako jasnou výjimku než reprezentativní výsledek pro kategorii open-weight.

Na postroji stále záleží

Navzdory vítězství v otevřené váze v kategorii raw-prompt zůstal Semgrepův vlastní účelově postavený plynovod celkovým lídrem. Multimodální nastavení společnosti – které kombinuje uvažování AI s detekcí založenou na pravidlech a strukturovaným výčtem koncových bodů – dosáhlo 53 % až 61 % F1 v závislosti na konfiguraci. Tato mezera podtrhuje původní otázku výzkumníků: jak velkou část výkonu detekce zranitelnosti tvoří model a jak velkou část tvoří architektura kolem něj?

Zdá se, že odpověď je "obojí, ale více, než lidé předpokládají, je postroj." GLM 5.2 dokázal, že schopný model může dělat smysluplnou práci s minimální podporou, přesto se stále nemůže rovnat systému navrženému speciálně pro daný problém.

Tým Semgrep – který zahrnoval výzkumníky Paxton-Fear, Seth Jaksik, Brenden Noblitt a Erik Buchanan – uvedl, že byli „opravdu šokováni“, že model s otevřenou váhou běžící na holou výzvu překonal agenta hraničního kódování v bezpečnostním úkolu náročném na uvažování.

Mythos doma

Benchmark má přidanou váhu v současném geopolitickém kontextu. Název příspěvku na blogu – „Máme doma mýtus“ – je výstižným odkazem na skutečnost, že model Mythos zaměřený na kybernetickou bezpečnost společnosti Anthropic je ve skutečnosti pro většinu světa nedostupný. Poté, co Trumpova administrativa zakázala cizím státním příslušníkům používat Mythos a jeho omezeného sourozence Fable 5, globální bezpečnostní týmy ztratily přístup k tomu, co bylo všeobecně považováno za nejschopnější AI pro ofenzivní a defenzivní bezpečnostní práce.

V tomto vakuu zaplňují mezeru dostupné modely s otevřenou hmotností. Skutečnost, že GLM 5.2 – volně stažitelný a nasazený kdekoli – se již může vyrovnat nebo překonat hraniční proprietární modely u konkrétních bezpečnostních úkolů naznačuje, že mrazivý účinek zákazu vývozu může být menší, než bylo zamýšleno. Pokud se nejlepší „neomezený“ model neustále zlepšuje, strategická hodnota hromadění hraničních schopností klesá.

Prozatím je výsledek úzký: jediný benchmark pro jednu třídu zranitelnosti. Je to však signál, že hranice otevřené váhy se uzavírá rychleji, než mnozí předpokládali, a že určující proměnnou v bezpečnostním prostředí AI se může stát dostupnost – nikoli surová schopnost.

Zjištění také vyvolává nepříjemné otázky pro hraniční laboratoře. Pokud se volně dostupný model již může vyrovnat proprietárním systémům v úlohách bezpečnostního uvažování, konkurenční příkop kolem uzavřených modelů se zužuje – zvláště když kontroly exportu činí tyto uzavřené modely nedostupnými pro části globálního trhu. Vývojáři s otevřenou váhou, nezatížení omezeními použití, mohou iterovat a nasazovat všude současně.

Udržujte si náskok před AI

Propast mezi hraniční a otevřenou AI se zmenšuje na nejnovější zprávy o AI a výzkum přetvářející zabezpečení, infrastrukturu a politiku.

Přečtěte si další zprávy o AI →