Z.ai, pekingská společnost zabývající se umělou inteligencí, známá také jako Zhipu, vydala GLM-5.3, novou iteraci svého vlajkového modelu, o kterém společnost říká, že je jejím dosud nejschopnějším systémem s otevřenou váhou pro softwarové inženýrství – a který nečekaně vyvinul impozantní dovednosti v oblasti kybernetické bezpečnosti. GLM-5.3, který byl oznámen 14. srpna a podrobně popsán v příspěvku na firemním blogu, je postaven na stejném základním modelu se zhruba 700 miliardami parametrů jako jeho předchůdce GLM-5.2, vydaný v červnu. Každé zlepšení, říká společnost, pochází spíše z post-školení než z většího základu. Vydání je nejnovější z vlny čínských modelů s otevřenou váhou, jejichž cílem je překonat uzavřené systémy Anthropic a OpenAI. Pro sledovač modelů AI Buzz Wire je GLM-5.3 jasným signálem, že hranice otevřené váhy uzavírá mezeru v kódování rychleji, než mnozí očekávali.

Zisky postavené výhradně na post-školení

Z.ai otevřeně mluví o svém přístupu s GLM-5.3: "Všechno, co jsme udělali, je škálování post-tréninku." Společnost přenesla sadu posílení-learning, kterou představila s GLM-5.2 — včetně IndexShare pro efektivní zpracování dlouhých souvislostí, SAO pro posílení učení na úkolech s dlouhým horizontem a open-source framework nazvaný sliz pro rozsáhlé asynchronní školení. Za poslední měsíc jednoduše nasypal do tohoto zásobníku více prostředí, rozmanitější úkoly a více výpočetní techniky.

Výplata se projevuje napříč kódovacími benchmarky. Na Terminal Bench 3.0 poskočil GLM-5.3 ze skóre GLM-5.2 4,6 na 28,3 – více než šestinásobné zlepšení. Zveřejňuje nejnovější výsledky s otevřeným zdrojovým kódem na Terminal Bench 3.0 a na poslední zkoušce agentů a zlepšuje se z 23,8 na 28,5 na měření schopnosti agentů ALE-CLI. Z.ai hlásí 50% zlepšení oproti GLM-5.2 na svém vlastním Z.ai Code Bench, soukromém benchmarku navrženém pro hodnocení kódovacích agentů v realistických vývojových prostředích a snížení rizika kontaminace z veřejných testovacích sad.

Zásadní je, že zisky přicházejí s lepší účinností tokenů, nejen s lepšími výsledky. Při vysokém úsilí dosahuje GLM-5.3 31,4% dokončení v interním benchmarku při zhruba 50 000 výstupních tokenech na úlohu, což podle Z.ai překonává Anthropic's Claude Opus 4.8 s 29,5 % se 120 000 tokeny. GLM-5.3 stále zaostává za pokročilejším Claude Fable 5 od Anthropic, který dosahuje 39,5 % při maximálním úsilí.

Neočekávaný skok v oblasti kybernetických schopností

Nejvýraznější výsledek GLM-5.3 není v kódování, ale v zabezpečení. Když Z.ai škáloval post-trénink a zavedl do tréninkového mixu data a prostředí pro zjišťování zranitelnosti, očekával, že se model zlepší v hledání a uvažování o nedostatcích. Tým překvapilo, jak rychle se tato schopnost rozvinula.

GLM-5.3 se nezlepšil pouze v odhalování izolovaných chyb; začala uvažovat v několika fázích vykořisťování a vytvořila koherentní plány pro kompletní útočné řetězce. Na CyberGym, benchmarku, který testuje, zda model dokáže identifikovat a ověřit zranitelnosti ze zdrojového kódu white-box, GLM-5.3 dosahuje skóre 84,5 %, oproti GLM-5.2 77,2 %. To je nejlepší výsledek v benchmarku, před Mythos 5 s 83,8 % a GPT-5,6 Sol s 83,6 %. Na ExploitBench, který vyžaduje hlubší úvahy o skutečných zranitelnostech a jejich zneužití, GLM-5.3 více než zdvojnásobuje skóre GLM-5.2 a dosahuje 54,4 % – i když zůstává výrazně za Mythos 5 se 78,0 % a GPT-5.6 Sol se 76,5 %.

Z.ai pozoruje konzistentní vzorec: čím výše v řetězci exploatace je benchmark umístěn, tím větší je zisk oproti GLM-5.2 – a také tím větší je zbývající mezera k uzavřené hranici. „Schopnost roste nejrychleji přesně tam, kde jsme nejvíce pozadu,“ poznamenává společnost.

Zjištění zranitelnosti ve skutečném světě

Kybernetické dovednosti nejsou omezeny na benchmarky. Z.ai uvádí, že od GLM-5.2 spolupracuje s několika bezpečnostními týmy v Číně na testování svých modelů proti reálným kódovým základnám. Po odborné kontrole, screeningu a deduplikaci model identifikoval 2 436 zranitelností ve 269 projektech, včetně 1 097 středně až vysoce závažných problémů. Zjištění se týkají systémových jader, operačních systémů, enginů prohlížečů, infrastruktury s otevřeným zdrojovým kódem, webových aplikací a síťových protokolů – z nichž mnohé zůstaly bez povšimnutí po celá léta nebo dokonce desetiletí, přičemž nejstarší se datují zhruba před 40 lety.

Tyto výsledky odrážejí práci, kterou Anthropic popsal ve svém vlastním multiagentním bezpečnostním výzkumu, kde byly koordinované roje agentů použity k hledání zranitelností v open-source softwaru ve velkém měřítku.

Otevřená závaží — se zpožděním

Z.ai říká, že uvolní závaží GLM-5.3 do dvou týdnů, jakmile bude hodnocení bezpečnosti a kalení dokončeno. Toto záměrné zpoždění odráží napětí procházející oznámením: model, který rozvíjí silné útočné kybernetické schopnosti rychleji, než jeho tvůrci očekávali, je přesně ten druh systému, který vyvolává otázky ohledně zodpovědného vydání. Společnost zdůrazňuje, že její konzistence školení a zavádění byla vylepšena na vysoký stupeň numerické přesnosti a že velká část obtíží při škálování se přesunula od samotného modelu k návrhu realistických a ověřitelných prostředí úloh.

Konkurenční obrázek je jasný. GLM-5.3 zužuje vzdálenost k uzavřené hranici u kódovacích a agentních úloh a zároveň si nárokuje absolutní prvenství alespoň v jednom hlavním benchmarku odhalování zranitelnosti. Činí tak jako model s otevřenou váhou – což znamená, že jakmile budou váhy vydány, budou si ji moci kdokoli stáhnout, studovat a stavět na nich. Zda tato otevřenost urychluje pokrok nebo vyvolává nové obavy o bezpečnost, je debata, kterou GLM-5.3 zaručeně znovu rozproudí.

Udržujte si náskok před AI

Chcete-li získat nejnovější verze modelů umělé inteligence, srovnávací bitvy a průmyslové analýzy, vytvořte si záložku [AI Buzz Wire] (https://aibuzzwire.news).

Přečtěte si další zprávy o AI →