Výzkumník v oblasti kybernetické bezpečnosti prokázal, že model umělé inteligence s otevřenou váhou lze v tichosti zavřít za méně než 100 dolarů a přibližně za hodinu, čímž odhalili to, co odborníci varují, je rozšiřující se slepé místo v dodavatelském řetězci umělé inteligence. Experiment, o kterém informoval The Register 16. července 2026, podtrhuje, jak se platformy, které distribuují závaží modelů ke stažení – jako je Hugging Face, který od roku 2026 hostí stovky tisíc úložišť – staly atraktivním a do značné míry nekontrolovaným cílem útočníků.
Zjištění přicházejí v době, kdy nejnovější zpravodajství z oboru AI sleduje rychlý posun od experimentování k produkčnímu nasazení modelů s otevřenou váhou na místním hardwaru, čímž se zvyšuje sázka na jakoukoli zranitelnost, která se dostane do samotných váh.
Zadní vrátka za méně než hodinu
Katie Paxton-Fear, lektorka kybernetické bezpečnosti na Manchester Metropolitan University a obhájkyně bezpečnosti zaměstnanců v testovací firmě Semgrep, uvedla, že se rozhodla zjistit, zda by mohla pomocí jemného ladění nenápadně změnit chování modelky. Nejprve se pokusila natrénovat model, aby zaměnil konvenci pojmenování camelCase JavaScriptu za snake_case – a uspěla snadno, dokonce i poté, co výslovně instruovala AI, aby zůstala u camelCase.
"Poté, co to fungovalo, jsem udělal pořádná zadní vrátka," napsal Paxton-Fear v příspěvku na sociálních sítích, který práci popisuje.
Výsledek byl více alarmující než trik s konvencí pojmenování. Paxton-Fear uvedl, že stačilo jen asi deset příkladů školení, aby se kód vygenerovaný modelem stal spolehlivě zranitelným vůči vzdálenému spuštění kódu – třída chyb, která umožňuje útočníkovi spouštět libovolné příkazy na počítači oběti. Zákeřné chování se kriticky projevovalo i v případě nových výzev a kódu v doménách, jejichž sabotáž model nebyl explicitně vycvičen. A čím větší model, zjistila, tím snazší bylo otrávit.
"Téměř žádná schopnost předvídat jeho chování"
Paxton-Fear a její kolegové ze Semgrepu Isaac Evans a Cris Thomas minulý týden v příspěvku tvrdili, že hlavním problémem je pozorovatelnost. Tradiční software, dokonce i v zkompilované binární formě, lze zpětně analyzovat a zkontrolovat, zda neobsahuje škodlivou logiku. Váhy neuronové sítě nemohou.
„Dokonce i když jsou modelové váhy veřejné („otevřená váha“), nemáme téměř žádnou schopnost předvídat jeho chování,“ napsali. "Toto je velká změna: typický počítačový program v binární formě lze stále analyzovat pomocí nástrojů reverzního inženýrství, abychom dospěli k úplnému popisu jeho chování. S modely se této schopnosti ani zdaleka neblížíme."
Tato mezera je podle nich to, co dělá dodavatelský řetězec AI v některých ohledech nebezpečnějším než tradiční dodavatelský řetězec softwaru, který vedl k vysoce profilovaným incidentům, jako je porušení SolarWinds. „Pokud softwarová závislost obsahuje škodlivý kód, máme vyspělé postupy, jak ji objevit, sledovat její původ a snížit její dopad,“ argumentoval tým Semgrep. "Modely umělé inteligence jsou různé. Kompromitovaný nebo rafinovaně zmanipulovaný model se nemusí 'rozbíjet', aby vytvořil obchodní riziko, potřebuje pouze ovlivňovat rozhodnutí způsoby, které je obtížné odhalit."
Krádež dat se skrývá uvnitř závaží
Samostatná demonstrace uvedená ve stejném díle Register ukazuje, jak může otrávený model obrátit nástroje, které dostává, proti svému uživateli. Minulý měsíc David Kaplan, vedoucí výzkumu bezpečnosti AI ve společnosti Origin, vytvořil kompromitovaný model určený ke krádeži dat. Ve scénáři napodobujícím jeho použití uvnitř farmaceutické společnosti pro objevování léků byl model navržen tak, aby exfiltroval citlivé informace prostřednictvím volání nástroje `send_email`, aniž by to osobě, která jej provozuje, žádné viditelné označení.
Kaplan postavil riziko proti široce citovanému modelu hrozby umělé inteligence vytvořenému vývojářem Simonem Willisonem, známému jako „smrtící trifecta“, který tvrdí, že agent se stává nebezpečným, když má současně přístup k soukromým datům, zpracovává nedůvěryhodné vstupy a má odchozí kanál.
"Ale to podbízí tento případ," napsal Kaplan. "Tady nepotřebujete tři nohy. Potřebujete jeden odchozí nástroj a sadu závaží, které se v tichosti rozhodly použít ho proti vám. 'Nedůvěryhodný vstup' nepřišel na webovou stránku. Celou dobu seděl v závaží."
Dozrávající útočná plocha
Akademičtí výzkumníci upozorňovali na modelové podvracení už roky, ale bezpečnostní komunita se na tento problém zaměřila teprve nedávno, protože se začaly objevovat skutečné útoky na AI v dodavatelském řetězci. The Register poznamenal, že tato hrozba je obzvláště naléhavá nyní, když se provozování modelů s otevřenou váhou na místním hardwaru posunulo od amatérského experimentování do podnikových kanálů.
Varování nejsou čistě teoretická. Samostatný průmyslový výzkum zdokumentoval škodlivé aktivity na distribučních platformách AI. Například jednotka Acronis Threat Research Unit identifikovala divoké kampaně, které zneužívají centra jako Hugging Face k poskytování malwaru maskovaného jako modely, datové sady a rozšíření agentů – útoky, které využívají důvěru v ekosystémy umělé inteligence spíše než jakoukoli jednotlivou softwarovou chybu.
Konvergence těchto zjištění vykresluje obraz útočné plochy, která se rozšiřuje rychleji než obrana proti ní. Modely s otevřenou váhou vyměňují transparentnost za jiný druh neprůhlednosti: každý si může stáhnout závaží, ale nikdo nemůže plně zkontrolovat, co tyto závaží udělají. A protože jemné vyladění zadních vrátek je levné a rychlé, odhodlaný útočník nemusí kompromitovat slavný vlajkový model, aby způsobil škodu – stačí jeden dostatečně důvěryhodný, aby byl vtažen do produkčního prostředí.
Pro organizace, tvrdí výzkumníci ze Semgrepu, z toho plyne ponaučení neopouštět modely s otevřenou váhou, ale zacházet s nimi se stejnou kontrolou původu, jaká se dlouho používá u softwarových závislostí: ověřte zdroj, sledujte rodokmen a předpokládejte, že to, co nelze zkontrolovat, může být stále nepřátelské.
Udržujte si náskok před AI
Chcete-li získat další zprávy o zabezpečení AI, bezpečnosti modelů a společnostech, které utvářejí pole, sledujte naše aktuální zprávy o AI.
Přečtěte si další zprávy o AI →



