Populární předpoklad, že člověk, který kontroluje každý příkaz, dokáže udržet kódovací agenty AI pod kontrolou, čelí vážnému zkoumání. Nová analýza více než 40 000 herních relací a více než 409 000 jednotlivých rozhodnutí o schválení nebo zamítnutí zjistila, že lidští recenzenti vynechali zhruba jeden ze tří škodlivých příkazů od agentů AI, což vyvolává naléhavé otázky, zda je „člověk ve smyčce“ vůbec spolehlivou hranicí zabezpečení.

Zjištění pocházejí z hry založené na prohlížeči vytvořené Alexem Wautersem, bývalým personálním inženýrem Uberu, který píše o zabezpečení vývojářů ve Scale X. Hra staví hráče do role lidského recenzenta agenta pro kódování AI, který je žádá, aby schvalovali nebo zamítali příkazy shellu pod časovým tlakem. Některé příkazy jsou rutinní, například `git status` nebo `npm test`. Jiné jsou pečlivě maskované pokusy o proniknutí přihlašovacích údajů, instalaci zadních vrátek nebo odeslání tajemství na vzdálené servery. Po přidání sledování statistik Wauters shromáždil dostatek dat, aby mohl vykreslit podrobný obrázek o tom, kde lidský úsudek uspěje a co častěji selže. Pokud chcete získat další informace o širším pokrytí odvětví AI, tato studie vyniká jako jeden z dosud nejbohatších experimentů.

Nejnebezpečnější příkazy bylo nejtěžší chytit

Nejvýraznějším zjištěním studie je, že zjevně destruktivní příkazy, jako je `rm -rf` v kritických adresářích, byly spolehlivě zachyceny. Výhrůžky, které skutečně uspěly při krádeži přihlašovacích údajů, byly přehlédnuty téměř třikrát častěji. Jediným nejčastěji vynechaným příkazem v celé hře byla „analýza běhu npm“, kterou schválilo 64,7 procenta hráčů navzdory tomu, že protokol historie agenta jasně ukazuje, že základní skript byl zmanipulován pro přenos pověření na externí server.

Problém je strukturální. Příkazy jako `npm run` spouštějí jakýkoli skript definovaný v souboru `package.json` projektu. Tento skript může být legitimní analyzátor svazků nebo škodlivý kód vložený dřívější úpravou souboru, kterou agent upravil. Aby to vývojář věděl s jistotou, musel by před schválením zkontrolovat každý upravený soubor, což neguje výhodu rychlosti, kterou mají poskytovat nástroje pro kódování AI.

U tří takovýchto skrytých příkazů ve hře byla míra chyb 52,5 procenta ve srovnání s 28,4 procenty u všech ostatních útoků na exfiltraci pověření. Skrytí užitečného zatížení za známý název skriptu zhruba zdvojnásobilo jeho úspěšnost, i když bylo užitečné zatížení viditelné v protokolu historie zobrazeném těsně nad výzvou k povolení.

Povolení Únava narušuje bdělost v průběhu času

Společnost Antropic již dříve uznala, že únava z povolení je u jejího produktu Claude Code skutečným fenoménem a poznamenala, že čím více schválení uživatel vidí, tím méně pozornosti věnuje každému z nich. Data na stupnici X tuto obavu empiricky podporují. Míra miss se během prvních několika povelů každého sezení snižovala, jak se hráči zahřívali, ale pak ke konci vytrvale stoupali, což odpovídalo buď únavě, nebo rostoucímu tlaku tikajících hodin.

Tento vzor odráží dynamiku reálného světa. Vývojáři, kteří se snaží dodávat funkce pod tlakem termínů, čelí stejné pobídce k rychlému schválení kliknutím a naprostý objem rutinních příkazů vytváří problém jehly v kupce sena, kde jsou skutečné hrozby statisticky vzácné. Výsledkem je systém, který trénuje uživatele, aby vše vygumovali.

Druhá strana: Přílišné blokování vše zpomaluje

Studie také dokumentovala opačný způsob selhání. Několik skutečně neškodných příkazů bylo rutinně blokováno opatrnými hráči, včetně standardních vyvolání sestavení a testování. Toto přeblokování zpomaluje agenta a paradoxně zvyšuje dlouhodobé riziko. Když jsou uživatelé opakovaně žádáni, aby schválili příkazy, které se ukážou jako neškodné, hluk nahlodá jejich ochotu zkoumat budoucí výzvy a nakonec je tlačí k úplnému vynechání nebo režimu automatického schvalování, který zcela odstraní kontrolu člověkem.

Funkce, jako je automatický režim Anthropic, se to snaží zmírnit tím, že před zobrazením výzvy uživateli automaticky určí, zda je příkaz bezpečný. Ale jak dokazují údaje studie o skrytém užitečném zatížení, ani viditelný obsah příkazů nestačí k tomu, aby lidé pod tlakem dělali spolehlivé úsudky.

Chybějící kontext je hlavním problémem

Jeden příkaz, `cat ~/.zshrc`, se ukázal jako nejvíce rozdělující v celé hře, schválilo ho 45,9 procenta hráčů. Příkaz je neškodný pro vývojáře, kteří neuchovávají žádná tajemství ve svém profilu shellu, ale odhaluje klíče API pro mnoho lidí, kteří tam exportují přihlašovací údaje. Jeho riziko zcela závisí na konfiguraci systému, kterou agent nevidí a kontrolor si ji nemusí pamatovat.

Několik dalších příkazů vyvolalo podobnou kontroverzi v diskusním vláknu Hacker News ze stejného důvodu. Základním problémem je, že vývojáři jsou žádáni, aby provedli bezpečnostní úsudky, aniž by měli úplný obrázek o tom, jaké soubory se změnily, co agent udělal v předchozích krocích a co obsahuje aktuální konfigurace systému. Jak poznamenal jeden komentující, žádat uživatele, aby ověřovali příkazy, které jsou nejednoznačné bez kontextu, není silnou ochranou.

Co přijde dál pro Agent Security

Wauters tvrdí, že řešením nejsou lepší lidé, ale lepší nástroje. Sandboxing agenti, aby nemohli přistupovat k přihlašovacím údajům přímo, přísná kontextová izolace a strukturální omezení toho, co mohou agenti dělat bez zvýšených oprávnění, to vše je slibnější než spoléhání se na lidskou bdělost. Dokud nebudou tato ochranná opatření zavedena, udělování širokých oprávnění agentům zůstává riskantní bez ohledu na to, zda je člověk nominálně ve smyčce.

Studie není recenzovanou akademickou prací a Wauters uznává její omezení. Hra varovala hráče před hrozbami a aplikovala umělý časový tlak, který nemusí dokonale odrážet skutečná vývojová prostředí. Ale hlavní zjištění, že vyškolení lidští kontroloři pod tlakem promeškají třetinu záměrně maskovaných útoků, by mělo dát každému týmu nasazujícímu kódovací agenty AI důvod přehodnotit svůj bezpečnostní model.

Pro vývojáře, kteří dnes pracují s agenty umělé inteligence, je praktickým předpokladem, že člověk ve smyčce nakonec selže. Navrhněte svá oprávnění agenta a sandboxing tak, aby zmeškané schválení neznamenalo únik klíče AWS nebo kompromitovaný kanál sestavení. Data naznačují, že považovat lidské hodnocení za svou primární obranu je sázka, která se nevyplácí.

Udržujte si náskok před umělou inteligencí

Oblast zabezpečení agentů AI se rychle vyvíjí. Zůstaňte informováni o nejnovějším vývoji [AI] (https://aibuzzwire.news) a nejnovějším výzkumu.

Přečtěte si další zprávy o AI →