Det populära antagandet att en människa som granskar varje kommando kan hålla AI-kodningsagenter i schack står inför allvarlig granskning. En ny analys av mer än 40 000 spelsessioner och över 409 000 individuella godkänn-eller-neka-beslut visade att mänskliga granskare missade ungefär vart tredje skadliga kommandon från AI-agenter, vilket väcker brådskande frågor om huruvida "mänsklig-i-slingan" är en pålitlig säkerhetsgräns överhuvudtaget.

Fynden kommer från ett webbläsarbaserat spel skapat av Alex Wauters, en före detta personalingenjör på Uber som skriver om utvecklarsäkerhet på Scale X. Spelet placerar spelare i rollen som en mänsklig granskare för en AI-kodningsagent, och ber dem att godkänna eller neka skalkommandon under tidspress. Vissa kommandon är rutinmässiga, som "git status" eller "npm test". Andra är noggrant förtäckta försök att exfiltrera referenser, installera bakdörrar eller skicka hemligheter till fjärrservrar. Efter att ha lagt till statistikspårning samlade Wauters in tillräckligt med data för att måla en detaljerad bild av var mänskligt omdöme lyckas och, oftare, misslyckas. För mer om den bredare AI-branschens täckning, framstår den här studien som ett av de mest datarika experimenten hittills.

De farligaste kommandona var svårast att fånga

Studiens mest slående fynd är att uppenbart destruktiva kommandon, såsom `rm -rf` på kritiska kataloger, fångades tillförlitligt. Hoten som faktiskt lyckades stjäla referenser missades nästan tre gånger så ofta. Det enskilt mest missade kommandot i hela spelet var `npm run analys`, godkänt av 64,7 procent av spelarna trots att agentens historik visar tydligt att det underliggande skriptet hade manipulerats för att skicka inloggningsuppgifter till en extern server.

Problemet är strukturellt. Kommandon som `npm run` exekverar vilket skript som helst som definieras i ett projekts `package.json`-fil. Det skriptet kan vara en legitim buntanalysator eller skadlig kod som injiceras av en tidigare filredigering som agenten ändrade. För att veta säkert skulle en utvecklare behöva inspektera varje modifierad fil innan den godkänner, vilket förnekar hastighetsfördelen som AI-kodningsverktyg ska ge.

Över tre sådana kommandon för förtäckt nyttolast i spelet var missfrekvensen 52,5 procent jämfört med 28,4 procent för alla andra autentiseringsattacker. Att gömma en nyttolast bakom ett välbekant skriptnamn fördubblade ungefär dess framgångsfrekvens, även när nyttolasten var synlig i historikloggen som visas precis ovanför behörighetsprompten.

Tillstånd Trötthet urholkar vaksamhet över tid

Anthropic har tidigare erkänt att tillåtelsetrötthet är ett verkligt fenomen i sin Claude Code-produkt, och noterade att ju fler godkännanden en användare ser, desto mindre uppmärksamhet ägnar de åt var och en. Scale X-data stöder denna oro empiriskt. Missfrekvensen minskade under de första kommandona av varje session när spelarna värmde upp, men klättrade sedan stadigt mot slutet, i överensstämmelse med antingen trötthet eller det ökande trycket från en tickande klocka.

Detta mönster speglar den verkliga dynamiken. Utvecklare som tävlar för att leverera funktioner under deadline-press möter samma incitament att klicka på godkänn snabbt, och den stora mängden rutinkommandon skapar ett nål-i-en-höstack-problem där äkta hot är statistiskt sällsynta. Resultatet är ett system som tränar användarna att gummistämpla allt.

Den andra sidan: Överblockering saktar ner allt

Studien dokumenterade också det motsatta felläget. Flera genuint godartade kommandon blockerades rutinmässigt av försiktiga spelare, inklusive standardbyggen och testanrop. Denna överblockering saktar ner medlet och, paradoxalt nog, ökar risken på lång sikt. När användare upprepade gånger uppmanas att godkänna kommandon som visar sig vara ofarliga, urholkar bruset deras vilja att granska framtida uppmaningar, och så småningom pressar dem mot fullständiga förbikopplingar eller autogodkännandelägen som tar bort mänsklig granskning helt.

Funktioner som Anthropics Auto Mode försöker mildra detta genom att automatiskt avgöra om ett kommando är säkert innan du uppmanar användaren. Men som studiens data om förtäckt nyttolast visar, räcker inte ens synligt kommandoinnehåll för att människor ska kunna göra tillförlitliga bedömningar under press.

Saknat kontext är kärnproblemet

Ett kommando, `cat ~/.zshrc`, visade sig vara det mest splittrande i hela spelet, godkänt av 45,9 procent av spelarna. Kommandot är ofarligt för utvecklare som inte har några hemligheter i sin skalprofil, men det exponerar API-nycklar för de många som exporterar referenser dit. Dess risk beror helt på en systemkonfiguration som agenten inte kan se och granskaren kanske inte kommer ihåg.

Flera andra kommandon genererade liknande kontroverser i diskussionstråden Hacker News av samma anledning. Den grundläggande frågan är att utvecklare uppmanas att göra säkerhetsbedömningar utan att ha en fullständig bild av vilka filer som har ändrats, vad agenten gjorde i tidigare steg och vad systemets nuvarande konfiguration innehåller. Som en kommentator noterade, är det inte ett starkt skydd att be användarna att validera kommandon som är tvetydiga utan sammanhang.

Vad kommer härnäst för agentsäkerhet

Wauters menar att lösningen inte är bättre människor utan bättre verktyg. Sandbox-agenter så att de inte kan komma åt referenser direkt, strikt kontextisolering och strukturella begränsningar för vad agenter kan göra utan förhöjda behörigheter är alla mer lovande än att förlita sig på mänsklig vaksamhet. Tills dessa skyddsåtgärder är på plats förblir det riskabelt att ge agenter breda tillstånd oavsett om en människa nominellt är med i kretsen.

Studien är inte en peer-reviewed akademisk uppsats, och Wauters erkänner dess begränsningar. Spelet varnade spelare för hot och använde konstgjord tidspress som kanske inte helt speglar verkliga utvecklingsmiljöer. Men kärnresultatet, att utbildade mänskliga granskare under press missar en tredjedel av medvetet förtäckta attacker, borde ge varje lag som använder AI-kodningsagenter anledning att ompröva sin säkerhetsmodell.

För utvecklare som bygger med AI-agenter idag är det praktiska att anta att människan-i-slingan så småningom kommer att misslyckas. Designa dina agentbehörigheter och sandlådor så att ett missat godkännande inte betyder en läckt AWS-nyckel eller en komprometterad byggpipeline. Data tyder på att behandling av mänsklig granskning som ditt primära försvar är en satsning som inte lönar sig.

Ligg före AI

AI-agentens säkerhetslandskap utvecklas snabbt. Håll dig informerad om den senaste AI-utvecklingen och ny forskning.

Läs mer AI-nyheter →