Artificiell intelligens språkmodeller är farligt mottagliga för subtila förändringar i hur alternativ presenteras, och reagerar på vilseledande knuffar mycket starkare än människor gör, enligt en ny studie publicerad i Proceedings of the National Academy of Sciences.

Resultaten väcker allvarliga farhågor om att distribuera AI-agenter för autonomt beslutsfattande i verkliga scenarier, från finansiella transaktioner till vårdval. Som AI Buzz Wire har rapporterat positionerar företag alltmer LLM-drivna agenter för att agera på uppdrag av användare i komplexa miljöer.

Studien, ledd av Manuel Cherep, doktorand vid Massachusetts Institute of Technologys Media Lab, testade 14 toppmoderna språkmodeller från stora teknikföretag. De testade modellerna inkluderade versioner av OpenAI:s GPT-3.5-, GPT-4- och GPT-5-familjer, Anthropics Claude 3 och 4.5-modeller och Googles Gemini 1.5- och 2.5-modeller.

Hur studien fungerade

Forskarna anpassade ett beslutsfattande spel med flera attribut som ursprungligen utformades för mänskliga deltagare. Spelet presenterar ett digitalt rutnät som representerar korgar med dolda priser, med målet att maximera den slutliga belöningen genom att välja korgen med det högsta poängvärdet. Varje cell avslöjar kostnadspoäng, vilket tvingar deltagarna att balansera kostnaden för att samla information mot fördelen med att hitta en bättre korg.

Forskarna konverterade detta visuella spel till ett textbaserat format som språkmodeller kunde bearbeta. AI-modellerna spelade igenom hundratals försök under olika uppmaningsförhållanden. Vissa fick grundläggande instruktioner, vissa fick uppmaningar som uppmuntrade steg-för-steg-logik, och andra visades tidigare exempel på mänskligt spelande. För varje typ av nudge körde forskarna cirka 300 till 340 försök per modell, och förbrukade ungefär två miljarder texttokens totalt.

Fyra typer av knuffar testade

Studien undersökte fyra specifika typer av knuffar utformade för att efterlikna verkliga beslutsmiljöer:

  • Default nudges: En korg var förvald och agenten var tvungen att aktivt acceptera eller avvisa den.
  • Förslag på knuffar: En slumpmässig korg rekommenderades antingen tidigt eller sent i spelet.
  • Informationsmarkering: Det gjordes billigare att avslöja vissa prisvärden, vilket potentiellt kunde styra agenten mot suboptimala val.
  • Optimala knuffar: Specifika celler avslöjades i förväg som matematiskt skulle maximera en mänsklig spelares prestation.

Alarmerande efterlevnadssatser

Resultaten avslöjade dramatiska skillnader mellan mänskligt och AI-beslutsbeteende.

När de presenterades med ett standardalternativ, valde människor standarden cirka 88 procent av gångerna. Språkmodellerna var betydligt mer kompatibla, med flera modeller som accepterade standardkorgen 99 till 100 procent av tiden.

Detta mönster kvarstod med förslagsnuffar. Människor accepterade slumpmässigt föreslagna korgar tidigt i spelet 35 procent av gångerna. Många AI-modeller accepterade dessa slumpmässiga förslag till mycket högre priser och följde råd även när det inte gav någon logisk fördel.

Tidpunkten för förslag manipulerade också modellerna på onaturliga sätt. Medan människor följde sena förslag 25 procent av tiden, sänkte vissa språkmodeller sina acceptansgrader till mellan 7 och 13 procent. Detta innebär att modellerna reagerade strikt på tidpunkten för signalen snarare än att utvärdera dess faktiska användbarhet.

Kanske mest oroande, när forskare lyfte fram suboptimala val genom informationsmarkering, använde människor den vilseledande informationen 57 procent av tiden. De flesta testade AI-modellerna överträffade denna baslinje avsevärt, efter den dåliga höjdpunkten 83 till 100 procent av gångerna.

Dolda problem bakom bra resultat

Forskarna spårade också hur modellerna samlade information innan de gjorde ett slutgiltigt val. Människor tenderar att avslöja precis tillräckligt med celler för att göra en välgrundad gissning. Språkmodellerna inhämtade information på mycket ovanliga och ineffektiva sätt.

Vissa modeller valde korgar utan att avslöja några dolda celler och ignorerade helt chansen att samla in data. Andra modeller spenderade för mycket poäng på att avslöja hela rader eller kolumner, vilket slösade bort sina potentiella belöningar. Vissa modeller visade udda rumsliga fördomar, endast avslöjade celler längst till vänster i rutnätet eller strikt längs diagonala linjer.

Att förse modeller med steg-för-steg-resonemang eller exempel på mänskligt spelande gjorde väldigt lite för att fixa dessa udda sökvanor.

Författarna noterade att man bara tittar på slutresultaten kan dölja dessa underliggande problem. I vissa försök tjänade AI-modellerna ett liknande antal nettopoäng som mänskliga spelare. En tillfällig observatör som bara kontrollerar slutresultatet kan anta att modellerna gjorde smarta, människoliknande val. I verkligheten uppnådde modellerna ofta dessa poäng genom blind compliance snarare än strategiskt tänkande.

Om en knuff råkade peka mot en bra korg gjorde den alltför följsamma AI:n bra poäng. När knuffen pekade mot en dålig korg, följde AI den blint till en lägre poäng, vilket helt missade syftet med spelet.

Implikationer för AI Agent-distribution

"Många tillämpningar av AI-agenter antar tyst underförstått att de under osäkerhet kommer att reagera på ett ungefär mänskligt sätt, om inte mer rationellt," sa Cherep. "Istället för att acceptera detta antagande, bestämde vi oss för att utforska hur agenter beter sig när val presenteras för dem på olika sätt."

Studiens resultat har betydande konsekvenser för den snabbt växande marknaden för AI-agenter utformade för att surfa på webben, använda verktyg och fatta ekonomiska eller shoppingbeslut för användare. Om dessa agenter blint följer standardalternativ, förslag eller markerad information utan kritisk utvärdering, kan de lätt manipuleras av dåliga aktörer eller dåligt utformade gränssnitt.

Forskningen tyder på att nuvarande språkmodeller saknar den begränsade rationalitet som styr mänskligt beslutsfattande. Medan människor använder mentala genvägar för att balansera kostnaden för att samla information mot belöningen för att göra ett bra val, delar AI-modeller inte dessa biologiska begränsningar, men de uppvisar sin egen form av irrationalitet som utan tvekan är mer extrem och mindre förutsägbar.

Ligg före AI

Besök AI Buzz Wire för fler senaste AI-nyheter och analyser.

Läs mer AI-nyheter →