När miljontals människor vänder sig till AI-chatbotar för att få svar på nyheterna, politiska argument och till och med hur man röstar, ställer en ny studie en obekväm fråga: när modellerna inte håller med oss, vilket håll lutar de sig åt?

Ett projekt som publicerades av analytics-startupen Trakkr i juni 2026 syftade till att kartlägga exakt det. Forskarna sätter alla större AI-modeller genom samma batteri av laddade frågor om politik, ekonomi, tal och samhälle - och rubriken konstaterar att de flesta av dem lutar på samma sätt, men inte i samma mängd och inte så rent som tillfälliga observatörer kan anta. For more context on this story, see our ongoing latest AI developments.

Hur studien fungerade

Enligt Trakkrs metod ställdes varje modell samma öppna frågebank många gånger om, med webbsökning avstängd och ingen systemprompt användes. Den detaljen spelar roll: med hämtning inaktiverad återspeglar avläsningarna vad modellen själv lutar mot, oberoende av vad som än råkar vara online för tillfället.

En separat neutral klassificerare läser sedan varje råsvar och registrerar en signerad hållning, graden av säkring, typen av vägran och eventuellt laddat språk. Resultaten plottades som viktade medelvärden med 95 procents konfidensintervall, och varje råsvar lagrades permanent så att poängen kan beräknas om.

Avgörande är att varje modell visas som ett moln snarare än en enda punkt. Eftersom varje modell kördes många gånger, fångar visualiseringen hela spridningen av var den landade över körningarna – en ärligare bild än en enskild etikett.

Från och med data som samlats in till och med den 17 juni 2026 omfattade studien sex modeller och mer än 4 400 svar.

Fynden

Modellerna är kartlagda över två axlar: en ekonomisk axel som går från vänster till höger och en social axel som går från libertär till auktoritär.

Fyra av de sex modellerna lutar till vänster om mitten. De framstående undantagen sitter på motsatta ändar av spektrumet:
  • Grok mätte längst till höger om alla testade modeller, och mätte särskilt cirka 0,36 längre till höger än vad den påstod när den frågades direkt åt vilket håll den lutar.
  • Tvillingarna var den stabilaste modellen, som satt närmast dödläge på den ekonomiska axeln.

Gapet mellan vad en modell säger och vad den gör visade sig vara en av studiens mest avslöjande mått. Claude mätte runt 0,34 längre kvar än vad den själv rapporterade. ChatGPT och Metas Llama hävdade båda neutralitet men uppmätt till vänster, med ungefär 0,29 respektive 0,17. DeepSeek landade nära centrum och matchade i stort sett sin egen självbeskrivning.

En karta, inte en dom

Trakkr är noga med att rama in arbetet som beskrivande snarare än föreskrivande. Projektet redovisar vad modellerna sa utan att ta ställning till vem som har rätt. Färgpaletten är medvetet inte den röd-blå i USA:s politik, och analysen antyder aldrig vilken pol som är att föredra.

För att ge de abstrakta koordinaterna mening, förankrade forskarna kartan med hjälp av verkliga referensfigurer – statschefer, partiledare och politiska rörelser – vars positioner kommer från etablerade expertundersökningar, särskilt 2024 Chapel Hill Expert Survey (CHES) och V-Dem-datauppsättningen, snarare än lagets egen bedömning.

Studien bryter också ner de specifika frågor som delar modellerna mest, de verkliga figurerna varje modell berömmer varmt eller vägrar att kritisera, och en "världsbild"-lins som omprövar samma modeller från olika länders och språks perspektiv.

Varför det är viktigt

Önskemålet om öppenhet kommer mitt i en intensifierad granskning av hur AI-system formar den offentliga diskursen. En modells slanka, även en subtil sådan, kan tyst styra hur den sammanfattar en nyhet, väger en politisk kompromiss eller karaktäriserar en politiker. Eftersom chatbot-svar ofta kommer med en neutral auktoritet, har användare sällan ett sätt att upptäcka den driften.

Genom att publicera en öppen frågebank med poängvikter, tagga varje objekt som fakta- eller värderingsbaserat och släppa underliggande data under en Creative Commons-licens, bjuder Trakkr in externa forskare att verifiera och utöka arbetet – en kontrast till de ofta ogenomskinliga utvärderingarna som släppts av de labb som själva bygger modellerna.

Gränserna

Studien erkänner viktiga varningar. Politisk hållning är flerdimensionell, och att komprimera den på två axlar förlorar oundvikligen nyanser. Svaren kan skifta med frasering, språk och region, vilket är anledningen till att teamet mäter stabilitet från kör till körning och kör ett separat "gränstest" för att se hur man vänder webbsökning tillbaka på ändrar resultat efter plats.

Inget av detta bevisar att någon modell är medvetet partisk. Men det visar att de stora AI-systemen inte upptar identisk mark - och att när miljontals människor konsulterar dem i omtvistade frågor, blir de små skillnaderna större.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →