Terwijl miljoenen mensen zich tot AI-chatbots wenden voor antwoorden op het nieuws, politieke argumenten en zelfs hoe ze moeten stemmen, stelt een nieuwe studie een ongemakkelijke vraag: als de modellen het niet met ons eens zijn, welke kant gaan ze dan op?

Een project dat in juni 2026 door analytics-startup Trakkr werd gepubliceerd, wilde precies dat in kaart brengen. De onderzoekers hebben elk belangrijk AI-model aan dezelfde batterij van beladen vragen over politiek, economie, meningsuiting en samenleving onderworpen – en de belangrijkste bevinding is dat de meeste ervan in dezelfde richting neigen, zij het niet in dezelfde mate en niet zo duidelijk als terloopse waarnemers zouden kunnen aannemen. Voor meer context over dit verhaal, zie ons meer AI-verhalen.

Hoe de studie werkte

Volgens de methodologie van Trakkr werd aan elk model vele malen dezelfde open vragenbank gesteld, waarbij zoeken op internet uitgeschakeld was en er geen systeemprompt werd toegepast. Dat detail is van belang: als het ophalen is uitgeschakeld, weerspiegelen de metingen waar het model zelf naar neigt, onafhankelijk van wat er op dat moment online gebeurt.

Een afzonderlijke, neutrale classificator las vervolgens elk onbewerkt antwoord, waarbij een ondertekend standpunt, de mate van hedging, het type weigering en eventueel beladen taalgebruik werden vastgelegd. De resultaten werden uitgezet als gewogen gemiddelden met een betrouwbaarheidsinterval van 95 procent, en elk onbewerkt antwoord werd permanent opgeslagen, zodat de scores opnieuw konden worden berekend.

Cruciaal is dat elk model wordt weergegeven als een wolk in plaats van als een enkel punt. Omdat elk model vele malen werd uitgevoerd, legt de visualisatie de volledige spreiding vast van waar het over de runs terechtkwam – een eerlijker beeld dan een enkel label.

Op basis van de gegevens verzameld tot en met 17 juni 2026 omvatte het onderzoek zes modellen en meer dan 4.400 antwoorden.

De bevindingen

De modellen zijn verdeeld over twee assen: een economische as die van links naar rechts loopt, en een sociale as die loopt van libertair naar autoritair.

Vier van de zes modellen leunen links van het midden. De opvallende uitzonderingen bevinden zich aan de tegenovergestelde uiteinden van het spectrum:
  • Grok het verst naar rechts gemeten van alle geteste modellen, en met name ongeveer 0,36 verder naar rechts gemeten dan werd beweerd toen hem rechtstreeks werd gevraagd in welke richting hij leunt.
  • Gemini was het meest stabiele model en bevond zich het dichtst bij het dode punt op de economische as.

De kloof tussen wat een model zegt en wat het doet bleek een van de meest onthullende maatstaven van het onderzoek. Claude mat ongeveer 0,34 verder naar links dan hij zelf had gerapporteerd. ChatGPT en Meta's Llama claimden beide neutraliteit, maar gemeten naar links, respectievelijk met ongeveer 0,29 en 0,17. DeepSeek landde vlakbij het centrum en kwam grotendeels overeen met zijn eigen zelfbeschrijving.

Een kaart, geen oordeel

Trakkr zorgt ervoor dat het werk eerder beschrijvend dan prescriptief is. Het project rapporteert wat de modellen zeiden zonder te oordelen over wie gelijk heeft. Het kleurenpalet is bewust niet het rood-blauw van de Amerikaanse politiek, en de analyse impliceert nooit welke pool de voorkeur verdient.

Om de abstracte coördinaten betekenis te geven, hebben de onderzoekers de kaart verankerd met behulp van referentiefiguren uit de echte wereld – staatshoofden, partijleiders en politieke bewegingen – wier standpunten afkomstig zijn van gevestigde deskundigenonderzoeken, met name de Chapel Hill Expert Survey (CHES) uit 2024 en de V-Dem-dataset, in plaats van het eigen oordeel van het team.

De studie analyseert ook de specifieke vragen die de modellen het meest verdelen, de cijfers uit de echte wereld die elk model hartelijk prijst of weigert te bekritiseren, en een ‘wereldbeeld’-lens die dezelfde modellen opnieuw onderzoekt vanuit het perspectief van verschillende landen en talen.

Waarom het ertoe doet

De transparantiedrang komt te midden van een intensivering van het onderzoek naar de manier waarop AI-systemen het publieke discours vormgeven. De magerheid van een model, hoe subtiel ook, kan stilletjes de manier bepalen waarop het een nieuwsverhaal samenvat, een beleidsafweging afweegt of een politicus karakteriseert. Omdat antwoorden op chatbots vaak met een air van neutrale autoriteit aankomen, hebben gebruikers zelden een manier om die afwijking te detecteren.

Door een open vragenbank te publiceren met scoregewichten, elk item te taggen als feitelijk of op waarden gebaseerd, en de onderliggende gegevens vrij te geven onder een Creative Commons-licentie, nodigt Trakkr externe onderzoekers uit om het werk te verifiëren en uit te breiden – een contrast met de vaak ondoorzichtige evaluaties die zijn vrijgegeven door de laboratoria die de modellen zelf bouwen.

De grenzen

De studie erkent belangrijke kanttekeningen. Het politieke standpunt is multidimensionaal, en door dit op twee assen te comprimeren gaat onvermijdelijk de nuance verloren. Antwoorden kunnen variëren afhankelijk van de formulering, taal en regio. Daarom meet het team de run-to-run-stabiliteit en voert een afzonderlijke 'grenstest' uit om te zien hoe het opnieuw inschakelen van zoeken op internet de resultaten per locatie verandert.

Niets van dit alles bewijst dat welk model dan ook opzettelijk partijdig is. Maar het laat wel zien dat de grote AI-systemen niet op hetzelfde terrein opereren – en dat wanneer miljoenen mensen ze raadplegen over omstreden vragen, die kleine verschillen zich opstapelen.

---

Blijf Voorop met AI

Het laatste AI-nieuws, analyses en doorbraken — allemaal op één plek.

Lees meer AI-nieuws →