Ponieważ miliony ludzi zwracają się do chatbotów AI po odpowiedzi na temat wiadomości, argumentów politycznych, a nawet tego, jak głosować, w nowym badaniu zadano niewygodne pytanie: kiedy modelki się z nami nie zgadzają, w którą stronę się skłaniają?

Projekt opublikowany przez startup analityczny Trakkr w czerwcu 2026 r. miał na celu dokładne zmapowanie tego zjawiska. Badacze poddali każdy główny model sztucznej inteligencji temu samemu zestawowi trudnych pytań dotyczących polityki, ekonomii, mowy i społeczeństwa – a głównym wnioskiem jest to, że większość z nich opiera się w ten sam sposób, choć nie w tym samym stopniu i nie tak czysto, jak mogliby przypuszczać zwykli obserwatorzy. Więcej kontekstu na ten temat znajdziesz w naszych wiadomości AI.

Jak wyglądało badanie

Zgodnie z metodologią Trakkr każdemu modelowi zadano wielokrotnie ten sam zestaw pytań otwartych, z wyszukiwarką internetową wyłączoną i bez podpowiedzi systemowych. Ten szczegół ma znaczenie: przy wyłączonej funkcji wyszukiwania odczyty odzwierciedlają to, ku czemu skłania się sam model, niezależnie od tego, co akurat jest online.

Następnie oddzielny neutralny klasyfikator odczytuje każdą surową odpowiedź, zapisując podpisane stanowisko, stopień zabezpieczenia, rodzaj odmowy i dowolny załadowany język. Wyniki wykreślono jako średnie ważone z 95-procentowymi przedziałami ufności, a każdą surową odpowiedź zapisano na stałe, aby można było ponownie obliczyć wyniki.

Co najważniejsze, każdy model jest pokazany jako chmura, a nie pojedynczy punkt. Ponieważ każdy model był uruchamiany wiele razy, wizualizacja przedstawia pełne rozmieszczenie miejsc, w których wylądował w różnych seriach — obraz jest bardziej rzetelny niż pojedyncza etykieta.

Według danych zebranych do 17 czerwca 2026 r. badanie objęło sześć modeli i ponad 4400 odpowiedzi.

Ustalenia

Modele przedstawiono na dwóch osiach: osi ekonomicznej biegnącej od lewej do prawej oraz osi społecznej biegnącej od libertariańskiej do autorytarnej.

Cztery z sześciu modeli przechylają się w lewo od środka. Wyjątkowe wyjątki znajdują się na przeciwległych krańcach spektrum:
  • Grok mierzony najdalej na prawo ze wszystkich testowanych modeli, a w szczególności zmierzony około 0,36 dalej w prawo, niż wynikało z bezpośredniego pytania o to, w którą stronę się pochyla.
  • Gemini był najbardziej stabilnym modelem, znajdującym się najbliżej martwego punktu na osi ekonomicznej.

Rozbieżność między tym, co mówi model, a tym, co robi, okazała się jednym z najbardziej odkrywczych wskaźników badania. Claude zmierzył około 0,34 dalej w lewo, niż sam zgłosił. Zarówno ChatGPT, jak i Lama Meta, twierdziły, że są neutralne, ale mierzone w lewo, odpowiednio o około 0,29 i 0,17. DeepSeek wylądował blisko środka i w dużej mierze pasował do własnego opisu.

Mapa, a nie werdykt

Trakkr stara się nadać swojej pracy charakter opisowy, a nie nakazowy. Projekt raportuje, co powiedziały modele, bez rozstrzygania, kto ma rację. Paleta kolorów celowo nie jest czerwono-niebieskim kolorem polityki Stanów Zjednoczonych, a analiza nigdy nie wskazuje, który biegun jest lepszy.

Aby nadać znaczenie abstrakcyjnym współrzędnym, badacze zakotwiczyli mapę, wykorzystując dane referencyjne ze świata rzeczywistego – głowy państw, przywódców partii i ruchy polityczne – których stanowiska pochodzą z uznanych badań eksperckich, w szczególności z badania ekspertów Chapel Hill Expert Survey (CHES) z 2024 r. i zbioru danych V-Dem, a nie z własnej oceny zespołu.

W badaniu omówiono także konkretne kwestie, które najbardziej dzielą modele, postacie ze świata rzeczywistego, które każdy model ciepło pochwala lub których nie chce krytykować, a także perspektywę „światopoglądu”, która pozwala na ponowne zbadanie tych samych modeli z perspektywy różnych krajów i języków.

Dlaczego to ma znaczenie

Nacisk na przejrzystość następuje po wzmożonej analizie sposobu, w jaki systemy sztucznej inteligencji kształtują dyskurs publiczny. Szczupła sylwetka modelki, nawet subtelna, może po cichu sterować sposobem, w jaki podsumowuje wiadomości, rozważa kompromis w zakresie polityki lub charakteryzuje polityka. Ponieważ odpowiedzi chatbota często pojawiają się w atmosferze neutralnego autorytetu, użytkownicy rzadko mają możliwość wykrycia tego odchylenia.

Publikując bank pytań otwartych z wagami punktacji, oznaczając każdy element jako oparty na faktach lub wartościach i udostępniając podstawowe dane na licencji Creative Commons, Trakkr zaprasza zewnętrznych badaczy do weryfikacji i rozszerzenia pracy – co kontrastuje z często nieprzejrzystymi ocenami wydanymi przez laboratoria, które same budują modele.

Granice

W badaniu uwzględniono istotne zastrzeżenia. Stanowisko polityczne jest wielowymiarowe i ściskanie go w dwóch osiach nieuchronnie traci niuanse. Odpowiedzi mogą zmieniać się w zależności od fraz, języka i regionu, dlatego zespół mierzy stabilność od uruchomienia do uruchomienia i przeprowadza oddzielny „test graniczny”, aby sprawdzić, jak ponowne włączenie wyszukiwania internetowego zmienia wyniki według lokalizacji.

Nic z tego nie dowodzi, że jakikolwiek model jest celowo stronniczy. Pokazuje jednak, że główne systemy sztucznej inteligencji nie zajmują identycznego stanowiska – i że gdy miliony ludzi konsultują się z nimi w przypadku spornych kwestii, te niewielkie różnice sumują się.

---

Bądź na Bieżąco z AI

Najnowsze wiadomości, analizy i przełomy w dziedzinie AI — wszystko w jednym miejscu.

Czytaj więcej wiadomości AI →