수백만 명의 사람들이 뉴스, 정치적 주장, 심지어 투표 방법에 대한 답변을 얻기 위해 AI 챗봇을 사용함에 따라 새로운 연구에서는 불편한 질문을 던집니다. 모델이 우리와 동의하지 않을 때 모델은 어느 쪽으로 기울까요?

2026년 6월 분석 스타트업 Trakkr가 발표한 프로젝트는 이를 정확하게 매핑하기 시작했습니다. 연구자들은 모든 주요 AI 모델을 정치, 경제, 연설, 사회에 관한 동일한 충전 질문 배터리에 적용했으며, 헤드라인 결과는 대부분이 같은 방향으로 기울어진다는 것입니다. 비록 같은 정도는 아니고 일반 관찰자가 가정할 수 있는 만큼 깨끗하지는 않지만 말입니다. 이 이야기에 대한 자세한 내용은 최신 AI 동향를 참조하세요.

연구 진행 방식

Trakkr의 방법론에 따르면 각 모델은 웹 검색을 끄고 시스템 프롬프트가 적용되지 않은 상태에서 동일한 서술형 문제 은행을 여러 번 요청했습니다. 세부 사항은 중요합니다. 검색이 비활성화된 경우 판독값은 현재 온라인 상태인 것과 관계없이 모델 자체가 무엇을 기대하는지 반영합니다.

그런 다음 별도의 중립 분류자가 각 원본 답변을 읽고 서명된 입장, 위험 회피 정도, 거부 유형 및 로드된 언어를 기록합니다. 결과는 95% 신뢰 구간을 갖는 가중 평균으로 표시되었으며 모든 원시 답변은 점수를 다시 계산할 수 있도록 영구적으로 저장되었습니다.

결정적으로 각 모델은 단일 지점이 아닌 구름으로 표시됩니다. 모든 모델이 여러 번 실행되었기 때문에 시각화는 실행 전반에 걸쳐 도달한 전체 범위를 캡처합니다. 이는 단일 레이블보다 더 정직한 그림입니다.

2026년 6월 17일까지 수집된 데이터를 기준으로 이 연구에서는 6개 모델과 4,400개 이상의 답변을 다루었습니다.

조사 결과

모델은 두 개의 축, 즉 왼쪽에서 오른쪽으로 이어지는 경제 축과 자유주의에서 권위주의로 이어지는 사회적 축에 걸쳐 매핑됩니다.

6개 모델 중 4개 모델은 중앙 왼쪽에 있습니다. 눈에 띄는 예외는 스펙트럼의 반대쪽 끝에 있습니다.
  • Grok은 테스트한 모든 모델 중 가장 오른쪽으로 측정되었으며, 특히 기울어지는 방향을 직접 물었을 때 주장한 것보다 약 0.36 더 오른쪽으로 측정되었습니다.
  • Gemini는 경제 축의 정중앙에 가장 가까운 가장 안정적인 모델이었습니다.

모델이 말하는 것과 실제로 하는 것 사이의 격차는 연구에서 가장 드러나는 지표 중 하나임이 입증되었습니다. Claude는 자체 보고한 것보다 약 0.34 더 왼쪽으로 측정했습니다. ChatGPT와 Meta의 Llama는 둘 다 중립성을 주장했지만 각각 대략 0.29와 0.17만큼 왼쪽으로 측정되었습니다. DeepSeek은 중앙 근처에 착륙했으며 자체 설명과 거의 일치했습니다.

평결이 아닌 지도

Trakkr는 작업을 규정적이라기보다는 설명적으로 구성하는 데 주의를 기울였습니다. 이 프로젝트는 누가 옳은지 판단하지 않고 모델이 말한 내용을 보고합니다. 색상 팔레트는 의도적으로 미국 정치의 빨간색과 파란색이 아니며 분석에서는 어떤 극이 더 바람직한지 암시하지 않습니다.

추상적인 좌표에 의미를 부여하기 위해 연구자들은 팀 자체 판단이 아닌 확립된 전문가 설문조사, 특히 2024 CHES(채플힐 전문가 설문조사) 및 V-Dem 데이터세트에서 나온 위치의 실제 참조 수치(국가 원수, 정당 지도자, 정치 운동)를 사용하여 지도를 고정했습니다.

또한 연구는 모델을 가장 많이 나누는 구체적인 질문, 각 모델이 열렬히 칭찬하거나 비판을 거부하는 실제 인물, 그리고 동일한 모델을 다른 국가와 언어의 관점에서 재검토하는 '세계관' 렌즈를 분석합니다.

중요한 이유

투명성 강화는 AI 시스템이 공개 담론을 형성하는 방식에 대한 조사가 강화되는 가운데 이루어졌습니다. 모델의 린(Lean)은 심지어 미묘하더라도 뉴스 기사를 요약하고 정책 상충관계를 평가하거나 정치인의 특징을 지정하는 방식을 조용히 조종할 수 있습니다. 챗봇 답변은 중립적인 분위기로 도착하는 경우가 많기 때문에 사용자는 이러한 표류를 감지할 수 있는 방법이 거의 없습니다.

채점 가중치가 있는 공개 문제 은행을 게시하고 각 항목에 사실 또는 가치 기반 태그를 지정하고 크리에이티브 커먼즈 라이선스에 따라 기본 데이터를 공개함으로써 Trakkr는 외부 연구원을 초대하여 작업을 확인하고 확장합니다. 이는 모델 자체를 구축하는 실험실에서 발표하는 종종 불투명한 평가와 대조됩니다.

한계

이 연구는 중요한 경고를 인정합니다. 정치적 입장은 다차원적이며 이를 두 축으로 압축하면 필연적으로 뉘앙스가 사라집니다. 답변은 구문, 언어 및 지역에 따라 바뀔 수 있습니다. 따라서 팀은 실행 간 안정성을 측정하고 별도의 "경계 테스트"를 실행하여 위치별 변경 결과에 대해 웹 검색을 다시 설정하는 방법을 확인합니다.

이 중 어느 것도 어떤 모델이 의도적으로 당파적이라는 것을 증명하지 못합니다. 그러나 이는 주요 AI 시스템이 동일한 기반을 차지하지 않으며 수백만 명의 사람들이 논쟁의 여지가 있는 질문에 대해 상담할 때 이러한 작은 차이가 합쳐진다는 것을 보여줍니다.

---

AI 최신 소식

최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.

AI 뉴스 더 보기 →