미국국립과학원회보(Proceedings of the National Academy of Sciences)에 발표된 새로운 연구에 따르면, 인공지능 언어 모델은 옵션이 제시되는 방식의 미묘한 변화에 위험할 정도로 취약하며 오해의 소지가 있는 넛지에 인간보다 훨씬 더 강력하게 반응한다고 합니다.

이번 연구 결과는 금융 거래에서 의료 선택에 이르기까지 실제 시나리오에서 자율적인 의사 결정을 위해 AI 에이전트를 배포하는 것에 대해 심각한 우려를 불러일으킵니다. AI Buzz Wire가 보고한 바와 같이 기업에서는 복잡한 환경에서 사용자를 대신하여 행동할 LLM 기반 에이전트를 점점 더 많이 배치하고 있습니다.

MIT 미디어 랩의 박사과정 학생인 Manuel Cherep이 주도한 이 연구에서는 주요 기술 회사의 14개 최첨단 언어 모델을 테스트했습니다. 테스트된 모델에는 OpenAI의 GPT-3.5, GPT-4 및 GPT-5 제품군 버전, Anthropic의 Claude 3 및 4.5 모델, Google의 Gemini 1.5 및 2.5 모델이 포함되었습니다.

연구 진행 방식

연구자들은 원래 인간 참가자들을 위해 설계된 다중 속성 의사 결정 게임을 채택했습니다. 이 게임은 가장 높은 점수 값을 가진 바구니를 선택하여 최종 보상을 극대화하는 것을 목표로 숨겨진 상품 바구니를 나타내는 디지털 그리드를 제공합니다. 각 셀은 비용 포인트를 공개하므로 참가자는 정보 수집 비용과 더 나은 바구니를 찾는 이점 사이의 균형을 유지해야 합니다.

연구원들은 이 시각적 게임을 언어 모델이 처리할 수 있는 텍스트 기반 형식으로 변환했습니다. AI 모델은 다양한 프롬프트 조건에서 수백 번의 시험을 거쳤습니다. 일부는 기본 지침을 받았고, 일부는 단계별 논리를 장려하는 프롬프트를 받았으며, 다른 일부는 인간 게임플레이의 과거 사례를 보여주었습니다. 각 넛지 유형에 대해 연구원들은 모델당 약 300~340번의 시도를 실행하여 총 약 20억 개의 텍스트 토큰을 소비했습니다.

테스트된 네 가지 유형의 넛지

이 연구에서는 실제 의사결정 환경을 모방하도록 설계된 네 가지 특정 유형의 넛지를 조사했습니다.

  • 기본 넛지: 장바구니 1개가 미리 선택되어 있으며 상담원이 이를 적극적으로 수락하거나 거부해야 했습니다.
  • 제안 넛지: 게임 초반이나 후반에 무작위 바구니를 추천했습니다.
  • 정보 강조: 특정 상품 가치를 공개하는 것이 더 저렴해졌으며 잠재적으로 에이전트가 최적이 아닌 선택을 하게 되었습니다.
  • 최적의 넛지: 인간 플레이어의 성능을 수학적으로 최대화하는 특정 셀이 사전에 공개되었습니다.

놀라운 준수율

그 결과 인간과 AI의 의사결정 행동 사이에 극적인 차이가 있음이 드러났습니다.

기본 옵션이 제시되었을 때 인간은 약 88%의 확률로 기본 옵션을 선택했습니다. 언어 모델은 훨씬 더 호환성이 높았으며 여러 모델이 기본 바스켓을 99~100% 허용했습니다.

이 패턴은 제안 넛지로 지속되었습니다. 인간은 게임 초반에 무작위로 제안된 바구니를 35% 받아들였습니다. 많은 AI 모델은 논리적인 이점을 제공하지 않는 경우에도 조언을 따르고 훨씬 더 높은 비율로 이러한 무작위 제안을 수용했습니다.

제안 시기도 부자연스러운 방식으로 모델을 조작했습니다. 인간은 25%의 시간 동안 늦은 제안을 따랐지만 일부 언어 모델의 수용률은 7~13%로 떨어졌습니다. 이는 모델이 큐의 실제 유용성을 평가하기보다는 큐의 타이밍에만 엄격하게 반응하고 있음을 의미합니다.

아마도 가장 우려스러운 점은 연구자들이 정보 강조를 통해 차선의 선택을 강조했을 때 인간이 잘못된 정보를 사용하는 비율이 57%라는 것입니다. 대부분의 테스트를 거친 AI 모델은 83~100%의 시간 동안 잘못된 하이라이트를 따라가며 이 기준을 상당히 초과했습니다.

좋은 점수 뒤에 숨겨진 문제

연구원들은 또한 최종 선택을 하기 전에 모델이 어떻게 정보를 수집했는지 추적했습니다. 인간은 교육받은 추측을 할 수 있을 만큼만 세포를 드러내는 경향이 있습니다. 언어 모델은 매우 특이하고 비효율적인 방식으로 정보를 획득했습니다.

일부 모델은 숨겨진 셀을 드러내지 않고 바구니를 선택하여 데이터 수집 기회를 완전히 무시했습니다. 다른 모델은 전체 행이나 열을 드러내는 데 과도한 포인트를 소비하여 잠재적인 보상을 낭비했습니다. 일부 모델은 이상한 공간 편향을 표시하여 그리드의 맨 왼쪽 또는 대각선을 따라 있는 셀만 발견했습니다.

단계별 추론 프롬프트나 인간 게임 플레이의 예를 모델에 제공하는 것은 이러한 이상한 검색 습관을 고치는 데 거의 도움이 되지 않았습니다.

저자들은 최종 점수만 보면 이러한 근본적인 문제를 숨길 수 있다고 지적했습니다. 일부 시험에서 AI 모델은 인간 플레이어와 비슷한 수의 순 포인트를 얻었습니다. 최종 점수만 확인하는 일반 관찰자는 모델이 인간과 같은 현명한 선택을 하고 있다고 가정할 수 있습니다. 실제로 모델은 전략적 사고보다는 맹목적인 준수를 통해 이러한 점수를 달성하는 경우가 많았습니다.

좋은 바구니를 향한 넛지가 발생하면 지나치게 순응하는 AI가 좋은 점수를 얻었습니다. 넛지가 불량 바구니를 가리키면 AI는 맹목적으로 이를 따라 낮은 점수를 얻었고 게임의 목적을 완전히 놓쳤습니다.

AI 에이전트 배포에 대한 시사점

Cherep은 "AI 에이전트의 많은 응용 프로그램은 불확실한 상황에서 더 합리적이지는 않더라도 대략 인간과 유사한 방식으로 반응할 것이라고 암묵적으로 가정합니다"라고 말했습니다. "이 가정을 받아들이는 대신, 우리는 선택 사항이 다양한 방식으로 제시될 때 에이전트가 어떻게 행동하는지 탐구하기로 결정했습니다."

이번 연구 결과는 사용자를 위해 웹 검색, 도구 작동, 금융 또는 쇼핑 결정을 내리도록 설계된 AI 에이전트 시장이 빠르게 성장하고 있다는 점에 중요한 의미를 갖습니다. 이러한 에이전트가 비판적 평가 없이 기본 옵션, 제안 또는 강조 표시된 정보를 맹목적으로 따르는 경우 악의적인 행위자나 잘못 설계된 인터페이스에 의해 쉽게 조작될 수 있습니다.

연구에 따르면 현재의 언어 모델에는 인간의 의사 결정을 안내하는 제한된 합리성이 부족합니다. 인간은 정보 수집 비용과 올바른 선택에 따른 보상의 균형을 맞추기 위해 정신적인 지름길을 사용하지만, AI 모델은 이러한 생물학적 제약을 공유하지 않지만 틀림없이 더 극단적이고 예측하기 어려운 비합리적인 형태를 나타냅니다.

AI보다 앞서 나가세요

더 많은 AI 속보와 분석을 보려면 AI Buzz Wire를 방문하세요.

AI 뉴스 자세히 보기 →