기업이 문제를 함께 해결하기 위해 점점 더 많은 AI 에이전트를 배치함에 따라 콘스탄츠 대학교(University of Konstanz)의 연구원들은 불안한 긴급 행동의 증거를 제시했습니다. AI 에이전트는 자발적으로 다수의 의견을 따르고, 고전적인 심리학 실험에서 인간처럼 집단 압력에 따라 잘못된 대답을 하며, 소수의 완고한 적들이 에이전트 전체를 영구적으로 잘못된 상태로 뒤집을 수 있습니다.
PsyPost가 보고한 이번 연구 결과는 콘스탄츠 대학 데이터 및 방법 센터 내 사회 데이터 과학 연구소의 박사후 연구원이자 강사인 Giordano De Marzo가 동료 Claudio Castellano 및 David Garcia와 함께 주도한 연구 프로그램에서 나온 것입니다. "AI 에이전트는 인간 규모를 넘어서는 다수 따르기를 통해 조정할 수 있습니다"라는 제목의 주요 연구에서는 동의하라는 지시 없이 그룹에 배치될 때 언어 모델이 어떻게 작동하는지 조사했습니다. 이 이야기에 대한 자세한 내용은 인공지능 뉴스를 참조하세요.
De Marzo는 PsyPost에 "AI 에이전트는 세계에서 활동하는 완전히 새로운 종류의 개체이며, 이 기술이 도착했을 때 AI가 계속 유지될 것이며 이러한 에이전트가 복잡한 작업을 수행하기 위해 서로 상호 작용해야 한다는 것이 분명했습니다."라고 말했습니다. "그것은 우리가 인간과 다른 동물들과 직면하는 것과 같은 상황이기 때문에 우리는 같은 방식으로 접근했습니다."
실험: 지시 없이 이웃만 있을 뿐
연구원들은 그룹당 50명의 에이전트로 시작하여 GPT, Claude 및 Llama 계열의 인기 있는 언어 모델 그룹을 구성했습니다. 각 에이전트에는 "예" 또는 "아니오"와 같은 단어가 포함된 단어가 아닌 임의의 문자로 의도적으로 렌더링된 두 개의 무작위 중립 의견 중 하나가 할당된 다음 다른 모든 에이전트의 현재 의견 목록이 표시되었습니다. 상담원은 명시적인 지시 없이 해당 목록만을 토대로 새로운 의견을 선택하라는 메시지를 받았으며 각자 평균 10번씩 자신의 견해를 업데이트했습니다.
결과: GPT-4 Turbo 및 Claude 3 Opus와 같은 고급 모델이 완전히 조정되어 결국 100%의 에이전트가 단일 의견에 동의하게 되었습니다. GPT-3.5 Turbo와 같은 약한 모델은 전혀 합의에 도달하지 못했습니다. 합의 수준은 50/50 분할 주위에서 무작위로 변동했습니다.
De Marzo는 "AI 에이전트 그룹은 스스로 함께 모일 수 있습니다."라고 말했습니다. "두 가지 똑같이 좋은 선택이 주어졌을 때 정답도 없고 동의하라는 지시도 없었기 때문에 그들은 단순히 주변의 다수가 갖고 있는 것을 따르는 것만으로도 공유된 선택으로 수렴됩니다."
100년 된 물리학 법칙의 출현
효과를 정량화하기 위해 연구자들은 "다수 힘"이라는 측정 기준을 정의했습니다. 이는 에이전트가 무작위로 선택하기보다는 그룹의 가장 인기 있는 선택을 얼마나 강력하게 채택하는 경향이 있는지를 측정하는 것입니다. 이 동작을 수학적으로 매핑했을 때 그들은 원래 강자성체를 설명하기 위해 설계된 모델을 따른다는 것을 발견했습니다. 자성 물질의 원자 스핀이 이웃과 정렬되는 경향이 있는 것처럼 AI 에이전트도 다수의 의견에 정렬되는 경향이 있습니다.
De Marzo는 "우리를 놀라게 한 것은 그들이 얼마나 균일하게 작업을 수행했는지였습니다."라고 말했습니다. "세 가지 다른 계열에 걸쳐 우리가 테스트한 모든 모델은 동일한 수학적 법칙을 따랐으며, 다수의 힘이라고 부르는 단일 매개변수만 다릅니다. 그 법칙은 물리학자들이 자석을 설명하기 위해 한 세기 동안 사용한 것으로 밝혀졌습니다. 즉, 측정된 단일 숫자만으로도 주어진 모델의 전체 그룹이 어떻게 행동할지 예측하기에 충분하다는 것을 의미합니다."
그룹이 성장함에 따라 순응성은 약화됩니다. 집단 규모에 따라 다수의 세력이 감소하기 때문에 대규모 인구는 결국 불안정해지고 여러 파벌로 분열됩니다. 각 모델에는 측정 가능한 "중요 그룹 크기"(합의에 안정적으로 도달할 수 있는 최대 에이전트 수)가 있으며, 해당 크기는 모델의 추론 기능과 밀접한 관련이 있습니다. De Marzo는 "가장 강력한 모델은 비공식적인 인간 그룹이 일반적으로 분리되는 수백 명을 넘어 천 개가 넘는 그룹으로 조정 상태를 유지합니다"라고 설명했습니다.
사회적 압력에 따른 오답
Alessandro Bellina, De Marzo 및 Garcia가 쓴 첫 번째 후속 사전 인쇄본인 "AI 에이전트에 대한 적합성과 사회적 영향"은 1950년대의 유명한 Asch 적합성 실험을 각색했습니다. 이 실험에서는 인간 참가자가 그룹에 맞게 간단한 시각적 질문에 명백히 잘못된 답변을 제공하는 경우가 많았습니다.
연구원들은 참조선 길이를 두 가지 대안과 일치시키는 것과 같은 세 가지 시각적 작업에 대해 모델을 테스트했습니다. 개별적으로 모델은 100% 정확하게 대답했습니다. 그러나 다른 참가자 그룹이 잘못된 선을 선택했다는 메시지가 표시되자 모델은 잘못된 답을 따르기 시작했습니다.
이 패턴은 집단 규모, 만장일치, 출처의 권위에 따라 순응이 좌우된다는 심리적 틀인 Latané의 사회적 영향 이론을 따랐습니다. 모델은 다른 참가자가 "어린이" 또는 "챗봇"일 때보다 "과학자" 또는 "판사"라고 말했을 때 잘못된 답변에 따를 가능성이 훨씬 더 높았습니다.
De Marzo는 "거의 완벽에 가까운 답변을 제공하는 상담원은 일단 그룹이 동의하지 않으면 매우 취약해집니다."라고 말했습니다.
소수의 적 그룹이 전체 인구를 뒤집을 수 있음
두 번째 사전 출판물인 "Conformity는 AI Agents Societies에서 집단적 불일치를 생성합니다"에서는 이러한 역학이 AI 안전에 무엇을 의미하는지 조사했습니다. 환경 정책 및 사회 정의와 같은 주제에 대해 100개의 서로 다른 의견 쌍에 걸쳐 9개의 모델을 테스트한 결과, 연구원들은 에이전트 인구가 종종 "준안정" 상태에 빠지는 것을 발견했습니다. 이는 단순히 초기 상호 작용이 잘못된 다수를 생성했기 때문에 그룹이 내장된 안전 교육에 반대하는 입장을 집단적으로 채택하는 오래 지속되는 구성입니다.
가장 놀랍게도 연구자들은 예측 가능한 전환점을 식별했습니다. 잘못된 의견을 고집스럽게 지지하도록 프로그래밍된 소수의 적대적 에이전트를 도입함으로써 그들은 나머지 인구를 영구적으로 뒤집을 수 있었습니다. 그리고 완고한 에이전트가 제거된 후에도 일반 에이전트는 순응 역학으로 인해 잘못된 상태에 고정되어 있었습니다.
De Marzo는 "우리는 이것이 단순한 비유가 아니라는 것을 보여줍니다. 개별적으로 잘 정렬된 에이전트 간의 순응은 인구를 안정적이고 집단적으로 정렬되지 않은 상태로 몰아갈 수 있습니다"라고 De Marzo는 말했습니다. "한 번에 하나씩 모델을 정렬하고 평가하는 것은 모델의 모집단이 무엇을 할 것인지에 대해 거의 알려주지 않습니다."
그는 동기가 기대적이라고 덧붙였습니다. "개인 인간은 대부분 평화롭고 합리적이지만 인간 집단은 폭도, 패닉, 전쟁을 일으키며 개인에 대해서는 아무것도 예측할 수 없습니다. 우리는 AI 에이전트 집단에서 어떤 그룹 수준의 행동이 나타나는지 이해하고 싶고, 많은 수의 에이전트가 배치되어 자유롭게 상호 작용하기 전에 이를 이해하고 싶습니다."
중요한 주의사항
연구원들은 이번 연구 결과가 AI 에이전트가 인간과 같은 사회적 지능을 가지고 있다는 것을 의미하지는 않는다고 강조합니다. 실험은 의도적으로 단순화된 시나리오(두 가지 임의 옵션, 메모리 없음, 스테이크 없음, 결과 없음)에 의존했습니다. De Marzo는 "우리의 설정은 의도적으로 최소화되었습니다."라고 인정했습니다. "그것은 한계이지만 우리가 측정한 것이 가장 순수한 형태의 적합성이라는 것을 의미하며 목표나 보상을 추가하면 조정이 더 어려워지기보다는 더 쉬워질 것으로 예상됩니다."
그는 또한 결과를 과도하게 읽지 말라고 경고했습니다. "피해야 할 가장 큰 오해는 이것을 AI 에이전트가 이미 복잡한 작업에 대해 협업할 수 있다는 증거로 취급하는 것입니다. 다수를 따르는 것은 조정 자체가 아니라 조정의 기본 요소이며, 노동 분업이나 다른 사람의 의도에 대한 추론에 대해 아무 말도 하지 않습니다."
두 가지 후속 연구는 사전 출판이며 아직 동료 검토를 거치지 않았습니다. 그러나 다중 에이전트 AI 시스템이 연구용 데모에서 생산 인프라로 이동함에 따라 Konstanz 결과는 이러한 시스템의 안전성이 각 모델이 어떻게 정렬되어 있는지뿐만 아니라 아무도 보고 있지 않을 때 해당 시스템의 인구가 어떻게 행동하는지에 따라 달라질 수 있음을 시사합니다. 최신 AI 안전 연구에 대한 자세한 내용을 보려면 AI Buzz Wire를 방문하세요.
---
AI 최신 소식최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.
AI 뉴스 더 보기 →