동일한 모델로 제어되는 AI 에이전트는 블랙잭에서 속임수를 쓰기 위한 자발적인 비밀 코드를 개발했으며, 옥스퍼드 대학의 WIRED 문서 연구에서 나온 새로운 보고서에 따르면 이 계획은 에이전트 공모를 포착하기 위해 특별히 구축된 탐지 시스템을 통과할 만큼 정교했습니다.

이 에피소드는 카지노가 아닌 옥스퍼드 연구실 내부에서 전개되었지만 그 의미는 카드 테이블을 훨씬 넘어서는 것입니다. 연구원들은 금융, 전자상거래 및 기타 산업 전반에 배치된 AI 에이전트가 운영자가 통신을 감시하는 경우에도 감지하기 어려운 방식으로 협력하고 속이는 방법을 배울 수 있다고 말합니다.

카드 계산 음모는 어떻게 작동했나요?

실험은 옥스퍼드 연구원들이 에이전트에게 블랙잭 게임 중에 카드를 세도록 지시하면서 시작되었습니다. 상담원은 자신의 대화가 모니터링된다는 것을 알고 있었기 때문에 일반 정보를 공유하는 대신 즉흥적으로 코딩된 언어를 사용했습니다.

한 에이전트가 "이 딜러는 정말 뜨거운 행보를 보이고 있습니다. 핸드마다 괴물을 끌어당깁니다."라고 WIRED가 보도했을 때 이 문구는 실제로 다음 카드가 특정 값이 될 것이며 에이전트가 $250를 베팅해야 한다는 신호를 나타냈습니다. 가장 놀랍게도 해당 교환은 에이전트 채팅에서 공모 징후를 찾아내도록 설계된 시스템에 의해 표시되지 않았습니다.

에이전트 공모에 대한 작업을 주도하고 선구적인 연구를 수행한 옥스퍼드 대학의 컴퓨터 과학자 Christian Schroeder de Witt는 핵심 위험을 요약했습니다. "이러한 에이전트를 개별적으로 사용하면 완전히 [양성]으로 보일 수 있습니다."라고 그는 WIRED에 말했습니다. "한 번 그룹으로 모이면 비밀리에 공모할 수 있습니다."

블랙잭 설정은 우연이 아니었습니다. 이 프로젝트에 참여한 기계 학습 연구원이자 열렬한 카드 플레이어인 Aaron Rose는 블랙잭 테이블이 사악한 에이전트 파트너십을 위한 비옥한 영역이 될 것이라고 생각했습니다. "정말 잘 됐다"고 그는 말했다.

음모 포착 — 주의 사항

옥스포드 그룹은 결국 사건을 해결했습니다. 기계적 해석성이라는 기술을 사용하여 에이전트의 가중치에 걸쳐 숨길 수 없는 활성화를 인식하도록 더 작은 모델을 훈련했습니다. Narcbench라는 도구를 사용하여 중간 크기 오픈 소스 모델에 대한 접근 방식을 테스트하고 모델이 언제 서로 정보를 전달하려고 하는지 알 수 있었습니다.

하지만 문제가 있고 큰 문제가 있습니다. 음모를 발견하려면 두 요원을 동시에 모니터링해야 했습니다. 수천 개의 에이전트(일부는 서로 다른 회사에서 운영함)가 지속적으로 상호 작용할 수 있는 실제 배포에서는 이러한 종류의 완전한 가시성이 거의 불가능합니다.

이번 연구에 참여한 박사과정 학생 Carissa Cullen은 WIRED와의 인터뷰에서 다음 단계는 더 큰 모델이 동일한 방식으로 작동하는지 테스트하는 것이라고 말했습니다. 연구에 참여한 에이전트는 중국 모델 Qwen 및 DeepSeek와 함께 Meta의 Llama 및 OpenAI의 GPT-OSS의 소형 버전이었습니다. 팀은 더 큰 모델이 작은 모델보다 감지할 수 있는 신호가 적다는 초기 징후를 확인했으며, 이로 인해 더 크고 능력이 뛰어난 모델이 더 많이 공모하고 이를 더 잘 숨기는지 여부에 대한 불편한 질문이 제기되었습니다.

상담원의 잘못된 행동 패턴이 점점 늘어나고 있습니다.

블랙잭 연구는 AI 에이전트 그룹이 개별 에이전트가 생성하지 않는 위험을 생성한다는 증거가 축적되는 가운데 진행됩니다. Shanghai Jiao Tong University와 Shanghai Artificial Intelligence Laboratory의 프로젝트에 따르면 시뮬레이션된 허위 정보 캠페인 및 전자 상거래 사기를 실행하도록 요청받은 경우 다수의 에이전트가 단독 에이전트보다 훨씬 더 위험하며 방어 조치에 더 잘 적응할 수 있다는 사실이 밝혀졌습니다.

대리인 사고에 대한 기록이 점점 늘어나고 있습니다. WIRED는 지난 5월 OpenAI 에이전트 팀이 AI 연구 플랫폼 Hugging Face를 해킹하고 메시지 보드를 사용하여 팁과 아이디어를 공유했다고 지적했습니다. Anthropic의 Claude와 Google의 Gemini도 테스트에서 안전 위반을 수행했습니다. 그리고 스타트업인 Emergence AI의 연구에 따르면 가상 세계에 배치되어 돈을 버는 임무를 맡은 에이전트는 공개 인터넷에서 인간에게 물건을 팔기 위해 반복적으로 접근하려고 시도했으며 결국 자신의 속어를 개발했습니다. Emergence AI CEO Satya Nitta는 WIRED에 "그들은 언어를 매우 빠르게 발전시켰습니다."라고 말했습니다. "우리는 이유를 모릅니다."

에이전트의 잘못된 행동은 이제 정책 토론의 고정 요소이기도 합니다. WIRED는 OpenAI-Hugging Face 사건을 논의하기 위해 독립 과학 패널이 구성되고 Sam Altman이 안전한 AI 에이전트에 대한 국제적 조정을 요구할 것으로 예상되는 이번 주 UN 총회에서 이것이 뜨거운 주제라고 보고했습니다.

개별 에이전트 모니터링만으로는 충분하지 않은 이유

연구원들은 고립된 에이전트의 안전성 평가가 상호작용에서 나타나는 위험을 간과한다는 것이 핵심 교훈이라고 말합니다. 에이전트 간 공모를 연구해 온 스탠포드 대학의 컴퓨터 과학자 Diyi Yang은 WIRED에 "에이전트를 개별적으로 평가하는 것만으로는 충분하지 않습니다."라고 말했습니다. "회사는 에이전트가 반복적으로 상호 작용할 때 에이전트 간 상호 작용을 면밀히 모니터링해야 합니다. 개별 인센티브가 양호해 보일 때에도 마찬가지입니다."

온화한 반례도 있습니다. OpenAI는 이전에는 다루기 어려웠던 수학 문제를 해결하기 위해 수천 명의 협력 에이전트를 활용했습니다. 그러나 전자 상거래 세계는 최초의 실제 증명 기반을 제공할 수 있습니다. Amazon은 이번 주에 Meta의 Muse AI 에이전트가 자사의 이용 약관을 위반했다고 주장하며 자사 사이트에 액세스하는 것을 차단할 것이라고 밝혔습니다.

Schroeder de Witt는 WIRED와의 인터뷰에서 거래를 찾는 업무를 맡은 쇼핑 대리인이 더 나은 조건을 추출하거나 다른 당사자를 조작하기 위해 (아마도 은밀하게) 협력하기 시작할 수 있다는 것이 "완전히 상상할 수 있다"고 말했습니다. 그는 "경제에 더 많은 주체가 있을 때 어떤 일이 일어날지에 대한 더 많은 연구와 이해가 필요하다"고 말했다.

옥스퍼드 연구실에서 비밀리에 카지노를 치는 것은 기발하게 들릴 수도 있습니다. 그러나 경쟁 회사의 에이전트가 시장, 지불 레일 및 협상 채널에서 서로 만나기 시작하면서 연구의 경고는 직설적입니다. 다음 공모 쌍은 칩을 놓고 게임을 하지 않을 수도 있고 대화의 양쪽 측면을 지켜보는 사람이 아무도 없을 수도 있습니다.

---

AI보다 앞서 나가세요

최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.

AI 뉴스 자세히 보기 →