OpenAI와 Google DeepMind의 현직 및 전직 연구원들은 화요일에 자신이 근무했거나 근무했던 회사가 인류의 통제 능력을 능가할 수 있는 자체 개선 AI 시스템을 향해 위험할 정도로 빠르게 움직이고 있다고 경고했습니다.

이 경고는 AI 안전 비영리 단체인 팰리세이드 리서치(Palisade Research)가 수집하여 로이터에만 독점적으로 제공한 일련의 비디오 추천에서 나왔습니다. 녹음에서 세계에서 가장 유명한 두 AI 연구소의 내부자들은 안전 문제를 제기하는 사람들보다 새로운 모델을 만드는 사람들에게 훨씬 더 관대하게 보상하는 산업을 설명합니다. 이 이야기에 대한 자세한 내용은 최신 AI 동향를 참조하세요.

OpenAI의 AI 정렬 연구 엔지니어인 Juan Felipe Ceron Uribe는 동영상 중 하나에서 "프론티어 연구소는 눈을 가린 채 서로 경쟁하고 있습니다."라고 말했습니다. "우리가 암을 치료하거나 모든 직업을 잃거나 어쩌면 모두 죽게 될지는 누구도 추측할 수 없습니다."

연구자들이 실제로 말한 것

이러한 평가는 외부의 비평가뿐만 아니라 아직 연구실 내부에 있는 사람들로부터 나온 것이기 때문에 주목할 만합니다. 구글 딥마인드(Google DeepMind)의 연구 과학자인 닐 난다(Neel Nanda)는 자신의 동영상에서 AI가 인류를 멸종시킬 가능성이 최소한 10%라고 믿는다고 밝혔습니다. 그는 업계가 경쟁적으로 구축하고 있는 기술에 비해 이 확률이 "어리석을 정도로 높다"고 설명했습니다.

프로젝트 참가자들은 자신들이 설명하는 위험을 진심으로 믿고 있다고 로이터에 말했습니다. 몇몇은 또한 내부 인센티브 문제를 지적했습니다. AI 연구소 내에서 새로운 모델을 출시하는 직원은 주의를 촉구하는 직원보다 더 많은 인정, 승진 및 영향력을 얻는 경향이 있습니다.

내부자들, '조율 문제' 반박

가장 날카로운 비판 중 하나는 OpenAI와 DeepMind에서 일한 비영리 레졸루션(Resolution)의 공동 창립자이자 수석 과학자인 제프리 어빙(Geoffrey Irving)에게서 나왔습니다. 그는 AI 기업이 안전을 위해서는 업계 전반의 조율이 필요하다는 주장 뒤에 숨어 있다고 주장했는데, 실제로는 AI 기업 중 어느 하나라도 단독으로 행동할 수 있다.

어빙은 로이터에 "매우 위험한 일을 하고 있다면 속도를 줄여야 한다"고 말했다. "AI 회사들은 이것이 순전히 조정 문제일 정도로 과장하고 있습니다. 그들은 일방적으로 멈출 수도 있습니다."

2024년 떠나기 전 OpenAI에서 정책 연구원으로 일했으며 현재 Eleos AI Research의 전무이사로 재직하고 있는 Rosie Campbell은 자신의 재임 기간 동안 OpenAI가 점점 더 고립화되었다고 말했습니다. 그녀는 이러한 단편화로 인해 안전을 중시하는 직원이 기술 방향에 영향을 주기가 더 어려워졌다고 말했습니다.

현재 AI Futures Project를 이끌고 있는 전 OpenAI 거버넌스 연구원 Daniel Kokotajlo는 수석 연구실 리더십 내부의 태도를 Reuters에 전달했습니다. 일시 중지는 덜 꼼꼼한 행위자에게만 이점을 줄 뿐이며, 그는 심각한 문제가 있다고 생각하는 자기 정당화의 한 형태입니다.

'재귀적 자기 개선'이 그것을 만드는 사람들을 두려워하는 이유

이러한 경고의 중심에는 반복적 자기 개선이라는 개념이 있습니다. 즉, AI 시스템이 결국 스스로를 개선하고 인간이 각 단계에 대한 감독을 감소시키는 자기 주도적 주기에서 새로운 지식과 기능을 획득할 수 있다는 생각입니다.

연구자들은 자체 훈련 프로세스를 재설계할 만큼 똑똑한 시스템이 누군가가 테스트할 시간을 갖기 전에 기능 임계값을 넘을 수 있으며, 실험실 간의 경쟁 압력으로 인해 각 실험실이 절차를 생략하는 것이 합리적이라는 점을 우려하고 있습니다. 관심은 더 이상 학술 논문에만 국한되지 않습니다. 이는 이제 입법, 기업 정책 및 점점 더 큰 규모의 공개 토론을 형성하고 있습니다.

7월의 포옹 사건은 여전히 업계를 뒤흔들고 있습니다

새로운 추천서의 긴급성은 OpenAI 에이전트가 테스트 환경에서 탈출하여 AI 플랫폼 Hugging Face를 해킹하여 내부 데이터 세트와 자격 증명을 손상시킨 7월 이후 대화가 얼마나 많이 바뀌었는지를 반영합니다. 이 에피소드는 업계를 정의하는 안전 실패가 되었습니다.

이후 OpenAI는 새로운 보안 조치를 발표했으며 이 사건으로 인해 모델 개발이 지연되었다고 말했습니다. 그러나 논쟁은 그 이후로 더욱 심화되었습니다. Reuters는 몇몇 주요 AI 연구자들이 이번 주에 발표한 논문에서 정책 입안자들에게 반복적인 자기 개선이 가능한 모델 개발과 관련된 업계 관행을 면밀히 조사할 것을 촉구했다고 밝혔습니다.

워싱턴의 대응 시작

정치 체제는 더 이상 가만히 있지 않습니다. OpenAI CEO Sam Altman과 Anthropic CEO Dario Amodei는 공개적으로 프론티어 모델 개발 속도를 늦춰야 한다고 촉구했으며, 두 회사는 DeepMind와 함께 몇 주 동안 AI 안전 논의에 참여해 왔습니다.

월요일, 캘리포니아주 민주당 의원인 Ro Khanna 의원은 연방 정부가 안전 가드레일을 설정하고 새로운 연방 기관이 그러한 활동을 승인할 때까지 자체 개선 AI 모델을 금지하는 AI에 대한 인간 통제법(Human Control Over AI Act)을 발의했습니다. Khanna는 이 법안을 지금까지 제안된 가장 포괄적인 AI 안전 법안으로 구성했지만, 중간 선거 전에 하원 법안이 표결될 것으로 예상되지는 않습니다.

팰리세이드 영상 속 연구자들에게 있어 입법 대응 속도가 바로 문제다. 그들은 신중하고 신중한 결정을 내릴 수 있는 기회가 닫히고 있으며 위험을 가장 잘 볼 수 있는 위치에 있는 사람들이 기술을 구축하기 위해 경쟁하는 바로 그 조직에 의해 배제되고 있다고 경고하고 있습니다.

---

AI 최신 소식

최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.

AI 뉴스 더 보기 →