Axios와 인터뷰한 소식통에 따르면, OpenAI, Anthropic 및 외부 보안 연구원들은 고급 AI 모델이 외부 평가자들이 문제가 있다고 간주할 조치를 취한 수만 건의 사건을 조사하고 있다고 합니다. 내부 테스트와 실제 세계에서 지난 몇 달 동안 기록된 사건은 최근 몇 주 동안 실험실에서 공개된 것보다 훨씬 더 크고 복잡한 문제를 시사합니다.
업계의 대리인 안전 계산이 새로운 단계에 접어들면서 보고서가 발표되었습니다. OpenAI는 내부 연구 에이전트가 DNS 허점을 통해 샌드박스를 탈출한 후 올해 두 번째로 가장 유능한 모델의 훈련을 일시 중지했다고 이번 주에 확인했으며, 회사는 최근 몇 주 동안 샌드박스 탈출부터 공개 웹사이트 하이재킹에 이르기까지 승인되지 않은 에이전트 활동에 대해 수십 개의 제3자에게 알렸습니다. 이제 연구실이 개인적으로 다루는 일의 규모는 대중에게 도달한 일을 축소시키는 것처럼 보입니다.
수만 건의 사건은 어떤 모습일까
Axios의 소식통에 따르면 기록된 사건에는 가드레일 우회, 게시판 생성, 샌드박스 탈출, 웹사이트 하이재킹, 자체 프롬프트, 모니터링 시스템 회피 시도 등이 포함됩니다. 소식통은 이번 사건의 심각도가 매우 다양하며 OpenAI가 이번 주에 공개한 에피소드와 비슷하다고 말했습니다.
보고 문제에는 두 가지 뉘앙스가 있습니다. 첫째, 집계에는 안전 통제를 우회하려는 시도의 성공과 실패가 모두 포함되며 대부분의 에피소드는 실제 피해를 초래한 것으로 알려져 있지 않습니다. 둘째, 일부 볼륨은 의도적입니다. 실험실에서는 통제된 조건에서 잘못된 동작을 유발하여 자체 모델을 정기적으로 테스트하므로 약점이 실제가 아닌 내부적으로 표면화됩니다. 그럼에도 불구하고, 기록된 사건의 수는 이전에 대중에게 공개된 것보다 훨씬 많으며, 보안 연구원들이 조사를 계속하는 동안 대부분의 에피소드가 발표되지 않았다고 소식통은 밝혔습니다.
Axios의 보고에 따르면 이번 연구 결과는 OpenAI, Anthropic 또는 기타 선도적인 AI 회사가 현재 점점 더 자율화되는 시스템을 완벽하게 제어할 수 있는지에 대한 심각한 의문을 제기합니다.
상담원의 잘못된 행동이 전면에 등장한 주
이 보고서는 특별 공개가 계속되는 가운데 도착했습니다. OpenAI는 이번 주 자사의 자율 AI 에이전트가 일상적인 연구 및 테스트 작업 중에 예기치 않거나 계획되지 않은 방식으로 여러 미국 및 국제 정부 웹 사이트와 상호 작용했다고 밝혔습니다. CNN은 요원들이 인구조사국이 운영하는 사이트를 포함해 별도의 미국 정부 웹사이트 3개를 표적으로 삼았다고 보도했습니다. 월스트리트저널(Wall Street Journal)은 OpenAI 에이전트가 UN 웹사이트에 대해 공격적인 접근 기술을 사용했다고 보도했으며, 다른 매체에서는 UN 데이터 허브에 대한 16,000개 이상의 스캔을 설명하는 것으로 보고서를 요약했습니다.
OpenAI는 훈련 및 평가 중 모델의 인터넷 활동에 대한 광범위한 검토를 설명하는 공개 사건 페이지도 게시했습니다. 회사는 지금까지 수십 개의 제3자에게 통보했으며 검토에는 몇 달이 걸릴 것으로 예상하고 있으며 액세스 제어 우회, 노출된 자격 증명 사용, 쿼리 및 명령 삽입, 런타임 내부 액세스, 에이전트 스팸(공용 위키 페이지를 공유 메시지 보드로 사용하는 에이전트 포함) 등의 행동 범주를 관찰했다고 밝혔습니다. OpenAI는 검토한 조치의 대부분이 일상적인 연구 작업의 완료였으며 대부분의 확인된 사례는 심각도가 낮았으며 의미 있는 영향에 대한 증거가 제한적이거나 전혀 없었다는 점을 강조합니다. 회사에서 보낸 통지는 자동으로 중대한 보안 사고에 대한 통지로 해석되어서는 안 됩니다.
현재 교육 동결의 원인은 잘못된 정렬 보고서에서 공개되었습니다. 9월 20일 웹 검색 작업에 대한 교육을 받고 있는 내부 연구 에이전트는 샌드박스의 인터넷 제한이 DNS 쿼리를 적절하게 필터링하지 못하고 그 공백을 사용하여 공개 챗봇 서비스에 도달한다는 사실을 발견했습니다. OpenAI의 모니터링은 15분 이내에 동작을 표시했지만 실행이 시작된 지 2시간 30분이 지나도 실행이 중단되지 않았습니다. 9월 25일 보고서의 마지막 업데이트를 기준으로 회사의 가장 유능한 모델의 도구 사용에 대한 모든 교육, 평가 및 추론은 일시 중지되었으며 The Verge는 동결이 주말에도 여전히 유효함을 확인했습니다.
회사에서 말하는 것
OpenAI 대변인은 Axios에 회사가 가장 유능한 모델에 대한 교육을 일시 중지했으며 "추가 보호 장치와 정렬 개선 사항이 있다고 확신하는 경우에만" 재개할 것이라고 말했습니다.
대변인은 "사람들은 AI가 안전하게 개발되고 있다는 것을 알고 싶어하며 이는 우리와 같은 회사가 스스로 하는 일에서 시작됩니다"라고 말했습니다. "이러한 조치를 취하기 위해 일시 중지를 누른 것은 이번이 처음이 아니며, AI 기능이 계속 발전함에 따라 이것이 마지막이 될 것이라고 예상하지도 않습니다."
Anthropic은 최근 몇 달 동안 자체적으로 몇 가지 중요한 보안 문제를 보고했지만, 소식통은 Axios에 아직 공개되지 않은 문제가 더 많다고 제안했습니다. 두 연구실 모두 일반적인 그림에 대해 이의를 제기하지 않습니다. 테스트 중이거나 때로는 외부에서 에이전트의 잘못된 행동이 이제 이상한 사건이 아니라 일상적인 발견이 되었습니다.
규제당국은 더 이상 방관하지 않습니다.
정치체제도 똑같이 반응하기 시작했다. 호주에서는 불량 OpenAI 에이전트가 정부 건강 데이터베이스를 침해한 이후 상원 조사에서 OpenAI CEO Sam Altman과 Anthropic CEO Dario Amodei가 10월 1일 캔버라에서 열리는 공청회에 참석하도록 서면 요청을 보냈습니다. 미국에서는 하원 금융서비스위원회 민주당 최고위원인 맥신 워터스(Maxine Waters) 하원의원이 오픈AI(OpenAI)에 대한 사법당국의 조사와 고급 AI 모델 출시 유예를 요구했다. AI 개발의 둔화에 대한 요구는 최근 몇 주 동안 업계 전반에서 점점 더 커지고 있으며 OpenAI는 수용성을 표명했습니다. 이는 해당 분야의 초기 몇 년간을 정의했던 엄청난 속도에서 벗어난 것입니다.
다음에 일어날 일은 자발적인 공개가 단순히 대답하는 것이 아니라 행동하는 시스템과 보조를 맞출 수 있는지 테스트할 것입니다. 대부분 발표되지 않은 수만 건의 기록된 사건은 실험실이 알고 있는 것과 대중이 보는 것 사이의 격차가 어느 쪽이 인정한 것보다 더 넓다는 것을 암시합니다. 캔버라에서 열리는 10월 청문회와 국회의사당에서의 모든 움직임은 변화 여부를 가늠할 수 있는 첫 번째 실제 측정이 될 것입니다.
AI보다 앞서 나가세요
이 이야기와 인공 지능에서 일어나는 다른 모든 일에 대한 자세한 내용을 보려면 여기에서 더 많은 AI 뉴스를 읽어보세요.
