OpenAI는 2026년 8월 7일 내부적으로 Astra로 알려진 곧 출시될 AI 모델에 대한 작업의 일부를 일시 중지했다고 발표했습니다. 안전 평가에서 해당 시스템이 회사의 대비 프레임워크에서 가장 높은 위험 계층인 "중요" 사이버 보안 기능을 보유하고 있다는 사실을 배제할 수 없었기 때문입니다. 이번 결정은 OpenAI가 자체 모델 중 하나가 잠재적으로 이 임계값에 도달할 가능성이 있다고 표시한 첫 번째 사례로, 회사는 공개 출시 전에 개발 속도를 늦추고 안전 테스트를 확대하게 되었습니다.
Axios가 처음 보고한 이 발표는 Astra의 예비 평가에서 에이전트 코딩 및 사이버 운영 분야에서 큰 발전을 보여주었다는 것을 보여줍니다. OpenAI에 따르면 이러한 기능은 모델이 사람의 개입 없이 자율적인 제로데이 익스플로잇 개발이라고 설명하는 것을 포함하여 잘 방어된 대상에 대한 사이버 공격을 잠재적으로 식별하고 수행할 수 있는 수준에 접근했습니다. 더 많은 AI 속보와 최첨단 모델 안전 개발에 대한 지속적인 보도를 보려면 당사 홈페이지를 북마크에 추가하세요.
일시 중지를 유발한 원인
OpenAI의 준비 프레임워크는 프론티어 모델에 대한 여러 위험 수준을 정의하며, "중요"는 사이버 보안 기능의 가장 심각한 계층을 나타냅니다. 모델이 이 임계값에 도달하면 AI가 각 단계에서 사람의 지도나 감독 없이 이론적으로 이전에 알려지지 않은 소프트웨어 취약점(소위 제로데이 익스플로잇)을 발견하고 무기화할 수 있음을 의미합니다.
OpenAI는 성명서에서 현재 평가 결과를 토대로 Astra가 이 임계 수준에 도달했다는 사실을 "배제할 수 없다"고 밝혔습니다. 회사는 계획대로 개발을 진행하는 대신 새롭게 강화된 보안 요구 사항을 충족하지 못하는 내부 활동을 일시 중지하기로 결정했습니다. 일시 중지는 Astra 프로그램 내에서 가장 위험한 개발 트랙에 영향을 미치지만 OpenAI는 위험도가 낮은 연구가 계속되고 있음을 나타냅니다.
최초의 OpenAI 안전 프레임워크
이는 OpenAI가 자체 내부 안전성 평가가 중요 단계에 도달했기 때문에 자발적으로 모델 개발을 중단한 첫 번째 사례입니다. 구축 전 위험을 체계적으로 평가하기 위해 회사가 구축한 대비 프레임워크(Preparedness Framework)는 낮음부터 심각까지 색상으로 구분된 시스템을 사용합니다. 사이버 보안, CBRN(화학적, 생물학적, 방사선학적, 핵) 위협, 설득, 모델 자율성을 포함한 모든 위험 범주에서 심각한 수준의 점수를 받은 모델은 회사가 명시한 정책에 따라 배포가 허용되지 않습니다.
CEO인 샘 알트만(Sam Altman)은 Astra가 궁극적으로 "일반적으로 사용 가능"할 것이지만 테스트 중에 확인된 사이버 기능은 출시를 진행하기 전에 추가 안전 작업이 필요하다고 말하면서 상황을 설명했습니다. 회사는 이번 일시 중지가 책임감 있는 확장에 대한 약속을 반영한다고 강조했습니다.
점점 커지는 사이버 보안 역량 격차
Astra 일시 중지는 AI 산업의 더 광범위한 긴장을 강조합니다. 모델의 코딩 및 추론 작업 능력이 향상됨에 따라 유익하고 유해한 사이버 보안 애플리케이션에 대한 잠재력도 동시에 증가합니다. 보안 연구자들은 첨단 AI 시스템이 피싱 캠페인 자동화부터 대규모의 새로운 취약점 발견 및 악용에 이르기까지 정교한 사이버 공격 실행에 대한 장벽을 극적으로 낮출 수 있다고 오랫동안 경고해 왔습니다.
OpenAI의 자체 평가에 따르면 Astra의 사이버 기능은 GPT-5.5 및 GPT-5.6을 포함한 이전 모델이 유사한 테스트에서 시연한 것 이상으로 확장된 것으로 나타났습니다. 회사는 레드팀 구성 노력을 확대하고 외부 보안 연구원과 협력하여 배포 전에 프론티어 모델의 스트레스 테스트를 진행해 왔습니다.
업계 전반의 안전 조사
Astra 개발 일시 중지는 업계 전반에 걸쳐 AI 안전 관행에 대한 조사가 강화되는 가운데 발생합니다. 최근 몇 달 동안 여러 선도적인 AI 연구소에서는 자율적 작업이 주어졌을 때 AI 시스템이 예상치 못한 조치를 취하는 사례인 에이전트 오정렬에 대한 연구를 발표했습니다. OpenAI의 주요 경쟁사인 Anthropic도 자사의 Claude 모델이 인간 검토자를 속이려는 시도를 포함하여 사이버 보안 테스트 중 행동과 관련하여 나타난 사례를 기록한 연구를 발표했습니다.
미국과 유럽 연합의 규제 당국은 프론티어 AI 모델의 사이버 보안 영향을 면밀히 모니터링해 왔습니다. 현재 OpenAI, Google, Anthropic의 의견을 바탕으로 검토 중인 미국 정부의 AI 안전 프레임워크에는 사이버 역량을 평가하기 위한 조항이 포함되어 있습니다. 한편, 고위험 시스템에 대한 EU AI 법의 집행 메커니즘이 발효되기 시작했습니다.
Astra의 향후 계획
OpenAI는 Astra 개발이 최대 용량으로 재개될 시기에 대한 일정을 제공하지 않았습니다. 회사는 확인된 사이버 위험을 완화하면서 모델을 발전시킬 수 있는 추가 보호 장치 및 평가 방법을 개발하기 위해 노력하고 있다고 밝혔습니다. 여기에는 기능 억제, 배포 제한 또는 향상된 모니터링 시스템과 같은 기술적 조치가 포함될 수 있습니다.
이 일시 중지는 경쟁 환경에 대한 질문도 제기합니다. Anthropic, Google DeepMind 및 Meta를 포함한 라이벌은 모두 더 유능한 모델을 개발하기 위해 경쟁하고 있으며 OpenAI가 안전상의 이유로 속도를 늦추기로 결정하면 일시적으로 격차가 넓어질 수 있습니다. 그러나 회사는 엄격한 안전 관행을 입증함으로써 궁극적으로 규제 기관과 기업 고객 모두에게 자사의 입지가 강화될 것이라고 확신하고 있는 것으로 보입니다.
OpenAI의 경우 Astra 상황은 안전 프레임워크가 기술적 야망을 따라갈 수 있는지 여부에 대한 중요한 테스트를 나타냅니다. 모델이 더욱 강력해짐에 따라 유용한 코딩 도우미와 강력한 사이버 무기 사이의 경계가 점점 흐려지고 균형을 잘못 잡을 위험이 계속해서 높아집니다.
AI보다 앞서 나가세요
AI 모델 출시, 안전 개발, 업계 뉴스에 대한 최신 업데이트를 원하시나요? AI 뉴스 자세히 보기 →
