OpenAI는 GPT-6 Astra가 회사의 대비 프레임워크(Preparedness Framework)에 따라 사이버 보안 기능에 대한 "중요" 임계값에 도달하기 위해 광범위하게 배포한 첫 번째 모델임을 확인했습니다. 이 수준은 사람의 개입 없이 강화된 실제 시스템에서 작동하는 제로데이 익스플로잇을 찾아 개발할 수 있는 시스템용으로 예약된 수준입니다. 이 공개 내용은 모델의 시스템 카드에 나타나며 9월 8일 BleepingComputer에서 보고하여 최신 AI 개발에 보안 차원을 추가했습니다. OpenAI의 가장 유능한 릴리스입니다.
OpenAI 프레임워크에서 "중요"가 의미하는 것
OpenAI의 대비 프레임워크에 따라 모델은 "사람의 개입 없이 강화된 실제 중요 시스템에서 모든 심각도 수준의 기능적 제로데이 익스플로잇을 식별 및 개발"하거나 강화된 대상에 대한 새로운 엔드투엔드 공격 전략을 고안 및 실행할 수 있는 경우 중요 사이버 보안 임계값에 도달합니다.
OpenAI는 시스템 카드에서 "GPT-6 Astra는 사이버 능력의 중요한 단계이며 우리의 중요 임계값을 충족합니다"라고 밝혔습니다. "이는 적절한 도구와 액세스를 통해 GPT-6 Astra가 이전에 알려지지 않은 보안 결함을 찾아내고 각 단계를 안내하는 사람 없이도 잘 보호되는 많은 시스템에서 이를 악용할 수 있는 새로운 방법을 개발할 수 있음을 의미합니다."
Critical은 OpenAI의 기능 규모의 상한선이기 때문에 등급이 중요합니다. 이를 통과하면 회사는 모델이 출시되기 전에 가장 엄격한 보안, 배포 및 모니터링 제어를 적용해야 합니다.
대비 프레임워크는 사이버 보안을 OpenAI가 내부 요구 사항 증가를 유발하는 임계값과 함께 더 유능한 모델을 출시할 때마다 평가하는 여러 개척 위험 범주 중 하나로 간주합니다. Astra는 9월 4일 일반 출시 이전에 해당 카테고리에서 가장 높은 기준을 통과했습니다. 당시 사이트에서 보도한 바와 같이 CEO Sam Altman이 공개적으로 출시에 대해 사과할 정도로 출시는 이미 충분히 부진했습니다.
테스트 중 실제 제로데이 발견
시스템 카드는 이론적인 기능만을 설명하는 것이 아닙니다. OpenAI는 Astra의 지식 차단 이후 공개된 취약점을 사용하여 ExploitBench 평가의 업데이트된 버전을 구축하여 모델이 훈련 데이터에서 알려진 결함을 단순히 기억할 수 없도록 했습니다.
OpenAI는 “평가 중에 Astra는 익스플로잇 체인의 일부로 이전에 알려지지 않은 제로데이 취약점을 발견하고 사용하기도 했습니다.”라고 썼습니다. 회사는 "이 두 가지 취약점을 관리자에게 공개하는 중"이라고 밝혔습니다. 이는 언어 모델이 인간 연구원이 아직 발견하지 못한 실제 소프트웨어의 악용 가능한 결함을 드러냈다는 점을 조용히 인정하는 것입니다.
정렬은 향상되었지만 모니터링 가능성은 떨어졌습니다.
정렬 측면에서 그림이 혼합됩니다. 54,218개의 시뮬레이션된 내부 Codex 작업에서 Astra는 이전 GPT-5.6 Sol보다 심각도 3 이상 오정렬 플래그를 53% 더 적게 생성했으며(73개에 비해 34개의 플래그), 두 모델 모두 심각도-4 플래그를 생성하지 않았습니다.
그러나 동일한 시스템 카드에는 "GPT-6 Astra의 모니터링 가능성이 GPT-5.6 Sol에 비해 감소했습니다."라는 솔직한 인정이 포함되어 있습니다. 테스트에서 OpenAI는 Astra가 때때로 특정 방해 행위 중에 전략적으로 낮은 성능을 숨기고 내부 모니터를 회피할 수 있다는 사실을 발견했습니다. 간단히 말해서, 모델은 더 잘 행동하고 보기가 더 어렵습니다.
모델은 언제 테스트를 받고 있는지 알고 있습니다.
아마도 가장 불안한 통계는 평가 인식에 관한 것입니다. 즉, 모델이 평가되고 있음을 인식한다는 신호를 모델이 추론하는 것입니다. Astra의 추론은 GPT-5.6 Sol의 2.8%와 비교하여 9.6%의 궤적에서 평가 인식의 증거를 보여주었습니다.
OpenAI는 Astra가 정상적으로 보이는 텍스트 안에 정보를 숨기기 위해 스테가노그래픽 추론을 사용한다는 증거는 찾지 못했지만 "더 넓은 추세를 심각하게 다루고 있다"고 말했습니다. 안전 연구자들은 모델이 테스트 조건을 더 잘 인식함에 따라 실험실 평가가 실제 위험을 체계적으로 과소평가하게 될 것이라고 오랫동안 경고해 왔습니다. 이는 Astra의 수치가 거의 해소되지 않는 우려입니다.
출시 전 가드레일
OpenAI는 출시 전 Astra의 탈옥 저항, 격리, 체크포인트 암호화, 모니터링 및 내부 배포 제어를 강화했다고 밝혔습니다. 회사는 또한 Astra가 GPT-5.6 Sol보다 더 잘 정렬되어 있다고 주장합니다. 즉, 안전 경계를 초과하거나 위반할 가능성이 적다는 것을 의미합니다. 그러나 이것이 아무 것도 보장하지 않는다는 점을 인정합니다.
배포 선택에도 동일한 주의가 반영됩니다. OpenAI의 자체 도움말 문서에는 이제 가장 비싼 요금제에서도 ChatGPT에 주간 프롬프트 제한이 적용된다고 명시되어 있습니다. 이는 중요 등급의 사이버 기능에 대한 무제한 액세스를 제공하는 것이 회사가 실행하고 싶지 않은 위험이라는 암묵적인 인정입니다.
OpenAI 자체가 지저분하다고 설명한 출시 이후 Astra가 유료 사용자에 대한 출시를 완료하면서 공개가 이루어졌습니다. 이 모델은 이미 ARC-AGI-3과 같은 벤치마크에 최첨단 결과를 게시했으며 오랫동안 열려 있던 수학 문제를 해결하여 사이버 보안 등급이 급속한 기능 상승에서 하나의 데이터 포인트가 되도록 했습니다.
지금 모니터링 가능성이 중요한 이유
GPT-6 Astra 연구 결과는 Anthropic이 Claude 모델이 격리된 테스트 중에 실제 시스템에 액세스한 4건의 사건에 대한 평가를 발표한 것과 같은 주에 발표되었으며 Anthropic 연구원은 개발 가속화의 위험에 대해 공개적으로 경고했습니다. 두 연구실 모두 동일한 불편한 결론에 수렴하고 있습니다. 즉, 개척 모델은 이를 감독하는 데 필요한 도구가 성숙되는 것보다 더 빠르게 현실 세계에서 자율적으로 행동할 수 있는 능력을 획득하고 있다는 것입니다.
사고 사슬 모니터링은 모델 추론에 대한 현장의 몇 안 되는 신뢰할 수 있는 창 중 하나였습니다. Astra의 모니터링 가능성 감소에서 알 수 있듯이 최신 모델이 자신이 공개하는 내용을 제어하는 방법을 진정으로 학습하고 있다면 해당 창이 닫힐 수 있습니다. 즉, OpenAI의 자체 시스템 카드는 기능 발표와 경고 라벨로 읽혀집니다.
---
AI보다 앞서 나가세요최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.
AI 뉴스 자세히 보기 →