OpenAI는 수요일에 일상적인 웰빙 질문부터 긴급 위기에 이르기까지 AI 시스템이 현실적인 시나리오에서 어떻게 반응하는지 측정하도록 설계된 1,215개의 합성 정신 건강 대화에 대한 공개 벤치마크인 MentalHealthBench를 출시했습니다. 모든 시나리오는 자격증을 갖춘 임상의가 검토하고 점수를 매겼습니다.
이번 릴리스는 OpenAI의 자체 모델보다 훨씬 중요합니다. 회사에 따르면 매주 10억 명 이상의 사람들이 ChatGPT를 사용하고 있으며 AI 챗봇은 조용히 정서적 고통을 겪는 사람들의 첫 번째 정거장이 되었습니다. 지금까지 업계에는 이러한 행동에 대한 엄격하고 공유된 척도가 부족했습니다. 이 이야기에 대한 자세한 내용은 진행 중인 AI 산업 보도를 참조하세요.
22개국 80명 이상의 임상의로 구축
Unite.AI의 발표 보도에 따르면 OpenAI는 22개국에서 19개 언어를 구사하고 약 20개 정신 건강 하위 전문 분야를 대표하는 80명 이상의 자격증을 갖춘 심리학자 및 정신과 의사 집단과 함께 벤치마크를 공동 개발했습니다. 전체 릴리스에는 전문가가 작성한 기준표 기준 5,262개가 포함되어 있습니다.
각 대화는 3단계 프로세스를 통해 최소 3명의 전문가에 의해 검토되었습니다. 두 명의 임상의가 독립적으로 가중치 기준을 작성하고, 세 번째 전문가가 이를 판정하고 개선했으며, 최소 두 명의 전문가가 동의하고 세 번째 전문가가 모순되지 않은 기준만 유지했습니다. 각 기준은 모델 반응의 단일 측면을 목표로 하며 -10에서 +10 사이의 가중치를 가지며, 절대값이 클수록 임상적 중요성이 더 크다는 것을 나타냅니다.
미국 심리학 협회(American Psychological Association)의 CEO인 Arthur Evans 박사는 정신 건강이 연속체에 존재하며 해당 범위에 걸쳐 사람들을 참여시키는 AI 시스템은 임상 과학과 실제 경험 모두에 기반을 두어야 한다고 발표에서 인용했습니다.
벤치마크에는 무엇이 포함되어 있나요?
1,215개의 대화는 심각도와 도움을 요청하는 사람이 누구인지 의도적으로 다양합니다.
- 비급성 대화는 데이터세트의 53.5%를 차지하고, 고급 대화는 18.2%, 긴급 대화는 28.3%를 차지합니다.
- 4개의 사용자 프로필이 대표됩니다: 성인 68.1%, 청소년 21.2%, 임상의 5.8%, 간병인 4.9%.
- 대화는 실제 사용자를 노출시키지 않고 실제 ChatGPT 정신 건강 사용 패턴을 반영하는 것을 목표로 하는 Clio 방법론과 유사하다고 연구 논문에서 설명하는 개인 정보 보호 기술을 사용하여 합성적으로 생성되었습니다.
- 70개의 작업(벤치마크의 5.8%)은 최근 가족의 상실과 같은 이전 사용자 컨텍스트를 전달합니다.
- 영어 외에도 벤치마크에는 스페인어 105개, 힌디어 54개, 아랍어 34개, 포르투갈어 29개 대화가 포함되며 독일어, 이탈리아어, 페르시아어, 인도네시아어, 터키어 및 중국어 대화도 추가로 포함됩니다.
모델의 점수
평가는 작업당 4개의 독립적으로 샘플링된 판단을 통해 높은 추론 노력으로 실행되는 자동 채점기(GPT-5.6 Sol)에 의해 점수가 매겨졌으며, 결과는 맥락 탐색, 공감, 긴급성 보정 및 현실 테스트를 포함하여 전문가가 정의한 10가지 행동 축에 걸쳐 분해될 수 있습니다.
OpenAI가 보고한 결과에서는 GPT-6 Astra가 57.3%로 가장 높은 점수를 얻었고, GPT-6 Sol이 53.9%, Anthropic의 Claude Opus 5.5가 52.4%, GPT-6 Luna가 50.2%로 그 뒤를 이었습니다. 이전 세대는 훨씬 뒤처졌습니다. 2025년 3월의 GPT-4o는 32.1%, Gemini 2.5 Pro는 29.5%를 기록했으며 모든 수치는 95% 신뢰 구간을 나타냈습니다.
두 개의 참조점이 해당 숫자의 틀을 잡습니다. 채점 기준표에 대한 전체 액세스 권한을 갖고 작성된 완료는 99.0%(평가의 소음 한도에 대한 건전성 검사)를 얻은 반면, 임상의가 직접 작성한 완료는 38.5%에 불과했습니다. 이는 주로 임상의가 포괄적인 챗봇 답변보다는 직접 짧은 답변을 작성하기 때문입니다.
OpenAI는 이번 결과가 모델 세대 전반에 걸쳐 꾸준한 개선을 보여주는 동시에 적절한 맥락을 찾고 긴급성을 조정하는 데 개선의 여지가 있음을 강조한다고 밝혔습니다. 특히, 이 논문은 절충안을 보고합니다. 긴급하고 위험도가 높은 대화에 주의를 기울이는 모델은 일상적인 대화에 참여하는 데 시간이 더 걸릴 수 있으며 그 반대의 경우도 마찬가지입니다.
사용자와 전문가는 "좋은" 것이 무엇인지에 대해 의견이 다릅니다.
벤치마크와 함께 OpenAI는 16개국, 14개 언어를 대표하는 정신 건강 또는 정서적 지원을 위해 AI를 사용한 성인 44명을 대상으로 별도의 분석을 실시했습니다. 참가자들은 모델 응답을 평가하고 자신만의 기준을 작성했지만, 검토는 고통스러운 자료에 노출되는 것을 피하기 위해 심각하지 않은 대화로 제한되었습니다.
사용자 및 전문가 루브릭은 전체 루브릭 가중치의 25.7%에 불과하며, 1.0%는 직접적으로 모순됩니다. 사용자는 실용적인 다음 단계와 어조를 강조했습니다. 전문가들은 관련 맥락을 수집하고 모호한 상황을 주의 깊게 해석하는 데 더 큰 비중을 두었습니다. OpenAI의 결론: 사용자 피드백은 일관되고 보완적인 신호이지만 임상 및 안전 지침과 상호 교환될 수 없습니다.
리더보드가 아닌 감사 가능한 진단
OpenAI는 MentalHealthBench가 최종 순위표가 아니라 감사 가능한 진단 도구이며 언어 비교가 설명적임을 명시합니다. 예리함, 주제, 문화 또는 사용자 프로필의 차이에서 언어의 효과를 분리할 수는 없습니다. 데이터세트는 다운로드할 수 있으며, 각 예시에는 카나리아 문자열이 포함되어 있어 연구자는 데이터가 향후 교육 자료로 유출되는지 감지할 수 있습니다.
회사는 또한 AI 정신 건강 업무를 위한 연구 보조금, AI 파트너십과의 전문가 회의, Transluce의 독립적인 정신 건강 평가 노력에 대한 지원 등 관련 노력을 언급했습니다.
주의할 점은 현실입니다. 대화는 합성되고, 채점은 자동화되며, OpenAI의 자체 모델은 OpenAI가 설계한 벤치마크보다 우수합니다. 그러나 OpenAI는 전문가 루브릭, 등급 방법론 및 데이터를 공개적으로 공개함으로써 규제 기관, 임상의 및 경쟁업체에게 회사의 주간 사용량에서 알 수 있듯이 위험이 계속 증가하는 도메인에 대한 공통 도구를 제공했습니다.
---
AI보다 앞서 나가세요최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.
AI 뉴스 자세히 보기 →