A OpenAI apresentou o MentalHealthBench na quarta-feira, um benchmark aberto de 1.215 conversas sintéticas sobre saúde mental projetadas para medir como os sistemas de IA respondem em cenários realistas – desde questões diárias de bem-estar até crises urgentes – com cada cenário revisado e pontuado por médicos licenciados.
O lançamento é muito além dos próprios modelos da OpenAI. Mais de um bilhão de pessoas usam o ChatGPT todas as semanas, de acordo com a empresa, e os chatbots de IA tornaram-se silenciosamente a primeira parada para pessoas com problemas emocionais. Até agora, a indústria carecia de um critério rigoroso e partilhado para esse comportamento. Para obter mais contexto sobre esta história, consulte nossa cobertura do setor de IA em andamento.
Construído com mais de 80 médicos em 22 países
A OpenAI co-criou o benchmark com um grupo de mais de 80 psicólogos e psiquiatras licenciados em 22 países, que falam coletivamente 19 idiomas e representam quase 20 subespecialidades de saúde mental, de acordo com a cobertura do anúncio pela Unite.AI. A versão completa contém 5.262 critérios de rubrica de autoria de especialistas.
Cada conversa foi revisada por pelo menos três especialistas através de um processo de três etapas: dois médicos criaram critérios ponderados de autoria independente, um terceiro os julgou e refinou, e apenas os critérios acordados por pelo menos dois especialistas – e não contraditos por um terceiro – foram mantidos. Cada critério visa um único aspecto da resposta de um modelo e carrega um peso de -10 a +10, com valores absolutos maiores indicando maior importância clínica.
O CEO da Associação Americana de Psicologia, Dr. Arthur Evans, foi citado no anúncio dizendo que a saúde mental existe em um continuum e que os sistemas de IA que envolvem pessoas em toda essa faixa precisam ser fundamentados tanto na ciência clínica quanto na experiência vivida.
O que está no benchmark
As 1.215 conversas variam deliberadamente em termos de gravidade e de quem está pedindo ajuda:
- Conversas não agudas respondem por 53,5% do conjunto de dados, conversas de alta acuidade por 18,2% e conversas emergentes por 28,3%.
- Quatro perfis de usuários estão representados: adultos com 68,1%, adolescentes com 21,2%, médicos com 5,8% e cuidadores com 4,9%.
- As conversas foram geradas sinteticamente usando técnicas de preservação de privacidade que o artigo de pesquisa descreve como semelhantes à metodologia Clio, com o objetivo de refletir padrões reais de uso de saúde mental do ChatGPT sem expor usuários reais.
- Setenta tarefas — 5,8% do valor de referência — trazem contexto anterior do usuário, como uma perda recente na família.
- Além do inglês, o benchmark inclui 105 conversas em espanhol, 54 em hindi, 34 em árabe e 29 em português, com conversas adicionais em alemão, italiano, persa, indonésio, turco e chinês.
Qual foi a pontuação dos modelos
As avaliações foram pontuadas por um avaliador automatizado — GPT-5.6 Sol, executado com alto esforço de raciocínio — com quatro julgamentos amostrados independentemente por tarefa, e os resultados podem ser decompostos em dez eixos comportamentais definidos por especialistas, incluindo busca de contexto, empatia, calibração de urgência e teste de realidade.
Nos resultados relatados pela OpenAI, GPT-6 Astra obteve a pontuação mais alta com 57,3 por cento, seguido por GPT-6 Sol com 53,9 por cento, Claude Opus 5,5 da Anthropic com 52,4 por cento e GPT-6 Luna com 50,2 por cento. As gerações mais antigas ficaram bem atrás: GPT-4o de março de 2025 obteve 32,1% e Gemini 2.5 Pro obteve 29,5%, com todos os números apresentando intervalos de confiança de 95%.
Dois pontos de referência enquadram esses números. As conclusões escritas com acesso total às rubricas de classificação obtiveram pontuação de 99,0% — uma verificação de sanidade do teto de ruído da avaliação — enquanto as conclusões escritas pelos próprios médicos obtiveram pontuação de apenas 38,5%, principalmente porque os médicos escrevem respostas curtas e presenciais, em vez de respostas abrangentes de chatbot.
A OpenAI disse que os resultados mostram uma melhoria constante ao longo das gerações de modelos, ao mesmo tempo que destacam espaço para melhorias na busca do contexto apropriado e na calibração da urgência. Notavelmente, o artigo relata uma compensação: modelos que são cautelosos em conversas emergentes e de alto risco podem demorar mais para se engajar nas conversas cotidianas e vice-versa.
Usuários e especialistas discordam sobre o que é "bom"
Alongside the benchmark, OpenAI ran a separate analysis with 44 adults who had used AI for mental health or emotional support, representing 16 countries and 14 languages. Participants rated model responses and wrote their own criteria, though their review was limited to non-acute conversations to avoid exposing them to distressing material.
User and expert rubrics aligned on just 25.7 percent of total rubric weight, with 1.0 percent directly contradictory. Users emphasized practical next steps and tone; experts placed greater weight on gathering relevant context and carefully interpreting ambiguous situations. OpenAI's conclusion: user feedback is a coherent and complementary signal, but not interchangeable with clinical and safety guidance.
An auditable diagnostic, not a leaderboard
OpenAI is explicit that MentalHealthBench is an auditable diagnostic tool rather than a definitive leaderboard, and that its language comparisons are descriptive — they cannot isolate the effect of language from differences in acuity, topic, culture, or user profile. The dataset is available for download, and each example carries a canary string so researchers can detect if the data leaks into future training corpora.
The company also pointed to related efforts, including research grants for AI mental health work, expert convenings with the Partnership on AI, and assistance for Transluce's independent mental health evaluation effort.
The caveats are real: the conversations are synthetic, grading is automated, and OpenAI's own models top a benchmark OpenAI designed. But by releasing the expert rubrics, the grading methodology, and the data openly, OpenAI has given regulators, clinicians, and competitors a common instrument for a domain where — as the company's own weekly usage numbers suggest — the stakes keep rising.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →