OpenAI presentó MentalHealthBench el miércoles, un punto de referencia abierto de 1215 conversaciones sintéticas sobre salud mental diseñadas para medir cómo responden los sistemas de inteligencia artificial en escenarios realistas, desde preguntas cotidianas sobre bienestar hasta crisis urgentes, con cada escenario revisado y calificado por médicos autorizados.

El lanzamiento importa mucho más allá de los propios modelos de OpenAI. Según la compañía, más de mil millones de personas usan ChatGPT cada semana, y los chatbots de IA se han convertido silenciosamente en la primera parada para las personas con angustia emocional. Hasta ahora, la industria ha carecido de un criterio riguroso y compartido para ese comportamiento. Para obtener más contexto sobre esta historia, consulte nuestra cobertura de la industria de la IA en curso.

Construido con más de 80 médicos en 22 países

OpenAI cocreó el punto de referencia con una cohorte de más de 80 psicólogos y psiquiatras autorizados en 22 países, que en conjunto hablan 19 idiomas y representan casi 20 subespecialidades de salud mental, según la cobertura del anuncio de Unite.AI. El comunicado completo contiene 5262 criterios de rúbrica escritos por expertos.

Cada conversación fue revisada por al menos tres expertos a través de un proceso de tres etapas: dos médicos redactaron de forma independiente los criterios ponderados, un tercero los juzgó y los refinó, y solo se retuvieron los criterios acordados por al menos dos expertos, y que no fueron contradichos por un tercero. Cada criterio se dirige a un único aspecto de la respuesta de un modelo y tiene un peso de -10 a +10, donde los valores absolutos más grandes indican una mayor importancia clínica.

El director ejecutivo de la Asociación Estadounidense de Psicología, el Dr. Arthur Evans, fue citado en el anuncio diciendo que la salud mental existe en un continuo, y que los sistemas de inteligencia artificial que involucran a personas en ese rango necesitan una base tanto en la ciencia clínica como en la experiencia vivida.

¿Qué hay en el punto de referencia?

Las 1.215 conversaciones varían deliberadamente en gravedad y en quién pide ayuda:

  • Las conversaciones no agudas representan el 53,5 por ciento del conjunto de datos, las conversaciones de alta agudeza el 18,2 por ciento y las conversaciones emergentes el 28,3 por ciento.
  • Están representados cuatro perfiles de usuarios: adultos con un 68,1 por ciento, adolescentes con un 21,2 por ciento, médicos con un 5,8 por ciento y cuidadores con un 4,9 por ciento.
  • Las conversaciones se generaron sintéticamente utilizando técnicas de preservación de la privacidad que el artículo de investigación describe como similares a su metodología Clio, con el objetivo de reflejar los patrones de uso de salud mental de ChatGPT en el mundo real sin exponer a los usuarios reales.
  • Setenta tareas (5,8 por ciento del punto de referencia) conllevan un contexto de usuario anterior, como una pérdida reciente en la familia.
  • Más allá del inglés, el punto de referencia incluye 105 conversaciones en español, 54 en hindi, 34 en árabe y 29 en portugués, con conversaciones adicionales en alemán, italiano, persa, indonesio, turco y chino.

Cómo puntuaron los modelos

Las evaluaciones fueron calificadas por un evaluador automatizado (GPT-5.6 Sol que funciona con un alto esfuerzo de razonamiento) con cuatro juicios muestreados de forma independiente por tarea, y los resultados se pueden descomponer en diez ejes de comportamiento definidos por expertos que incluyen búsqueda de contexto, empatía, calibración de urgencia y prueba de realidad.

En los resultados informados de OpenAI, GPT-6 Astra obtuvo la puntuación más alta con un 57,3 por ciento, seguido por GPT-6 Sol con un 53,9 por ciento, Claude Opus 5.5 de Anthropic con un 52,4 por ciento y GPT-6 Luna con un 50,2 por ciento. Las generaciones anteriores quedaron muy por detrás: GPT-4o de marzo de 2025 obtuvo un 32,1 por ciento y Gemini 2.5 Pro obtuvo un 29,5 por ciento, y todas las cifras tienen intervalos de confianza del 95 por ciento.

Dos puntos de referencia enmarcan esas cifras. Las respuestas escritas con acceso completo a las rúbricas de calificación obtuvieron un puntaje del 99,0 por ciento (una prueba de cordura en el límite máximo de ruido de la evaluación), mientras que las respuestas escritas por los propios médicos obtuvieron solo un 38,5 por ciento, en gran parte porque los médicos escriben respuestas breves, de estilo personal, en lugar de respuestas integrales de chatbot.

OpenAI dijo que los resultados muestran una mejora constante en todas las generaciones de modelos, al tiempo que resaltan el margen de mejora en la búsqueda del contexto apropiado y la calibración de la urgencia. En particular, el artículo informa de una compensación: los modelos que son cautelosos en conversaciones emergentes y de alto riesgo pueden ser más lentos en participar en las cotidianas, y viceversa.

Los usuarios y expertos no están de acuerdo sobre cómo es "bueno"

Además del punto de referencia, OpenAI realizó un análisis separado con 44 adultos que habían utilizado la IA para la salud mental o el apoyo emocional, en representación de 16 países y 14 idiomas. Los participantes calificaron las respuestas del modelo y escribieron sus propios criterios, aunque su revisión se limitó a conversaciones no agudas para evitar exponerlos a material angustiante.

Las rúbricas de usuarios y expertos se alinearon en sólo el 25,7 por ciento del peso total de las rúbricas, con un 1,0 por ciento directamente contradictorio. Los usuarios enfatizaron los próximos pasos prácticos y el tono; Los expertos dieron mayor importancia a la recopilación de contexto relevante y a la interpretación cuidadosa de situaciones ambiguas. Conclusión de OpenAI: los comentarios de los usuarios son una señal coherente y complementaria, pero no intercambiable con las directrices clínicas y de seguridad.

Un diagnóstico auditable, no una tabla de clasificación

OpenAI es explícito en que MentalHealthBench es una herramienta de diagnóstico auditable en lugar de una tabla de clasificación definitiva, y que sus comparaciones de idiomas son descriptivas: no pueden aislar el efecto del idioma de las diferencias en agudeza, tema, cultura o perfil de usuario. El conjunto de datos está disponible para descargar y cada ejemplo lleva una cadena canary para que los investigadores puedan detectar si los datos se filtran a futuros corpus de entrenamiento.

La compañía también señaló esfuerzos relacionados, incluidas subvenciones de investigación para trabajos de salud mental de IA, reuniones de expertos con la Asociación sobre IA y asistencia para el esfuerzo independiente de evaluación de salud mental de Transluce.

Las advertencias son reales: las conversaciones son sintéticas, la calificación está automatizada y los propios modelos de OpenAI superan un punto de referencia diseñado por OpenAI. Pero al publicar abiertamente las rúbricas de expertos, la metodología de calificación y los datos, OpenAI ha brindado a los reguladores, médicos y competidores un instrumento común para un dominio donde, como sugieren las propias cifras de uso semanal de la compañía, lo que está en juego sigue aumentando.

---

Manténgase a la vanguardia de la IA

Obtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.

Leer más noticias sobre IA →