OpenAI a présenté mercredi MentalHealthBench, une référence ouverte de 1 215 conversations synthétiques sur la santé mentale conçue pour mesurer la façon dont les systèmes d'IA réagissent dans des scénarios réalistes – des questions de bien-être quotidiennes aux crises urgentes – chaque scénario étant examiné et noté par des cliniciens agréés.
Cette version compte bien au-delà des propres modèles d'OpenAI. Plus d'un milliard de personnes utilisent ChatGPT chaque semaine, selon l'entreprise, et les chatbots IA sont discrètement devenus un premier arrêt pour les personnes en détresse émotionnelle. Jusqu’à présent, l’industrie manquait d’un critère rigoureux et partagé pour ce comportement. Pour plus de contexte sur cette histoire, consultez notre couverture continue de l'industrie de l'IA.
Construit avec plus de 80 cliniciens dans 22 pays
OpenAI a co-créé la référence avec une cohorte de plus de 80 psychologues et psychiatres agréés dans 22 pays, qui parlent collectivement 19 langues et représentent près de 20 sous-spécialités de la santé mentale, selon la couverture de l'annonce par Unite.AI. La version complète contient 5 262 critères de rubrique rédigés par des experts.
Chaque conversation a été examinée par au moins trois experts selon un processus en trois étapes : deux cliniciens ont rédigé des critères pondérés de manière indépendante, un troisième les a évalués et affinés, et seuls les critères convenus par au moins deux experts – et non contredits par un tiers – ont été retenus. Chaque critère cible un seul aspect de la réponse d'un modèle et porte une pondération de -10 à +10, les valeurs absolues plus élevées indiquant une plus grande importance clinique.
Le PDG de l'American Psychological Association, le Dr Arthur Evans, a été cité dans l'annonce, affirmant que la santé mentale existe sur un continuum et que les systèmes d'IA qui engagent des personnes dans ce domaine doivent être fondés à la fois sur la science clinique et sur l'expérience vécue.
Qu'y a-t-il dans le benchmark
Les 1 215 conversations varient délibérément en termes de gravité et de personnes demandant de l'aide :
- Les conversations non aiguës représentent 53,5 % de l'ensemble de données, les conversations de haute acuité 18,2 % et les conversations émergentes 28,3 %.
- Quatre profils d'utilisateurs sont représentés : les adultes à 68,1 pour cent, les adolescents à 21,2 pour cent, les cliniciens à 5,8 pour cent et les soignants à 4,9 pour cent.
- Les conversations ont été générées de manière synthétique à l'aide de techniques de préservation de la vie privée que le document de recherche décrit comme similaires à sa méthodologie Clio, visant à refléter les modèles d'utilisation réels de la santé mentale ChatGPT sans exposer les utilisateurs réels.
- Soixante-dix tâches (5,8 % du benchmark) portent sur un contexte utilisateur antérieur, comme une perte récente dans la famille.
- Au-delà de l'anglais, le benchmark comprend 105 conversations en espagnol, 54 en hindi, 34 en arabe et 29 en portugais, avec des conversations supplémentaires en allemand, italien, persan, indonésien, turc et chinois.
Comment les modèles ont obtenu leurs scores
Les évaluations ont été notées par un évaluateur automatisé – GPT-5.6 Sol fonctionnant avec un effort de raisonnement élevé – avec quatre jugements échantillonnés indépendamment par tâche, et les résultats peuvent être décomposés en dix axes comportementaux définis par des experts, notamment la recherche de contexte, l'empathie, l'étalonnage d'urgence et les tests de réalité.
Dans les résultats rapportés par OpenAI, GPT-6 Astra a obtenu le score le plus élevé à 57,3 %, suivi de GPT-6 Sol à 53,9 %, Claude Opus 5,5 d'Anthropic à 52,4 % et GPT-6 Luna à 50,2 %. Les générations plus âgées sont loin derrière : GPT-4o de mars 2025 a obtenu un score de 32,1 % et Gemini 2.5 Pro un score de 29,5 %, tous les chiffres comportant des intervalles de confiance de 95 %.
Deux points de référence encadrent ces chiffres. Les réponses rédigées avec un accès complet aux grilles de notation ont obtenu un score de 99,0 pour cent - un contrôle de cohérence sur le plafond de bruit de l'évaluation - tandis que les réponses rédigées par les cliniciens eux-mêmes n'ont obtenu que 38,5 pour cent, en grande partie parce que les cliniciens écrivent des réponses courtes, en personne plutôt que des réponses complètes du chatbot.
OpenAI a déclaré que les résultats montrent une amélioration constante au fil des générations de modèles, tout en soulignant les possibilités d'amélioration dans la recherche d'un contexte approprié et le calibrage de l'urgence. L’article fait notamment état d’un compromis : les modèles prudents dans les conversations émergentes et à haut risque peuvent être plus lents à s’engager dans les conversations quotidiennes, et vice versa.
Les utilisateurs et les experts ne sont pas d'accord sur ce à quoi ressemble le « bien »
Parallèlement à l'analyse comparative, OpenAI a mené une analyse distincte auprès de 44 adultes ayant utilisé l'IA à des fins de santé mentale ou de soutien émotionnel, représentant 16 pays et 14 langues. Les participants ont évalué les réponses des modèles et rédigé leurs propres critères, bien que leur examen se soit limité aux conversations non aiguës pour éviter de les exposer à des éléments pénibles.
Les rubriques des utilisateurs et des experts ne représentent que 25,7 % du poids total de la rubrique, dont 1,0 % directement contradictoires. Les utilisateurs ont mis l’accent sur les prochaines étapes pratiques et le ton ; les experts ont accordé une plus grande importance à la collecte d’un contexte pertinent et à une interprétation prudente des situations ambiguës. Conclusion d'OpenAI : le retour des utilisateurs est un signal cohérent et complémentaire, mais non interchangeable avec les conseils cliniques et de sécurité.
Un diagnostic vérifiable, pas un classement
OpenAI indique explicitement que MentalHealthBench est un outil de diagnostic vérifiable plutôt qu'un classement définitif, et que ses comparaisons linguistiques sont descriptives : elles ne peuvent pas isoler l'effet de la langue des différences d'acuité, de sujet, de culture ou de profil d'utilisateur. L'ensemble de données est disponible en téléchargement et chaque exemple comporte une chaîne canari afin que les chercheurs puissent détecter si les données fuient dans les futurs corpus de formation.
La société a également souligné les efforts connexes, notamment les subventions de recherche pour les travaux sur la santé mentale de l'IA, les réunions d'experts avec le Partenariat sur l'IA et l'assistance aux efforts indépendants d'évaluation de la santé mentale de Transluce.
Les mises en garde sont réelles : les conversations sont synthétiques, la notation est automatisée et les propres modèles d'OpenAI sont supérieurs à une référence conçue par OpenAI. Mais en publiant ouvertement les rubriques d'experts, la méthodologie de notation et les données, OpenAI a fourni aux régulateurs, aux cliniciens et aux concurrents un instrument commun pour un domaine où, comme le suggèrent les chiffres d'utilisation hebdomadaires de l'entreprise, les enjeux ne cessent d'augmenter.
---
Gardez une longueur d'avance sur l'IARecevez les dernières actualités, analyses et avancées en matière d'IA, le tout en un seul endroit.
Lire plus d'actualités sur l'IA →