OpenAI introduceerde woensdag MentalHealthBench, een open benchmark van 1.215 synthetische gesprekken over geestelijke gezondheidszorg, ontworpen om te meten hoe AI-systemen reageren in realistische scenario's – van alledaagse welzijnsvragen tot urgente crises – waarbij elk scenario wordt beoordeeld en gescoord door bevoegde artsen.

De release is veel belangrijker dan de eigen modellen van OpenAI. Volgens het bedrijf gebruiken meer dan een miljard mensen wekelijks ChatGPT, en AI-chatbots zijn stilletjes een eerste stop geworden voor mensen in emotionele nood. Tot nu toe ontbeerde de sector een rigoureuze, gedeelde maatstaf voor dat gedrag. Voor meer context over dit verhaal, zie onze voortdurende AI-industrieverslaggeving.

Gebouwd met meer dan 80 artsen in 22 landen

OpenAI heeft de benchmark samen met een cohort van meer dan 80 gediplomeerde psychologen en psychiaters uit 22 landen gecreëerd, die gezamenlijk 19 talen spreken en bijna 20 subspecialismen op het gebied van de geestelijke gezondheidszorg vertegenwoordigen, zo blijkt uit berichtgeving over de aankondiging door Unite.AI. De volledige release bevat 5.262 door experts geschreven rubriekcriteria.

Elk gesprek werd beoordeeld door ten minste drie experts via een proces in drie fasen: twee clinici stelden onafhankelijk van elkaar gewogen criteria op, een derde beoordeelde en verfijnde deze, en alleen de criteria waarover ten minste twee experts overeenstemming hadden bereikt – en die niet door een derde werden tegengesproken – werden weerhouden. Elk criterium richt zich op een enkel aspect van de respons van een model en heeft een gewicht van -10 tot +10, waarbij grotere absolute waarden wijzen op een groter klinisch belang.

De CEO van de American Psychological Association, Dr. Arthur Evans, werd in de aankondiging geciteerd en zei dat geestelijke gezondheid zich op een continuüm afspeelt, en dat AI-systemen die mensen uit dat hele bereik aanspreken, een basis moeten hebben in zowel klinische wetenschap als geleefde ervaring.

Wat zit er in de benchmark

De 1.215 gesprekken zijn bewust gevarieerd in ernst en in wie om hulp vraagt:

  • Niet-acute gesprekken zijn goed voor 53,5 procent van de dataset, gesprekken met hoge scherpte voor 18,2 procent en opkomende gesprekken voor 28,3 procent.
  • Er zijn vier gebruikersprofielen vertegenwoordigd: volwassenen met 68,1 procent, tieners met 21,2 procent, artsen met 5,8 procent en zorgverleners met 4,9 procent.
  • De gesprekken werden synthetisch gegenereerd met behulp van privacybehoudende technieken die in het onderzoeksartikel worden beschreven als vergelijkbaar met de Clio-methodologie, met als doel om real-world ChatGPT-gebruikspatronen in de geestelijke gezondheidszorg te weerspiegelen zonder echte gebruikers bloot te leggen.
  • Zeventig taken – 5,8 procent van de benchmark – bevatten eerdere gebruikerscontext, zoals een recent verlies in de familie.
  • Naast het Engels omvat de benchmark 105 Spaanse, 54 Hindi, 34 Arabische en 29 Portugese gesprekken, met aanvullende gesprekken in het Duits, Italiaans, Perzisch, Indonesisch, Turks en Chinees.

Hoe de modellen scoorden

Evaluaties werden gescoord door een geautomatiseerde beoordelaar – GPT-5.6 Sol met hoge redeneerinspanning – met vier onafhankelijk bemonsterde oordelen per taak, en de resultaten kunnen worden ontleed over tien door experts gedefinieerde gedragsassen, waaronder contextzoeken, empathie, urgentiekalibratie en realiteitstests.

In de gerapporteerde resultaten van OpenAI scoorde GPT-6 Astra het hoogst met 57,3 procent, gevolgd door GPT-6 Sol met 53,9 procent, Claude Opus 5.5 van Anthropic met 52,4 procent en GPT-6 Luna met 50,2 procent. Oudere generaties bleven ver achter: GPT-4o uit maart 2025 scoorde 32,1 procent en Gemini 2.5 Pro scoorde 29,5 procent, waarbij alle cijfers een betrouwbaarheidsinterval van 95 procent hadden.

Twee referentiepunten omlijsten deze cijfers. Voltooiingen geschreven met volledige toegang tot de beoordelingsrubrieken scoorden 99,0 procent – ​​een controle op het ruisplafond van de evaluatie – terwijl voltooiingen geschreven door artsen zelf slechts 38,5 procent scoorden, grotendeels omdat artsen korte, persoonlijke antwoorden schrijven in plaats van uitgebreide chatbot-antwoorden.

OpenAI zei dat de resultaten een gestage verbetering laten zien over de modelgeneraties heen, terwijl er ruimte is voor verbetering bij het zoeken naar de juiste context en het kalibreren van de urgentie. Het artikel rapporteert met name een afweging: modellen die voorzichtig zijn bij opkomende gesprekken met een hoog risico kunnen langzamer zijn in het aangaan van alledaagse gesprekken, en vice versa.

Gebruikers en experts zijn het er niet over eens hoe 'goed' eruit ziet

Naast de benchmark voerde OpenAI een afzonderlijke analyse uit met 44 volwassenen die AI hadden gebruikt voor geestelijke gezondheid of emotionele ondersteuning, die 16 landen en 14 talen vertegenwoordigden. Deelnemers beoordeelden modelreacties en schreven hun eigen criteria, hoewel hun beoordeling beperkt was tot niet-acute gesprekken om te voorkomen dat ze werden blootgesteld aan verontrustend materiaal.

De rubrieken van gebruikers en experts kwamen overeen op slechts 25,7 procent van het totale gewicht van de rubrieken, waarbij 1,0 procent direct tegenstrijdig was. Gebruikers legden de nadruk op praktische vervolgstappen en toon; experts hechtten meer waarde aan het verzamelen van relevante context en het zorgvuldig interpreteren van dubbelzinnige situaties. De conclusie van OpenAI: gebruikersfeedback is een coherent en complementair signaal, maar niet uitwisselbaar met klinische en veiligheidsrichtlijnen.

Een controleerbare diagnose, geen scorebord

OpenAI maakt duidelijk dat MentalHealthBench een controleerbaar diagnostisch hulpmiddel is in plaats van een definitief klassement, en dat de taalvergelijkingen beschrijvend zijn: ze kunnen het effect van taal niet isoleren van verschillen in scherpte, onderwerp, cultuur of gebruikersprofiel. De dataset kan worden gedownload en bij elk voorbeeld is een kanarietekenreeks opgenomen, zodat onderzoekers kunnen detecteren of de gegevens in toekomstige trainingscorpora terechtkomen.

Het bedrijf wees ook op gerelateerde inspanningen, waaronder onderzoekssubsidies voor AI-werk op het gebied van de geestelijke gezondheidszorg, bijeenkomsten van deskundigen met het Partnership on AI en hulp voor Transluce's onafhankelijke evaluatie van de geestelijke gezondheidszorg.

De kanttekeningen zijn reëel: de gesprekken zijn synthetisch, de beoordeling is geautomatiseerd en de eigen modellen van OpenAI staan ​​bovenaan een door OpenAI ontworpen benchmark. Maar door de expertrubrieken, de beoordelingsmethodologie en de gegevens openlijk vrij te geven, heeft OpenAI regelgevers, artsen en concurrenten een gemeenschappelijk instrument gegeven voor een domein waar – zoals de wekelijkse gebruikscijfers van het bedrijf suggereren – de inzet blijft stijgen.

---

Blijf AI een stap voor

Ontvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.

Lees meer AI-nieuws →