OpenAI introducerade MentalHealthBench på onsdagen, ett öppet riktmärke av 1 215 syntetiska samtal om mental hälsa utformade för att mäta hur AI-system reagerar i realistiska scenarier – från vardagliga frågor om välbefinnande till akuta kriser – med varje scenario granskat och poängsatt av licensierade läkare.
Releasen har betydelse långt utöver OpenAI:s egna modeller. Mer än en miljard människor använder ChatGPT varje vecka, enligt företaget, och AI-chatbotar har tyst blivit ett första stopp för människor i känslomässig nöd. Fram till nu har branschen saknat en rigorös, delad måttstock för det beteendet. För mer sammanhang om den här historien, se vår pågående AI-industribevakning.
Byggd med mer än 80 läkare i 22 länder
OpenAI skapade riktmärket tillsammans med en kohort av mer än 80 licensierade psykologer och psykiatriker i 22 länder, som tillsammans talar 19 språk och representerar nästan 20 underspecialiteter inom mental hälsa, enligt bevakningen av tillkännagivandet av Unite.AI. Den fullständiga versionen innehåller 5 262 expertförfattade rubrikkriterier.
Varje konversation granskades av minst tre experter genom en process i tre steg: två kliniker skrev självständigt viktade kriterier, en tredje bedömde och förfinade dem, och endast kriterier som kommit överens om av minst två experter - och inte motsägs av en tredje - behölls. Varje kriterium riktar sig mot en enskild aspekt av en modells svar och har en vikt från -10 till +10, med större absoluta värden som indikerar större klinisk betydelse.
American Psychological Associations VD, Dr. Arthur Evans, citerades i tillkännagivandet och sa att mental hälsa existerar på ett kontinuum och att AI-system som engagerar människor över hela det området behöver grund i både klinisk vetenskap och levd erfarenhet.
Vad står i riktmärket
De 1 215 samtalen varierar medvetet i svårighetsgrad och i vem som ber om hjälp:
- Icke-akuta konversationer står för 53,5 procent av datamängden, konversationer med hög skärpa för 18,2 procent och konversationer för 28,3 procent.
- Konversationerna skapades syntetiskt med hjälp av integritetsbevarande tekniker som forskningsartikeln beskriver som liknar dess Clio-metodik, som syftar till att återspegla verkliga ChatGPT-användningsmönster för mental hälsa utan att avslöja riktiga användare.
- Sjuttio uppgifter - 5,8 procent av riktmärket - har tidigare användarkontext, till exempel en nyligen förlust i familjen.
- Utöver engelska inkluderar riktmärket 105 spanska, 54 hindi, 34 arabiska och 29 portugisiska samtal, med ytterligare samtal på tyska, italienska, persiska, indonesiska, turkiska och kinesiska.
Hur modellerna fick poäng
Utvärderingar gjordes av en automatiserad grader – GPT-5.6 Sol som körs med hög resonemangsansträngning – med fyra oberoende samplade bedömningar per uppgift, och resultaten kan delas upp över tio expertdefinierade beteendeaxlar inklusive kontextsökning, empati, brådskande kalibrering och verklighetstester.
I OpenAIs rapporterade resultat fick GPT-6 Astra högst poäng på 57,3 procent, följt av GPT-6 Sol på 53,9 procent, Anthropics Claude Opus 5,5 på 52,4 procent och GPT-6 Luna på 50,2 procent. Äldre generationer låg långt efter: GPT-4o från mars 2025 fick 32,1 procent och Gemini 2.5 Pro fick 29,5 procent, med alla siffror med 95 procents konfidensintervall.
Två referenspunkter ramar in dessa siffror. Slutföranden skrivna med full tillgång till betygskriterierna fick 99,0 procent – en förnuftskontroll på utvärderingens bullertak – medan slutföranden skrivna av kliniker själva fick bara 38,5 procent, till stor del på grund av att kliniker skriver korta, personliga svar snarare än omfattande chatbotsvar.
OpenAI sa att resultaten visar stadiga förbättringar över modellgenerationer, samtidigt som de lyfter fram utrymme att förbättra när det gäller att söka lämpligt sammanhang och kalibrera brådska. Noterbart rapporterar tidningen en avvägning: modeller som är försiktiga med framväxande, högriskkonversationer kan vara långsammare att engagera sig i vardagliga, och vice versa.
Användare och experter är oense om hur "bra" ser ut
Vid sidan av riktmärket gjorde OpenAI en separat analys med 44 vuxna som hade använt AI för mental hälsa eller känslomässigt stöd, representerande 16 länder och 14 språk. Deltagarna betygsatte modellsvar och skrev sina egna kriterier, även om deras granskning var begränsad till icke-akuta konversationer för att undvika att utsätta dem för plågsamt material.
Användar- och expertrubriken ligger i linje med bara 25,7 procent av den totala rubrikens vikt, med 1,0 procent direkt motsägelsefulla. Användare betonade praktiska nästa steg och ton; experter lade större vikt vid att samla relevant sammanhang och noggrant tolka tvetydiga situationer. OpenAI:s slutsats: feedback från användare är en sammanhängande och kompletterande signal, men inte utbytbar med klinisk vägledning och säkerhetsvägledning.
En kontrollbar diagnostik, inte en topplista
OpenAI är tydligt att MentalHealthBench är ett auditerbart diagnostiskt verktyg snarare än en definitiv topplista, och att dess språkjämförelser är beskrivande - de kan inte isolera effekten av språk från skillnader i skärpa, ämne, kultur eller användarprofil. Datauppsättningen är tillgänglig för nedladdning, och varje exempel har en kanariefågel så att forskare kan upptäcka om data läcker in i framtida träningskorpus.
Företaget pekade också på relaterade insatser, inklusive forskningsanslag för AI-arbete inom mental hälsa, expertmöten med Partnership on AI och assistans för Transluces oberoende insats för utvärdering av mental hälsa.
Förbehållen är verkliga: konversationerna är syntetiska, betygsättningen är automatiserad och OpenAI:s egna modeller toppar ett benchmark som OpenAI designat. Men genom att släppa expertrubriken, betygsmetoden och data öppet har OpenAI gett tillsynsmyndigheter, kliniker och konkurrenter ett gemensamt instrument för en domän där - som företagets egna veckovisa användningssiffror antyder - insatserna fortsätter att öka.
---
Stay ahead of AIFå de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.
Läs mer AI-nyheter →