Mercoledì OpenAI ha presentato MentalHealthBench, un benchmark aperto di 1.215 conversazioni sintetiche sulla salute mentale progettate per misurare il modo in cui i sistemi di intelligenza artificiale rispondono in scenari realistici – dalle domande sul benessere quotidiano alle crisi urgenti – con ogni scenario rivisto e valutato da medici autorizzati.
Il rilascio conta ben oltre i modelli stessi di OpenAI. Secondo l’azienda, più di un miliardo di persone utilizzano ChatGPT ogni settimana e i chatbot basati sull’intelligenza artificiale sono diventati silenziosamente la prima tappa per le persone in difficoltà emotiva. Fino ad ora, al settore mancava un parametro rigoroso e condiviso per tale comportamento. Per ulteriori informazioni su questa storia, consulta la nostra copertura del settore dell'intelligenza artificiale in corso.
Costruito con più di 80 medici in 22 paesi
OpenAI ha co-creato il benchmark con una coorte di oltre 80 psicologi e psichiatri autorizzati in 22 paesi, che parlano complessivamente 19 lingue e rappresentano quasi 20 sottospecialità di salute mentale, secondo la copertura dell'annuncio di Unite.AI. La versione completa contiene 5.262 criteri di rubriche redatte da esperti.
Ogni conversazione è stata esaminata da almeno tre esperti attraverso un processo in tre fasi: due medici hanno redatto in modo indipendente criteri ponderati, un terzo li ha giudicati e perfezionati e sono stati mantenuti solo i criteri concordati da almeno due esperti – e non contraddetti da un terzo. Ciascun criterio prende di mira un singolo aspetto della risposta di un modello e ha un peso compreso tra -10 e +10, con valori assoluti più grandi che indicano una maggiore importanza clinica.
L'amministratore delegato dell'American Psychological Association, il dottor Arthur Evans, è stato citato nell'annuncio affermando che la salute mentale esiste in un continuum e che i sistemi di intelligenza artificiale che coinvolgono persone in tale ambito necessitano di basi sia nella scienza clinica che nell'esperienza vissuta.
Cosa c'è nel benchmark
Le 1.215 conversazioni sono volutamente diverse in termini di gravità e di chi chiede aiuto:
- Le conversazioni non acute rappresentano il 53,5% del set di dati, le conversazioni ad alta gravità il 18,2% e le conversazioni emergenti il 28,3%.
- Sono rappresentati quattro profili utente: adulti al 68,1%, adolescenti al 21,2%, medici al 5,8% e operatori sanitari al 4,9%.
- Le conversazioni sono state generate sinteticamente utilizzando tecniche di tutela della privacy che il documento di ricerca descrive come simili alla metodologia Clio, con l'obiettivo di riflettere i modelli di utilizzo della salute mentale di ChatGPT nel mondo reale senza esporre gli utenti reali.
- Settanta attività – 5,8% del benchmark – riguardano il contesto precedente dell'utente, come una recente perdita in famiglia.
- Oltre all'inglese, il benchmark include 105 conversazioni in spagnolo, 54 in hindi, 34 in arabo e 29 in portoghese, con conversazioni aggiuntive in tedesco, italiano, persiano, indonesiano, turco e cinese.
Qual è stato il punteggio dei modelli
Le valutazioni sono state valutate da un selezionatore automatizzato – GPT-5.6 Sol che esegue un elevato sforzo di ragionamento – con quattro giudizi campionati in modo indipendente per attività, e i risultati possono essere scomposti su dieci assi comportamentali definiti dagli esperti tra cui ricerca del contesto, empatia, calibrazione dell’urgenza e test di realtà.
Nei risultati riportati da OpenAI, GPT-6 Astra ha ottenuto il punteggio più alto con il 57,3%, seguito da GPT-6 Sol con il 53,9%, Claude Opus 5.5 di Anthropic con il 52,4% e GPT-6 Luna con il 50,2%. Le generazioni più anziane sono rimaste ben indietro: GPT-4o di marzo 2025 ha ottenuto il 32,1% e Gemini 2.5 Pro ha ottenuto il 29,5%, con tutti i dati con intervalli di confidenza del 95%.
Due punti di riferimento inquadrano quei numeri. I completamenti scritti con pieno accesso alle rubriche di valutazione hanno ottenuto un punteggio del 99,0% – un controllo di integrità sul limite massimo di rumore della valutazione – mentre i completamenti scritti dai medici stessi hanno ottenuto solo il 38,5%, in gran parte perché i medici scrivono risposte brevi, in stile personale piuttosto che risposte esaurienti da chatbot.
OpenAI ha affermato che i risultati mostrano un miglioramento costante tra le generazioni di modelli, evidenziando al contempo margini di miglioramento nella ricerca del contesto appropriato e nella calibrazione dell’urgenza. In particolare, il documento segnala un compromesso: i modelli che sono cauti nei confronti delle conversazioni emergenti e ad alto rischio possono essere più lenti a impegnarsi in quelle quotidiane, e viceversa.
Utenti ed esperti non sono d'accordo su cosa significhi "buono".
Oltre al benchmark, OpenAI ha condotto un’analisi separata con 44 adulti che avevano utilizzato l’intelligenza artificiale per la salute mentale o il supporto emotivo, in rappresentanza di 16 paesi e 14 lingue. I partecipanti hanno valutato le risposte modello e hanno scritto i propri criteri, sebbene la loro revisione fosse limitata a conversazioni non acute per evitare di esporli a materiale angosciante.
Le rubriche degli utenti e degli esperti si allineavano solo per il 25,7% del peso totale delle rubriche, con l'1,0% direttamente contraddittorio. Gli utenti hanno sottolineato i passaggi pratici successivi e il tono; gli esperti attribuiscono maggiore importanza alla raccolta del contesto rilevante e all’interpretazione attenta delle situazioni ambigue. Conclusione di OpenAI: il feedback degli utenti è un segnale coerente e complementare, ma non intercambiabile con le linee guida cliniche e di sicurezza.
Una diagnostica verificabile, non una classifica
OpenAI afferma esplicitamente che MentalHealthBench è uno strumento diagnostico verificabile piuttosto che una classifica definitiva e che i suoi confronti linguistici sono descrittivi: non possono isolare l'effetto del linguaggio dalle differenze di acutezza, argomento, cultura o profilo utente. Il set di dati è disponibile per il download e ogni esempio contiene una stringa canary in modo che i ricercatori possano rilevare se i dati penetrano nei futuri corpora di formazione.
L’azienda ha anche sottolineato gli sforzi correlati, tra cui borse di ricerca per il lavoro sulla salute mentale dell’IA, riunioni di esperti con la Partnership on AI e assistenza per lo sforzo di valutazione indipendente della salute mentale di Transluce.
Le avvertenze sono reali: le conversazioni sono sintetiche, la valutazione è automatizzata e i modelli di OpenAI superano un benchmark progettato da OpenAI. Ma rilasciando apertamente le rubriche degli esperti, la metodologia di valutazione e i dati, OpenAI ha fornito ai regolatori, ai medici e ai concorrenti uno strumento comune per un settore in cui, come suggeriscono i numeri di utilizzo settimanale dell’azienda, la posta in gioco continua ad aumentare.
---
Stai al passo con l'intelligenza artificialeRicevi le ultime notizie, analisi e scoperte sull'intelligenza artificiale, tutto in un unico posto.
Leggi altre notizie sull'AI →