OpenAI a introdus miercuri MentalHealthBench, un etalon deschis de 1.215 conversații sintetice privind sănătatea mintală, concepute pentru a măsura modul în care sistemele AI răspund în scenarii realiste – de la întrebările de zi cu zi de bunăstare până la crize urgente – cu fiecare scenariu revizuit și punctat de clinicieni autorizați.

Lansarea contează cu mult dincolo de propriile modele OpenAI. Potrivit companiei, mai mult de un miliard de oameni folosesc ChatGPT în fiecare săptămână, iar chatboții AI au devenit în liniște o primă oprire pentru persoanele aflate în dificultate emoțională. Până acum, industriei i-a lipsit un criteriu riguros și comun pentru acest comportament. Pentru mai mult context asupra acestei povești, consultați [acoperirea industriei AI] (https://aibuzzwire.news).

Construit cu peste 80 de clinicieni din 22 de țări

OpenAI a creat standardul cu o cohortă de peste 80 de psihologi și psihiatri autorizați din 22 de țări, care vorbesc în mod colectiv 19 limbi și reprezintă aproape 20 de subspecialități de sănătate mintală, potrivit acoperirii anunțului de Unite.AI. Versiunea completă conține 5.262 de criterii de rubrică scrise de experți.

Fiecare conversație a fost revizuită de cel puțin trei experți printr-un proces în trei etape: doi clinicieni au creat criterii ponderate în mod independent, un al treilea le-a adjudecat și le-a rafinat și au fost reținute numai criteriile convenite de cel puțin doi experți - și care nu au fost contrazise de un al treilea -. Fiecare criteriu vizează un singur aspect al răspunsului unui model și are o pondere de la -10 la +10, cu valori absolute mai mari indicând o importanță clinică mai mare.

Directorul general al Asociației Americane de Psihologie, dr. Arthur Evans, a fost citat în anunț spunând că sănătatea mintală există într-un continuum și că sistemele de inteligență artificială care implică oamenii din această gamă au nevoie atât de știința clinică, cât și de experiența trăită.

Ce este în benchmark

Cele 1.215 conversații sunt variate în mod deliberat în severitate și în cine cere ajutor:

  • Conversațiile neacute reprezintă 53,5% din setul de date, conversațiile cu acuitate ridicată pentru 18,2% și conversațiile emergente pentru 28,3%.
  • Sunt reprezentate patru profiluri de utilizatori: adulți la 68,1 la sută, adolescenți la 21,2 la sută, clinicieni la 5,8 la sută și îngrijitorii la 4,9 la sută.
  • Conversațiile au fost generate sintetic folosind tehnici de păstrare a confidențialității, pe care lucrarea de cercetare le descrie ca fiind similare cu metodologia sa Clio, având ca scop să reflecte modelele de utilizare a sănătății mintale ChatGPT din lumea reală, fără a expune utilizatorii reali.
  • Șaptezeci de sarcini — 5,8 la sută din benchmark — poartă contextul utilizatorului anterior, cum ar fi o pierdere recentă în familie.
  • Dincolo de engleză, testul de referință include 105 conversații în spaniolă, 54 hindi, 34 în arabă și 29 în portugheză, cu conversații suplimentare în germană, italiană, persană, indoneziană, turcă și chineză.

Cum au marcat modelele

Evaluările au fost punctate de un evaluator automat – GPT-5.6 Sol care rulează cu un efort mare de raționament – cu patru judecăți eșantionate independent pentru fiecare sarcină, iar rezultatele pot fi descompuse pe zece axe comportamentale definite de experți, inclusiv căutarea contextului, empatia, calibrarea de urgență și testarea realității.

În rezultatele raportate de OpenAI, GPT-6 Astra a obținut cel mai mare scor cu 57,3%, urmat de GPT-6 Sol cu ​​53,9%, Claude Opus de la Anthropic 5,5 cu 52,4% și GPT-6 Luna cu 50,2%. Generațiile mai în vârstă au rămas cu mult în urmă: GPT-4o din martie 2025 a obținut 32,1 la sută, iar Gemini 2.5 Pro a obținut 29,5 la sută, toate cifrele având intervale de încredere de 95 la sută.

Două puncte de referință încadrează acele numere. Terminările scrise cu acces deplin la rubricile de notare au obținut un scor de 99,0 la sută - o verificare a nivelului de zgomot al evaluării - în timp ce completările scrise de clinicieni au obținut doar 38,5 la sută, în mare parte pentru că clinicienii scriu răspunsuri scurte, în stil personal, mai degrabă decât răspunsuri cuprinzătoare pe chatbot.

OpenAI a spus că rezultatele arată o îmbunătățire constantă de-a lungul generațiilor de modele, subliniind în același timp spațiu de îmbunătățire în căutarea contextului adecvat și calibrarea urgenței. În special, lucrarea raportează un compromis: modelele care sunt precaute cu conversațiile emergente, cu risc ridicat, pot fi mai lente în a se implica în cele de zi cu zi și invers.

Utilizatorii și experții nu sunt de acord cu privire la cum arată „binele”.

Pe lângă criteriul de referință, OpenAI a efectuat o analiză separată cu 44 de adulți care au folosit IA pentru sănătatea mintală sau pentru sprijin emoțional, reprezentând 16 țări și 14 limbi. Participanții au evaluat răspunsurile model și și-au scris propriile criterii, deși revizuirea lor s-a limitat la conversații non-acute pentru a evita expunerea lor la materiale supărătoare.

Rubricile utilizatorilor și experților s-au aliniat la doar 25,7% din greutatea totală a rubricii, cu 1,0% direct contradictorii. Utilizatorii au subliniat următorii pași practici și ton; experții au acordat o importanță mai mare colectării contextului relevant și interpretării cu atenție a situațiilor ambigue. Concluzia OpenAI: feedback-ul utilizatorului este un semnal coerent și complementar, dar nu este interschimbabil cu îndrumările clinice și de siguranță.

Un diagnostic auditabil, nu un clasament

OpenAI este explicit că MentalHealthBench este un instrument de diagnostic auditabil mai degrabă decât un clasament definitiv și că comparațiile sale de limbă sunt descriptive - nu pot izola efectul limbajului de diferențele de acuitate, subiect, cultură sau profil de utilizator. Setul de date este disponibil pentru descărcare, iar fiecare exemplu poartă un șir canar, astfel încât cercetătorii să poată detecta dacă datele se scurg în corpurile de antrenament viitoare.

Compania a subliniat, de asemenea, eforturile conexe, inclusiv granturi de cercetare pentru munca în domeniul sănătății mintale AI, reuniuni ale experților cu Parteneriatul pentru IA și asistență pentru efortul de evaluare independent al sănătății mintale al Transluce.

Avertismentele sunt reale: conversațiile sunt sintetice, notarea este automatizată, iar modelele proprii OpenAI depășesc un etalon de referință conceput de OpenAI. Dar prin lansarea deschisă a rubricilor de experți, a metodologiei de notare și a datelor, OpenAI a oferit autorităților de reglementare, clinicienilor și concurenților un instrument comun pentru un domeniu în care - după cum sugerează propriile cifre de utilizare săptămânală ale companiei - mizele continuă să crească.

---

Rămâneți înaintea AI

Obțineți cele mai recente știri, analize și descoperiri despre AI - toate într-un singur loc.

Citiți mai multe știri AI →