OpenAI ngenalake MentalHealthBench dina Rebo, pathokan mbukak 1,215 obrolan kesehatan mental sintetik sing dirancang kanggo ngukur cara sistem AI nanggapi ing skenario sing nyata - saka pitakonan kesejahteraan saben dina nganti krisis sing penting - kanthi saben skenario ditinjau lan dicetak dening dokter sing dilisensi.

Rilis kasebut luwih penting tinimbang model OpenAI dhewe. Luwih saka siji milyar wong nggunakake ChatGPT saben minggu, miturut perusahaan, lan AI chatbots sepi dadi mandeg pisanan kanggo wong-wong sing nandhang sangsara marga saka emosi. Nganti saiki, industri kasebut ora duwe ukuran sing ketat lan nuduhake prilaku kasebut. Kanggo konteks liyane babagan crita iki, deleng [liputan industri AI] (https://aibuzzwire.news).

Dibangun karo luwih saka 80 dokter ing 22 negara

OpenAI nggawe pathokan kasebut kanthi kohort luwih saka 80 psikolog lan psikiater sing dilisensi ing 22 negara, sing bebarengan nganggo 19 basa lan makili meh 20 subspesialisasi kesehatan mental, miturut jangkoan woro-woro dening Unite.AI. Rilis lengkap ngemot 5.262 kriteria rubrik sing ditulis pakar.

Saben obrolan dideleng dening paling ora telung ahli liwat proses telung tahap: loro klinisi independen nulis kritéria bobot, katelu diadili lan olahan, lan mung kritéria sing disepakati dening paling ora rong ahli - lan ora mbantah karo pihak katelu - ditahan. Saben kriteria ngarahake aspek siji saka respon model lan bobote saka -10 nganti +10, kanthi nilai absolut sing luwih gedhe sing nuduhake pentinge klinis sing luwih gedhe.

CEO Asosiasi Psikologi Amerika, Dr. Arthur Evans, dipetik ing woro-woro kasebut ujar manawa kesehatan mental ana terus-terusan, lan sistem AI sing melu wong ing macem-macem kasebut mbutuhake dhasar ing ilmu klinis lan pengalaman urip.

Apa ing pathokan

1,215 obrolan kasebut kanthi sengaja beda-beda ing tingkat keruwetan lan sapa sing njaluk pitulung:

  • Obrolan non-akut nyatakake 53,5 persen saka dataset, ketajaman dhuwur obrolan kanggo 18,2 persen, lan obrolan muncul kanggo 28,3 persen.
  • Sekawan profil pangguna diwakili: wong diwasa 68,1 persen, remaja 21,2 persen, dokter ing 5,8 persen, lan pengasuh 4,9 persen.
  • Obrolan kasebut digawe sacara sintetik nggunakake teknik njaga privasi sing diterangake ing kertas riset kasebut padha karo metodologi Clio, kanthi tujuan nggambarake pola panggunaan kesehatan mental ChatGPT ing jagad nyata tanpa mbabarake pangguna nyata.
  • Tujuh puluh tugas - 5,8 persen saka pathokan - nindakake konteks pangguna sadurunge, kayata mundhut anyar ing kulawarga.
  • Ngluwihi basa Inggris, pathokan kalebu 105 obrolan Spanyol, 54 Hindi, 34 Arab, lan 29 Portugis, kanthi obrolan tambahan ing basa Jerman, Italia, Persia, Indonesia, Turki, lan Cina.

Carane model ngetung

Evaluasi padha ngetung dening grader otomatis - GPT-5.6 Sol mlaku ing gaweyan pertimbangan dhuwur - karo papat kaputusan sampel independen saben tugas, lan asil bisa decomposed tengen sepuluh sumbu prilaku pakar-ditetepake kalebu konteks seeking, empathy, kalibrasi urgency, lan testing kasunyatan.

Ing asil OpenAI kang dilapurake, GPT-6 Astra skor paling dhuwur ing 57,3 persen, ngiring dening GPT-6 Sol ing 53,9 persen, Anthropic's Claude Opus 5,5 ing 52,4 persen, lan GPT-6 Luna ing 50,2 persen. Generasi lawas ketinggalan: GPT-4o wiwit Maret 2025 ngetung 32,1 persen lan Gemini 2.5 Pro ngetung 29,5 persen, kanthi kabeh tokoh nggawa interval kapercayan 95 persen.

Loro titik referensi pigura angka kasebut. Rampung sing ditulis kanthi akses lengkap menyang rubrik penilaian ngetung 99,0 persen - mriksa kewarasan ing langit-langit gangguan evaluasi - dene completion sing ditulis dening dokter dhewe mung ngetung 38,5 persen, umume amarga dokter nulis tanggapan kanthi gaya pribadi tinimbang balesan chatbot lengkap.

OpenAI ujar manawa asil kasebut nuduhake perbaikan sing tetep ing antarane generasi model, nalika nyorot ruangan kanggo nambah konteks sing cocog lan kalibrasi urgensi. Utamane, koran kasebut nglaporake tradeoff: model sing ngati-ati babagan obrolan sing muncul, berisiko dhuwur bisa luwih alon kanggo nindakake saben dina, lan kosok balene.

Pangguna lan ahli ora setuju babagan "apik" kaya apa

Saliyane pathokan kasebut, OpenAI nindakake analisis kapisah karo 44 wong diwasa sing wis nggunakake AI kanggo kesehatan mental utawa dhukungan emosional, sing makili 16 negara lan 14 basa. Peserta menehi rating respon model lan nulis kritéria dhewe, sanajan review kasebut diwatesi kanggo obrolan sing ora akut supaya ora mbukak materi sing nyusahake.

Rubrik pangguna lan ahli didadekake siji mung 25,7 persen saka total bobot rubrik, kanthi 1,0 persen langsung kontradiktif. Pangguna nandheske praktis langkah lan nada sabanjure; ahli sijine bobot luwih ing ngumpulake konteks cocog lan kasebut kanthi teliti, interpretasi kahanan ambigu. Kesimpulan OpenAI: umpan balik pangguna minangka sinyal sing koheren lan komplementer, nanging ora bisa diganti karo pandhuan klinis lan safety.

Diagnosa sing bisa diaudit, dudu papan pimpinan

OpenAI kanthi eksplisit yen MentalHealthBench minangka alat diagnostik sing bisa diaudit tinimbang papan pimpinan sing definitif, lan perbandingan basa kasebut deskriptif - ora bisa ngisolasi efek basa saka bedane ketajaman, topik, budaya, utawa profil pangguna. Dataset kasedhiya kanggo diundhuh, lan saben conto ngemot senar kenari supaya peneliti bisa ndeteksi yen data kasebut bocor menyang korpora latihan ing mangsa ngarep.

Perusahaan kasebut uga nuduhake upaya sing ana gandhengane, kalebu hibah riset kanggo pakaryan kesehatan mental AI, rapat ahli karo Kemitraan babagan AI, lan pitulungan kanggo upaya evaluasi kesehatan mental independen Transluce.

Caveat kasebut nyata: obrolan kasebut sintetik, gradasi otomatis, lan model OpenAI dhewe minangka benchmark sing dirancang OpenAI. Nanging kanthi ngeculake rubrik pakar, metodologi penilaian, lan data kanthi terbuka, OpenAI wis menehi regulator, dokter, lan pesaing minangka instrumen umum kanggo domain ing ngendi - kaya sing disaranake nomer panggunaan mingguan perusahaan - taruhan terus mundhak.

---

Tetep Ahead of AI

Entuk warta, analisis, lan terobosan AI paling anyar - kabeh ing sak panggonan.

Waca liyane AI warta →