OpenAI memperkenalkan MentalHealthBench pada hari Rabu, sebuah tolok ukur terbuka dari 1.215 percakapan kesehatan mental sintetis yang dirancang untuk mengukur bagaimana sistem AI merespons dalam skenario yang realistis – mulai dari pertanyaan kesejahteraan sehari-hari hingga krisis yang mendesak – dengan setiap skenario ditinjau dan dinilai oleh dokter berlisensi.
Rilis ini jauh lebih penting daripada model OpenAI sendiri. Lebih dari satu miliar orang menggunakan ChatGPT setiap minggunya, menurut perusahaan tersebut, dan chatbot AI diam-diam menjadi perhentian pertama bagi orang-orang yang mengalami tekanan emosional. Hingga saat ini, industri ini masih belum mempunyai tolak ukur yang ketat dan seragam dalam menentukan perilaku tersebut. Untuk konteks lebih lanjut mengenai kisah ini, lihat liputan industri AI kami yang sedang berlangsung.
Dibangun dengan lebih dari 80 dokter di 22 negara
OpenAI bersama-sama menciptakan tolok ukur ini dengan lebih dari 80 psikolog dan psikiater berlisensi di 22 negara, yang secara kolektif berbicara dalam 19 bahasa dan mewakili hampir 20 subspesialisasi kesehatan mental, menurut liputan pengumuman oleh Unite.AI. Rilis lengkap berisi 5.262 kriteria rubrik yang ditulis oleh para ahli.
Setiap percakapan ditinjau oleh setidaknya tiga ahli melalui proses tiga tahap: dua dokter secara independen menyusun kriteria berbobot, yang ketiga menilai dan menyempurnakannya, dan hanya kriteria yang disetujui oleh setidaknya dua ahli – dan tidak bertentangan dengan yang ketiga – yang dipertahankan. Setiap kriteria menargetkan satu aspek respons model dan memiliki bobot dari -10 hingga +10, dengan nilai absolut yang lebih besar menunjukkan kepentingan klinis yang lebih besar.
CEO American Psychological Association, Dr. Arthur Evans, yang dikutip dalam pengumuman tersebut mengatakan bahwa kesehatan mental ada dalam sebuah kontinum, dan bahwa sistem AI yang melibatkan orang-orang dalam rentang tersebut perlu didasarkan pada ilmu klinis dan pengalaman hidup.
Apa yang ada di benchmark
1.215 percakapan tersebut sengaja dibuat bervariasi dalam tingkat keparahan dan siapa yang meminta bantuan:
- Percakapan non-akut menyumbang 53,5 persen dari kumpulan data, percakapan dengan ketajaman tinggi sebesar 18,2 persen, dan percakapan emergent sebesar 28,3 persen.
- Empat profil pengguna terwakili: dewasa sebesar 68,1 persen, remaja sebesar 21,2 persen, dokter sebesar 5,8 persen, dan perawat sebesar 4,9 persen.
- Percakapan dihasilkan secara sintetis menggunakan teknik menjaga privasi yang digambarkan oleh makalah penelitian serupa dengan metodologi Clio, yang bertujuan untuk mencerminkan pola penggunaan kesehatan mental ChatGPT di dunia nyata tanpa mengekspos pengguna sebenarnya.
- Tujuh puluh tugas — 5,8 persen dari tolok ukur — membawa konteks pengguna sebelumnya, seperti kehilangan anggota keluarga yang baru-baru ini terjadi.
- Selain bahasa Inggris, tolok ukurnya mencakup 105 percakapan bahasa Spanyol, 54 bahasa Hindi, 34 bahasa Arab, dan 29 bahasa Portugis, dengan tambahan percakapan dalam bahasa Jerman, Italia, Persia, Indonesia, Turki, dan Mandarin.
Bagaimana skor model
Evaluasi dinilai oleh penilai otomatis — GPT-5.6 Sol yang dijalankan dengan upaya penalaran tinggi — dengan empat penilaian sampel independen per tugas, dan hasilnya dapat dipecah menjadi sepuluh sumbu perilaku yang ditentukan oleh para ahli termasuk pencarian konteks, empati, kalibrasi urgensi, dan pengujian realitas.
Dalam hasil yang dilaporkan OpenAI, GPT-6 Astra mendapat skor tertinggi sebesar 57,3 persen, diikuti oleh GPT-6 Sol sebesar 53,9 persen, Claude Opus 5.5 dari Anthropic sebesar 52,4 persen, dan GPT-6 Luna sebesar 50,2 persen. Generasi yang lebih tua tertinggal jauh: GPT-4o dari Maret 2025 memperoleh skor 32,1 persen dan Gemini 2.5 Pro memperoleh skor 29,5 persen, dengan semua angka memiliki interval kepercayaan 95 persen.
Dua titik referensi membingkai angka-angka tersebut. Penyelesaian yang ditulis dengan akses penuh ke rubrik penilaian memperoleh skor 99,0 persen – pemeriksaan kewarasan pada batasan kebisingan evaluasi – sementara penyelesaian yang ditulis oleh dokter sendiri hanya memperoleh skor 38,5 persen, sebagian besar karena dokter menulis tanggapan yang singkat dan bergaya tatap muka dibandingkan balasan chatbot yang komprehensif.
OpenAI mengatakan bahwa hasilnya menunjukkan peningkatan yang stabil di seluruh generasi model, sekaligus menyoroti ruang untuk perbaikan dalam mencari konteks yang sesuai dan mengkalibrasi urgensi. Khususnya, makalah ini melaporkan adanya trade-off: model yang berhati-hati dalam percakapan yang bersifat darurat dan berisiko tinggi akan lebih lambat untuk dilakukan dalam percakapan sehari-hari, dan sebaliknya.
Pengguna dan pakar tidak sepakat mengenai apa yang dimaksud dengan "baik".
Selain tolok ukur tersebut, OpenAI juga melakukan analisis terpisah terhadap 44 orang dewasa yang telah menggunakan AI untuk kesehatan mental atau dukungan emosional, mewakili 16 negara dan 14 bahasa. Peserta menilai tanggapan model dan menulis kriteria mereka sendiri, meskipun tinjauan mereka dibatasi pada percakapan yang tidak akut untuk menghindari mereka terpapar pada materi yang menyusahkan.
Rubrik pengguna dan rubrik ahli hanya selaras pada 25,7 persen dari total bobot rubrik, dan 1,0 persennya bertentangan secara langsung. Pengguna menekankan langkah dan nada praktis selanjutnya; para ahli lebih menekankan pengumpulan konteks yang relevan dan menafsirkan situasi ambigu dengan hati-hati. Kesimpulan OpenAI: umpan balik pengguna adalah sinyal yang koheren dan saling melengkapi, namun tidak dapat dipertukarkan dengan panduan klinis dan keselamatan.
Diagnostik yang dapat diaudit, bukan papan peringkat
OpenAI secara eksplisit menyatakan bahwa MentalHealthBench adalah alat diagnostik yang dapat diaudit dan bukan papan peringkat definitif, dan bahwa perbandingan bahasanya bersifat deskriptif — perbandingan bahasanya tidak dapat mengisolasi pengaruh bahasa dari perbedaan ketajaman, topik, budaya, atau profil pengguna. Kumpulan data tersedia untuk diunduh, dan setiap contoh membawa string kenari sehingga peneliti dapat mendeteksi jika data bocor ke korpora pelatihan di masa mendatang.
Perusahaan juga menyebutkan upaya-upaya terkait, termasuk hibah penelitian untuk pekerjaan kesehatan mental AI, pertemuan para ahli dengan Kemitraan AI, dan bantuan untuk upaya evaluasi kesehatan mental independen Transluce.
Peringatannya nyata: percakapan bersifat sintetis, penilaian dilakukan secara otomatis, dan model OpenAI sendiri berada di puncak tolok ukur yang dirancang OpenAI. Namun dengan merilis rubrik ahli, metodologi penilaian, dan data secara terbuka, OpenAI telah memberikan instrumen umum kepada regulator, dokter, dan pesaing untuk sebuah domain yang — seperti yang ditunjukkan oleh angka penggunaan mingguan perusahaan — pertaruhannya terus meningkat.
---
Tetap Terdepan dalam AIDapatkan berita, analisis, dan terobosan AI terkini — semuanya di satu tempat.
Baca berita AI selengkapnya →