OpenAI ने बुधवारी MentalHealthBench सादर केले, AI सिस्टीम वास्तववादी परिस्थितींमध्ये कसा प्रतिसाद देतात हे मोजण्यासाठी डिझाइन केलेले 1,215 सिंथेटिक मानसिक आरोग्य संभाषणांचा खुला बेंचमार्क — दैनंदिन आरोग्याच्या प्रश्नांपासून ते तातडीच्या संकटांपर्यंत — प्रत्येक परिस्थितीचे पुनरावलोकन केले गेले आणि परवानाधारक डॉक्टरांनी गुण मिळवले.

OpenAI च्या स्वतःच्या मॉडेल्सच्या पलीकडे रिलीझचे महत्त्व आहे. कंपनीच्या म्हणण्यानुसार, दर आठवड्याला एक अब्जाहून अधिक लोक ChatGPT वापरतात आणि एआय चॅटबॉट्स भावनिक त्रासात असलेल्या लोकांसाठी शांतपणे पहिले स्थान बनले आहेत. आत्तापर्यंत, उद्योगाकडे त्या वर्तनासाठी कठोर, सामायिक मापदंडाचा अभाव आहे. या कथेच्या अधिक संदर्भासाठी, आमचे सध्या सुरू असलेले AI उद्योग कव्हरेज पहा.

22 देशांमधील 80 पेक्षा जास्त चिकित्सकांसह तयार केलेले

Unite.AI च्या घोषणेच्या कव्हरेजनुसार OpenAI ने 22 देशांमधील 80 पेक्षा जास्त परवानाधारक मानसशास्त्रज्ञ आणि मानसोपचारतज्ज्ञांच्या समूहासह बेंचमार्क तयार केला, जे एकत्रितपणे 19 भाषा बोलतात आणि जवळपास 20 मानसिक आरोग्य उप-विशेषांचे प्रतिनिधित्व करतात. पूर्ण प्रकाशनात 5,262 तज्ञ-लेखक रूब्रिक निकष आहेत.

प्रत्येक संभाषणाचे तीन-टप्प्यांवरील प्रक्रियेद्वारे किमान तीन तज्ञांनी पुनरावलोकन केले: दोन चिकित्सकांनी स्वतंत्रपणे भारित निकषांचे लेखन केले, तिसऱ्याने त्यांचा निर्णय घेतला आणि त्यांना परिष्कृत केले आणि केवळ किमान दोन तज्ञांनी मान्य केलेले निकष - आणि तिसऱ्याने विरोध केला नाही - राखून ठेवले. प्रत्येक निकष मॉडेलच्या प्रतिसादाच्या एका पैलूला लक्ष्य करतो आणि -10 ते +10 पर्यंत वजन असतो, मोठ्या निरपेक्ष मूल्यांसह अधिक नैदानिक ​​महत्त्व दर्शवते.

अमेरिकन सायकोलॉजिकल असोसिएशनचे सीईओ, डॉ. आर्थर इव्हान्स, या घोषणेमध्ये उद्धृत करण्यात आले होते की मानसिक आरोग्य अखंडपणे अस्तित्वात आहे आणि त्या श्रेणीतील लोकांना गुंतवून ठेवणाऱ्या AI प्रणालींना क्लिनिकल सायन्स आणि जिवंत अनुभव या दोन्ही गोष्टींमध्ये आधार असणे आवश्यक आहे.

बेंचमार्कमध्ये काय आहे

1,215 संभाषणे जाणूनबुजून तीव्रतेमध्ये भिन्न आहेत आणि कोण मदतीसाठी विचारत आहे:

  • तीव्र नसलेली संभाषणे डेटासेटच्या ५३.५ टक्के, उच्च-तीव्रता संभाषणे १८.२ टक्के, आणि २८.३ टक्के आविर्भावित संभाषणे.
  • चार वापरकर्ता प्रोफाइल दर्शविल्या जातात: प्रौढ 68.1 टक्के, किशोरवयीन 21.2 टक्के, चिकित्सक 5.8 टक्के आणि काळजीवाहू 4.9 टक्के.
  • रिसर्च पेपरमध्ये क्लिओ पद्धतीप्रमाणेच वर्णन केलेल्या गोपनीयता-संरक्षण तंत्रांचा वापर करून संभाषणे कृत्रिमरित्या व्युत्पन्न केली गेली होती, ज्याचा उद्देश वास्तविक वापरकर्त्यांना उघड न करता वास्तविक-जगातील ChatGPT मानसिक आरोग्य वापर पद्धती प्रतिबिंबित करण्याचा उद्देश आहे.
  • सत्तर कार्ये — बेंचमार्कच्या ५.८ टक्के — पूर्वीचा वापरकर्ता संदर्भ, जसे की कुटुंबातील अलीकडील नुकसान.
  • इंग्रजीच्या पलीकडे, बेंचमार्कमध्ये 105 स्पॅनिश, 54 हिंदी, 34 अरबी आणि 29 पोर्तुगीज संभाषणे, जर्मन, इटालियन, पर्शियन, इंडोनेशियन, तुर्की आणि चिनी भाषेतील अतिरिक्त संभाषणांचा समावेश आहे.

मॉडेल्सनी कसे स्कोअर केले

मूल्यमापन स्वयंचलित ग्रेडरद्वारे केले गेले — GPT-5.6 सोल उच्च तर्कशक्तीच्या प्रयत्नांवर चालत — प्रत्येक कार्यासाठी चार स्वतंत्रपणे नमुने घेतलेल्या निर्णयांसह, आणि संदर्भ शोधणे, सहानुभूती, तात्काळ कॅलिब्रेशन आणि वास्तविकता चाचणी यासह दहा तज्ञ-परिभाषित वर्तणूक अक्षांमध्ये परिणाम विघटित केले जाऊ शकतात.

OpenAI च्या अहवाल दिलेल्या निकालांमध्ये, *GPT-6 Astra ने सर्वाधिक 57.3 टक्के गुण मिळवले, त्यानंतर GPT-6 सोलने 53.9 टक्के, Anthropic's Claude Opus 5.5 52.4 टक्के आणि GPT-6 लुना 50.2 टक्के गुण मिळवले. जुन्या पिढ्या खूप मागे आहेत: मार्च 2025 पासून GPT-4o ने 32.1 टक्के गुण मिळवले आणि जेमिनी 2.5 प्रो ने 29.5 टक्के गुण मिळवले, सर्व आकडे 95 टक्के आत्मविश्वास अंतरांसह आहेत.

दोन संदर्भ बिंदू त्या संख्यांना फ्रेम करतात. ग्रेडिंग रुब्रिक्समध्ये पूर्ण प्रवेशासह लिहिलेल्या पूर्णतेने 99.0 टक्के गुण मिळवले — मूल्यांकनाच्या आवाजाच्या कमाल मर्यादेवर एक विवेकी तपासणी — तर स्वतः चिकित्सकांनी लिहिलेल्या पूर्णतेने केवळ 38.5 टक्के गुण मिळवले, मुख्यत्वे कारण चिकित्सक व्यापक चॅटबॉट प्रतिनिधींऐवजी लहान, वैयक्तिक शैलीतील प्रतिसाद लिहितात.

OpenAI ने सांगितले की परिणाम मॉडेल पिढ्यांमध्ये स्थिर सुधारणा दर्शवितात, तसेच योग्य संदर्भ शोधण्यात आणि तात्काळ कॅलिब्रेट करण्यासाठी सुधारण्यासाठी खोली हायलाइट करतात. विशेष म्हणजे, पेपर एक ट्रेडऑफचा अहवाल देतो: जे मॉडेल उदयोन्मुख, उच्च-जोखमीच्या संभाषणांवर सावध असतात ते दररोजच्या संभाषणांमध्ये व्यस्त राहण्यासाठी हळू असू शकतात आणि त्याउलट.

"चांगले" कसे दिसते यावर वापरकर्ते आणि तज्ञ असहमत आहेत

बेंचमार्कच्या बरोबरीने, ओपनएआयने 16 देश आणि 14 भाषांचे प्रतिनिधीत्व करत, मानसिक आरोग्य किंवा भावनिक समर्थनासाठी AI वापरलेल्या 44 प्रौढांसोबत स्वतंत्र विश्लेषण केले. सहभागींनी मॉडेल प्रतिसादांना रेट केले आणि त्यांचे स्वतःचे निकष लिहिले, जरी त्यांचे पुनरावलोकन त्यांना त्रासदायक सामग्रीच्या समोर येऊ नये म्हणून गैर-तीव्र संभाषणांपुरते मर्यादित होते.

वापरकर्ता आणि तज्ञ रुब्रिक्स एकूण रुब्रिक वजनाच्या फक्त 25.7 टक्के वर संरेखित केले आहेत, 1.0 टक्के थेट विरोधाभासी आहेत. वापरकर्त्यांनी व्यावहारिक पुढील चरणांवर आणि टोनवर जोर दिला; तज्ञांनी संबंधित संदर्भ एकत्रित करण्यावर आणि संदिग्ध परिस्थितींचा काळजीपूर्वक अर्थ लावण्यावर अधिक वजन ठेवले. ओपनएआयचा निष्कर्ष: वापरकर्ता अभिप्राय एक सुसंगत आणि पूरक सिग्नल आहे, परंतु क्लिनिकल आणि सुरक्षा मार्गदर्शनासह अदलाबदल करता येणार नाही.

ऑडिटेबल डायग्नोस्टिक, लीडरबोर्ड नाही

OpenAI स्पष्टपणे सांगते की MentalHealthBench हे निश्चित लीडरबोर्डऐवजी एक ऑडिट करण्यायोग्य निदान साधन आहे आणि त्याची भाषा तुलना वर्णनात्मक आहे — ती तीव्रता, विषय, संस्कृती किंवा वापरकर्ता प्रोफाइलमधील फरकांपासून भाषेचा प्रभाव वेगळा करू शकत नाही. डेटासेट डाउनलोडसाठी उपलब्ध आहे, आणि प्रत्येक उदाहरणामध्ये कॅनरी स्ट्रिंग असते जेणेकरून भविष्यातील प्रशिक्षण कॉर्पोरामध्ये डेटा लीक झाला की नाही हे संशोधक शोधू शकतात.

कंपनीने संबंधित प्रयत्नांकडेही लक्ष वेधले, ज्यात AI मानसिक आरोग्य कार्यासाठी संशोधन अनुदान, AI वर भागीदारीसह तज्ञांची बैठक आणि Transluce च्या स्वतंत्र मानसिक आरोग्य मूल्यमापन प्रयत्नांसाठी सहाय्य.

चेतावणी वास्तविक आहेत: संभाषणे सिंथेटिक आहेत, ग्रेडिंग स्वयंचलित आहे आणि OpenAI चे स्वतःचे मॉडेल OpenAI डिझाइन केलेल्या बेंचमार्कमध्ये शीर्षस्थानी आहेत. परंतु तज्ञ रुब्रिक्स, ग्रेडिंग पद्धत आणि डेटा उघडपणे जारी करून, OpenAI ने नियामक, चिकित्सक आणि स्पर्धकांना डोमेनसाठी एक सामान्य साधन दिले आहे - जिथे कंपनीच्या स्वतःच्या साप्ताहिक वापराच्या संख्येनुसार - स्टेक वाढतच जातो.

---

एआयच्या पुढे राहा

नवीनतम AI बातम्या, विश्लेषण आणि यश मिळवा — सर्व एकाच ठिकाणी.

अधिक AI बातम्या वाचा →