OpenAI បានណែនាំ MentalHealthBench កាលពីថ្ងៃពុធដែលជាគោលចំហនៃការសន្ទនាសុខភាពផ្លូវចិត្តសំយោគចំនួន 1,215 ដែលត្រូវបានរចនាឡើងដើម្បីវាស់ស្ទង់ពីរបៀបដែលប្រព័ន្ធ AI ឆ្លើយតបក្នុងសេណារីយ៉ូជាក់ស្តែង - ពីសំណួរសុខុមាលភាពប្រចាំថ្ងៃរហូតដល់វិបត្តិបន្ទាន់ - ជាមួយនឹងគ្រប់សេណារីយ៉ូដែលត្រូវបានពិនិត្យ និងវាយតម្លៃដោយគ្រូពេទ្យដែលមានអាជ្ញាប័ណ្ណ។
ការចេញផ្សាយនេះមានសារៈសំខាន់លើសពីម៉ូដែលផ្ទាល់ខ្លួនរបស់ OpenAI ។ យោងតាមក្រុមហ៊ុនបានឱ្យដឹងថា មនុស្សច្រើនជាងមួយពាន់លាននាក់ប្រើប្រាស់ ChatGPT រៀងរាល់សប្តាហ៍ ហើយ AI chatbots បានក្លាយជាកន្លែងឈប់ដំបូងសម្រាប់មនុស្សដែលមានបញ្ហាផ្លូវចិត្ត។ រហូតមកដល់ពេលនេះ ឧស្សាហកម្មនេះនៅខ្វះការចែករំលែកយ៉ាងម៉ឺងម៉ាត់ និងច្បាស់លាស់សម្រាប់ឥរិយាបថនោះ។ សម្រាប់បរិបទបន្ថែមអំពីរឿងនេះ សូមមើល [ការគ្របដណ្តប់ឧស្សាហកម្ម AI] (https://aibuzzwire.news) ដែលកំពុងដំណើរការរបស់យើង។
បង្កើតឡើងដោយមានគ្រូពេទ្យជាង 80 នាក់ក្នុង 22 ប្រទេស
OpenAI បានសហការបង្កើតតារាងពិន្ទុជាមួយនឹងក្រុមអ្នកចិត្តសាស្រ្ត និងអ្នកវិកលចរិតដែលមានអាជ្ញាប័ណ្ណជាង 80 នាក់នៅទូទាំង 22 ប្រទេស ដែលនិយាយរួមគ្នា 19 ភាសា និងតំណាងឱ្យជំនាញផ្នែកសុខភាពផ្លូវចិត្តជិត 20 នេះបើយោងតាមការគ្របដណ្តប់នៃសេចក្តីប្រកាសដោយ Unite.AI ។ ការចេញផ្សាយពេញលេញមាន 5,262 លក្ខណៈវិនិច្ឆ័យរូបដែលអ្នកនិពន្ធដោយអ្នកជំនាញ។
ការសន្ទនានីមួយៗត្រូវបានពិនិត្យដោយអ្នកជំនាញយ៉ាងហោចណាស់បីនាក់តាមរយៈដំណើរការបីដំណាក់កាល៖ គ្រូពេទ្យពីរនាក់បាននិពន្ធលក្ខណៈវិនិច្ឆ័យទម្ងន់ដោយឯករាជ្យ ទីបីបានវិនិច្ឆ័យ និងកែលម្អវា ហើយមានតែលក្ខណៈវិនិច្ឆ័យដែលបានយល់ព្រមដោយអ្នកជំនាញយ៉ាងហោចណាស់ពីរនាក់ប៉ុណ្ណោះ - និងមិនផ្ទុយពីទីបី - ត្រូវបានរក្សា។ លក្ខណៈវិនិច្ឆ័យនីមួយៗកំណត់គោលដៅទិដ្ឋភាពតែមួយនៃការឆ្លើយតបរបស់គំរូមួយ ហើយផ្ទុកទម្ងន់ពី -10 ដល់ +10 ជាមួយនឹងតម្លៃដាច់ខាតធំជាងដែលបង្ហាញពីសារៈសំខាន់ខាងព្យាបាលកាន់តែច្រើន។
នាយកប្រតិបត្តិនៃសមាគមចិត្តសាស្រ្តអាមេរិក លោកវេជ្ជបណ្ឌិត Arthur Evans ត្រូវបានដកស្រង់សម្តីនៅក្នុងសេចក្តីប្រកាសដោយនិយាយថា សុខភាពផ្លូវចិត្តមានជាបន្តបន្ទាប់ ហើយប្រព័ន្ធ AI ដែលចូលរួមជាមួយមនុស្សនៅទូទាំងជួរនោះ ត្រូវការមូលដ្ឋានទាំងវិទ្យាសាស្ត្រព្យាបាល និងបទពិសោធន៍រស់នៅ។
អ្វីដែលស្ថិតនៅក្នុងគោល
ការសន្ទនាចំនួន 1,215 គឺមានភាពខុសប្លែកគ្នាដោយចេតនានៅក្នុងភាពធ្ងន់ធ្ងរ ហើយអ្នកដែលស្នើសុំជំនួយ៖
- ការសន្ទនាមិនស្រួចស្រាវ មានចំនួន 53.5 ភាគរយនៃសំណុំទិន្នន័យ ការសន្ទនាកម្រិតខ្ពស់ សម្រាប់ 18.2 ភាគរយ និងការសន្ទនា បន្ទាន់ សម្រាប់ 28.3 ភាគរយ។
- ទម្រង់អ្នកប្រើប្រាស់ចំនួនបួនត្រូវបានតំណាង៖ មនុស្សពេញវ័យ 68.1 ភាគរយ ក្មេងជំទង់ 21.2 ភាគរយ គ្រូពេទ្យនៅ 5.8 ភាគរយ និងអ្នកថែទាំ 4.9 ភាគរយ។
- ការសន្ទនាត្រូវបានបង្កើតដោយសំយោគដោយប្រើបច្ចេកទេសរក្សាឯកជនភាព ដែលឯកសារស្រាវជ្រាវពិពណ៌នាថាស្រដៀងនឹងវិធីសាស្រ្ត Clio របស់វា គោលបំណងឆ្លុះបញ្ចាំងពីគំរូនៃការប្រើប្រាស់សុខភាពផ្លូវចិត្ត ChatGPT ពិភពលោកពិតដោយមិនបង្ហាញអ្នកប្រើប្រាស់ពិតប្រាកដ។
- កិច្ចការចំនួន 70 — 5.8 ភាគរយនៃគោលកំណត់ — អនុវត្តបរិបទរបស់អ្នកប្រើពីមុន ដូចជាការបាត់បង់ថ្មីៗនៅក្នុងគ្រួសារ។
- លើសពីភាសាអង់គ្លេស តារាងពិន្ទុរួមមាន 105 ភាសាអេស្ប៉ាញ 54 ហិណ្ឌូ 34 អារ៉ាប់ និង 29 ការសន្ទនាព័រទុយហ្គាល់ ជាមួយនឹងការសន្ទនាបន្ថែមជាភាសាអាឡឺម៉ង់ អ៊ីតាលី ពែរ្ស ឥណ្ឌូនេស៊ី ទួរគី និងចិន។
របៀបដែលម៉ូដែលបានពិន្ទុ
ការវាយតម្លៃត្រូវបានផ្តល់ពិន្ទុដោយសិស្សថ្នាក់ស្វ័យប្រវត្តិ - GPT-5.6 Sol ដែលកំពុងដំណើរការដោយកិច្ចខិតខំប្រឹងប្រែងដោយហេតុផលខ្ពស់ - ជាមួយនឹងការវិនិច្ឆ័យគំរូដោយឯករាជ្យចំនួនបួនក្នុងមួយកិច្ចការ ហើយលទ្ធផលអាចត្រូវបានបំបែកនៅទូទាំងអ័ក្សអាកប្បកិរិយាដែលកំណត់ដោយអ្នកជំនាញចំនួន 10 រួមទាំងការស្វែងរកបរិបទ ការយល់ចិត្ត ការក្រិតតាមខ្នាតបន្ទាន់ និងការធ្វើតេស្តការពិត។
នៅក្នុងលទ្ធផលដែលបានរាយការណ៍របស់ OpenAI, GPT-6 Astra ទទួលបានពិន្ទុខ្ពស់បំផុតនៅ 57.3 ភាគរយ បន្ទាប់មក GPT-6 Sol នៅ 53.9 ភាគរយ, Claude Opus 5.5 របស់ Anthropic នៅ 52.4 ភាគរយ និង GPT-6 Luna នៅ 50.2 ភាគរយ។ ជំនាន់ចាស់បានតាមពីក្រោយយ៉ាងល្អ៖ GPT-4o ចាប់ពីខែមីនា ឆ្នាំ 2025 ទទួលបានពិន្ទុ 32.1 ភាគរយ ហើយ Gemini 2.5 Pro ទទួលបានពិន្ទុ 29.5 ភាគរយ ដោយតួលេខទាំងអស់មានចន្លោះពេលទំនុកចិត្ត 95 ភាគរយ។
ចំណុចយោងពីរកំណត់លេខទាំងនោះ។ ការបញ្ចប់ដែលសរសេរដោយមានការចូលប្រើប្រាស់ពេញលេញចំពោះតារាងចំណាត់ថ្នាក់ទទួលបានពិន្ទុ 99.0 ភាគរយ - ការត្រួតពិនិត្យអនាម័យនៅលើពិដានសំលេងរំខាននៃការវាយតម្លៃ - ខណៈពេលដែលការបញ្ចប់ដែលសរសេរដោយគ្រូពេទ្យខ្លួនឯងទទួលបានពិន្ទុត្រឹមតែ 38.5 ភាគរយប៉ុណ្ណោះ ភាគច្រើនដោយសារតែគ្រូពេទ្យសរសេរការឆ្លើយតបខ្លីៗតាមបែបបុគ្គលជាជាងការឆ្លើយតបតាម chatbot ដ៏ទូលំទូលាយ។
OpenAI បាននិយាយថា លទ្ធផលបង្ហាញពីភាពប្រសើរឡើងជាលំដាប់នៅទូទាំងជំនាន់គំរូ ខណៈពេលដែលការរំលេចបន្ទប់ដើម្បីកែលម្អក្នុងការស្វែងរកបរិបទសមស្រប និងការកែតម្រូវភាពបន្ទាន់។ គួរកត់សម្គាល់ថា ក្រដាសនេះរាយការណ៍អំពីការដោះដូរមួយ៖ គំរូដែលមានការប្រុងប្រយ័ត្នចំពោះការសន្ទនាដែលមានហានិភ័យខ្ពស់អាចមានភាពយឺតយ៉ាវក្នុងការចូលរួមជារៀងរាល់ថ្ងៃ និងផ្ទុយមកវិញ។
អ្នកប្រើប្រាស់ និងអ្នកជំនាញមិនយល់ស្របលើអ្វីដែល "ល្អ" មើលទៅដូចនោះទេ។
ទន្ទឹមនឹងតារាងពិន្ទុ OpenAI បានដំណើរការការវិភាគដាច់ដោយឡែកជាមួយមនុស្សពេញវ័យចំនួន 44 នាក់ ដែលបានប្រើប្រាស់ AI សម្រាប់សុខភាពផ្លូវចិត្ត ឬជំនួយផ្លូវចិត្ត ដែលតំណាងឱ្យ 16 ប្រទេស និង 14 ភាសា។ អ្នកចូលរួមវាយតម្លៃការឆ្លើយតបគំរូ និងសរសេរលក្ខណៈវិនិច្ឆ័យផ្ទាល់ខ្លួនរបស់ពួកគេ ទោះបីជាការវាយតម្លៃរបស់ពួកគេត្រូវបានកំណត់ចំពោះការសន្ទនាដែលមិនមានលក្ខណៈស្រួចស្រាវ ដើម្បីជៀសវាងការលាតត្រដាងពួកគេទៅនឹងសម្ភារៈដែលពិបាកចិត្តក៏ដោយ។
រង្វិលរបស់អ្នកប្រើនិងអ្នកជំនាញបានតម្រឹមលើត្រឹមតែ 25.7 ភាគរយនៃទម្ងន់រូបបាតសរុប ដោយមាន 1.0 ភាគរយផ្ទុយផ្ទាល់។ អ្នកប្រើប្រាស់បានសង្កត់ធ្ងន់លើការអនុវត្តជាក់ស្តែងជំហានបន្ទាប់ និងសម្លេង។ អ្នកជំនាញបានដាក់ទម្ងន់កាន់តែខ្លាំងលើការប្រមូលផ្តុំបរិបទដែលពាក់ព័ន្ធ និងបកស្រាយដោយប្រុងប្រយ័ត្ននូវស្ថានភាពមិនច្បាស់លាស់។ ការសន្និដ្ឋានរបស់ OpenAI៖ មតិរបស់អ្នកប្រើគឺជាសញ្ញាដែលស៊ីសង្វាក់គ្នា និងបំពេញបន្ថែម ប៉ុន្តែមិនអាចផ្លាស់ប្តូរបានជាមួយនឹងការណែនាំពីគ្លីនិក និងសុវត្ថិភាពនោះទេ។
ការវិនិច្ឆ័យដែលអាចធ្វើសវនកម្មបាន មិនមែនជាតារាងពិន្ទុទេ។
OpenAI គឺច្បាស់ណាស់ថា MentalHealthBench គឺជាឧបករណ៍វិនិច្ឆ័យដែលអាចធ្វើសវនកម្មជាជាងតារាងពិន្ទុច្បាស់លាស់ ហើយការប្រៀបធៀបភាសារបស់វាមានលក្ខណៈពិពណ៌នា - ពួកគេមិនអាចញែកឥទ្ធិពលនៃភាសាចេញពីភាពខុសប្លែកគ្នានៅក្នុងភាពច្បាស់លាស់ ប្រធានបទ វប្បធម៌ ឬទម្រង់អ្នកប្រើប្រាស់បានទេ។ សំណុំទិន្នន័យអាចទាញយកបាន ហើយឧទាហរណ៍នីមួយៗមានខ្សែអក្សរ Canary ដូច្នេះអ្នកស្រាវជ្រាវអាចរកឃើញប្រសិនបើទិន្នន័យលេចធ្លាយចូលទៅក្នុងស្ថាប័នបណ្តុះបណ្តាលនាពេលអនាគត។
ក្រុមហ៊ុនក៏បានចង្អុលទៅកិច្ចខិតខំប្រឹងប្រែងដែលពាក់ព័ន្ធ រួមទាំងជំនួយស្រាវជ្រាវសម្រាប់ការងារសុខភាពផ្លូវចិត្ត AI ការប្រជុំអ្នកជំនាញជាមួយភាពជាដៃគូលើ AI និងជំនួយសម្រាប់កិច្ចខិតខំប្រឹងប្រែងវាយតម្លៃសុខភាពផ្លូវចិត្តឯករាជ្យរបស់ Transluce ។
ការព្រមានគឺពិតប្រាកដ៖ ការសន្ទនាគឺសំយោគ ការចាត់ថ្នាក់គឺស្វ័យប្រវត្តិ ហើយម៉ូដែលផ្ទាល់ខ្លួនរបស់ OpenAI កំពូលតារាង OpenAI ដែលបានរចនាឡើង។ ប៉ុន្តែតាមរយៈការចេញផ្សាយតារាងពិន្ទុអ្នកជំនាញ វិធីសាស្ត្រចាត់ថ្នាក់ និងទិន្នន័យដោយបើកចំហ OpenAI បានផ្តល់ឱ្យនិយតករ គ្រូពេទ្យ និងដៃគូប្រកួតប្រជែងនូវឧបករណ៍ទូទៅសម្រាប់ដែនដែល - ដូចដែលចំនួនអ្នកប្រើប្រាស់ប្រចាំសប្តាហ៍របស់ក្រុមហ៊ុនផ្ទាល់បានបង្ហាញ - ភាគហ៊ុននៅតែបន្តកើនឡើង។
---
ស្នាក់នៅមុន AIទទួលបានព័ត៌មាន AI ការវិភាគ និងរបកគំហើញចុងក្រោយបំផុត — ទាំងអស់នៅកន្លែងតែមួយ។
អានព័ត៌មាន AI បន្ថែម →