OpenAI သည် ဗုဒ္ဓဟူးနေ့တွင် မိတ်ဆက်ခဲ့သည့် MentalHealthBench တွင် AI စနစ်များသည် လက်တွေ့ကျသောအခြေအနေများတွင် AI စနစ်များ မည်သို့တုံ့ပြန်သည်ကို တိုင်းတာရန် ဒီဇိုင်းထုတ်ထားသော ပေါင်းစပ်ထားသော ပေါင်းစပ်စိတ်ကျန်းမာရေးစကားဝိုင်း 1,215 ခု၏ အဖွင့်စံနှုန်းဖြစ်သည့် - နေ့စဉ်ကျန်းမာရေးမေးခွန်းများမှ အရေးပေါ်အကျပ်အတည်းများအထိ — လိုင်စင်ရဆေးခန်းများမှ စစ်ဆေးပြီး အမှတ်ပေးထားသည့် မြင်ကွင်းတိုင်းကို မိတ်ဆက်ပေးခဲ့သည်။

ဖြန့်ချိမှုသည် OpenAI ၏ကိုယ်ပိုင်မော်ဒယ်များထက်အလွန်အရေးကြီးသည်။ ကုမ္ပဏီ၏အဆိုအရ တစ်ပတ်လျှင် လူတစ်ဘီလီယံကျော်သည် ChatGPT ကိုအသုံးပြုကြပြီး AI chatbots များသည် စိတ်ပိုင်းဆိုင်ရာဒုက္ခကြုံနေသူများအတွက် တိတ်တဆိတ်ပထမနေရာဖြစ်လာသည်။ ယခုအချိန်အထိ စက်မှုလုပ်ငန်းသည် ထိုအပြုအမူအတွက် တင်းကျပ်ပြီး မျှဝေထားသော ကိုက်ခဲမှု ကင်းမဲ့နေပါသည်။ ဤဇာတ်လမ်းနှင့်ပတ်သက်သည့် နောက်ထပ်အကြောင်းအရာအတွက်၊ ကျွန်ုပ်တို့၏လုပ်ဆောင်နေသော AI လုပ်ငန်းကဏ္ဍလွှမ်းခြုံ ကို ကြည့်ပါ။

နိုင်ငံပေါင်း 22 တွင် ဆေးဆရာ 80 ကျော်ဖြင့် တည်ဆောက်ထားသည်။

Unite.AI ၏ ကြေညာချက်၏ အကျုံးဝင်ချက်အရ OpenAI သည် နိုင်ငံပေါင်း ၂၂ နိုင်ငံရှိ လိုင်စင်ရ စိတ်ပညာရှင် နှင့် စိတ်ရောဂါအထူးကု 80 ကျော်၏ အစုအဝေးဖြင့် စံသတ်မှတ်ချက်ကို ပူးတွဲဖန်တီးခဲ့ကြောင်း Unite.AI ၏ ကြေညာချက်တွင် ဖော်ပြထားသည်။ ထုတ်ဝေမှု အပြည့်အစုံတွင် ကျွမ်းကျင်သူ-စာရေးဆရာမှ ရူဘယ်သတ်မှတ်ချက် 5,262 ပါရှိသည်။

စကားဝိုင်းတစ်ခုစီကို အဆင့်သုံးဆင့်ဖြင့် ကျွမ်းကျင်သူ အနည်းဆုံး သုံးဦးက ပြန်လည်သုံးသပ်ခဲ့သည်- ဆေးခန်းသမား နှစ်ဦးက လွတ်လပ်စွာ ကိုယ်အလေးချိန် စံနှုန်းများကို ရေးသားခဲ့ပြီး၊ တတိယတစ်ခုက ၎င်းတို့ကို စီရင်ဆုံးဖြတ်ပြီး ပြုပြင်ထားခြင်းဖြစ်ပြီး အနည်းဆုံး ကျွမ်းကျင်သူ နှစ်ဦးက သဘောတူထားသည့် စံနှုန်းများကိုသာ သိမ်းဆည်းထားသည်။ စံသတ်မှတ်ချက်တစ်ခုစီသည် မော်ဒယ်တစ်ခု၏ တုံ့ပြန်မှု၏ ရှုထောင့်တစ်ခုတည်းကို ပစ်မှတ်ထားပြီး -10 မှ +10 အထိ အလေးချိန်ကို သယ်ဆောင်ကာ၊ ပိုကြီးသော ပကတိတန်ဖိုးများသည် ဆေးခန်းဆိုင်ရာ အရေးပါမှုကို ညွှန်ပြသော ပိုကြီးသော ပကတိတန်ဖိုးများဖြစ်သည်။

American Psychological Association ၏ CEO ဖြစ်သူ ဒေါက်တာ Arthur Evans က စိတ်ကျန်းမာရေးသည် အသန္တာန်တွင် ရှိနေကြောင်းနှင့် အဆိုပါ အပိုင်းအခြားတစ်လျှောက်ရှိ လူများကို ချိတ်ဆက်ပေးသည့် AI စနစ်များသည် လက်တွေ့သိပ္ပံနှင့် အသက်မွေးဝမ်းကြောင်းဆိုင်ရာ အတွေ့အကြုံနှစ်ခုလုံးအတွက် အခြေခံလိုအပ်သည်ဟု ကြေညာချက်တွင် ကိုးကားဖော်ပြထားသည်။

စံသတ်မှတ်ချက်မှာ ဘာလဲ။

စကားဝိုင်း 1,215 ခုသည် ပြင်းထန်မှုနှင့် ဘယ်သူက အကူအညီတောင်းနေသည်မှာ တမင်တကာ ကွဲပြားနေသည်-

  • စူးရှသောမဟုတ်သော စကားဝိုင်းများ သည် ဒေတာအတွဲ၏ 53.5 ရာခိုင်နှုန်း၊ high-acuity စကားဝိုင်းများ 18.2 ရာခိုင်နှုန်းနှင့် အရေးပေါ် စကားဝိုင်းများ 28.3 ရာခိုင်နှုန်းအတွက် ပါဝင်သည်။
  • အသုံးပြုသူပရိုဖိုင်လေးခုကို ကိုယ်စားပြုသည်- အရွယ်ရောက်ပြီးသူ 68.1 ရာခိုင်နှုန်း၊ ဆယ်ကျော်သက် 21.2 ရာခိုင်နှုန်း၊ ဆေးခန်းမှူး 5.8 ရာခိုင်နှုန်းနှင့် ပြုစုစောင့်ရှောက်သူ 4.9 ရာခိုင်နှုန်း။
  • သုတေသနစာတမ်းသည် ၎င်း၏ Clio နည်းစနစ်နှင့် ဆင်တူကြောင်းဖော်ပြထားသည့် သုတေသနစာတမ်းမှ သီးသန့်အသုံးပြုသူများကို လက်တွေ့ကမ္ဘာမှ ChatGPT စိတ်ကျန်းမာရေးအသုံးပြုမှုပုံစံများကို ရောင်ပြန်ဟပ်စေရန် ရည်ရွယ်ချက်ဖြင့် စကားဝိုင်းများကို စကားဝိုင်းများကို ပေါင်းစပ်ထုတ်လုပ်ထားပါသည်။
  • လုပ်ငန်းခုနစ်ဆယ်—စံနှုန်း၏ ၅.၈ ရာခိုင်နှုန်း—မိသားစုတွင် မကြာသေးမီက ဆုံးရှုံးခြင်းကဲ့သို့သော ယခင်အသုံးပြုသူအကြောင်းအရာကို သယ်ဆောင်သည်။
  • အင်္ဂလိပ်အပြင်၊ စံသတ်မှတ်ချက်တွင် ဂျာမန်၊ အီတလီ၊ ပါရှန်း၊ အင်ဒိုနီးရှား၊ တူရကီနှင့် တရုတ်ဘာသာစကားများဖြင့် ထပ်လောင်းပြောဆိုမှုများနှင့်အတူ 105 စပိန်၊ 54 ဟိန္ဒီ၊ 34 အာရဗီနှင့် ပေါ်တူဂီစကား 29 ခု ပါဝင်သည်။

မော်ဒယ်တွေက ဘယ်လိုဂိုးသွင်းလဲ။

အကဲဖြတ်ချက်များကို အလိုအလျောက်အတန်းအစား - GPT-5.6 Sol သည် အလုပ်တစ်ခုလျှင် အမှီအခိုကင်းစွာဖြင့် နမူနာယူထားသော စီရင်ချက်လေးခုဖြင့် လုပ်ဆောင်နေပြီး ရလဒ်များကို အကြောင်းအရာရှာဖွေမှု၊ စာနာမှု၊ အရေးပေါ်ချိန်ညှိခြင်းနှင့် လက်တွေ့စမ်းသပ်ခြင်းအပါအဝင် ကျွမ်းကျင်သူသတ်မှတ်ထားသော အပြုအမူဆိုင်ရာ axes ဆယ်ခုတွင် ရလဒ်များကို ပြိုကွဲသွားစေနိုင်သည်။

OpenAI ၏ အစီရင်ခံထားသော ရလဒ်များတွင် GPT-6 Astra သည် အမြင့်ဆုံး ရမှတ် 57.3 ရာခိုင်နှုန်း၊ GPT-6 Sol က 53.9 ရာခိုင်နှုန်း၊ Anthropic ၏ Claude Opus 5.5 52.4 ရာခိုင်နှုန်းနှင့် GPT-6 Luna 50.2 ရာခိုင်နှုန်းတို့ ဖြစ်သည်။ မျိုးဆက်ဟောင်းများနောက်သို့ ကောင်းကောင်းလိုက်နိုင်သည်- မတ်လ 2025 မှ GPT-4o သည် 32.1 ရာခိုင်နှုန်း ရမှတ် 32.1 ရာခိုင်နှုန်းနှင့် Gemini 2.5 Pro က 29.5 ရာခိုင်နှုန်း ရရှိပြီး ကိန်းဂဏန်းအားလုံးသည် ယုံကြည်မှု 95 ရာခိုင်နှုန်းကြားကာလများ သယ်ဆောင်လာခဲ့သည်။

အကိုးအကား အချက်နှစ်ချက်သည် ထိုနံပါတ်များကို ဘောင်ခတ်သည်။ အဆင့်သတ်မှတ်ခြင်းဆိုင်ရာ စည်းမျဉ်းများကို အပြည့်အဝဝင်ရောက်ခွင့်ဖြင့်ရေးထားသော ပြီးစီးမှု 99.0 ရာခိုင်နှုန်းဖြစ်သည် — အကဲဖြတ်မှု၏ဆူညံသံမျက်နှာကျက်ပေါ်ရှိ စိတ်ပိုင်းဆိုင်ရာစစ်ဆေးချက် — ဆေးခန်းများကိုယ်တိုင်ရေးသားသောပြီးစီးမှုများမှာ 38.5 ရာခိုင်နှုန်းသာရရှိပြီး အများစုမှာ ဆေးခန်းသမားများက ကျယ်ကျယ်ပြန့်ပြန့် chatbot ပြန်စာများထက် လူကိုယ်တိုင်ပုံစံတုံ့ပြန်မှုများကို တိုတိုရေးသားခြင်းကြောင့်ဖြစ်သည်။

OpenAI မှ ရလဒ်များသည် မော်ဒယ်မျိုးဆက်များတစ်လျှောက် တည်ငြိမ်သောတိုးတက်မှုကိုပြသပြီး သင့်လျော်သောအကြောင်းအရာကိုရှာဖွေရန်နှင့် အရေးတကြီးချိန်ညှိခြင်းတွင် ပိုမိုကောင်းမွန်လာစေရန်အခန်းကို မီးမောင်းထိုးပြနေချိန်တွင် ရလဒ်များက တည်ငြိမ်နေပါသည်။ ထင်ရှားသည်မှာ၊ စာတမ်းတွင် အပေးအယူတစ်ရပ်ကို အစီရင်ခံသည်- ပေါ်ပေါက်လာသော၊ အန္တရာယ်များသော စကားဝိုင်းများတွင် သတိထားရသော မော်ဒယ်များသည် နေ့စဉ်နှင့်အမျှ ထိတွေ့ဆက်ဆံရန် နှေးကွေးနိုင်ပါသည်။

အသုံးပြုသူများနှင့် ကျွမ်းကျင်သူများက "ကောင်း" ပုံသဏ္ဍာန်ကို သဘောမတူပါ။

စံနှုန်းများနှင့်အတူ OpenAI သည် နိုင်ငံပေါင်း 16 နှင့် ဘာသာစကား 14 မျိုးတို့ကို ကိုယ်စားပြုသည့် စိတ်ကျန်းမာရေး သို့မဟုတ် စိတ်ပိုင်းဆိုင်ရာ ပံ့ပိုးမှုအတွက် AI ကို အသုံးပြုခဲ့သည့် အရွယ်ရောက်ပြီးသူ 44 ဦးနှင့် သီးခြားခွဲခြမ်းစိတ်ဖြာမှုကို လုပ်ဆောင်ခဲ့သည်။ ပါဝင်သူများသည် မော်ဒယ်တုံ့ပြန်မှုများကို အဆင့်သတ်မှတ်ပြီး ၎င်းတို့၏ စံနှုန်းများကို ရေးခဲ့ကြသော်လည်း၊ ၎င်းတို့၏ သုံးသပ်ချက်သည် စိတ်ဆင်းရဲစရာ အကြောင်းအရာများကို ထုတ်ဖော်ခြင်းမှ ရှောင်ရှားနိုင်ရန် ပြင်းထန်မဟုတ်သော စကားဝိုင်းများတွင်သာ ကန့်သတ်ထားသည်။

အသုံးပြုသူနှင့် ကျွမ်းကျင်သော ကောက်နုတ်ချက်များသည် စုစုပေါင်းရူဘယ်အလေးချိန်၏ 25.7 ရာခိုင်နှုန်းနှင့် 1.0 ရာခိုင်နှုန်း တိုက်ရိုက်ဆန့်ကျင်ဘက်ဖြစ်သည်။ အသုံးပြုသူများသည် လက်တွေ့ကျသော နောက်အဆင့်များနှင့် လေသံကို အလေးပေးဖော်ပြသည်။ ကျွမ်းကျင်သူများသည် သက်ဆိုင်ရာ ဆက်စပ်အကြောင်းအရာများကို စုစည်းပြီး မရေရာသော အခြေအနေများကို ဂရုတစိုက် အဓိပ္ပာယ်ပြန်ဆိုခြင်းအပေါ် ပို၍ အလေးထားပါသည်။ OpenAI ၏နိဂုံးချုပ်ချက်- အသုံးပြုသူတုံ့ပြန်ချက်သည် ပေါင်းစပ်ပြီး ပေါင်းစပ်အချက်ပြမှုတစ်ခုဖြစ်သော်လည်း လက်တွေ့နှင့် ဘေးကင်းရေးလမ်းညွှန်ချက်ဖြင့် လဲလှယ်၍မရပါ။

ဦးဆောင်သူစာရင်း မဟုတ်ဘဲ စစ်ဆေးနိုင်သော စစ်ဆေးမှု

OpenAI သည် MentalHealthBench သည် တိကျသေချာသော ဦးဆောင်သူစာရင်းထက် စစ်ဆေးနိုင်သော ကိရိယာတစ်ခုဖြစ်ပြီး ၎င်း၏ဘာသာစကား နှိုင်းယှဉ်မှုများသည် သရုပ်ဖော်ခြင်းဖြစ်သည် — ၎င်းတို့သည် ရှင်းလင်းပြတ်သားသော၊ အကြောင်းအရာ၊ ယဉ်ကျေးမှု သို့မဟုတ် အသုံးပြုသူပရိုဖိုင်တွင် ဘာသာစကား၏အကျိုးသက်ရောက်မှုကို ခွဲခြား၍မရပါ။ ဒေတာအတွဲကို ဒေါင်းလုဒ်လုပ်ရန် ရရှိနိုင်ပြီး ဥပမာတစ်ခုစီတွင် ကိန္နရီကြိုးတစ်ချောင်းပါရှိသောကြောင့် သုတေသီများသည် အနာဂတ်လေ့ကျင့်ရေးကော်ပိုရာသို့ ဒေတာပေါက်ကြားခြင်းရှိမရှိကို သုတေသီများက သိရှိနိုင်သည်။

ကုမ္ပဏီသည် AI စိတ်ကျန်းမာရေးလုပ်ငန်းအတွက် သုတေသနထောက်ပံ့ကြေးများ၊ AI ဆိုင်ရာ Partnership နှင့် ကျွမ်းကျင်သူတွေ့ဆုံပွဲများ၊ Transluce ၏ လွတ်လပ်သော စိတ်ကျန်းမာရေးအကဲဖြတ်ခြင်းအတွက် အကူအညီများအပါအဝင် ဆက်စပ်ကြိုးပမ်းမှုများကိုလည်း ထောက်ပြခဲ့သည်။

သတိပေးချက်များသည် အစစ်အမှန်ဖြစ်သည်- စကားဝိုင်းများသည် ပေါင်းစပ်ဖွဲ့စည်းထားခြင်းဖြစ်ပြီး အဆင့်သတ်မှတ်ခြင်းသည် အလိုအလျောက်ဖြစ်ပြီး OpenAI ၏ကိုယ်ပိုင်မော်ဒယ်များသည် OpenAI ဒီဇိုင်းထုတ်ထားသော စံသတ်မှတ်ချက်တစ်ခုဖြစ်သည်။ သို့သော် ကျွမ်းကျင်သော ရူဘယ်၊ အဆင့်သတ်မှတ်မှု နည်းစနစ်နှင့် ဒေတာများကို ပွင့်လင်းမြင်သာစွာ ထုတ်ပြန်ခြင်းဖြင့် OpenAI သည် ကုမ္ပဏီ၏ အပတ်စဉ် အသုံးပြုမှု နံပါတ်များ အကြံပြုထားသည့်အတိုင်း - ကုမ္ပဏီ၏ အပတ်စဉ် အသုံးပြုမှု နံပါတ်များ အကြံပြုထားသည့်အတိုင်း - ကုမ္ပဏီ၏ အပတ်စဉ် အသုံးပြုမှု နံပါတ်များ အကြံပြုထားသည့်အတိုင်း - အစုရှယ်ယာများ တက်လာပါသည်။

---

AI ၏ရှေ့တွင်နေရန်

နောက်ဆုံးပေါ် AI သတင်းများ၊ ခွဲခြမ်းစိတ်ဖြာမှုနှင့် အောင်မြင်မှုများ—အားလုံးကို တစ်နေရာတည်းတွင် ရယူပါ။

AI သတင်းအပြည့်အစုံကို ဖတ်ရှုရန် →