OpenAI ilianzisha MentalHealthBench siku ya Jumatano, kielelezo wazi cha mazungumzo 1,215 ya afya ya akili yaliyoundwa ili kupima jinsi mifumo ya AI inavyojibu katika hali halisi - kutoka kwa maswali ya kila siku ya ustawi hadi shida za dharura - kila hali ikipitiwa na alama na matabibu walio na leseni.

Toleo hilo ni muhimu zaidi ya mifano ya OpenAI yenyewe. Zaidi ya watu bilioni moja hutumia ChatGPT kila wiki, kulingana na kampuni, na gumzo za AI zimekuwa kituo cha kwanza kwa watu walio na dhiki ya kihemko. Hadi sasa, tasnia imekosa kigezo cha pamoja cha tabia hiyo. Kwa muktadha zaidi kuhusu hadithi hii, angalia utangazaji wetu wa tasnia ya AI.

Imejengwa na zaidi ya waganga 80 katika nchi 22

OpenAI iliunda alama hiyo pamoja na kundi la zaidi ya wanasaikolojia 80 walio na leseni na madaktari wa magonjwa ya akili katika nchi 22, ambao kwa pamoja wanazungumza lugha 19 na wanawakilisha karibu wataalamu 20 wa afya ya akili, kulingana na chanjo ya tangazo la Unite.AI. Toleo kamili lina vigezo 5,262 vya rubri vilivyoandikwa na wataalamu.

Kila mazungumzo yalikaguliwa na angalau wataalam watatu kupitia mchakato wa hatua tatu: matabibu wawili walijiandikisha kwa uhuru vigezo vya uzani, wa tatu waliwahukumu na kuwasafisha, na vigezo vilivyokubaliwa na angalau wataalam wawili - na sio kupingana na theluthi - vilihifadhiwa. Kila kigezo kinalenga kipengele kimoja cha jibu la modeli na hubeba uzani kutoka -10 hadi +10, kukiwa na maadili makubwa zaidi yanayoonyesha umuhimu mkubwa wa kiafya.

Mkurugenzi Mtendaji wa Chama cha Wanasaikolojia cha Marekani, Dk. Arthur Evans, alinukuliwa katika tangazo hilo akisema kuwa afya ya akili inaendelea kuwepo, na kwamba mifumo ya AI inayohusisha watu katika safu hiyo inahitaji msingi katika sayansi ya kliniki na uzoefu wa maisha.

Ni nini kilicho kwenye alama

Mazungumzo 1,215 yanatofautiana kimakusudi kwa ukali na ni nani anayeomba usaidizi:

  • Mazungumzo yasiyo ya papo hapo yanachangia asilimia 53.5 ya mkusanyiko wa data, mazungumzo yenye kasi ya juu kwa asilimia 18.2, na mazungumzo ya dharura kwa asilimia 28.3.
  • Maelezo manne ya watumiaji yanawakilishwa: watu wazima katika asilimia 68.1, vijana katika asilimia 21.2, matabibu asilimia 5.8 na walezi asilimia 4.9.
  • Mazungumzo yalitolewa kimantiki kwa kutumia mbinu za kuhifadhi faragha ambazo karatasi ya utafiti inaeleza kuwa sawa na mbinu yake ya Clio, ikilenga kuonyesha mifumo halisi ya matumizi ya afya ya akili ya ChatGPT bila kufichua watumiaji halisi.
  • Majukumu sabini - asilimia 5.8 ya kiwango - hubeba muktadha wa awali wa mtumiaji, kama vile hasara ya hivi majuzi katika familia.
  • Zaidi ya Kiingereza, alama hiyo inajumuisha mazungumzo 105 ya Kihispania, 54 ya Kihindi, 34 ya Kiarabu na 29 ya Kireno, na mazungumzo ya ziada katika Kijerumani, Kiitaliano, Kiajemi, Kiindonesia, Kituruki na Kichina.

Jinsi wanamitindo walivyopata alama

Tathmini zilitolewa na kitengeneza daraja kiotomatiki - GPT-5.6 Sol ikifanya kazi kwa bidii ya juu ya kufikiria - ikiwa na maamuzi manne yaliyotolewa kwa kila kazi moja kwa moja, na matokeo yanaweza kutatuliwa kwenye mhimili kumi wa kitabia iliyobainishwa na kitaalamu ikijumuisha kutafuta muktadha, huruma, kurekebisha dharura na majaribio ya ukweli.

Katika matokeo yaliyoripotiwa ya OpenAI, GPT-6 Astra ilipata alama ya juu zaidi kwa asilimia 57.3, ikifuatiwa na GPT-6 Sol kwa asilimia 53.9, Anthropic Claude Opus 5.5 kwa asilimia 52.4, na GPT-6 Luna kwa asilimia 50.2. Vizazi vya zamani vilikuwa nyuma sana: GPT-4o kuanzia Machi 2025 ilipata asilimia 32.1 na Gemini 2.5 Pro ilipata asilimia 29.5, huku takwimu zote zikibeba asilimia 95 ya vipindi vya kujiamini.

Marejeleo mawili yanaunda nambari hizo. Ukamilishaji ulioandikwa kwa ufikiaji kamili wa rubriki za uwekaji alama ulipata asilimia 99.0 - ukaguzi wa utimamu kwenye kiwango cha kelele cha tathmini - huku ukamilishaji ulioandikwa na matabibu wenyewe ulipata asilimia 38.5 tu, hasa kwa sababu matabibu huandika majibu mafupi, ya ana kwa ana badala ya majibu ya kina ya chatbot.

OpenAI ilisema matokeo yanaonyesha uboreshaji thabiti katika vizazi vya mfano, huku ikionyesha nafasi ya kuboresha katika kutafuta muktadha unaofaa na kurekebisha uharaka. Hasa, karatasi inaripoti mabadiliko: mifano ambayo ni ya tahadhari kwenye mazungumzo ibuka, yenye hatari kubwa inaweza kuwa polepole kushirikishwa kwenye yale ya kila siku, na kinyume chake.

Watumiaji na wataalamu hawakubaliani kuhusu jinsi "nzuri" inaonekana

Kando na alama hiyo, OpenAI ilifanya uchanganuzi tofauti na watu wazima 44 ambao walikuwa wametumia AI kwa afya ya akili au msaada wa kihemko, wakiwakilisha nchi 16 na lugha 14. Washiriki walikadiria majibu ya kielelezo na kuandika vigezo vyao wenyewe, ingawa uhakiki wao ulikuwa wa mazungumzo yasiyo ya papo hapo ili kuepuka kuwaangazia nyenzo za kuhuzunisha.

Rubriki za watumiaji na wataalamu zikiwa zimepangiliwa kwa asilimia 25.7 tu ya uzani wote wa rubriki, huku asilimia 1.0 ikikinzana moja kwa moja. Watumiaji walisisitiza hatua zinazofuata na sauti; wataalam waliweka uzito mkubwa katika kukusanya muktadha husika na kutafsiri kwa makini hali zenye utata. Hitimisho la OpenAI: maoni ya mtumiaji ni ishara thabiti na inayosaidiana, lakini haiwezi kubadilishana na mwongozo wa kimatibabu na usalama.

Uchunguzi unaoweza kukaguliwa, si ubao wa wanaoongoza

OpenAI inaeleza wazi kwamba MentalHealthBench ni zana ya uchunguzi inayoweza kukaguliwa badala ya ubao mahususi wa wanaoongoza, na kwamba ulinganishi wake wa lugha ni wa maelezo — hauwezi kutenganisha athari za lugha kutoka kwa tofauti za acuity, mada, utamaduni, au wasifu wa mtumiaji. Seti ya data inapatikana kwa kupakuliwa, na kila mfano hubeba kamba ya canary ili watafiti waweze kugundua ikiwa data itavuja katika shirika la mafunzo la siku zijazo.

Kampuni hiyo pia ilirejelea juhudi zinazohusiana, ikiwa ni pamoja na ruzuku za utafiti kwa ajili ya kazi ya afya ya akili ya AI, mikutano ya kitaalamu na Ushirikiano wa AI, na usaidizi wa juhudi huru za tathmini ya afya ya akili ya Transluce.

Mawazo ni ya kweli: mazungumzo ni ya syntetisk, uwekaji alama ni wa kiotomatiki, na miundo yenyewe ya OpenAI huweka alama ya OpenAI iliyobuniwa. Lakini kwa kutoa rubri za utaalam, mbinu ya uwekaji madaraja, na data kwa uwazi, OpenAI imewapa wadhibiti, matabibu, na washindani chombo cha kawaida kwa kikoa ambapo - kama nambari za matumizi ya kila wiki za kampuni zinavyopendekeza - hisa zinaendelea kuongezeka.

---

Kaa Mbele ya AI

Pata habari za hivi punde za AI, uchanganuzi na mafanikio - yote katika sehemu moja.

Soma habari zaidi za AI →