OpenAI wprowadziło w środę MentalHealthBench, otwarty test porównawczy obejmujący 1215 syntetycznych rozmów na temat zdrowia psychicznego, zaprojektowany w celu pomiaru reakcji systemów sztucznej inteligencji w realistycznych scenariuszach – od codziennych pytań dotyczących dobrego samopoczucia po pilne kryzysy – przy czym każdy scenariusz jest sprawdzany i oceniany przez licencjonowanych klinicystów.

Wydanie ma znaczenie znacznie wykraczające poza własne modele OpenAI. Według firmy ponad miliard osób korzysta tygodniowo z ChatGPT, a chatboty oparte na sztucznej inteligencji po cichu stały się pierwszym przystankiem dla osób znajdujących się w trudnej sytuacji emocjonalnej. Do tej pory w branży brakowało rygorystycznej, wspólnej miary tego zachowania. Więcej kontekstu tej historii znajdziesz w naszych bieżących reportażach z branży AI.

Opracowany przez ponad 80 lekarzy w 22 krajach

Jak wynika z ogłoszenia Unite.AI, OpenAI współtworzyło benchmark wraz z grupą ponad 80 licencjonowanych psychologów i psychiatrów z 22 krajów, którzy łącznie mówią 19 językami i reprezentują prawie 20 specjalności w zakresie zdrowia psychicznego. Pełna wersja zawiera 5262 kryteria rubryk autorstwa ekspertów.

Każda rozmowa była sprawdzana przez co najmniej trzech ekspertów w ramach trzyetapowego procesu: dwóch klinicystów niezależnie opracowało ważone kryteria, trzeci je orzekł i udoskonalił, a uwzględniono jedynie kryteria uzgodnione przez co najmniej dwóch ekspertów i którym nie sprzeciwił się trzeci. Każde kryterium dotyczy pojedynczego aspektu odpowiedzi modelu i ma wagę od -10 do +10, przy czym większe wartości bezwzględne wskazują na większe znaczenie kliniczne.

W oświadczeniu zacytowano dyrektora generalnego Amerykańskiego Towarzystwa Psychologicznego, dr Arthura Evansa, który stwierdził, że zdrowie psychiczne istnieje w sposób ciągły i że systemy sztucznej inteligencji angażujące ludzi z tego zakresu wymagają oparcia zarówno w nauce klinicznej, jak i na życiowym doświadczeniu.

Co znajduje się w teście porównawczym

1215 rozmów celowo różni się stopniem nasilenia i tym, kto prosi o pomoc:

  • Rozmowy nieostre stanowią 53,5% zbioru danych, rozmowy o dużej ostrości – 18,2%, a rozmowy w nagłych przypadkach – 28,3%.
  • Reprezentowane są cztery profile użytkowników: dorośli – 68,1 procent, nastolatki – 21,2 procent, lekarze – 5,8 procent i opiekunowie – 4,9 procent.
  • Rozmowy zostały wygenerowane syntetycznie przy użyciu technik ochrony prywatności, które w artykule badawczym opisano jako podobne do metodologii Clio, a których celem było odzwierciedlenie rzeczywistych wzorców korzystania ze zdrowia psychicznego ChatGPT bez narażania prawdziwych użytkowników.
  • Siedemdziesiąt zadań — 5,8 procent wartości odniesienia — ma kontekst wcześniejszego użytkownika, na przykład niedawną stratę w rodzinie.
  • Oprócz języka angielskiego test porównawczy obejmuje 105 rozmów w języku hiszpańskim, 54 w hindi, 34 w języku arabskim i 29 w języku portugalskim, a także dodatkowe rozmowy w języku niemieckim, włoskim, perskim, indonezyjskim, tureckim i chińskim.

Jak oceniały modelki

Oceny zostały ocenione przez zautomatyzowany system oceniający — GPT-5.6 Sol, wymagający dużego wysiłku rozumowania — z czterema niezależnymi ocenami na każde zadanie, a wyniki można rozłożyć na dziesięć zdefiniowanych przez ekspertów osi behawioralnych, w tym poszukiwanie kontekstu, empatia, kalibracja pilności i testowanie rzeczywistości.

W raportowanych wynikach OpenAI GPT-6 Astra uzyskała najwyższy wynik z wynikiem 57,3%, następnie GPT-6 Sol z 53,9%, Claude Opus 5.5 firmy Anthropic z 52,4% i GPT-6 Luna z 50,2%. Starsze generacje pozostały daleko w tyle: GPT-4o z marca 2025 r. uzyskał 32,1%, a Gemini 2.5 Pro – 29,5%, przy czym wszystkie dane miały 95% przedział ufności.

Liczby te wyznaczają dwa punkty odniesienia. Wypełnienia napisane z pełnym dostępem do rubryk oceniania uzyskały 99,0 procent, co stanowiło kontrolę poprawności w odniesieniu do pułapu szumów oceny, podczas gdy uzupełnienia napisane przez samych klinicystów uzyskały zaledwie 38,5 procent, głównie dlatego, że klinicyści piszą krótkie, osobiste odpowiedzi, a nie wyczerpujące odpowiedzi chatbota.

OpenAI stwierdziło, że wyniki wskazują na stałą poprawę w różnych generacjach modeli, podkreślając jednocześnie możliwości poprawy w poszukiwaniu odpowiedniego kontekstu i pilności kalibracji. Warto zauważyć, że w artykule wskazano na kompromis: modele, które zachowują ostrożność w przypadku nowych rozmów obarczonych wysokim ryzykiem, mogą wolniej angażować się w codzienne rozmowy i odwrotnie.

Użytkownicy i eksperci nie są zgodni co do tego, jak wygląda „dobrze”.

Oprócz testu porównawczego OpenAI przeprowadziło osobną analizę z udziałem 44 dorosłych, którzy korzystali ze sztucznej inteligencji w celu zapewnienia zdrowia psychicznego lub wsparcia emocjonalnego, reprezentujących 16 krajów i 14 języków. Uczestnicy ocenili odpowiedzi modelowe i napisali własne kryteria, chociaż ich ocena ograniczała się do nieostrych rozmów, aby uniknąć narażania ich na niepokojący materiał.

Rubryki użytkowników i ekspertów pokrywają się z zaledwie 25,7 procentami całkowitej wagi rubryk, przy czym 1,0 procent jest bezpośrednio sprzeczne. Użytkownicy podkreślali praktyczne kolejne kroki i ton; eksperci przywiązywali większą wagę do gromadzenia odpowiedniego kontekstu i uważnej interpretacji niejednoznacznych sytuacji. Wniosek OpenAI: opinie użytkowników to spójny i uzupełniający się sygnał, ale nie wymienny z wytycznymi klinicznymi i dotyczącymi bezpieczeństwa.

Diagnostyka podlegająca audytowi, a nie tabela wyników

OpenAI wyraźnie stwierdza, że MentalHealthBench jest narzędziem diagnostycznym podlegającym audytowi, a nie ostateczną tabelą liderów, a porównania językowe mają charakter opisowy — nie mogą oddzielić wpływu języka od różnic w ostrości, temacie, kulturze lub profilu użytkownika. Zbiór danych jest dostępny do pobrania, a każdy przykład zawiera sznurek kanarkowy, dzięki czemu badacze mogą wykryć, czy dane wyciekną do przyszłych korpusów szkoleniowych.

Firma wskazała również na powiązane działania, w tym granty badawcze na rzecz prac związanych ze zdrowiem psychicznym opartych na sztucznej inteligencji, spotkania ekspertów z Partnerstwem na rzecz sztucznej inteligencji oraz pomoc w niezależnych działaniach Transluce związanych z oceną zdrowia psychicznego.

Zastrzeżenia są prawdziwe: rozmowy są syntetyczne, ocenianie jest zautomatyzowane, a własne modele OpenAI przewyższają standardy zaprojektowane przez OpenAI. Jednak udostępniając w sposób otwarty rubryki eksperckie, metodologię oceniania i dane, OpenAI dało organom regulacyjnym, klinicystom i konkurentom wspólny instrument dla domeny, w której – jak sugerują tygodniowe dane dotyczące wykorzystania firmy – stawka stale rośnie.

---

Wyprzedź sztuczną inteligencję

Otrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.

Przeczytaj więcej aktualności o sztucznej inteligencji →