В среду OpenAI представила MentalHealthBench, открытый тест, включающий 1215 синтетических разговоров о психическом здоровье, предназначенный для измерения того, как системы ИИ реагируют в реалистичных сценариях — от повседневных вопросов о благополучии до неотложных кризисов — при этом каждый сценарий проверяется и оценивается лицензированными врачами.

Релиз имеет значение, выходящее далеко за рамки собственных моделей OpenAI. По данным компании, более миллиарда человек используют ChatGPT каждую неделю, а чат-боты с искусственным интеллектом незаметно стали первой остановкой для людей, испытывающих эмоциональные расстройства. До сих пор в отрасли отсутствовали строгие общие критерии такого поведения. Дополнительную информацию об этой истории можно найти в нашем постоянном освещении об отрасли искусственного интеллекта.

Создано более чем 80 врачами в 22 странах

Согласно сообщению Unite.AI, OpenAI создала эталон вместе с группой из более чем 80 лицензированных психологов и психиатров из 22 стран, которые в совокупности говорят на 19 языках и представляют почти 20 специальностей в области психического здоровья. Полная версия содержит 5262 рубричных критерия, созданных экспертами.

Каждый разговор рассматривался как минимум тремя экспертами в рамках трехэтапного процесса: два клинициста независимо разрабатывали взвешенные критерии, третий выносил решения и уточнял их, и сохранялись только критерии, согласованные как минимум двумя экспертами и не противоречащие третьему. Каждый критерий нацелен на один аспект реакции модели и имеет вес от -10 до +10, причем более высокие абсолютные значения указывают на большую клиническую значимость.

В заявлении цитировался генеральный директор Американской психологической ассоциации д-р Артур Эванс, который заявил, что психическое здоровье существует в континууме, и что системы искусственного интеллекта, привлекающие людей в этом диапазоне, нуждаются как в клинической науке, так и в жизненном опыте.

Что в бенчмарке

1215 разговоров намеренно различаются по степени серьезности и по тому, кто обращается за помощью:

  • Неострые разговоры составляют 53,5 процента набора данных, острые разговоры - 18,2 процента и экстренные разговоры - 28,3 процента.
  • Представлены четыре профиля пользователей: взрослые — 68,1 процента, подростки — 21,2 процента, врачи — 5,8 процента и лица, осуществляющие уход — 4,9 процента.
  • Разговоры были созданы синтетически с использованием методов сохранения конфиденциальности, которые, как описано в исследовательском документе, аналогичны методологии Clio и направлены на отражение реальных моделей использования ChatGPT для психического здоровья без раскрытия реальных пользователей.
  • Семьдесят задач (5,8 процента контрольного показателя) содержат предыдущий пользовательский контекст, например недавнюю потерю в семье.
  • Помимо английского, тест включает 105 разговоров на испанском, 54 разговора на хинди, 34 разговора на арабском и 29 разговоров на португальском языке, а также дополнительные разговоры на немецком, итальянском, персидском, индонезийском, турецком и китайском языках.

Как модели набрали очки

Оценки выставлялись с помощью автоматизированного оценщика — GPT-5.6 Sol, работающего с высокими логическими усилиями — с четырьмя независимыми выборками суждений для каждого задания, а результаты можно разложить по десяти определенным экспертами поведенческим осям, включая поиск контекста, эмпатию, калибровку срочности и тестирование реальности.

Согласно опубликованным OpenAI результатам, GPT-6 Astra набрала самый высокий результат - 57,3 процента, за ним следуют GPT-6 Sol с 53,9 процента, Anthropic Claude Opus 5.5 с 52,4 процента и GPT-6 Luna с 50,2 процента. Старшие поколения сильно отставали: GPT-4o с марта 2025 года набрал 32,1 процента, а Gemini 2.5 Pro — 29,5 процента, при этом все цифры имеют 95-процентный доверительный интервал.

Эти цифры обрамляют две контрольные точки. Заполнения, написанные с полным доступом к оценочным критериям, набрали 99,0 процента (это проверка здравомыслия на «потолок шума» оценки), в то время как завершения, написанные самими врачами, набрали всего 38,5 процента, в основном потому, что врачи пишут короткие ответы в личном стиле, а не подробные ответы чат-бота.

В OpenAI заявили, что результаты демонстрируют стабильное улучшение среди поколений моделей, одновременно подчеркивая возможности для улучшения в поиске соответствующего контекста и оценке срочности. Примечательно, что в документе сообщается о компромиссе: модели, которые осторожны в экстренных разговорах с высоким уровнем риска, могут медленнее участвовать в повседневных разговорах, и наоборот.

Пользователи и эксперты расходятся во мнениях относительно того, что такое «хорошо».

Помимо эталонного теста, OpenAI провела отдельный анализ с участием 44 взрослых, которые использовали ИИ для психического здоровья или эмоциональной поддержки, представляющих 16 стран и 14 языков. Участники оценивали ответы моделей и записывали свои собственные критерии, хотя их обзор ограничивался неострыми разговорами, чтобы не подвергать их воздействию тревожного материала.

Пользовательские и экспертные рубрики совпадают лишь по 25,7 процента от общего веса рубрик, при этом 1,0 процента прямо противоречат друг другу. Пользователи подчеркивали практические последующие шаги и тон; эксперты уделяли больше внимания сбору соответствующего контекста и тщательной интерпретации неоднозначных ситуаций. Вывод OpenAI: отзывы пользователей — это последовательный и дополняющий сигнал, но не взаимозаменяемый с клиническими рекомендациями и рекомендациями по безопасности.

Диагностика, которую можно проверить, а не таблица лидеров

OpenAI ясно заявляет, что MentalHealthBench — это проверяемый диагностический инструмент, а не окончательная таблица лидеров, и что его языковые сравнения носят описательный характер — они не могут изолировать влияние языка от различий в остроте зрения, теме, культуре или профиле пользователя. Набор данных доступен для загрузки, и каждый пример содержит канареечную строку, чтобы исследователи могли обнаружить, не просочились ли данные в будущие учебные корпуса.

Компания также указала на сопутствующие усилия, в том числе на исследовательские гранты для работы в области психического здоровья с использованием искусственного интеллекта, встречи экспертов с Партнерством по искусственному интеллекту и помощь в независимой оценке психического здоровья Transluce.

Предостережения вполне реальны: разговоры являются синтетическими, выставление оценок автоматизировано, а собственные модели OpenAI превосходят эталонные модели, разработанные OpenAI. Но, открыто опубликовав экспертные рубрики, методологию оценки и данные, OpenAI предоставила регулирующим органам, врачам и конкурентам общий инструмент для области, где, как показывают собственные еженедельные показатели использования компании, ставки продолжают расти.

---

Будьте впереди ИИ

Получайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.

Подробнее новости AI →