OpenAIは水曜日、MentalHealthBenchを導入した。これは、日常の健康に関する質問から緊急の危機に至るまで、現実的なシナリオでAIシステムがどのように反応するかを測定するために設計された1,215の合成メンタルヘルス会話のオープンベンチマークであり、すべてのシナリオは認可された臨床医によってレビューおよび採点されている。

このリリースは、OpenAI 自身のモデルをはるかに超えて重要です。同社によれば、毎週 10 億人以上が ChatGPT を利用しており、AI チャットボットは、精神的苦痛を抱えた人々の最初の窓口となっています。これまで、業界にはその行動に対する厳格な共通の基準が欠けていました。このストーリーの詳細については、現在進行中の AI 業界の報道 をご覧ください。

22 か国の 80 名を超える臨床医によって構築されました

Unite.AIの発表の報道によると、OpenAIは、22か国の80人以上の公認心理師と精神科医の集団と共同でベンチマークを作成した。彼らは合わせて19の言語を話し、メンタルヘルスの下位専門分野約20を代表している。完全リリースには、専門家が作成した 5,262 のルーブリック基準が含まれています。

各会話は 3 段階のプロセスを通じて少なくとも 3 人の専門家によってレビューされました。2 人の臨床医が独自に重み付けされた基準を作成し、3 人目の臨床医がその基準を裁定して洗練させました。少なくとも 2 人の専門家によって合意され、3 人目の専門家によって矛盾していない基準のみが保持されました。各基準はモデルの応答の 1 つの側面を対象としており、-10 から +10 までの重みがあり、絶対値が大きいほど臨床的重要性が高いことを示します。

米国心理学会の最高経営責任者(CEO)であるアーサー・エバンス博士は発表文の中で、メンタルヘルスは連続体として存在し、その範囲にわたって人々を魅了するAIシステムには臨床科学と実際の経験の両方に基づく必要があると述べた。

ベンチマークの内容

1,215 件の会話は、重大度や助けを求めている人が意図的に異なります。

  • 非緊急会話はデータセットの 53.5 パーセントを占め、緊急 会話は 18.2 パーセント、緊急 会話は 28.3 パーセントを占めます。
  • 4 つのユーザー プロファイルが示されています。成人が 68.1 パーセント、十代の若者が 21.2 パーセント、臨床医が 5.8 パーセント、介護者が 4.9 パーセントです。
  • 会話は、研究論文で Clio 手法と同様のプライバシー保護技術を使用して合成的に生成され、実際のユーザーを暴露することなく現実世界の ChatGPT メンタルヘルスの使用パターンを反映することを目的としています。
  • ベンチマークの 5.8% である 70 のタスクには、最近の家族の喪失など、以前のユーザー コンテキストが含まれています。
  • ベンチマークには英語のほかに、スペイン語 105 件、ヒンディー語 54 件、アラビア語 34 件、ポルトガル語 29 件の会話が含まれており、さらにドイツ語、イタリア語、ペルシア語、インドネシア語、トルコ語、中国語の会話も含まれています。

モデルの得点方法

評価は、タスクごとに独立してサンプリングされた 4 つの判断を使用して、自動採点機 (GPT-5.6 Sol を高度な推論努力で実行) によって採点され、結果は、文脈探索、共感、緊急性の調整、現実テストなど、専門家が定義した 10 個の行動軸にわたって分解できます。

OpenAI が報告した結果では、GPT-6 Astra が 57.3 パーセントで最も高いスコアを獲得しました。続いて GPT-6 Sol が 53.9 パーセント、Anthropic の Claude Opus 5.5 が 52.4 パーセント、GPT-6 Luna が 50.2 パーセントでした。古い世代はそれに大きく遅れをとっています。2025 年 3 月の GPT-4o のスコアは 32.1 パーセント、Gemini 2.5 Pro のスコアは 29.5 パーセントで、すべての数値には 95 パーセントの信頼区間がありました。

2 つの基準点がこれらの数値を構成します。採点ルーブリックに完全にアクセスして書かれた回答は 99.0 パーセントのスコア(評価のノイズ シーリングの健全性チェック)を獲得しましたが、臨床医自身が書いた回答のスコアは 38.5 パーセントにとどまりました。これは主に、臨床医が包括的なチャットボットの返信ではなく、短くて対面形式の回答を書くためです。

OpenAIは、この結果はモデルの世代間で着実な改善を示している一方、適切なコンテキストの探索と緊急性の調整において改善の余地があることを強調していると述べた。特に、この論文はトレードオフを報告している。緊急でリスクの高い会話に慎重なモデルは、日常的な会話に取り組むのが遅くなる可能性があり、その逆も同様である。

「良いもの」がどのようなものであるかについて、ユーザーと専門家の意見は一致していません

OpenAI は、ベンチマークと並行して、メンタルヘルスまたは感情的サポートのために AI を使用したことがある 16 か国、14 言語を代表する 44 人の成人を対象に別の分析を実行しました。参加者は模範的な回答を評価し、独自の基準を書きましたが、参加者を悲惨な内容にさらすことを避けるために、レビューは急性ではない会話に限定されていました。

ユーザーと専門家のルーブリックは、ルーブリック総重量のわずか 25.7 パーセントで一致しており、1.0 パーセントは直接矛盾しています。ユーザーは、実際的な次のステップとトーンを強調しました。専門家は、関連する文脈を収集し、曖昧な状況を注意深く解釈することに重点を置きました。 OpenAI の結論: ユーザーのフィードバックは一貫性のある補完的なシグナルですが、臨床および安全性のガイダンスと置き換えることはできません。

リーダーボードではなく、監査可能な診断

OpenAI は、MentalHealthBench が決定的なリーダーボードではなく、監査可能な診断ツールであること、およびその言語比較が記述的なものであること、つまり言語の影響を鋭さ、トピック、文化、ユーザー プロファイルの違いから切り離すことはできないことを明確にしています。データセットはダウンロードでき、各サンプルにはカナリア文字列が含まれているため、研究者はデータが将来のトレーニング コーパスに漏洩したかどうかを検出できます。

同社はまた、AI メンタルヘルス研究への研究助成金、AI に関するパートナーシップとの専門家会議、Transluce の独立したメンタルヘルス評価取り組みへの支援など、関連する取り組みについても言及しました。

注意すべき点は現実です。会話は合成であり、採点は自動化されており、OpenAI 独自のモデルは OpenAI が設計したベンチマークを上回っています。しかし、OpenAI は、専門家のルーブリック、採点方法、およびデータをオープンに公開することで、規制当局、臨床医、競合他社に、同社の毎週の使用量が示唆するように、賭け金が高まり続ける分野における共通の手段を提供しました。

---

AI の先を行く

最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。

AI ニュースをもっと読む→