OpenAI hat am Mittwoch MentalHealthBench eingeführt, einen offenen Benchmark von 1.215 synthetischen Gesprächen über psychische Gesundheit, der messen soll, wie KI-Systeme in realistischen Szenarien reagieren – von alltäglichen Fragen zum Wohlbefinden bis hin zu dringenden Krisen – wobei jedes Szenario von lizenzierten Klinikern überprüft und bewertet wird.

Die Veröffentlichung ist weit über die eigenen Modelle von OpenAI hinaus von Bedeutung. Nach Angaben des Unternehmens nutzen jede Woche mehr als eine Milliarde Menschen ChatGPT, und KI-Chatbots sind in aller Stille zu einer ersten Anlaufstelle für Menschen in emotionaler Not geworden. Bisher fehlte der Branche ein strenger, gemeinsamer Maßstab für dieses Verhalten. Weitere Informationen zu dieser Geschichte finden Sie in unserer laufenden KI-Branchenberichterstattung.

Gebaut mit mehr als 80 Ärzten in 22 Ländern

OpenAI hat den Benchmark gemeinsam mit einer Kohorte von mehr als 80 zugelassenen Psychologen und Psychiatern in 22 Ländern erstellt, die zusammen 19 Sprachen sprechen und fast 20 Fachgebiete für psychische Gesundheit repräsentieren, wie aus der Berichterstattung von Unite.AI über die Ankündigung hervorgeht. Die vollständige Veröffentlichung enthält 5.262 von Experten verfasste Rubrikkriterien.

Jedes Gespräch wurde von mindestens drei Experten in einem dreistufigen Prozess überprüft: Zwei Kliniker verfassten unabhängig voneinander gewichtete Kriterien, ein dritter beurteilte und verfeinerte sie, und nur Kriterien, denen mindestens zwei Experten zustimmten – und denen ein Dritter nicht widersprach – wurden beibehalten. Jedes Kriterium zielt auf einen einzelnen Aspekt der Reaktion eines Modells ab und hat eine Gewichtung von -10 bis +10, wobei größere absolute Werte auf eine größere klinische Bedeutung hinweisen.

Der CEO der American Psychological Association, Dr. Arthur Evans, wurde in der Ankündigung mit den Worten zitiert, dass psychische Gesundheit auf einem Kontinuum existiert und dass KI-Systeme, die Menschen in diesem Bereich einbeziehen, sowohl auf klinischer Wissenschaft als auch auf gelebter Erfahrung basieren müssen.

Was steht im Benchmark?

Die 1.215 Gespräche sind bewusst unterschiedlich im Schweregrad und in der Frage, wer um Hilfe bittet:

  • Nicht-akute Gespräche machen 53,5 Prozent des Datensatzes aus, Gespräche mit hoher Schärfe 18,2 Prozent und Notgespräche 28,3 Prozent.
  • Es sind vier Benutzerprofile vertreten: Erwachsene mit 68,1 Prozent, Jugendliche mit 21,2 Prozent, Ärzte mit 5,8 Prozent und Pflegekräfte mit 4,9 Prozent.
  • Die Konversationen wurden synthetisch mithilfe von Techniken zur Wahrung der Privatsphäre generiert, die laut Forschungsbericht der Clio-Methodik ähneln und darauf abzielen, reale ChatGPT-Nutzungsmuster im Bereich der psychischen Gesundheit abzubilden, ohne echte Benutzer preiszugeben.
  • Siebzig Aufgaben – 5,8 Prozent des Benchmarks – enthalten früheren Benutzerkontext, beispielsweise einen kürzlichen Verlust in der Familie.
  • Über Englisch hinaus umfasst der Benchmark 105 Spanisch-, 54 Hindi-, 34 Arabisch- und 29 Portugiesisch-Konversationen sowie zusätzliche Konversationen in Deutsch, Italienisch, Persisch, Indonesisch, Türkisch und Chinesisch.

So punkteten die Models

Die Bewertungen wurden von einem automatisierten Grader – GPT-5.6 Sol, der mit hohem Argumentationsaufwand läuft – mit vier unabhängigen Urteilen pro Aufgabe bewertet, und die Ergebnisse können in zehn von Experten definierte Verhaltensachsen zerlegt werden, darunter Kontextsuche, Empathie, Dringlichkeitskalibrierung und Realitätstests.

In den von OpenAI gemeldeten Ergebnissen schnitt GPT-6 Astra mit 57,3 Prozent am höchsten ab, gefolgt von GPT-6 Sol mit 53,9 Prozent, Claude Opus 5.5 von Anthropic mit 52,4 Prozent und GPT-6 Luna mit 50,2 Prozent. Ältere Generationen lagen deutlich zurück: GPT-4o vom März 2025 erreichte 32,1 Prozent und Gemini 2.5 Pro erreichte 29,5 Prozent, wobei alle Zahlen ein Konfidenzintervall von 95 Prozent hatten.

Zwei Referenzpunkte umrahmen diese Zahlen. Vervollständigungen, die mit vollem Zugriff auf die Bewertungsrubriken geschrieben wurden, erreichten 99,0 Prozent – ​​eine Plausibilitätsprüfung der Rauschobergrenze der Bewertung –, während Vervollständigungen, die von Klinikern selbst verfasst wurden, nur 38,5 Prozent erreichten, was vor allem daran lag, dass Kliniker kurze, persönliche Antworten statt umfassender Chatbot-Antworten verfassten.

Laut OpenAI zeigen die Ergebnisse eine stetige Verbesserung über die Modellgenerationen hinweg und verdeutlichen gleichzeitig Verbesserungspotenzial bei der Suche nach einem geeigneten Kontext und der Kalibrierung der Dringlichkeit. Bemerkenswerterweise berichtet das Papier über einen Kompromiss: Modelle, die bei aufkommenden, risikoreichen Gesprächen vorsichtig sind, können bei alltäglichen Gesprächen langsamer sein und umgekehrt.

Benutzer und Experten sind sich nicht einig darüber, wie „gut“ aussieht

Neben dem Benchmark führte OpenAI eine separate Analyse mit 44 Erwachsenen aus 16 Ländern und 14 Sprachen durch, die KI zur psychischen Gesundheit oder emotionalen Unterstützung eingesetzt hatten. Die Teilnehmer bewerteten die Antworten des Modells und verfassten ihre eigenen Kriterien. Ihre Bewertung beschränkte sich jedoch auf nicht akute Gespräche, um zu vermeiden, dass sie beunruhigendem Material ausgesetzt wurden.

Benutzer- und Expertenrubriken stimmten nur bei 25,7 Prozent des gesamten Rubrikengewichts überein, wobei 1,0 Prozent direkt widersprüchlich waren. Die Benutzer legten Wert auf praktische nächste Schritte und den Ton; Experten legten größeren Wert auf die Erfassung des relevanten Kontexts und die sorgfältige Interpretation mehrdeutiger Situationen. Fazit von OpenAI: Benutzerfeedback ist ein kohärentes und ergänzendes Signal, aber nicht austauschbar mit klinischen und sicherheitsrelevanten Leitlinien.

Eine überprüfbare Diagnose, keine Bestenliste

OpenAI weist ausdrücklich darauf hin, dass es sich bei MentalHealthBench um ein überprüfbares Diagnosetool und nicht um eine definitive Rangliste handelt und dass seine Sprachvergleiche beschreibend sind – sie können die Wirkung der Sprache nicht von Unterschieden in der Schärfe, dem Thema, der Kultur oder dem Benutzerprofil isolieren. Der Datensatz steht zum Download zur Verfügung und jedes Beispiel enthält eine Canary-Zeichenfolge, damit Forscher erkennen können, ob die Daten in zukünftige Trainingskorpora gelangen.

Das Unternehmen wies auch auf damit verbundene Bemühungen hin, darunter Forschungsstipendien für KI-Arbeit im Bereich der psychischen Gesundheit, Expertentreffen mit der Partnership on AI und Unterstützung für die unabhängige Bewertung der psychischen Gesundheit von Transluce.

Die Vorbehalte sind real: Die Gespräche sind synthetisch, die Bewertung ist automatisiert und die eigenen Modelle von OpenAI übertreffen einen von OpenAI entwickelten Benchmark. Aber durch die offene Veröffentlichung der Expertenrubriken, der Bewertungsmethodik und der Daten hat OpenAI Aufsichtsbehörden, Ärzten und Wettbewerbern ein gemeinsames Instrument für einen Bereich an die Hand gegeben, in dem – wie die wöchentlichen Nutzungszahlen des Unternehmens zeigen – der Einsatz immer weiter steigt.

---

Der KI einen Schritt voraus sein

Erhalten Sie die neuesten KI-Nachrichten, Analysen und Durchbrüche – alles an einem Ort.

Weitere KI-Neuigkeiten lesen →