OpenAI הציגה את MentalHealthBench ביום רביעי, אמת מידה פתוחה של 1,215 שיחות סינתטיות על בריאות הנפש שנועדו למדוד איך מערכות בינה מלאכותית מגיבות בתרחישים מציאותיים - החל משאלות רווחה יומיומיות ועד למשברים דחופים - כאשר כל תרחיש נבדק ומקבל ניקוד על ידי רופאים מורשים.
המהדורה חשובה הרבה מעבר לדגמים של OpenAI עצמה. יותר ממיליארד אנשים משתמשים ב-ChatGPT מדי שבוע, לפי החברה, וצ'אטבוטים של AI הפכו בשקט לתחנה ראשונה עבור אנשים במצוקה רגשית. עד כה, התעשייה חסרה קנה מידה קפדני ומשותף להתנהגות זו. להקשר נוסף על הסיפור הזה, עיין בסיקור תעשיית הבינה המלאכותית שלנו.
נבנה עם יותר מ-80 רופאים ב-22 מדינות
OpenAI יצרה את המדד יחד עם קבוצה של יותר מ-80 פסיכולוגים ופסיכיאטרים מורשים ב-22 מדינות, שדוברים ביחד 19 שפות ומייצגים כמעט 20 תת התמחויות בבריאות הנפש, על פי סיקור ההכרזה של Unite.AI. המהדורה המלאה מכילה 5,262 קריטריונים של רובריקות שנכתבו על ידי מומחה.
כל שיחה נבדקה על ידי לפחות שלושה מומחים בתהליך בן שלושה שלבים: שני קלינאים חיברו באופן עצמאי קריטריונים משוקללים, שלישית קבעה ושכללה אותם, ורק קריטריונים שעליהם הסכימו לפחות שני מומחים - ולא סתרו על ידי שלישי - נשמרו. כל קריטריון מכוון להיבט בודד של תגובת המודל והוא נושא משקל מ-10 עד 10+, כאשר ערכים מוחלטים גדולים יותר מצביעים על חשיבות קלינית רבה יותר.
מנכ"ל איגוד הפסיכולוגים האמריקני, ד"ר ארתור אוונס, צוטט בהודעה שאמר כי בריאות הנפש קיימת על רצף, וכי מערכות בינה מלאכותית העוסקות באנשים בטווח זה זקוקות לביסוס הן במדע הקליני והן בניסיון חי.
מה יש במדד
1,215 השיחות מגוונות בכוונה בחומרה ובמי שמבקש עזרה:
- שיחות לא חריפות מהוות 53.5 אחוזים ממערך הנתונים, שיחות בחדות גבוהה עבור 18.2 אחוזים, ושיחות מתעוררות עבור 28.3 אחוזים.
- ארבעה פרופילי משתמשים מיוצגים: מבוגרים ב-68.1 אחוזים, בני נוער ב-21.2 אחוזים, רופאים ב-5.8 אחוזים ומטפלים ב-4.9 אחוזים.
- השיחות נוצרו באופן סינתטי תוך שימוש בטכניקות לשמירה על הפרטיות שמאמר המחקר מתאר כדומים למתודולוגיית ה-Clio שלו, במטרה לשקף דפוסי שימוש אמיתיים של ChatGPT בבריאות הנפש מבלי לחשוף משתמשים אמיתיים.
- שבעים משימות - 5.8 אחוז מהמדד - נושאות הקשר קודם של המשתמש, כמו אובדן לאחרונה במשפחה.
- מעבר לאנגלית, המדד כולל 105 שיחות ספרדית, 54 הינדית, 34 ערבית ו-29 שיחות פורטוגזית, עם שיחות נוספות בגרמנית, איטלקית, פרסית, אינדונזית, טורקית וסינית.
איך השיגו הדוגמניות
הערכות קיבלו ציון על ידי מדרוג אוטומטי - GPT-5.6 Sol הפועל במאמץ חשיבה גבוה - עם ארבעה שיפוטים שנדגמו באופן עצמאי לכל משימה, וניתן לפרק את התוצאות על פני עשרה צירים התנהגותיים המוגדרים על ידי מומחה, כולל חיפוש הקשר, אמפתיה, כיול דחיפות ובדיקת מציאות.
בתוצאות המדווחות של OpenAI, GPT-6 Astra השיגה את הציון הגבוה ביותר עם 57.3 אחוזים, ואחריה GPT-6 Sol ב-53.9 אחוזים, קלוד אופוס 5.5 של Anthropic ב-52.4 אחוזים, ו-GPT-6 לונה ב-50.2 אחוזים. דורות מבוגרים השתרכו בפיגור: GPT-4o ממרץ 2025 קיבל ציון של 32.1 אחוזים ו-Gemini 2.5 Pro קיבל ציון של 29.5 אחוזים, כאשר כל הנתונים נושאים רווחי סמך של 95 אחוזים.
שתי נקודות ייחוס ממסגרות את המספרים הללו. השלמות שנכתבו עם גישה מלאה לרובריקות הדירוג קיבלו ציון של 99.0 אחוז - בדיקת שפיות על תקרת הרעש של ההערכה - בעוד שהשלמות שנכתבו על ידי רופאים עצמם קיבלו ציון של 38.5 אחוז בלבד, בעיקר בגלל שהקלינאים כותבים תגובות קצרות בסגנון אישי ולא תשובות צ'אטבוט מקיפות.
OpenAI אמר שהתוצאות מראות שיפור מתמיד על פני דורות הדגמים, תוך הדגשת מקום לשיפור בחיפוש ההקשר המתאים ובדחיפות הכיול. יש לציין שהעיתון מדווח על פשרה: מודלים שנזהרים בשיחות מתעוררות בסיכון גבוה יכולים להיות איטיים יותר לעסוק בשיחות יומיומיות, ולהיפך.
משתמשים ומומחים חלוקים בדעתם לגבי איך "טוב" נראה
לצד המדד, OpenAI ערך ניתוח נפרד עם 44 מבוגרים שהשתמשו בבינה מלאכותית לבריאות נפשית או לתמיכה רגשית, המייצגים 16 מדינות ו-14 שפות. המשתתפים דירגו את תגובות המודל וכתבו קריטריונים משלהם, אם כי סקירתם הוגבלה לשיחות לא חריפות כדי להימנע מחשיפתם לחומר מציק.
הקריטריונים של המשתמשים והמומחים היו מיושרים על רק 25.7 אחוז ממשקל הכלל, כאשר 1.0 אחוז סותרים באופן ישיר. המשתמשים הדגישו את הצעדים הבאים ואת הטון המעשיים; מומחים נתנו משקל רב יותר לאיסוף הקשר רלוונטי ולפרש בקפידה מצבים מעורפלים. המסקנה של OpenAI: משוב משתמשים הוא אות קוהרנטי ומשלים, אך אינו ניתן להחלפה עם הנחיה קלינית ובטיחותית.
אבחון שניתן לביקורת, לא לוח הישגים
OpenAI מפורש ש- MentalHealthBench הוא כלי אבחון הניתן לביקורת ולא לוח תוצאות סופי, ושהשוואות השפה שלו הן תיאוריות - הן לא יכולות לבודד את השפעת השפה מהבדלים בחדות, בנושא, בתרבות או בפרופיל המשתמש. מערך הנתונים זמין להורדה, וכל דוגמה נושאת מחרוזת קנרית כדי שהחוקרים יוכלו לזהות אם הנתונים דולפים לתוך גופי אימון עתידיים.
החברה גם הצביעה על מאמצים קשורים, כולל מענקי מחקר לעבודה בבריאות הנפש בינה מלאכותית, כינוסים של מומחים עם השותפות בנושא בינה מלאכותית וסיוע למאמץ העצמאי של Transluce להערכת בריאות הנפש.
ההסתייגות אמיתיות: השיחות הן סינתטיות, הדירוג הוא אוטומטי, והדגמים של OpenAI עצמם נמצאים בראש רף שעוצב OpenAI. אבל על ידי שחרור כללי המומחים, מתודולוגיית הדירוג והנתונים באופן גלוי, OpenAI נתנה לרגולטורים, לרופאים ולמתחרים מכשיר משותף לתחום שבו - כפי שמצביעים מספרי השימוש השבועי של החברה עצמה - ההימור ממשיך לעלות.
---
הישאר לפני AIקבל את החדשות, הניתוחים ופריצות הדרך האחרונות של AI - הכל במקום אחד.
קרא עוד חדשות AI →