قدمت OpenAI MentalHealthBench يوم الأربعاء، وهو معيار مفتوح يضم 1215 محادثة اصطناعية تتعلق بالصحة العقلية مصممة لقياس كيفية استجابة أنظمة الذكاء الاصطناعي في سيناريوهات واقعية - بدءًا من أسئلة الرفاهية اليومية إلى الأزمات العاجلة - مع مراجعة كل سيناريو وتسجيله بواسطة أطباء مرخصين.

الإصدار له أهمية تتجاوز نماذج OpenAI الخاصة. يستخدم أكثر من مليار شخص ChatGPT كل أسبوع، وفقًا للشركة، وأصبحت روبوتات الدردشة المدعمة بالذكاء الاصطناعي بمثابة المحطة الأولى للأشخاص الذين يعانون من ضائقة عاطفية. وحتى الآن، كانت الصناعة تفتقر إلى مقياس صارم ومشترك لهذا السلوك. لمزيد من السياق حول هذه القصة، راجع [تغطية صناعة الذكاء الاصطناعي] المستمرة لدينا (https://aibuzzwire.news).

تم تصميمه بمشاركة أكثر من 80 طبيبًا في 22 دولة

شاركت OpenAI في إنشاء المعيار مع مجموعة مكونة من أكثر من 80 عالمًا نفسيًا وطبيبًا نفسيًا مرخصًا في 22 دولة، والذين يتحدثون بشكل جماعي 19 لغة ويمثلون ما يقرب من 20 تخصصًا فرعيًا للصحة العقلية، وفقًا لتغطية الإعلان بواسطة Unite.AI. يحتوي الإصدار الكامل على 5,262 معيارًا من معايير التقييم التي كتبها الخبراء.

تمت مراجعة كل محادثة من قبل ثلاثة خبراء على الأقل من خلال عملية مكونة من ثلاث مراحل: قام اثنان من الأطباء بشكل مستقل بتأليف معايير مرجحة، وقام ثالث بالفصل فيها وتحسينها، وتم الاحتفاظ بالمعايير التي وافق عليها خبيران على الأقل - ولم يتعارضها ثلث. يستهدف كل معيار جانبًا واحدًا من استجابة النموذج ويحمل وزنًا يتراوح من -10 إلى +10، مع وجود قيم مطلقة أكبر تشير إلى أهمية سريرية أكبر.

نُقل عن الرئيس التنفيذي لجمعية علم النفس الأمريكية، الدكتور آرثر إيفانز، في الإعلان قوله إن الصحة العقلية موجودة في سلسلة متواصلة، وأن أنظمة الذكاء الاصطناعي التي تشرك الأشخاص عبر هذا النطاق تحتاج إلى ترسيخ في كل من العلوم السريرية والخبرة الحياتية.

ما هو في المعيار

تتنوع المحادثات البالغ عددها 1215 عمدًا من حيث الخطورة ومن يطلب المساعدة:

  • المحادثات غير الحادة تمثل 53.5 بالمائة من مجموعة البيانات، والمحادثات عالية الحدة بنسبة 18.2 بالمائة، والمحادثات الطارئة بنسبة 28.3 بالمائة.
  • يتم تمثيل أربعة ملفات تعريف للمستخدمين: البالغين بنسبة 68.1 في المائة، والمراهقين بنسبة 21.2 في المائة، والأطباء بنسبة 5.8 في المائة، ومقدمي الرعاية بنسبة 4.9 في المائة.
  • تم إنشاء المحادثات بشكل صناعي باستخدام تقنيات الحفاظ على الخصوصية التي تصفها ورقة البحث بأنها مشابهة لمنهجية Clio الخاصة بها، والتي تهدف إلى عكس أنماط استخدام الصحة العقلية ChatGPT في العالم الحقيقي دون الكشف عن مستخدمين حقيقيين.
  • سبعون مهمة - 5.8 بالمائة من المعيار - تحمل سياق مستخدم سابق، مثل خسارة حديثة في العائلة.
  • بالإضافة إلى اللغة الإنجليزية، يتضمن المعيار 105 محادثة إسبانية و54 هندية و34 عربية و29 محادثة برتغالية، مع محادثات إضافية باللغات الألمانية والإيطالية والفارسية والإندونيسية والتركية والصينية.

كيف سجلت العارضات

تم تسجيل التقييمات بواسطة مُصنف آلي — GPT-5.6 Sol يعمل بجهد تفكير عالي — مع أربعة أحكام تم أخذ عينات منها بشكل مستقل لكل مهمة، ويمكن تحليل النتائج عبر عشرة محاور سلوكية محددة من قبل الخبراء بما في ذلك البحث عن السياق، والتعاطف، ومعايرة الإلحاح، واختبار الواقع.

في نتائج OpenAI المعلنة، سجل GPT-6 Astra أعلى نسبة بنسبة 57.3 بالمائة، يليه GPT-6 Sol بنسبة 53.9 بالمائة، وAnthropic's Claude Opus 5.5 بنسبة 52.4 بالمائة، وGPT-6 Luna بنسبة 50.2 بالمائة. وجاءت الأجيال الأكبر سنا متأخرة كثيرا: فقد سجل GPT-4o من مارس 2025 32.1 في المائة، وسجل Gemini 2.5 Pro 29.5 في المائة، وتحمل جميع الأرقام فواصل ثقة بنسبة 95 في المائة.

نقطتان مرجعيتان تؤطران هذه الأرقام. سجلت الإكمالات المكتوبة مع إمكانية الوصول الكامل إلى معايير التقييم 99.0 بالمائة - وهو اختبار سلامة لسقف الضوضاء في التقييم - في حين سجلت الإكمالات التي كتبها الأطباء أنفسهم 38.5 بالمائة فقط، ويرجع ذلك إلى حد كبير إلى أن الأطباء يكتبون استجابات قصيرة بأسلوب شخصي بدلاً من ردود الدردشة الشاملة.

وقالت OpenAI إن النتائج تظهر تحسنًا مطردًا عبر أجيال النماذج، مع تسليط الضوء على مجال للتحسين في البحث عن السياق المناسب ومعايرة الإلحاح. ومن الجدير بالذكر أن الورقة البحثية تشير إلى مقايضة: النماذج التي تتوخى الحذر في المحادثات الناشئة عالية المخاطر يمكن أن تكون أبطأ في المشاركة في المحادثات اليومية، والعكس صحيح.

يختلف المستخدمون والخبراء حول الشكل الذي تبدو عليه كلمة "جيد".

إلى جانب المعيار، أجرت OpenAI تحليلاً منفصلاً مع 44 شخصًا بالغًا استخدموا الذكاء الاصطناعي للصحة العقلية أو الدعم العاطفي، يمثلون 16 دولة و14 لغة. قام المشاركون بتقييم الاستجابات النموذجية وكتبوا معاييرهم الخاصة، على الرغم من أن مراجعتهم اقتصرت على المحادثات غير الحادة لتجنب تعريضهم لمواد مؤلمة.

تتوافق عناوين التقييم الخاصة بالمستخدمين والخبراء مع 25.7 بالمائة فقط من إجمالي وزن العناوين، مع وجود 1.0 بالمائة متناقضة بشكل مباشر. أكد المستخدمون على الخطوات العملية التالية والنبرة؛ أعطى الخبراء أهمية أكبر لجمع السياق ذي الصلة وتفسير المواقف الغامضة بعناية. استنتاج OpenAI: تعليقات المستخدمين هي إشارة متماسكة ومتكاملة، ولكنها غير قابلة للتبديل مع الإرشادات السريرية وإرشادات السلامة.

تشخيص قابل للتدقيق، وليس لوحة الصدارة

إن OpenAI صريحة في أن MentalHealthBench هي أداة تشخيصية قابلة للتدقيق وليست لوحة صدارة نهائية، وأن مقارناتها اللغوية وصفية - فهي لا تستطيع عزل تأثير اللغة عن الاختلافات في الحدة أو الموضوع أو الثقافة أو ملف تعريف المستخدم. مجموعة البيانات متاحة للتنزيل، وكل مثال يحمل سلسلة كناري حتى يتمكن الباحثون من اكتشاف ما إذا كانت البيانات تتسرب إلى مجموعات التدريب المستقبلية.

وأشارت الشركة أيضًا إلى الجهود ذات الصلة، بما في ذلك المنح البحثية لأعمال الصحة العقلية باستخدام الذكاء الاصطناعي، واجتماعات الخبراء مع الشراكة حول الذكاء الاصطناعي، والمساعدة في جهود تقييم الصحة العقلية المستقلة لشركة Transluce.

التحذيرات حقيقية: المحادثات اصطناعية، والتصنيف آلي، ونماذج OpenAI الخاصة تتفوق على المعيار الذي صممته OpenAI. ولكن من خلال إطلاق نماذج تقييم الخبراء، ومنهجية التصنيف، والبيانات بشكل علني، أعطت OpenAI المنظمين والأطباء والمنافسين أداة مشتركة لمجال حيث - كما تشير أرقام الاستخدام الأسبوعية للشركة - تستمر المخاطر في الارتفاع.

---

ابقَ في طليعة الذكاء الاصطناعي

احصل على آخر الأخبار والتحليلات والإنجازات في مجال الذكاء الاصطناعي — كل ذلك في مكان واحد.

اقرأ المزيد من أخبار الذكاء الاصطناعي →