OpenAI روز چهارشنبه MentalHealthBench را معرفی کرد، معیاری باز از 1215 مکالمه سلامت روان مصنوعی که برای اندازهگیری نحوه پاسخگویی سیستمهای هوش مصنوعی در سناریوهای واقع بینانه - از سؤالات رفاهی روزمره تا بحرانهای فوری - با هر سناریویی که توسط پزشکان دارای مجوز بررسی و امتیازدهی میشود، طراحی شده است.
این نسخه فراتر از مدل های خود OpenAI اهمیت دارد. به گفته این شرکت، بیش از یک میلیارد نفر هر هفته از ChatGPT استفاده می کنند، و چت ربات های هوش مصنوعی بی سر و صدا به اولین ایستگاه برای افرادی که در پریشانی عاطفی هستند تبدیل شده اند. تا به حال، صنعت فاقد معیار دقیق و مشترک برای آن رفتار بوده است. برای زمینه بیشتر در مورد این داستان، [پوشش صنعت هوش مصنوعی] (https://aibuzzwire.news) را ببینید.
با بیش از 80 پزشک در 22 کشور ساخته شده است
بر اساس پوشش اعلامیه Unite.AI، OpenAI این معیار را با گروهی متشکل از بیش از 80 روانشناس و روانپزشک دارای مجوز در 22 کشور ایجاد کرد که مجموعاً به 19 زبان صحبت می کنند و تقریباً 20 تخصص فرعی سلامت روان را نمایندگی می کنند. نسخه کامل شامل 5262 معیار روبریک نویسنده متخصص است.
هر مکالمه توسط حداقل سه کارشناس طی یک فرآیند سه مرحلهای بررسی شد: دو پزشک به طور مستقل معیارهای وزنی را تألیف کردند، سومی آنها را مورد قضاوت و اصلاح قرار داد، و تنها معیارهایی که حداقل دو متخصص با آن موافقت کردند - و توسط یک نفر سوم مغایرت نداشت - حفظ شدند. هر معیار یک جنبه از پاسخ یک مدل را هدف قرار می دهد و وزنی از 10- تا 10+ دارد، با مقادیر مطلق بزرگتر که نشان دهنده اهمیت بالینی بیشتر است.
مدیر عامل انجمن روانشناسی آمریکا، دکتر آرتور ایوانز، در این اطلاعیه نقل شده است که سلامت روان به صورت پیوسته وجود دارد و سیستم های هوش مصنوعی که افراد را در آن محدوده درگیر می کنند، هم در علم بالینی و هم در تجربیات زنده نیاز دارند.
آنچه در معیار است
1215 مکالمه عمداً از نظر شدت و درخواست کمک متفاوت هستند:
- مکالمات غیرحاد 53.5 درصد از مجموعه داده ها، مکالمات با دقت بالا 18.2 درصد و مکالمات اضطراری 28.3 درصد را تشکیل می دهند.
- چهار نمایه کاربر نشان داده شده است: بزرگسالان با 68.1 درصد، نوجوانان با 21.2 درصد، پزشکان با 5.8 درصد، و مراقبان با 4.9 درصد.
- مکالمات به صورت مصنوعی و با استفاده از تکنیکهای حفظ حریم خصوصی که مقاله تحقیقاتی آن را شبیه به روش Clio توصیف میکند، ایجاد شد، با هدف انعکاس الگوهای استفاده از سلامت روان ChatGPT در دنیای واقعی بدون افشای کاربران واقعی.
- هفتاد کار - 5.8 درصد از معیار - دارای زمینه کاربر قبلی است، مانند از دست دادن اخیر در خانواده.
- فراتر از انگلیسی، معیار شامل 105 مکالمه اسپانیایی، 54 هندی، 34 عربی، و 29 مکالمه پرتغالی، با مکالمات اضافی به زبان های آلمانی، ایتالیایی، فارسی، اندونزیایی، ترکی و چینی است.
چگونه مدل ها امتیاز گرفتند
ارزیابیها توسط یک درجهدهنده خودکار - GPT-5.6 Sol با تلاش استدلالی بالا - با چهار قضاوت نمونهگیری مستقل در هر کار به ثمر رسید و نتایج را میتوان در ده محور رفتاری تعریفشده توسط متخصص از جمله جستجوی زمینه، همدلی، کالیبراسیون فوری و آزمایش واقعیت تجزیه کرد.
در نتایج گزارش شده OpenAI، **GPT-6 Astra با 57.3 درصد بالاترین امتیاز را کسب کرد، پس از آن GPT-6 Sol با 53.9 درصد، Claude Opus 5.5 از Anthropic با 52.4 درصد و GPT-6 Luna با 50.2 درصد قرار گرفتند. نسلهای قدیمیتر خیلی عقب ماندهاند: GPT-4o از مارس 2025 امتیاز 32.1 درصد و Gemini 2.5 Pro امتیاز 29.5 درصد را بهدست آوردهاند که همه ارقام دارای فاصلههای اطمینان 95 درصدی هستند.
دو نقطه مرجع آن اعداد را قاب می کنند. تکمیلهایی که با دسترسی کامل به روبریکهای درجهبندی نوشته شدهاند 99.0 درصد امتیاز کسب کردهاند - یک بررسی عقلانی در سقف نویز ارزیابی - در حالی که تکمیلهایی که توسط خود پزشکان نوشته شدهاند فقط 38.5 درصد امتیاز کسب کردهاند، عمدتاً به این دلیل که پزشکان بهجای پاسخهای جامع چتبات، پاسخهای کوتاه و شخصی را مینویسند.
OpenAI گفت که نتایج نشان دهنده بهبود مستمر در بین نسلهای مدل است، در حالی که فضای بهبود در جستجوی زمینه مناسب و کالیبراسیون فوریت را برجسته میکند. به طور قابلتوجه، این مقاله یک معامله را گزارش میکند: مدلهایی که در مکالمات اضطراری و پرخطر محتاط هستند، میتوانند در مکالمات روزمره کندتر عمل کنند و بالعکس.
كاربران و كارشناسان در مورد ظاهر «خوب» اختلاف نظر دارند
در کنار این معیار، OpenAI تجزیه و تحلیل جداگانه ای را با 44 بزرگسال که از هوش مصنوعی برای سلامت روان یا حمایت عاطفی استفاده کرده بودند، به نمایندگی از 16 کشور و 14 زبان انجام داد. شرکتکنندگان پاسخهای مدل را رتبهبندی کردند و معیارهای خود را نوشتند، اگرچه بررسی آنها به مکالمات غیرحاد محدود شد تا از قرار دادن آنها در معرض مطالب ناراحتکننده جلوگیری شود.
روبریکهای کاربر و متخصص تنها در 25.7 درصد وزن کل روبریک، با 1.0 درصد مستقیماً متناقض بودند. کاربران بر مراحل و لحن عملی بعدی تأکید کردند. کارشناسان وزن بیشتری بر گردآوری زمینه های مرتبط و تفسیر دقیق موقعیت های مبهم گذاشتند. نتیجه گیری OpenAI: بازخورد کاربر یک سیگنال منسجم و مکمل است، اما با راهنمای بالینی و ایمنی قابل تعویض نیست.
یک تشخیص قابل بازرسی، نه یک تابلوی امتیازات
OpenAI صریح است که MentalHealthBench یک ابزار تشخیصی قابل ممیزی است نه یک تابلوی امتیازی قطعی، و مقایسه زبان آن توصیفی است - آنها نمی توانند تأثیر زبان را از تفاوت در حدت، موضوع، فرهنگ یا نمایه کاربر جدا کنند. مجموعه داده برای دانلود در دسترس است، و هر نمونه دارای یک رشته قناری است تا محققان بتوانند تشخیص دهند که آیا داده ها به مجموعه های آموزشی آینده نشت می کند یا خیر.
این شرکت همچنین به تلاشهای مرتبط، از جمله کمک هزینههای تحقیقاتی برای کار سلامت روان هوش مصنوعی، گردهماییهای تخصصی با مشارکت در زمینه هوش مصنوعی، و کمک به تلاش مستقل ارزیابی سلامت روان Transluce اشاره کرد.
اخطارها واقعی هستند: مکالمات مصنوعی هستند، درجه بندی خودکار است، و مدل های خود OpenAI بالاتر از معیار طراحی OpenAI هستند. اما OpenAI با انتشار روبریکهای تخصصی، روششناسی درجهبندی و دادهها، ابزار مشترکی را برای تنظیمکنندهها، پزشکان و رقبا در اختیار دامنهای قرار داده است که در آن - همانطور که اعداد استفاده هفتگی خود شرکت نشان میدهد - ریسکها همچنان در حال افزایش است.
---
از هوش مصنوعی جلوتر بمانیدآخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →