OpenAI روز چهارشنبه MentalHealthBench را معرفی کرد، معیاری باز از 1215 مکالمه سلامت روان مصنوعی که برای اندازه‌گیری نحوه پاسخگویی سیستم‌های هوش مصنوعی در سناریوهای واقع بینانه - از سؤالات رفاهی روزمره تا بحران‌های فوری - با هر سناریویی که توسط پزشکان دارای مجوز بررسی و امتیازدهی می‌شود، طراحی شده است.

این نسخه فراتر از مدل های خود OpenAI اهمیت دارد. به گفته این شرکت، بیش از یک میلیارد نفر هر هفته از ChatGPT استفاده می کنند، و چت ربات های هوش مصنوعی بی سر و صدا به اولین ایستگاه برای افرادی که در پریشانی عاطفی هستند تبدیل شده اند. تا به حال، صنعت فاقد معیار دقیق و مشترک برای آن رفتار بوده است. برای زمینه بیشتر در مورد این داستان، [پوشش صنعت هوش مصنوعی] (https://aibuzzwire.news) را ببینید.

با بیش از 80 پزشک در 22 کشور ساخته شده است

بر اساس پوشش اعلامیه Unite.AI، OpenAI این معیار را با گروهی متشکل از بیش از 80 روانشناس و روانپزشک دارای مجوز در 22 کشور ایجاد کرد که مجموعاً به 19 زبان صحبت می کنند و تقریباً 20 تخصص فرعی سلامت روان را نمایندگی می کنند. نسخه کامل شامل 5262 معیار روبریک نویسنده متخصص است.

هر مکالمه توسط حداقل سه کارشناس طی یک فرآیند سه مرحله‌ای بررسی شد: دو پزشک به طور مستقل معیارهای وزنی را تألیف کردند، سومی آنها را مورد قضاوت و اصلاح قرار داد، و تنها معیارهایی که حداقل دو متخصص با آن موافقت کردند - و توسط یک نفر سوم مغایرت نداشت - حفظ شدند. هر معیار یک جنبه از پاسخ یک مدل را هدف قرار می دهد و وزنی از 10- تا 10+ دارد، با مقادیر مطلق بزرگتر که نشان دهنده اهمیت بالینی بیشتر است.

مدیر عامل انجمن روانشناسی آمریکا، دکتر آرتور ایوانز، در این اطلاعیه نقل شده است که سلامت روان به صورت پیوسته وجود دارد و سیستم های هوش مصنوعی که افراد را در آن محدوده درگیر می کنند، هم در علم بالینی و هم در تجربیات زنده نیاز دارند.

آنچه در معیار است

1215 مکالمه عمداً از نظر شدت و درخواست کمک متفاوت هستند:

  • مکالمات غیرحاد 53.5 درصد از مجموعه داده ها، مکالمات با دقت بالا 18.2 درصد و مکالمات اضطراری 28.3 درصد را تشکیل می دهند.
  • چهار نمایه کاربر نشان داده شده است: بزرگسالان با 68.1 درصد، نوجوانان با 21.2 درصد، پزشکان با 5.8 درصد، و مراقبان با 4.9 درصد.
  • مکالمات به صورت مصنوعی و با استفاده از تکنیک‌های حفظ حریم خصوصی که مقاله تحقیقاتی آن را شبیه به روش Clio توصیف می‌کند، ایجاد شد، با هدف انعکاس الگوهای استفاده از سلامت روان ChatGPT در دنیای واقعی بدون افشای کاربران واقعی.
  • هفتاد کار - 5.8 درصد از معیار - دارای زمینه کاربر قبلی است، مانند از دست دادن اخیر در خانواده.
  • فراتر از انگلیسی، معیار شامل 105 مکالمه اسپانیایی، 54 هندی، 34 عربی، و 29 مکالمه پرتغالی، با مکالمات اضافی به زبان های آلمانی، ایتالیایی، فارسی، اندونزیایی، ترکی و چینی است.

چگونه مدل ها امتیاز گرفتند

ارزیابی‌ها توسط یک درجه‌دهنده خودکار - GPT-5.6 Sol با تلاش استدلالی بالا - با چهار قضاوت نمونه‌گیری مستقل در هر کار به ثمر رسید و نتایج را می‌توان در ده محور رفتاری تعریف‌شده توسط متخصص از جمله جستجوی زمینه، همدلی، کالیبراسیون فوری و آزمایش واقعیت تجزیه کرد.

در نتایج گزارش شده OpenAI، **GPT-6 Astra با 57.3 درصد بالاترین امتیاز را کسب کرد، پس از آن GPT-6 Sol با 53.9 درصد، Claude Opus 5.5 از Anthropic با 52.4 درصد و GPT-6 Luna با 50.2 درصد قرار گرفتند. نسل‌های قدیمی‌تر خیلی عقب مانده‌اند: GPT-4o از مارس 2025 امتیاز 32.1 درصد و Gemini 2.5 Pro امتیاز 29.5 درصد را به‌دست آورده‌اند که همه ارقام دارای فاصله‌های اطمینان 95 درصدی هستند.

دو نقطه مرجع آن اعداد را قاب می کنند. تکمیل‌هایی که با دسترسی کامل به روبریک‌های درجه‌بندی نوشته شده‌اند 99.0 درصد امتیاز کسب کرده‌اند - یک بررسی عقلانی در سقف نویز ارزیابی - در حالی که تکمیل‌هایی که توسط خود پزشکان نوشته شده‌اند فقط 38.5 درصد امتیاز کسب کرده‌اند، عمدتاً به این دلیل که پزشکان به‌جای پاسخ‌های جامع چت‌بات، پاسخ‌های کوتاه و شخصی را می‌نویسند.

OpenAI گفت که نتایج نشان دهنده بهبود مستمر در بین نسل‌های مدل است، در حالی که فضای بهبود در جستجوی زمینه مناسب و کالیبراسیون فوریت را برجسته می‌کند. به طور قابل‌توجه، این مقاله یک معامله را گزارش می‌کند: مدل‌هایی که در مکالمات اضطراری و پرخطر محتاط هستند، می‌توانند در مکالمات روزمره کندتر عمل کنند و بالعکس.

كاربران و كارشناسان در مورد ظاهر «خوب» اختلاف نظر دارند

در کنار این معیار، OpenAI تجزیه و تحلیل جداگانه ای را با 44 بزرگسال که از هوش مصنوعی برای سلامت روان یا حمایت عاطفی استفاده کرده بودند، به نمایندگی از 16 کشور و 14 زبان انجام داد. شرکت‌کنندگان پاسخ‌های مدل را رتبه‌بندی کردند و معیارهای خود را نوشتند، اگرچه بررسی آنها به مکالمات غیرحاد محدود شد تا از قرار دادن آنها در معرض مطالب ناراحت‌کننده جلوگیری شود.

روبریک‌های کاربر و متخصص تنها در 25.7 درصد وزن کل روبریک، با 1.0 درصد مستقیماً متناقض بودند. کاربران بر مراحل و لحن عملی بعدی تأکید کردند. کارشناسان وزن بیشتری بر گردآوری زمینه های مرتبط و تفسیر دقیق موقعیت های مبهم گذاشتند. نتیجه گیری OpenAI: بازخورد کاربر یک سیگنال منسجم و مکمل است، اما با راهنمای بالینی و ایمنی قابل تعویض نیست.

یک تشخیص قابل بازرسی، نه یک تابلوی امتیازات

OpenAI صریح است که MentalHealthBench یک ابزار تشخیصی قابل ممیزی است نه یک تابلوی امتیازی قطعی، و مقایسه زبان آن توصیفی است - آنها نمی توانند تأثیر زبان را از تفاوت در حدت، موضوع، فرهنگ یا نمایه کاربر جدا کنند. مجموعه داده برای دانلود در دسترس است، و هر نمونه دارای یک رشته قناری است تا محققان بتوانند تشخیص دهند که آیا داده ها به مجموعه های آموزشی آینده نشت می کند یا خیر.

این شرکت همچنین به تلاش‌های مرتبط، از جمله کمک هزینه‌های تحقیقاتی برای کار سلامت روان هوش مصنوعی، گردهمایی‌های تخصصی با مشارکت در زمینه هوش مصنوعی، و کمک به تلاش مستقل ارزیابی سلامت روان Transluce اشاره کرد.

اخطارها واقعی هستند: مکالمات مصنوعی هستند، درجه بندی خودکار است، و مدل های خود OpenAI بالاتر از معیار طراحی OpenAI هستند. اما OpenAI با انتشار روبریک‌های تخصصی، روش‌شناسی درجه‌بندی و داده‌ها، ابزار مشترکی را برای تنظیم‌کننده‌ها، پزشکان و رقبا در اختیار دامنه‌ای قرار داده است که در آن - همانطور که اعداد استفاده هفتگی خود شرکت نشان می‌دهد - ریسک‌ها همچنان در حال افزایش است.

---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

بیشتر بخوانید اخبار هوش مصنوعی →