OpenAI نے بدھ کے روز MentalHealthBench متعارف کرایا، 1,215 مصنوعی دماغی صحت کی بات چیت کا ایک کھلا بینچ مارک اس بات کا تعین کرنے کے لیے کہ AI سسٹمز حقیقت پسندانہ منظرناموں میں کس طرح جواب دیتے ہیں - روزمرہ کی فلاح و بہبود کے سوالات سے لے کر فوری بحران تک - ہر منظر نامے کے ساتھ لائسنس یافتہ معالجین کے ذریعہ جائزہ لیا گیا اور اسکور کیا گیا۔
رہائی OpenAI کے اپنے ماڈلز سے بہت زیادہ اہمیت رکھتی ہے۔ کمپنی کے مطابق، ہر ہفتے ایک ارب سے زیادہ لوگ ChatGPT استعمال کرتے ہیں، اور AI چیٹ بوٹس خاموشی سے جذباتی پریشانی میں مبتلا لوگوں کے لیے پہلا پڑاؤ بن گیا ہے۔ اب تک، صنعت میں اس طرز عمل کے لیے ایک سخت، مشترکہ یارڈسٹک کا فقدان ہے۔ اس کہانی پر مزید سیاق و سباق کے لیے، ہماری جاری AI انڈسٹری کوریج دیکھیں۔
22 ممالک میں 80 سے زیادہ معالجین کے ساتھ بنایا گیا ہے۔
Unite.AI کے اعلان کی کوریج کے مطابق، OpenAI نے 22 ممالک میں 80 سے زیادہ لائسنس یافتہ ماہر نفسیات اور نفسیاتی ماہرین کے ساتھ مل کر بینچ مارک بنایا، جو مجموعی طور پر 19 زبانیں بولتے ہیں اور تقریباً 20 ذہنی صحت کی ذیلی خصوصیات کی نمائندگی کرتے ہیں۔ مکمل ریلیز میں 5,262 ماہر تصنیف کردہ روبرک معیار شامل ہیں۔
ہر بات چیت کا تین مراحل کے عمل کے ذریعے کم از کم تین ماہرین کے ذریعہ جائزہ لیا گیا: دو معالجین نے آزادانہ طور پر وزنی معیارات تحریر کیے، تیسرے نے فیصلہ کیا اور ان کی اصلاح کی، اور صرف وہی معیار جن پر کم از کم دو ماہرین نے اتفاق کیا - اور کسی تیسرے سے متصادم نہیں - کو برقرار رکھا گیا۔ ہر معیار ماڈل کے ردعمل کے ایک پہلو کو نشانہ بناتا ہے اور اس کا وزن -10 سے +10 تک ہوتا ہے، جس میں بڑی مطلق قدریں زیادہ طبی اہمیت کی نشاندہی کرتی ہیں۔
امریکن سائیکولوجیکل ایسوسی ایشن کے سی ای او، ڈاکٹر آرتھر ایونز کا اس اعلان میں حوالہ دیا گیا کہ دماغی صحت ایک تسلسل کے ساتھ موجود ہے، اور یہ کہ AI سسٹمز کو اس حد تک لوگوں کو شامل کرنے کے لیے کلینیکل سائنس اور زندگی کے تجربے دونوں میں بنیاد کی ضرورت ہے۔
بینچ مارک میں کیا ہے۔
1,215 مکالمات جان بوجھ کر شدت میں مختلف ہیں اور اس میں کہ کون مدد مانگ رہا ہے:
- غیر شدید گفتگو ڈیٹاسیٹ کا 53.5 فیصد، 18.2 فیصد کے لیے ہائی ایکیوٹی گفتگو، اور 28.3 فیصد کے لیے ابھرتی ہوئی گفتگو۔
- چار صارف پروفائلز کی نمائندگی کی گئی ہے: 68.1 فیصد بالغ، 21.2 فیصد نوعمر، 5.8 فیصد طبی ماہرین، اور 4.9 فیصد دیکھ بھال کرنے والے۔
- گفتگو کو مصنوعی طور پر رازداری کے تحفظ کی تکنیکوں کا استعمال کرتے ہوئے تخلیق کیا گیا تھا جسے تحقیقی مقالہ اس کے کلیو طریقہ کار سے ملتا جلتا بیان کرتا ہے، جس کا مقصد حقیقی صارفین کو بے نقاب کیے بغیر حقیقی دنیا کے ChatGPT ذہنی صحت کے استعمال کے نمونوں کی عکاسی کرنا ہے۔
- ستر کام - بینچ مارک کا 5.8 فیصد - پہلے صارف کے سیاق و سباق کو لے جاتے ہیں، جیسے خاندان میں حالیہ نقصان۔
- انگریزی کے علاوہ، بینچ مارک میں 105 ہسپانوی، 54 ہندی، 34 عربی، اور 29 پرتگالی گفتگو شامل ہیں، جن میں جرمن، اطالوی، فارسی، انڈونیشیائی، ترکی اور چینی میں اضافی گفتگو کی گئی ہے۔
ماڈلز نے کیسے اسکور کیا۔
تشخیص ایک خودکار گریڈر کے ذریعے کیے گئے — GPT-5.6 سول اعلی استدلال کی کوشش پر چل رہے ہیں — ہر کام کے لیے چار آزادانہ طور پر نمونے والے فیصلوں کے ساتھ، اور نتائج کو دس ماہرین کے بیان کردہ طرز عمل کے محوروں میں تحلیل کیا جا سکتا ہے جس میں سیاق و سباق کی تلاش، ہمدردی، فوری کیلیبریشن، اور حقیقت کی جانچ شامل ہے۔
OpenAI کے رپورٹ کردہ نتائج میں، **GPT-6 Astra نے 57.3 فیصد پر سب سے زیادہ اسکور کیا، اس کے بعد GPT-6 Sol نے 53.9 فیصد، Anthropic's Claude Opus 5.5 نے 52.4 فیصد، اور GPT-6 Luna نے 50.2 فیصد۔ پرانی نسلیں بہت پیچھے رہ گئیں: مارچ 2025 سے GPT-4o نے 32.1 فیصد اور جیمنی 2.5 پرو نے 29.5 فیصد اسکور کیا، تمام اعداد و شمار 95 فیصد اعتماد کے وقفوں کے ساتھ۔
دو حوالہ جات ان نمبروں کو فریم کرتے ہیں۔ گریڈنگ روبرکس تک مکمل رسائی کے ساتھ لکھی گئی تکمیلوں نے 99.0 فیصد اسکور کیا - تشخیص کی شور کی حد پر ایک سنجیدگی کی جانچ - جب کہ خود معالجین کی طرف سے لکھی گئی تکمیلوں نے صرف 38.5 فیصد اسکور کیا، بڑی وجہ یہ ہے کہ کلینشین جامع چیٹ بوٹ کے جوابات کے بجائے مختصر، ذاتی طرز کے جوابات لکھتے ہیں۔
OpenAI نے کہا کہ نتائج ماڈل نسلوں میں مسلسل بہتری کو ظاہر کرتے ہیں، جبکہ مناسب سیاق و سباق کی تلاش میں بہتری کے لیے گنجائش کو اجاگر کرتے ہوئے اور فوری ضرورت کی پیمائش کرتے ہیں۔ خاص طور پر، مقالے میں ایک تجارت کی اطلاع دی گئی ہے: ایسے ماڈل جو ابھرتی ہوئی، زیادہ خطرے والی بات چیت پر محتاط رہتے ہیں، روزمرہ کی گفتگو میں مشغول ہونے میں سست ہو سکتے ہیں، اور اس کے برعکس۔
صارفین اور ماہرین اس بات پر متفق نہیں ہیں کہ "اچھا" کیسا لگتا ہے۔
بینچ مارک کے ساتھ ساتھ، OpenAI نے 44 بالغوں کے ساتھ ایک الگ تجزیہ کیا جنہوں نے 16 ممالک اور 14 زبانوں کی نمائندگی کرتے ہوئے دماغی صحت یا جذباتی مدد کے لیے AI کا استعمال کیا تھا۔ شرکاء نے ماڈل کے جوابات کی درجہ بندی کی اور اپنا معیار لکھا، حالانکہ ان کا جائزہ غیر شدید گفتگو تک محدود تھا تاکہ انہیں تکلیف دہ مواد کے سامنے نہ لایا جا سکے۔
صارف اور ماہر روبرکس کل روبرک وزن کے صرف 25.7 فیصد پر منسلک ہیں، 1.0 فیصد براہ راست متضاد ہیں۔ صارفین نے عملی اگلے اقدامات اور لہجے پر زور دیا۔ ماہرین نے متعلقہ سیاق و سباق کو جمع کرنے اور مبہم حالات کی احتیاط سے تشریح کرنے پر زیادہ وزن رکھا۔ اوپن اے آئی کا نتیجہ: صارف کی رائے ایک مربوط اور تکمیلی سگنل ہے، لیکن طبی اور حفاظتی رہنمائی کے ساتھ قابل تبادلہ نہیں ہے۔
ایک قابل سماعت تشخیصی، لیڈر بورڈ نہیں۔
OpenAI واضح ہے کہ MentalHealthBench ایک حتمی لیڈر بورڈ کے بجائے ایک قابل سماعت تشخیصی ٹول ہے، اور یہ کہ اس کی زبان کے موازنہ وضاحتی ہیں - وہ زبان کے اثر کو تیکشنتا، موضوع، ثقافت، یا صارف پروفائل میں فرق سے الگ نہیں کر سکتے۔ ڈیٹاسیٹ ڈاؤن لوڈ کے لیے دستیاب ہے، اور ہر مثال میں ایک کینری تار ہوتا ہے تاکہ محقق اس بات کا پتہ لگا سکیں کہ آیا ڈیٹا مستقبل کے تربیتی کارپورا میں لیک ہو جاتا ہے۔
کمپنی نے متعلقہ کوششوں کی طرف بھی اشارہ کیا، بشمول AI دماغی صحت کے کام کے لیے تحقیقی گرانٹس، AI پر شراکت داری کے ساتھ ماہرین کا اجلاس، اور Transluce کی آزاد ذہنی صحت کی تشخیص کی کوششوں کے لیے مدد۔
انتباہات حقیقی ہیں: گفتگو مصنوعی ہوتی ہے، درجہ بندی خودکار ہوتی ہے، اور OpenAI کے اپنے ماڈل اوپن اے آئی کے ڈیزائن کردہ بینچ مارک میں سرفہرست ہیں۔ لیکن ماہر روبرکس، درجہ بندی کے طریقہ کار، اور ڈیٹا کو کھلے عام جاری کر کے، OpenAI نے ریگولیٹرز، کلینشینز، اور حریفوں کو ایک ڈومین کے لیے ایک مشترکہ آلہ فراہم کیا ہے جہاں - جیسا کہ کمپنی کے اپنے ہفتہ وار استعمال کے نمبر بتاتے ہیں - داؤ میں اضافہ ہوتا رہتا ہے۔
---
AI سے آگے رہیںتازہ ترین AI خبریں، تجزیہ اور کامیابیاں حاصل کریں — سب ایک جگہ پر۔
مزید AI خبریں پڑھیں →