OpenAI বুধবার MentalHealthBench চালু করেছে, 1,215টি সিন্থেটিক মানসিক স্বাস্থ্য কথোপকথনের একটি উন্মুক্ত বেঞ্চমার্ক যা পরিমাপ করার জন্য ডিজাইন করা হয়েছে যে কীভাবে এআই সিস্টেমগুলি বাস্তবসম্মত পরিস্থিতিতে সাড়া দেয় - প্রতিদিনের সুস্থতার প্রশ্ন থেকে জরুরী সংকট পর্যন্ত - লাইসেন্সপ্রাপ্ত চিকিত্সকদের দ্বারা প্রতিটি পরিস্থিতি পর্যালোচনা করা এবং স্কোর করা হয়েছে।

রিলিজটি OpenAI এর নিজস্ব মডেলের বাইরেও গুরুত্বপূর্ণ। কোম্পানির মতে, প্রতি সপ্তাহে এক বিলিয়নেরও বেশি মানুষ চ্যাটজিপিটি ব্যবহার করে, এবং এআই চ্যাটবট নিঃশব্দে মানসিক যন্ত্রণায় থাকা মানুষের জন্য প্রথম স্টপে পরিণত হয়েছে। এখন অবধি, শিল্পে সেই আচরণের জন্য একটি কঠোর, ভাগ করা মানদণ্ডের অভাব রয়েছে। এই গল্পের আরও প্রসঙ্গের জন্য, আমাদের চলমান AI শিল্প কভারেজ দেখুন।

22টি দেশে 80 টিরও বেশি চিকিত্সক নিয়ে নির্মিত

Unite.AI-এর ঘোষণার কভারেজ অনুসারে OpenAI 22টি দেশে 80 টিরও বেশি লাইসেন্সপ্রাপ্ত মনোবিজ্ঞানী এবং মনোরোগ বিশেষজ্ঞের একটি দল নিয়ে বেঞ্চমার্ক তৈরি করেছে, যারা সম্মিলিতভাবে 19টি ভাষায় কথা বলে এবং প্রায় 20টি মানসিক স্বাস্থ্য উপ-স্পেশালিটির প্রতিনিধিত্ব করে। সম্পূর্ণ প্রকাশে 5,262টি বিশেষজ্ঞ-লেখক রুব্রিক মানদণ্ড রয়েছে।

প্রতিটি কথোপকথন কমপক্ষে তিনজন বিশেষজ্ঞের দ্বারা তিন-পর্যায়ের প্রক্রিয়ার মাধ্যমে পর্যালোচনা করা হয়েছিল: দুইজন চিকিত্সক স্বাধীনভাবে ওজনযুক্ত মানদণ্ড রচনা করেছেন, তৃতীয়জন বিচার করেছেন এবং তাদের পরিমার্জিত করেছেন, এবং কেবলমাত্র অন্তত দুই বিশেষজ্ঞের দ্বারা সম্মত হওয়া মানদণ্ড - এবং তৃতীয় দ্বারা বিরোধিতা করা হয়নি - বজায় রাখা হয়েছিল। প্রতিটি মানদণ্ড একটি মডেলের প্রতিক্রিয়ার একটি একক দিককে লক্ষ্য করে এবং -10 থেকে +10 পর্যন্ত একটি ওজন বহন করে, বৃহত্তর পরম মানগুলি বৃহত্তর ক্লিনিকাল গুরুত্ব নির্দেশ করে।

আমেরিকান সাইকোলজিক্যাল অ্যাসোসিয়েশনের সিইও, ডক্টর আর্থার ইভানস, ঘোষণায় উদ্ধৃত করা হয়েছিল যে মানসিক স্বাস্থ্য একটি ধারাবাহিকভাবে বিদ্যমান, এবং সেই পরিসর জুড়ে লোকেদের জড়িত AI সিস্টেমের জন্য ক্লিনিকাল বিজ্ঞান এবং জীবন অভিজ্ঞতা উভয় ক্ষেত্রেই ভিত্তি প্রয়োজন।

বেঞ্চমার্কে কী আছে

1,215টি কথোপকথন ইচ্ছাকৃতভাবে তীব্রতা এবং কে সাহায্য চাইছে তার মধ্যে ভিন্ন:

  • অ-তীব্র কথোপকথন ডেটাসেটের 53.5 শতাংশ, উচ্চ-তীক্ষ্ণতা কথোপকথন 18.2 শতাংশের জন্য এবং 28.3 শতাংশের জন্য ইমারজেন্ট কথোপকথন।
  • চারটি ব্যবহারকারী প্রোফাইল প্রতিনিধিত্ব করা হয়েছে: প্রাপ্তবয়স্কদের 68.1 শতাংশ, কিশোর 21.2 শতাংশ, চিকিত্সক 5.8 শতাংশ এবং যত্নশীলদের 4.9 শতাংশ৷
  • কথোপকথনগুলি কৃত্রিমভাবে গোপনীয়তা-সংরক্ষণের কৌশলগুলি ব্যবহার করে তৈরি করা হয়েছিল যা গবেষণা পত্রটি তার ক্লিও পদ্ধতির অনুরূপ বর্ণনা করে, যার লক্ষ্য বাস্তব ব্যবহারকারীদের প্রকাশ না করে বাস্তব-বিশ্ব ChatGPT মানসিক স্বাস্থ্য ব্যবহারের ধরণগুলি প্রতিফলিত করা।
  • সত্তরটি কাজ — বেঞ্চমার্কের 5.8 শতাংশ — ব্যবহারকারীর পূর্ববর্তী প্রসঙ্গ বহন করে, যেমন পরিবারে সাম্প্রতিক ক্ষতি।
  • ইংরেজির বাইরে, বেঞ্চমার্কে 105টি স্প্যানিশ, 54টি হিন্দি, 34টি আরবি, এবং 29টি পর্তুগিজ কথোপকথন রয়েছে, যেখানে অতিরিক্ত কথোপকথন রয়েছে জার্মান, ইতালীয়, ফার্সি, ইন্দোনেশিয়ান, তুর্কি এবং চীনা ভাষায়৷

মডেলরা যেভাবে স্কোর করেছে

মূল্যায়নগুলি একটি স্বয়ংক্রিয় গ্রেডারের দ্বারা স্কোর করা হয়েছিল — GPT-5.6 Sol উচ্চ যুক্তির প্রচেষ্টায় চলছে — প্রতি টাস্কে চারটি স্বাধীনভাবে নমুনাযুক্ত রায় সহ, এবং ফলাফলগুলি প্রসঙ্গ অনুসন্ধান, সহানুভূতি, জরুরী ক্রমাঙ্কন এবং বাস্তবতা পরীক্ষা সহ দশটি বিশেষজ্ঞ-সংজ্ঞায়িত আচরণগত অক্ষ জুড়ে পচনশীল হতে পারে।

OpenAI এর রিপোর্ট করা ফলাফলে, GPT-6 Astra 57.3 শতাংশ সর্বোচ্চ স্কোর করেছে, GPT-6 Sol 53.9 শতাংশ, Anthropic's Claude Opus 5.5 এ 52.4 শতাংশ, এবং GPT-6 লুনা 50.2 শতাংশ। পুরানো প্রজন্ম বেশ পিছিয়ে: মার্চ 2025 থেকে GPT-4o স্কোর করেছে 32.1 শতাংশ এবং জেমিনি 2.5 Pro 29.5 শতাংশ স্কোর করেছে, সমস্ত পরিসংখ্যান 95 শতাংশ আত্মবিশ্বাসের ব্যবধান বহন করে।

দুটি রেফারেন্স পয়েন্ট সেই সংখ্যাগুলিকে ফ্রেম করে। গ্রেডিং রুব্রিক্সে সম্পূর্ণ অ্যাক্সেস সহ লিখিত সমাপ্তিগুলি 99.0 শতাংশ স্কোর করেছে — মূল্যায়নের নয়েজ সিলিং-এর একটি বিবেক পরীক্ষা — যেখানে চিকিত্সকদের দ্বারা লিখিত সমাপ্তিগুলি মাত্র 38.5 শতাংশ স্কোর করেছে, মূলত কারণ চিকিত্সকরা ব্যাপক চ্যাটবট রিপ্লেসের পরিবর্তে সংক্ষিপ্ত, ব্যক্তিগত-শৈলীর প্রতিক্রিয়া লেখেন।

ওপেনএআই বলেছে যে ফলাফলগুলি মডেল জেনারেশন জুড়ে স্থির উন্নতি দেখায়, যখন উপযুক্ত প্রেক্ষাপট খোঁজার জন্য এবং জরুরীতা ক্যালিব্রেট করার জন্য রুম হাইলাইট করে। উল্লেখযোগ্যভাবে, কাগজটি একটি ট্রেডঅফের প্রতিবেদন করেছে: যে মডেলগুলি উদ্ভূত, উচ্চ-ঝুঁকিপূর্ণ কথোপকথনের ক্ষেত্রে সতর্ক থাকে, সেগুলি দৈনন্দিন বিষয়গুলিতে জড়িত হতে ধীর হতে পারে এবং এর বিপরীতে।

ব্যবহারকারী এবং বিশেষজ্ঞরা "ভাল" দেখতে কেমন তা নিয়ে দ্বিমত পোষণ করেন

বেঞ্চমার্কের পাশাপাশি, ওপেনএআই 44 জন প্রাপ্তবয়স্কের সাথে একটি পৃথক বিশ্লেষণ চালিয়েছিল যারা মানসিক স্বাস্থ্য বা মানসিক সহায়তার জন্য AI ব্যবহার করেছিল, 16টি দেশ এবং 14টি ভাষার প্রতিনিধিত্ব করে। অংশগ্রহণকারীরা মডেল প্রতিক্রিয়াগুলিকে রেট দিয়েছেন এবং তাদের নিজস্ব মানদণ্ড লিখেছেন, যদিও তাদের পর্যালোচনাটি অ-তীক্ষ্ণ কথোপকথনের মধ্যে সীমাবদ্ধ ছিল যাতে তাদের বিরক্তিকর উপাদানের কাছে প্রকাশ না করা যায়।

ব্যবহারকারী এবং বিশেষজ্ঞ রুব্রিকগুলি মোট রুব্রিকের ওজনের মাত্র 25.7 শতাংশের সাথে সারিবদ্ধ, 1.0 শতাংশ সরাসরি পরস্পরবিরোধী। ব্যবহারকারীরা ব্যবহারিক পরবর্তী পদক্ষেপ এবং সুরের উপর জোর দিয়েছেন; বিশেষজ্ঞরা প্রাসঙ্গিক প্রেক্ষাপট সংগ্রহ করা এবং অস্পষ্ট পরিস্থিতিতে সাবধানতার সাথে ব্যাখ্যা করার উপর আরও বেশি গুরুত্ব দিয়েছেন। OpenAI এর উপসংহার: ব্যবহারকারীর প্রতিক্রিয়া একটি সুসংগত এবং পরিপূরক সংকেত, কিন্তু ক্লিনিকাল এবং নিরাপত্তা নির্দেশিকাগুলির সাথে বিনিময়যোগ্য নয়।

একটি নিরীক্ষণযোগ্য ডায়গনিস্টিক, লিডারবোর্ড নয়

OpenAI সুস্পষ্ট যে MentalHealthBench একটি নির্দিষ্ট লিডারবোর্ডের পরিবর্তে একটি নিরীক্ষণযোগ্য ডায়গনিস্টিক টুল, এবং এর ভাষার তুলনা বর্ণনামূলক — তারা তীক্ষ্ণতা, বিষয়, সংস্কৃতি বা ব্যবহারকারীর প্রোফাইলের পার্থক্য থেকে ভাষার প্রভাবকে আলাদা করতে পারে না। ডেটাসেট ডাউনলোডের জন্য উপলব্ধ, এবং প্রতিটি উদাহরণ একটি ক্যানারি স্ট্রিং বহন করে যাতে গবেষকরা শনাক্ত করতে পারেন যে ডেটা ভবিষ্যতের প্রশিক্ষণ সংস্থায় ফাঁস হয়েছে কিনা।

সংস্থাটি এআই মানসিক স্বাস্থ্য কাজের জন্য গবেষণা অনুদান, AI-তে অংশীদারিত্বের সাথে বিশেষজ্ঞদের সম্মেলন এবং ট্রান্সলুসের স্বাধীন মানসিক স্বাস্থ্য মূল্যায়ন প্রচেষ্টার জন্য সহায়তা সহ সংশ্লিষ্ট প্রচেষ্টার দিকেও ইঙ্গিত করেছে।

সতর্কতাগুলি বাস্তব: কথোপকথনগুলি সিন্থেটিক, গ্রেডিং স্বয়ংক্রিয়, এবং OpenAI-এর নিজস্ব মডেলগুলি OpenAI ডিজাইন করা বেঞ্চমার্কের শীর্ষে রয়েছে৷ কিন্তু বিশেষজ্ঞের রুব্রিক্স, গ্রেডিং পদ্ধতি এবং তথ্য প্রকাশ্যে প্রকাশ করার মাধ্যমে, OpenAI নিয়ন্ত্রক, চিকিত্সক এবং প্রতিযোগীদের একটি ডোমেনের জন্য একটি সাধারণ উপকরণ দিয়েছে যেখানে — কোম্পানির নিজস্ব সাপ্তাহিক ব্যবহারের সংখ্যা অনুসারে — বাড়তে থাকে।

---

এআই থেকে এগিয়ে থাকুন

সর্বশেষ AI খবর, বিশ্লেষণ এবং সাফল্য পান — সব এক জায়গায়।

আরও এআই খবর পড়ুন →