OpenAI, Çarşamba günü, her senaryonun lisanslı klinisyenler tarafından incelenip puanlandığı, AI sistemlerinin gerçekçi senaryolarda (günlük sağlık sorularından acil krizlere kadar) nasıl tepki verdiğini ölçmek için tasarlanmış 1.215 sentetik zihinsel sağlık görüşmesinden oluşan açık bir kıyaslama olan MentalHealthBench'i tanıttı.
Sürüm, OpenAI'nin kendi modellerinin çok ötesinde önem taşıyor. Şirkete göre her hafta bir milyardan fazla insan ChatGPT kullanıyor ve yapay zeka sohbet robotları, duygusal sıkıntı yaşayan insanların sessizce ilk durağı haline geldi. Şimdiye kadar sektörde bu davranış için kesin ve ortak bir ölçüt yoktu. Bu hikayeyle ilgili daha fazla bağlam için devam eden AI sektörü haberimize bakın.
22 ülkede 80'den fazla klinisyenin katılımıyla geliştirildi
Unite.AI tarafından yapılan duyuruya göre OpenAI, 22 ülkede toplam 19 dil konuşan ve yaklaşık 20 ruh sağlığı alt uzmanlığını temsil eden 80'den fazla lisanslı psikolog ve psikiyatristten oluşan bir grupla bu kriteri birlikte oluşturdu. Tam sürüm, 5.262 uzman tarafından yazılan değerlendirme listesi kriteri içermektedir.
Her görüşme, üç aşamalı bir süreç aracılığıyla en az üç uzman tarafından gözden geçirildi: iki klinisyen bağımsız olarak ağırlıklı kriterleri yazdı, üçüncüsü bunları değerlendirdi ve geliştirdi ve yalnızca en az iki uzmanın üzerinde anlaştığı ve üçüncüsü tarafından çelişmeyen kriterler korundu. Her kriter, bir modelin yanıtının tek bir yönünü hedefler ve -10 ila +10 arasında bir ağırlık taşır; daha büyük mutlak değerler, daha büyük klinik öneme işaret eder.
Amerikan Psikoloji Derneği'nin CEO'su Dr. Arthur Evans, duyuruda zihinsel sağlığın bir süreklilik içinde var olduğunu ve bu aralıktaki insanları ilgilendiren yapay zeka sistemlerinin hem klinik bilime hem de yaşanmış deneyime dayanması gerektiğini söylediği aktarıldı.
Karşılaştırmada neler var
1.215 konuşmanın ciddiyeti ve kimin yardım istediği konusunda kasıtlı olarak değişiklik yapıldı:
- Akut olmayan konuşmalar veri kümesinin yüzde 53,5'ini, yüksek keskinlikteki konuşmalar yüzde 18,2'sini ve acil konuşmalar yüzde 28,3'ünü oluşturuyor.
- Dört kullanıcı profili temsil ediliyor: yüzde 68,1 ile yetişkinler, yüzde 21,2 ile gençler, yüzde 5,8 ile klinisyenler ve yüzde 4,9 ile bakıcılar.
- Konuşmalar, araştırma makalesinin Clio metodolojisine benzer olarak tanımladığı gizliliği koruyan teknikler kullanılarak sentetik olarak oluşturuldu ve gerçek kullanıcıları ifşa etmeden gerçek dünyadaki ChatGPT ruh sağlığı kullanım kalıplarını yansıtmayı amaçlıyor.
- Kriterin yüzde 5,8'i olan yetmiş görev, ailede yakın zamanda yaşanan bir kayıp gibi önceki kullanıcı bağlamını taşıyor.
- Karşılaştırma, İngilizcenin ötesinde 105 İspanyolca, 54 Hintçe, 34 Arapça ve 29 Portekizce konuşmayı ve ayrıca Almanca, İtalyanca, Farsça, Endonezce, Türkçe ve Çince dillerindeki ek konuşmaları içermektedir.
Modellerin puanı nasıl
Değerlendirmeler, otomatik bir sınıflandırıcı (GPT-5.6 Sol yüksek muhakeme çabasıyla çalışıyor) tarafından, görev başına bağımsız olarak örneklenmiş dört kararla puanlandı ve sonuçlar, bağlam arama, empati, aciliyet kalibrasyonu ve gerçeklik testi de dahil olmak üzere uzman tanımlı on davranış eksenine ayrıştırılabiliyor.
OpenAI'nin rapor edilen sonuçlarında GPT-6 Astra yüzde 57,3 ile en yüksek puanı aldı, onu yüzde 53,9 ile GPT-6 Sol, yüzde 52,4 ile Anthropic'ten Claude Opus 5,5 ve yüzde 50,2 ile GPT-6 Luna izledi. Daha eski nesiller oldukça geride kaldı: Mart 2025'ten itibaren GPT-4o yüzde 32,1, Gemini 2.5 Pro ise yüzde 29,5 puan aldı; tüm rakamlar yüzde 95 güven aralığı taşıyordu.
Bu sayıları çerçeveleyen iki referans noktası vardır. Derecelendirme listelerine tam erişimle yazılan tamamlamalar yüzde 99,0 puan aldı - değerlendirmenin gürültü tavanına ilişkin bir akıl sağlığı kontrolü - klinisyenlerin kendileri tarafından yazılan tamamlamalar ise yalnızca yüzde 38,5 puan aldı; bunun büyük ölçüde nedeni, klinisyenlerin kapsamlı chatbot yanıtları yerine kısa, yüz yüze yanıtlar yazmalarıydı.
OpenAI, sonuçların model nesilleri boyunca istikrarlı bir iyileşme gösterdiğini ve uygun bağlamın aranması ve aciliyetin kalibre edilmesi konusunda geliştirilebilecek alanın altını çizdiğini söyledi. Makalede dikkat çekici bir şekilde bir değiş-tokuş bildiriliyor: acil, yüksek riskli konuşmalar konusunda temkinli davranan modellerin günlük konuşmalara katılması daha yavaş olabiliyor ve bunun tersi de geçerli.
Kullanıcılar ve uzmanlar "iyi"nin neye benzediği konusunda anlaşamıyor
OpenAI, karşılaştırmanın yanı sıra, 16 ülkeyi ve 14 dili temsil eden, zihinsel sağlık veya duygusal destek için yapay zekayı kullanan 44 yetişkinle ayrı bir analiz gerçekleştirdi. Katılımcılar model yanıtlarını derecelendirdiler ve kendi kriterlerini yazdılar; ancak incelemeleri onları rahatsız edici materyallere maruz bırakmaktan kaçınmak için akut olmayan konuşmalarla sınırlıydı.
Kullanıcı ve uzman değerlendirme listeleri, toplam değerlendirme listesi ağırlığının yalnızca yüzde 25,7'sine göre hizalanmıştır ve yüzde 1,0'ı doğrudan çelişkilidir. Kullanıcılar pratik sonraki adımları ve tarzı vurguladı; uzmanlar ilgili bağlamın toplanmasına ve belirsiz durumların dikkatle yorumlanmasına daha fazla ağırlık verdiler. OpenAI'nin vardığı sonuç: Kullanıcı geri bildirimi tutarlı ve tamamlayıcı bir sinyaldir ancak klinik ve güvenlik rehberliği ile değiştirilemez.
Liderlik tablosu değil, denetlenebilir bir teşhis
OpenAI, MentalHealthBench'in kesin bir sıralama tablosu yerine denetlenebilir bir tanı aracı olduğunu ve dil karşılaştırmalarının tanımlayıcı olduğunu açıkça belirtiyor; dilin etkisini keskinlik, konu, kültür veya kullanıcı profilindeki farklılıklardan izole edemiyorlar. Veri seti indirilmeye hazır ve her örnek bir kanarya dizisi taşıyor, böylece araştırmacılar verilerin gelecekteki eğitim kurumlarına sızıp sızmadığını tespit edebiliyor.
Şirket ayrıca yapay zeka ruh sağlığı çalışmaları için araştırma hibeleri, Yapay Zeka Ortaklığı ile uzman toplantıları ve Transluce'un bağımsız zihinsel sağlık değerlendirme çabalarına yardım dahil olmak üzere ilgili çabalara da dikkat çekti.
Uyarılar gerçektir: konuşmalar sentetiktir, derecelendirme otomatiktir ve OpenAI'nin kendi modelleri, OpenAI tarafından tasarlanan bir kıyaslamada en üst düzeydedir. Ancak uzman değerlendirme listelerini, derecelendirme metodolojisini ve verileri açık bir şekilde yayınlayarak OpenAI, düzenleyicilere, klinisyenlere ve rakiplere, şirketin kendi haftalık kullanım sayılarının da gösterdiği gibi, risklerin artmaya devam ettiği bir alan için ortak bir araç sağladı.
---
Yapay Zekanın Önünde OlunEn son yapay zeka haberlerini, analizlerini ve buluşlarını tek bir yerden alın.
Daha fazla AI haberini okuyun →