OpenAI เปิดตัว MentalHealthBench ในวันพุธ ซึ่งเป็นเกณฑ์มาตรฐานแบบเปิดของการสนทนาด้านสุขภาพจิตสังเคราะห์ 1,215 รายการที่ออกแบบมาเพื่อวัดวิธีที่ระบบ AI ตอบสนองในสถานการณ์ที่สมจริง ตั้งแต่คำถามเกี่ยวกับความเป็นอยู่ที่ดีในชีวิตประจำวันไปจนถึงวิกฤตการณ์เร่งด่วน โดยทุกสถานการณ์จะได้รับการตรวจสอบและให้คะแนนโดยแพทย์ที่มีใบอนุญาต

การเปิดตัวมีความสำคัญมากกว่ารุ่นของ OpenAI เอง ตามที่บริษัทระบุ ผู้คนมากกว่าหนึ่งพันล้านคนใช้ ChatGPT ในแต่ละสัปดาห์ และแชทบอท AI ได้กลายเป็นจุดแวะพักแรกอย่างเงียบๆ สำหรับผู้ที่มีความทุกข์ทางอารมณ์ จนถึงขณะนี้ อุตสาหกรรมยังขาดมาตรฐานที่เข้มงวดและใช้ร่วมกันสำหรับพฤติกรรมดังกล่าว หากต้องการทราบบริบทเพิ่มเติมเกี่ยวกับเรื่องราวนี้ โปรดดู ความครอบคลุมของอุตสาหกรรม AI ที่กำลังดำเนินอยู่

สร้างขึ้นโดยมีแพทย์มากกว่า 80 คนใน 22 ประเทศ

OpenAI ร่วมกันสร้างเกณฑ์มาตรฐานร่วมกับกลุ่มนักจิตวิทยาและจิตแพทย์ที่ได้รับใบอนุญาตมากกว่า 80 คนใน 22 ประเทศ ซึ่งพูดรวมกันได้ 19 ภาษา และเป็นตัวแทนสาขาย่อยด้านสุขภาพจิตเกือบ 20 สาขา ตามรายงานข่าวของ Unite.AI ฉบับเต็มประกอบด้วยเกณฑ์รูบริกที่เขียนโดยผู้เชี่ยวชาญ 5,262 รายการ

การสนทนาแต่ละครั้งได้รับการตรวจสอบโดยผู้เชี่ยวชาญอย่างน้อยสามคนผ่านกระบวนการสามขั้นตอน: แพทย์สองคนเป็นผู้จัดทำเกณฑ์ถ่วงน้ำหนักโดยอิสระ บุคคลที่สามเป็นผู้ตัดสินและปรับปรุงเกณฑ์เหล่านั้น และมีเพียงเกณฑ์ที่ผู้เชี่ยวชาญอย่างน้อยสองคนเห็นพ้องเท่านั้น และไม่ขัดแย้งกับหนึ่งในสามเท่านั้นที่ยังคงอยู่ เกณฑ์แต่ละข้อกำหนดเป้าหมายการตอบสนองของแบบจำลองเพียงด้านเดียว และมีน้ำหนักตั้งแต่ -10 ถึง +10 โดยค่าสัมบูรณ์ที่มากกว่าบ่งชี้ถึงความสำคัญทางคลินิกที่มากขึ้น

ดร.อาร์เธอร์ อีแวนส์ ซีอีโอของสมาคมจิตวิทยาอเมริกัน กล่าวในประกาศว่าสุขภาพจิตมีอยู่อย่างต่อเนื่อง และระบบ AI ที่มีส่วนร่วมกับผู้คนในช่วงนั้นจำเป็นต้องมีพื้นฐานทั้งในด้านวิทยาศาสตร์คลินิกและประสบการณ์การใช้ชีวิต

มีอะไรอยู่ในเกณฑ์มาตรฐาน

บทสนทนา 1,215 บทสนทนาจงใจแตกต่างกันไปตามความรุนแรง และในผู้ที่ขอความช่วยเหลือ:

  • การสนทนาที่ไม่เฉียบพลัน คิดเป็น 53.5 เปอร์เซ็นต์ของชุดข้อมูล การสนทนา ความรุนแรงสูง คิดเป็น 18.2 เปอร์เซ็นต์ และการสนทนา ฉุกเฉิน คิดเป็น 28.3 เปอร์เซ็นต์
  • โปรไฟล์ผู้ใช้ 4 โปรไฟล์ประกอบด้วย ผู้ใหญ่ 68.1 เปอร์เซ็นต์ วัยรุ่น 21.2 เปอร์เซ็นต์ แพทย์ 5.8 เปอร์เซ็นต์ และผู้ดูแล 4.9 เปอร์เซ็นต์
  • บทสนทนาถูกสร้างขึ้นแบบสังเคราะห์โดยใช้เทคนิคการรักษาความเป็นส่วนตัวที่งานวิจัยอธิบายว่าคล้ายกับวิธีการของ Clio โดยมีจุดมุ่งหมายเพื่อสะท้อนรูปแบบการใช้งานด้านสุขภาพจิตของ ChatGPT ในโลกแห่งความเป็นจริงโดยไม่เปิดเผยผู้ใช้จริง
  • งานเจ็ดสิบงาน — 5.8 เปอร์เซ็นต์ของเกณฑ์มาตรฐาน — มีบริบทของผู้ใช้ก่อนหน้านี้ เช่น การสูญเสียครอบครัวเมื่อเร็วๆ นี้
  • นอกเหนือจากภาษาอังกฤษแล้ว เกณฑ์มาตรฐานยังรวมบทสนทนาภาษาสเปน 105 รายการ ฮินดี 54 รายการ ภาษาอาหรับ 34 รายการ และภาษาโปรตุเกส 29 รายการ พร้อมบทสนทนาเพิ่มเติมในภาษาเยอรมัน อิตาลี เปอร์เซีย อินโดนีเซีย ตุรกี และจีน

โมเดลได้คะแนนอย่างไร

การประเมินทำได้โดยเครื่องให้คะแนนแบบอัตโนมัติ — GPT-5.6 Sol ทำงานโดยใช้ความพยายามในการให้เหตุผลสูง — โดยมีการสุ่มตัวอย่างสี่แบบต่องาน และผลลัพธ์สามารถแบ่งออกเป็นแกนพฤติกรรมที่กำหนดโดยผู้เชี่ยวชาญสิบแกน รวมถึงการแสวงหาบริบท การเอาใจใส่ การสอบเทียบอย่างเร่งด่วน และการทดสอบความเป็นจริง

ในผลการรายงานของ OpenAI นั้น GPT-6 Astra ทำคะแนนสูงสุดที่ 57.3 เปอร์เซ็นต์ ตามมาด้วย GPT-6 Sol ที่ 53.9 เปอร์เซ็นต์ Claude Opus ของ Anthropic 5.5 ที่ 52.4 เปอร์เซ็นต์ และ GPT-6 Luna ที่ 50.2 เปอร์เซ็นต์ คนรุ่นเก่าตามหลังมามาก: GPT-4o ตั้งแต่เดือนมีนาคม 2568 ได้คะแนน 32.1 เปอร์เซ็นต์ และ Gemini 2.5 Pro ได้คะแนน 29.5 เปอร์เซ็นต์ โดยตัวเลขทั้งหมดมีช่วงความเชื่อมั่น 95 เปอร์เซ็นต์

จุดอ้างอิงสองจุดวางกรอบตัวเลขเหล่านั้น การสำเร็จงานที่เขียนโดยมีสิทธิ์เข้าถึงรูบริกการให้คะแนนได้อย่างเต็มที่ได้คะแนน 99.0 เปอร์เซ็นต์ ซึ่งเป็นการตรวจสอบความมีสติบนเพดานเสียงของการประเมิน ในขณะที่การสำเร็จที่เขียนโดยแพทย์เองได้คะแนนเพียง 38.5 เปอร์เซ็นต์ ส่วนใหญ่เป็นเพราะแพทย์เขียนคำตอบสั้นๆ แบบตัวต่อตัว แทนที่จะตอบแชทบอทที่ครอบคลุม

OpenAI กล่าวว่าผลลัพธ์แสดงให้เห็นถึงการปรับปรุงอย่างต่อเนื่องในรุ่นต่างๆ ขณะเดียวกันก็เน้นย้ำถึงช่องทางในการปรับปรุงในการแสวงหาบริบทที่เหมาะสมและปรับเทียบความเร่งด่วน บทความนี้รายงานถึงข้อดี: โมเดลที่ระมัดระวังในการสนทนาฉุกเฉินและมีความเสี่ยงสูงสามารถสนทนาในชีวิตประจำวันได้ช้าลง และในทางกลับกัน

ผู้ใช้และผู้เชี่ยวชาญไม่เห็นด้วยกับสิ่งที่ "ดี" เป็นอย่างไร

นอกจากเกณฑ์มาตรฐานแล้ว OpenAI ยังทำการวิเคราะห์แยกต่างหากกับผู้ใหญ่ 44 คนที่เคยใช้ AI เพื่อสุขภาพจิตหรือการสนับสนุนทางอารมณ์ ซึ่งเป็นตัวแทนของ 16 ประเทศและ 14 ภาษา ผู้เข้าร่วมให้คะแนนการตอบกลับของแบบจำลองและเขียนเกณฑ์ของตนเอง แม้ว่าการทบทวนจะจำกัดอยู่เพียงการสนทนาที่ไม่รุนแรงเพื่อหลีกเลี่ยงการเปิดเผยเนื้อหาที่สร้างความกังวล

รูบริกของผู้ใช้และผู้เชี่ยวชาญสอดคล้องกับน้ำหนักรูบริกทั้งหมดเพียง 25.7 เปอร์เซ็นต์ โดยที่ 1.0 เปอร์เซ็นต์มีความขัดแย้งโดยตรง ผู้ใช้เน้นย้ำขั้นตอนและน้ำเสียงถัดไปที่ใช้งานได้จริง ผู้เชี่ยวชาญให้ความสำคัญกับการรวบรวมบริบทที่เกี่ยวข้องและตีความสถานการณ์ที่คลุมเครืออย่างรอบคอบ ข้อสรุปของ OpenAI: ความคิดเห็นของผู้ใช้เป็นสัญญาณที่สอดคล้องกันและส่งเสริม แต่ไม่สามารถแลกเปลี่ยนกับคำแนะนำทางคลินิกและความปลอดภัยได้

การวินิจฉัยที่ตรวจสอบได้ ไม่ใช่ลีดเดอร์บอร์ด

OpenAI แสดงให้เห็นอย่างชัดเจนว่า MentalHealthBench เป็นเครื่องมือวินิจฉัยที่สามารถตรวจสอบได้แทนที่จะเป็นกระดานผู้นำที่ชัดเจน และการเปรียบเทียบภาษานั้นเป็นคำอธิบาย โดยไม่สามารถแยกผลกระทบของภาษาออกจากความแตกต่างในด้านความรุนแรง หัวข้อ วัฒนธรรม หรือโปรไฟล์ผู้ใช้ได้ ชุดข้อมูลพร้อมให้ดาวน์โหลด และแต่ละตัวอย่างจะมีสตริงคานารีเพื่อให้นักวิจัยสามารถตรวจสอบได้ว่าข้อมูลรั่วไหลไปยังองค์กรการฝึกอบรมในอนาคตหรือไม่

บริษัทยังชี้ให้เห็นถึงความพยายามที่เกี่ยวข้อง เช่น ทุนวิจัยสำหรับงานด้านสุขภาพจิตของ AI การประชุมผู้เชี่ยวชาญกับ Partnership on AI และความช่วยเหลือสำหรับการประเมินสุขภาพจิตอิสระของ Transluce

คำเตือนมีจริง: บทสนทนาเป็นแบบสังเคราะห์ การให้เกรดเป็นแบบอัตโนมัติ และโมเดลของ OpenAI เองก็มีมาตรฐานสูงสุดที่ OpenAI ออกแบบมา แต่ด้วยการปล่อยรูบริกผู้เชี่ยวชาญ วิธีการให้คะแนน และข้อมูลอย่างเปิดเผย OpenAI ได้มอบเครื่องมือทั่วไปให้กับหน่วยงานกำกับดูแล แพทย์ และคู่แข่งสำหรับโดเมน ซึ่ง — ตามที่ตัวเลขการใช้งานรายสัปดาห์ของบริษัทแนะนำ — เดิมพันเพิ่มขึ้นอย่างต่อเนื่อง

---

ก้าวนำหน้า AI

รับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว

อ่านข่าว AI เพิ่มเติม →