OpenAI เปิดตัว MentalHealthBench ในวันพุธ ซึ่งเป็นเกณฑ์มาตรฐานแบบเปิดของการสนทนาด้านสุขภาพจิตสังเคราะห์ 1,215 รายการที่ออกแบบมาเพื่อวัดวิธีที่ระบบ AI ตอบสนองในสถานการณ์ที่สมจริง ตั้งแต่คำถามเกี่ยวกับความเป็นอยู่ที่ดีในชีวิตประจำวันไปจนถึงวิกฤตการณ์เร่งด่วน โดยทุกสถานการณ์จะได้รับการตรวจสอบและให้คะแนนโดยแพทย์ที่มีใบอนุญาต
การเปิดตัวมีความสำคัญมากกว่ารุ่นของ OpenAI เอง ตามที่บริษัทระบุ ผู้คนมากกว่าหนึ่งพันล้านคนใช้ ChatGPT ในแต่ละสัปดาห์ และแชทบอท AI ได้กลายเป็นจุดแวะพักแรกอย่างเงียบๆ สำหรับผู้ที่มีความทุกข์ทางอารมณ์ จนถึงขณะนี้ อุตสาหกรรมยังขาดมาตรฐานที่เข้มงวดและใช้ร่วมกันสำหรับพฤติกรรมดังกล่าว หากต้องการทราบบริบทเพิ่มเติมเกี่ยวกับเรื่องราวนี้ โปรดดู ความครอบคลุมของอุตสาหกรรม AI ที่กำลังดำเนินอยู่
สร้างขึ้นโดยมีแพทย์มากกว่า 80 คนใน 22 ประเทศ
OpenAI ร่วมกันสร้างเกณฑ์มาตรฐานร่วมกับกลุ่มนักจิตวิทยาและจิตแพทย์ที่ได้รับใบอนุญาตมากกว่า 80 คนใน 22 ประเทศ ซึ่งพูดรวมกันได้ 19 ภาษา และเป็นตัวแทนสาขาย่อยด้านสุขภาพจิตเกือบ 20 สาขา ตามรายงานข่าวของ Unite.AI ฉบับเต็มประกอบด้วยเกณฑ์รูบริกที่เขียนโดยผู้เชี่ยวชาญ 5,262 รายการ
การสนทนาแต่ละครั้งได้รับการตรวจสอบโดยผู้เชี่ยวชาญอย่างน้อยสามคนผ่านกระบวนการสามขั้นตอน: แพทย์สองคนเป็นผู้จัดทำเกณฑ์ถ่วงน้ำหนักโดยอิสระ บุคคลที่สามเป็นผู้ตัดสินและปรับปรุงเกณฑ์เหล่านั้น และมีเพียงเกณฑ์ที่ผู้เชี่ยวชาญอย่างน้อยสองคนเห็นพ้องเท่านั้น และไม่ขัดแย้งกับหนึ่งในสามเท่านั้นที่ยังคงอยู่ เกณฑ์แต่ละข้อกำหนดเป้าหมายการตอบสนองของแบบจำลองเพียงด้านเดียว และมีน้ำหนักตั้งแต่ -10 ถึง +10 โดยค่าสัมบูรณ์ที่มากกว่าบ่งชี้ถึงความสำคัญทางคลินิกที่มากขึ้น
ดร.อาร์เธอร์ อีแวนส์ ซีอีโอของสมาคมจิตวิทยาอเมริกัน กล่าวในประกาศว่าสุขภาพจิตมีอยู่อย่างต่อเนื่อง และระบบ AI ที่มีส่วนร่วมกับผู้คนในช่วงนั้นจำเป็นต้องมีพื้นฐานทั้งในด้านวิทยาศาสตร์คลินิกและประสบการณ์การใช้ชีวิต
มีอะไรอยู่ในเกณฑ์มาตรฐาน
บทสนทนา 1,215 บทสนทนาจงใจแตกต่างกันไปตามความรุนแรง และในผู้ที่ขอความช่วยเหลือ:
- การสนทนาที่ไม่เฉียบพลัน คิดเป็น 53.5 เปอร์เซ็นต์ของชุดข้อมูล การสนทนา ความรุนแรงสูง คิดเป็น 18.2 เปอร์เซ็นต์ และการสนทนา ฉุกเฉิน คิดเป็น 28.3 เปอร์เซ็นต์
- โปรไฟล์ผู้ใช้ 4 โปรไฟล์ประกอบด้วย ผู้ใหญ่ 68.1 เปอร์เซ็นต์ วัยรุ่น 21.2 เปอร์เซ็นต์ แพทย์ 5.8 เปอร์เซ็นต์ และผู้ดูแล 4.9 เปอร์เซ็นต์
- บทสนทนาถูกสร้างขึ้นแบบสังเคราะห์โดยใช้เทคนิคการรักษาความเป็นส่วนตัวที่งานวิจัยอธิบายว่าคล้ายกับวิธีการของ Clio โดยมีจุดมุ่งหมายเพื่อสะท้อนรูปแบบการใช้งานด้านสุขภาพจิตของ ChatGPT ในโลกแห่งความเป็นจริงโดยไม่เปิดเผยผู้ใช้จริง
- งานเจ็ดสิบงาน — 5.8 เปอร์เซ็นต์ของเกณฑ์มาตรฐาน — มีบริบทของผู้ใช้ก่อนหน้านี้ เช่น การสูญเสียครอบครัวเมื่อเร็วๆ นี้
- นอกเหนือจากภาษาอังกฤษแล้ว เกณฑ์มาตรฐานยังรวมบทสนทนาภาษาสเปน 105 รายการ ฮินดี 54 รายการ ภาษาอาหรับ 34 รายการ และภาษาโปรตุเกส 29 รายการ พร้อมบทสนทนาเพิ่มเติมในภาษาเยอรมัน อิตาลี เปอร์เซีย อินโดนีเซีย ตุรกี และจีน
โมเดลได้คะแนนอย่างไร
การประเมินทำได้โดยเครื่องให้คะแนนแบบอัตโนมัติ — GPT-5.6 Sol ทำงานโดยใช้ความพยายามในการให้เหตุผลสูง — โดยมีการสุ่มตัวอย่างสี่แบบต่องาน และผลลัพธ์สามารถแบ่งออกเป็นแกนพฤติกรรมที่กำหนดโดยผู้เชี่ยวชาญสิบแกน รวมถึงการแสวงหาบริบท การเอาใจใส่ การสอบเทียบอย่างเร่งด่วน และการทดสอบความเป็นจริง
ในผลการรายงานของ OpenAI นั้น GPT-6 Astra ทำคะแนนสูงสุดที่ 57.3 เปอร์เซ็นต์ ตามมาด้วย GPT-6 Sol ที่ 53.9 เปอร์เซ็นต์ Claude Opus ของ Anthropic 5.5 ที่ 52.4 เปอร์เซ็นต์ และ GPT-6 Luna ที่ 50.2 เปอร์เซ็นต์ คนรุ่นเก่าตามหลังมามาก: GPT-4o ตั้งแต่เดือนมีนาคม 2568 ได้คะแนน 32.1 เปอร์เซ็นต์ และ Gemini 2.5 Pro ได้คะแนน 29.5 เปอร์เซ็นต์ โดยตัวเลขทั้งหมดมีช่วงความเชื่อมั่น 95 เปอร์เซ็นต์
จุดอ้างอิงสองจุดวางกรอบตัวเลขเหล่านั้น การสำเร็จงานที่เขียนโดยมีสิทธิ์เข้าถึงรูบริกการให้คะแนนได้อย่างเต็มที่ได้คะแนน 99.0 เปอร์เซ็นต์ ซึ่งเป็นการตรวจสอบความมีสติบนเพดานเสียงของการประเมิน ในขณะที่การสำเร็จที่เขียนโดยแพทย์เองได้คะแนนเพียง 38.5 เปอร์เซ็นต์ ส่วนใหญ่เป็นเพราะแพทย์เขียนคำตอบสั้นๆ แบบตัวต่อตัว แทนที่จะตอบแชทบอทที่ครอบคลุม
OpenAI กล่าวว่าผลลัพธ์แสดงให้เห็นถึงการปรับปรุงอย่างต่อเนื่องในรุ่นต่างๆ ขณะเดียวกันก็เน้นย้ำถึงช่องทางในการปรับปรุงในการแสวงหาบริบทที่เหมาะสมและปรับเทียบความเร่งด่วน บทความนี้รายงานถึงข้อดี: โมเดลที่ระมัดระวังในการสนทนาฉุกเฉินและมีความเสี่ยงสูงสามารถสนทนาในชีวิตประจำวันได้ช้าลง และในทางกลับกัน
ผู้ใช้และผู้เชี่ยวชาญไม่เห็นด้วยกับสิ่งที่ "ดี" เป็นอย่างไร
นอกจากเกณฑ์มาตรฐานแล้ว OpenAI ยังทำการวิเคราะห์แยกต่างหากกับผู้ใหญ่ 44 คนที่เคยใช้ AI เพื่อสุขภาพจิตหรือการสนับสนุนทางอารมณ์ ซึ่งเป็นตัวแทนของ 16 ประเทศและ 14 ภาษา ผู้เข้าร่วมให้คะแนนการตอบกลับของแบบจำลองและเขียนเกณฑ์ของตนเอง แม้ว่าการทบทวนจะจำกัดอยู่เพียงการสนทนาที่ไม่รุนแรงเพื่อหลีกเลี่ยงการเปิดเผยเนื้อหาที่สร้างความกังวล
รูบริกของผู้ใช้และผู้เชี่ยวชาญสอดคล้องกับน้ำหนักรูบริกทั้งหมดเพียง 25.7 เปอร์เซ็นต์ โดยที่ 1.0 เปอร์เซ็นต์มีความขัดแย้งโดยตรง ผู้ใช้เน้นย้ำขั้นตอนและน้ำเสียงถัดไปที่ใช้งานได้จริง ผู้เชี่ยวชาญให้ความสำคัญกับการรวบรวมบริบทที่เกี่ยวข้องและตีความสถานการณ์ที่คลุมเครืออย่างรอบคอบ ข้อสรุปของ OpenAI: ความคิดเห็นของผู้ใช้เป็นสัญญาณที่สอดคล้องกันและส่งเสริม แต่ไม่สามารถแลกเปลี่ยนกับคำแนะนำทางคลินิกและความปลอดภัยได้
การวินิจฉัยที่ตรวจสอบได้ ไม่ใช่ลีดเดอร์บอร์ด
OpenAI แสดงให้เห็นอย่างชัดเจนว่า MentalHealthBench เป็นเครื่องมือวินิจฉัยที่สามารถตรวจสอบได้แทนที่จะเป็นกระดานผู้นำที่ชัดเจน และการเปรียบเทียบภาษานั้นเป็นคำอธิบาย โดยไม่สามารถแยกผลกระทบของภาษาออกจากความแตกต่างในด้านความรุนแรง หัวข้อ วัฒนธรรม หรือโปรไฟล์ผู้ใช้ได้ ชุดข้อมูลพร้อมให้ดาวน์โหลด และแต่ละตัวอย่างจะมีสตริงคานารีเพื่อให้นักวิจัยสามารถตรวจสอบได้ว่าข้อมูลรั่วไหลไปยังองค์กรการฝึกอบรมในอนาคตหรือไม่
บริษัทยังชี้ให้เห็นถึงความพยายามที่เกี่ยวข้อง เช่น ทุนวิจัยสำหรับงานด้านสุขภาพจิตของ AI การประชุมผู้เชี่ยวชาญกับ Partnership on AI และความช่วยเหลือสำหรับการประเมินสุขภาพจิตอิสระของ Transluce
คำเตือนมีจริง: บทสนทนาเป็นแบบสังเคราะห์ การให้เกรดเป็นแบบอัตโนมัติ และโมเดลของ OpenAI เองก็มีมาตรฐานสูงสุดที่ OpenAI ออกแบบมา แต่ด้วยการปล่อยรูบริกผู้เชี่ยวชาญ วิธีการให้คะแนน และข้อมูลอย่างเปิดเผย OpenAI ได้มอบเครื่องมือทั่วไปให้กับหน่วยงานกำกับดูแล แพทย์ และคู่แข่งสำหรับโดเมน ซึ่ง — ตามที่ตัวเลขการใช้งานรายสัปดาห์ของบริษัทแนะนำ — เดิมพันเพิ่มขึ้นอย่างต่อเนื่อง
---
ก้าวนำหน้า AIรับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว
อ่านข่าว AI เพิ่มเติม →