OpenAI đã giới thiệu MentalHealthBench vào thứ Tư, một chuẩn mực mở gồm 1.215 cuộc trò chuyện về sức khỏe tâm thần tổng hợp được thiết kế để đo lường cách các hệ thống AI phản ứng trong các tình huống thực tế – từ các câu hỏi về sức khỏe hàng ngày đến các cuộc khủng hoảng khẩn cấp – với mọi tình huống đều được các bác sĩ lâm sàng được cấp phép xem xét và chấm điểm.
Việc phát hành có ý nghĩa vượt xa các mô hình của OpenAI. Theo công ty, hơn một tỷ người sử dụng ChatGPT mỗi tuần và các chatbot AI đã lặng lẽ trở thành điểm dừng chân đầu tiên cho những người đang gặp khó khăn về mặt cảm xúc. Cho đến nay, ngành này vẫn thiếu một thước đo chung, chặt chẽ cho hành vi đó. Để biết thêm bối cảnh về câu chuyện này, hãy xem thông tin liên tục về ngành AI của chúng tôi.
Được xây dựng với hơn 80 bác sĩ lâm sàng ở 22 quốc gia
OpenAI đã đồng tạo ra tiêu chuẩn này với một nhóm gồm hơn 80 nhà tâm lý học và bác sĩ tâm thần được cấp phép trên 22 quốc gia, những người nói chung 19 ngôn ngữ và đại diện cho gần 20 chuyên ngành sức khỏe tâm thần, theo thông báo của Unite.AI. Bản phát hành đầy đủ bao gồm 5.262 tiêu chí đánh giá do chuyên gia soạn thảo.
Mỗi cuộc trò chuyện đã được ít nhất ba chuyên gia xem xét thông qua quy trình ba giai đoạn: hai bác sĩ lâm sàng đưa ra các tiêu chí có trọng số một cách độc lập, một người thứ ba xét xử và tinh chỉnh chúng, và chỉ những tiêu chí được ít nhất hai chuyên gia đồng ý - và không mâu thuẫn với một phần ba - mới được giữ lại. Mỗi tiêu chí nhắm đến một khía cạnh duy nhất trong phản ứng của mô hình và có trọng số từ -10 đến +10, với giá trị tuyệt đối lớn hơn cho thấy tầm quan trọng lâm sàng lớn hơn.
Giám đốc điều hành của Hiệp hội Tâm lý Hoa Kỳ, Tiến sĩ Arthur Evans, được trích dẫn trong thông báo nói rằng sức khỏe tâm thần tồn tại một cách liên tục và các hệ thống AI thu hút mọi người trong phạm vi đó cần có nền tảng cả về khoa học lâm sàng và kinh nghiệm sống.
Điểm chuẩn có gì
1.215 cuộc trò chuyện được cố tình thay đổi về mức độ nghiêm trọng và về người đang yêu cầu giúp đỡ:
- Các cuộc trò chuyện không cấp tính chiếm 53,5% tập dữ liệu, các cuộc trò chuyện có tính chính xác cao chiếm 18,2% và các cuộc trò chuyện mới nổi chiếm 28,3%.
- Bốn hồ sơ người dùng được đại diện: người lớn ở mức 68,1%, thanh thiếu niên ở mức 21,2%, bác sĩ lâm sàng ở mức 5,8% và người chăm sóc ở mức 4,9%.
- Các cuộc hội thoại được tạo tổng hợp bằng cách sử dụng các kỹ thuật bảo vệ quyền riêng tư mà tài liệu nghiên cứu mô tả là tương tự như phương pháp Clio của nó, nhằm phản ánh các kiểu sử dụng sức khỏe tâm thần ChatGPT trong thế giới thực mà không làm lộ thông tin của người dùng thực.
- 70 nhiệm vụ — 5,8% điểm chuẩn — mang bối cảnh trước đây của người dùng, chẳng hạn như sự mất mát gần đây trong gia đình.
- Ngoài tiếng Anh, điểm chuẩn bao gồm 105 đoạn hội thoại tiếng Tây Ban Nha, 54 tiếng Hindi, 34 tiếng Ả Rập và 29 đoạn hội thoại tiếng Bồ Đào Nha, cùng với các đoạn hội thoại bổ sung bằng tiếng Đức, tiếng Ý, tiếng Ba Tư, tiếng Indonesia, tiếng Thổ Nhĩ Kỳ và tiếng Trung.
Cách tính điểm của người mẫu
Các đánh giá được chấm điểm bởi một máy chấm điểm tự động — GPT-5.6 Sol chạy với nỗ lực suy luận cao — với bốn phán đoán được lấy mẫu độc lập cho mỗi nhiệm vụ và kết quả có thể được phân tách theo mười trục hành vi do chuyên gia xác định, bao gồm tìm kiếm ngữ cảnh, sự đồng cảm, hiệu chỉnh mức độ khẩn cấp và kiểm tra thực tế.
Trong kết quả được báo cáo của OpenAI, GPT-6 Astra đạt điểm cao nhất ở mức 57,3%, tiếp theo là GPT-6 Sol ở mức 53,9%, Claude Opus 5,5 của Anthropic ở mức 52,4% và GPT-6 Luna ở mức 50,2%. Các thế hệ cũ xếp sau khá xa: GPT-4o từ tháng 3 năm 2025 đạt 32,1% và Gemini 2.5 Pro đạt 29,5%, với tất cả các số liệu đều có khoảng tin cậy 95%.
Hai điểm tham chiếu đóng khung những con số đó. Các phần hoàn thành được viết với quyền truy cập đầy đủ vào các phiếu tự đánh giá đã đạt điểm 99,0 phần trăm - một sự kiểm tra rõ ràng về mức độ ồn của đánh giá - trong khi các phần hoàn thành do chính các bác sĩ lâm sàng viết chỉ đạt 38,5 phần trăm, phần lớn là do các bác sĩ lâm sàng viết các câu trả lời ngắn, theo phong cách trực tiếp thay vì các câu trả lời chatbot toàn diện.
OpenAI cho biết kết quả cho thấy sự cải thiện ổn định giữa các thế hệ mô hình, đồng thời nêu bật khả năng cải thiện trong việc tìm kiếm bối cảnh phù hợp và hiệu chỉnh tính cấp thiết. Đáng chú ý, bài báo báo cáo một sự cân bằng: những mô hình thận trọng trong các cuộc trò chuyện khẩn cấp, có rủi ro cao có thể tham gia chậm hơn vào các cuộc trò chuyện hàng ngày và ngược lại.
Người dùng và chuyên gia không đồng ý về việc thế nào là "tốt"
Bên cạnh điểm chuẩn, OpenAI đã tiến hành một phân tích riêng với 44 người trưởng thành đã sử dụng AI để hỗ trợ sức khỏe tâm thần hoặc cảm xúc, đại diện cho 16 quốc gia và 14 ngôn ngữ. Những người tham gia đánh giá các câu trả lời của người mẫu và viết ra các tiêu chí của riêng họ, mặc dù việc đánh giá của họ chỉ giới hạn ở những cuộc trò chuyện không gay gắt để tránh khiến họ phải tiếp xúc với những tài liệu gây lo lắng.
Thang đánh giá của người dùng và chuyên gia chỉ phù hợp với 25,7% tổng trọng lượng của thang đánh giá, với 1,0% mâu thuẫn trực tiếp. Người dùng nhấn mạnh các bước và giai điệu thực tế tiếp theo; các chuyên gia đặt trọng tâm lớn hơn vào việc thu thập bối cảnh liên quan và diễn giải cẩn thận các tình huống mơ hồ. Kết luận của OpenAI: phản hồi của người dùng là tín hiệu mạch lạc và bổ sung, nhưng không thể thay thế được với hướng dẫn lâm sàng và an toàn.
Chẩn đoán có thể kiểm tra được, không phải bảng xếp hạng
OpenAI nói rõ rằng MentalHealthBench là một công cụ chẩn đoán có thể kiểm tra chứ không phải là một bảng xếp hạng dứt khoát và các so sánh ngôn ngữ của nó chỉ mang tính mô tả - chúng không thể tách biệt tác động của ngôn ngữ khỏi sự khác biệt về mức độ nhạy bén, chủ đề, văn hóa hoặc hồ sơ người dùng. Tập dữ liệu có sẵn để tải xuống và mỗi ví dụ mang một chuỗi canary để các nhà nghiên cứu có thể phát hiện xem dữ liệu có bị rò rỉ vào kho dữ liệu đào tạo trong tương lai hay không.
Công ty cũng chỉ ra những nỗ lực liên quan, bao gồm tài trợ nghiên cứu cho công việc chăm sóc sức khỏe tâm thần AI, triệu tập chuyên gia với Quan hệ đối tác về AI và hỗ trợ cho nỗ lực đánh giá sức khỏe tâm thần độc lập của Transluce.
Những cảnh báo là có thật: các cuộc hội thoại là tổng hợp, việc chấm điểm được tự động hóa và các mô hình của OpenAI đứng đầu tiêu chuẩn mà OpenAI thiết kế. Nhưng bằng cách phát hành các phiếu đánh giá chuyên môn, phương pháp chấm điểm và dữ liệu một cách công khai, OpenAI đã cung cấp cho các cơ quan quản lý, bác sĩ lâm sàng và đối thủ cạnh tranh một công cụ chung cho một miền mà — như số lượng sử dụng hàng tuần của chính công ty cho thấy — số tiền đặt cược không ngừng tăng lên.
---
Đi trước AINhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.
Đọc thêm tin tức về AI →