Το OpenAI παρουσίασε το MentalHealthBench την Τετάρτη, ένα ανοιχτό σημείο αναφοράς 1.215 συνθετικών συνομιλιών ψυχικής υγείας που έχουν σχεδιαστεί για να μετρούν πώς τα συστήματα AI ανταποκρίνονται σε ρεαλιστικά σενάρια - από καθημερινές ερωτήσεις ευεξίας έως επείγουσες κρίσεις - με κάθε σενάριο που ελέγχεται και βαθμολογείται από εξουσιοδοτημένους κλινικούς γιατρούς.
Η κυκλοφορία έχει σημασία πολύ πέρα από τα ίδια τα μοντέλα του OpenAI. Περισσότεροι από ένα δισεκατομμύριο άνθρωποι χρησιμοποιούν το ChatGPT κάθε εβδομάδα, σύμφωνα με την εταιρεία, και τα chatbot AI έχουν γίνει αθόρυβα ο πρώτος σταθμός για άτομα που βρίσκονται σε συναισθηματική δυσφορία. Μέχρι τώρα, ο κλάδος δεν είχε ένα αυστηρό, κοινό κριτήριο για αυτή τη συμπεριφορά. Για περισσότερες πληροφορίες σχετικά με αυτήν την ιστορία, ανατρέξτε στην εν εξελίξει κάλυψη του κλάδου AI.
Κατασκευάστηκε με περισσότερους από 80 κλινικούς γιατρούς σε 22 χώρες
Το OpenAI συνδημιούργησε το σημείο αναφοράς με μια ομάδα περισσότερων από 80 αδειοδοτημένων ψυχολόγων και ψυχιάτρων σε 22 χώρες, οι οποίοι συλλογικά μιλούν 19 γλώσσες και αντιπροσωπεύουν σχεδόν 20 υποειδικότητες ψυχικής υγείας, σύμφωνα με την κάλυψη της ανακοίνωσης από την Unite.AI. Η πλήρης έκδοση περιέχει 5.262 κριτήρια ρουμπρίκων που έχουν συνταχθεί από ειδικούς.
Κάθε συνομιλία εξετάστηκε από τουλάχιστον τρεις ειδικούς μέσω μιας διαδικασίας τριών σταδίων: δύο κλινικοί ιατροί συνέταξαν ανεξάρτητα σταθμισμένα κριτήρια, ένας τρίτος τα έκρινε και τα βελτίωσε και διατηρήθηκαν μόνο τα κριτήρια που συμφωνήθηκαν από τουλάχιστον δύο ειδικούς - και δεν αντικρούστηκαν από έναν τρίτο. Κάθε κριτήριο στοχεύει μια μεμονωμένη πτυχή της απόκρισης ενός μοντέλου και φέρει βάρος από -10 έως +10, με μεγαλύτερες απόλυτες τιμές να υποδεικνύουν μεγαλύτερη κλινική σημασία.
Ο Διευθύνων Σύμβουλος της Αμερικανικής Ψυχολογικής Εταιρείας, Δρ. Άρθουρ Έβανς, αναφέρθηκε στην ανακοίνωση ότι η ψυχική υγεία υπάρχει σε μια συνέχεια και ότι τα συστήματα τεχνητής νοημοσύνης που εμπλέκουν ανθρώπους σε αυτό το εύρος χρειάζονται γείωση τόσο στην κλινική επιστήμη όσο και στη βιωμένη εμπειρία.
Τι είναι στο σημείο αναφοράς
Οι 1.215 συνομιλίες ποικίλλουν σκόπιμα ως προς τη σοβαρότητα και το ποιος ζητά βοήθεια:
- Οι Μη οξείες συνομιλίες αντιπροσωπεύουν το 53,5 τοις εκατό του συνόλου δεδομένων, οι συνομιλίες υψηλής οξύτητας το 18,2 τοις εκατό και οι συνομιλίες έκτακτης ανάγκης το 28,3 τοις εκατό.
- Εκπροσωπούνται τέσσερα προφίλ χρηστών: ενήλικες στο 68,1 τοις εκατό, έφηβοι στο 21,2 τοις εκατό, κλινικοί γιατροί στο 5,8 τοις εκατό και φροντιστές στο 4,9 τοις εκατό.
- Οι συνομιλίες δημιουργήθηκαν συνθετικά χρησιμοποιώντας τεχνικές διατήρησης της ιδιωτικής ζωής που η ερευνητική εργασία περιγράφει ως παρόμοιες με τη μεθοδολογία Clio, με στόχο να αντικατοπτρίζουν τα πρότυπα χρήσης ψυχικής υγείας του ChatGPT στον πραγματικό κόσμο χωρίς να εκτίθενται πραγματικοί χρήστες.
- Εβδομήντα εργασίες — το 5,8 τοις εκατό του σημείου αναφοράς — φέρουν προηγούμενο περιβάλλον χρήστη, όπως μια πρόσφατη απώλεια στην οικογένεια.
- Πέρα από τα αγγλικά, το σημείο αναφοράς περιλαμβάνει 105 ισπανικά, 54 χίντι, 34 αραβικά και 29 πορτογαλικά συνομιλίες, με επιπλέον συνομιλίες στα γερμανικά, ιταλικά, περσικά, ινδονησιακά, τουρκικά και κινέζικα.
Πώς σκόραραν τα μοντέλα
Οι αξιολογήσεις βαθμολογήθηκαν από έναν αυτοματοποιημένο βαθμολογητή - GPT-5.6 Sol που τρέχει με υψηλή συλλογιστική προσπάθεια - με τέσσερις κρίσεις ανεξάρτητα δειγματοληπτικά ανά εργασία και τα αποτελέσματα μπορούν να αναλυθούν σε δέκα άξονες συμπεριφοράς που καθορίζονται από τους ειδικούς, όπως αναζήτηση περιβάλλοντος, ενσυναίσθηση, βαθμονόμηση επείγουσας ανάγκης και δοκιμή πραγματικότητας.
Στα αναφερόμενα αποτελέσματα του OpenAI, το GPT-6 Astra σημείωσε την υψηλότερη βαθμολογία με 57,3 τοις εκατό, ακολουθούμενο από το GPT-6 Sol με 53,9 τοις εκατό, το Claude Opus του Anthropic 5,5 με 52,4 τοις εκατό και το GPT-6 Luna με 50,2 τοις εκατό. Οι παλαιότερες γενιές έμειναν πολύ πίσω: το GPT-4o από τον Μάρτιο του 2025 σημείωσε 32,1 τοις εκατό και το Gemini 2,5 Pro σημείωσε 29,5 τοις εκατό, με όλα τα στοιχεία να έχουν διαστήματα εμπιστοσύνης 95 τοις εκατό.
Δύο σημεία αναφοράς πλαισιώνουν αυτούς τους αριθμούς. Οι συμπληρώσεις που γράφτηκαν με πλήρη πρόσβαση στις ρουμπρίκες βαθμολόγησης σημείωσαν 99,0 τοις εκατό - έλεγχος λογικής για το ανώτατο όριο θορύβου της αξιολόγησης - ενώ οι συμπληρώσεις που γράφτηκαν από τους ίδιους τους κλινικούς ιατρούς σημείωσαν μόλις 38,5 τοις εκατό, κυρίως επειδή οι κλινικοί γιατροί γράφουν σύντομες, αυτοπροσώπως απαντήσεις αντί για περιεκτικές απαντήσεις chatbot.
Το OpenAI είπε ότι τα αποτελέσματα δείχνουν σταθερή βελτίωση μεταξύ των γενεών μοντέλων, ενώ τονίζουν τα περιθώρια βελτίωσης στην αναζήτηση του κατάλληλου πλαισίου και στη βαθμονόμηση του επείγοντος. Συγκεκριμένα, η εφημερίδα αναφέρει ένα συμβιβασμό: τα μοντέλα που είναι προσεκτικά σε επείγουσες συνομιλίες υψηλού κινδύνου μπορεί να είναι πιο αργά για να εμπλακούν σε καθημερινές και το αντίστροφο.
Οι χρήστες και οι ειδικοί διαφωνούν σχετικά με το πώς φαίνεται το "καλό".
Παράλληλα με το σημείο αναφοράς, το OpenAI πραγματοποίησε μια ξεχωριστή ανάλυση με 44 ενήλικες που είχαν χρησιμοποιήσει την τεχνητή νοημοσύνη για ψυχική υγεία ή συναισθηματική υποστήριξη, εκπροσωπώντας 16 χώρες και 14 γλώσσες. Οι συμμετέχοντες βαθμολόγησαν τις απαντήσεις του μοντέλου και έγραψαν τα δικά τους κριτήρια, αν και η ανασκόπησή τους περιορίστηκε σε μη οξείες συνομιλίες για να αποφευχθεί η έκθεσή τους σε ενοχλητικό υλικό.
Οι ρουμπρίκες χρηστών και ειδικών ευθυγραμμίστηκαν στο 25,7% του συνολικού βάρους της ρουμπρίκας, με το 1,0% να είναι άμεσα αντιφατικό. Οι χρήστες τόνισαν τα πρακτικά επόμενα βήματα και τον τόνο. Οι ειδικοί έδωσαν μεγαλύτερο βάρος στη συγκέντρωση σχετικού πλαισίου και στην προσεκτική ερμηνεία διφορούμενων καταστάσεων. Συμπέρασμα του OpenAI: η ανατροφοδότηση των χρηστών είναι ένα συνεκτικό και συμπληρωματικό σήμα, αλλά δεν μπορεί να εναλλάσσεται με κλινικές οδηγίες και οδηγίες ασφαλείας.
Ένα ελεγχόμενο διαγνωστικό, όχι ένα leaderboard
Το OpenAI είναι ξεκάθαρο ότι το MentalHealthBench είναι ένα ελεγχόμενο διαγνωστικό εργαλείο και όχι ένας οριστικός πίνακας κατάταξης και ότι οι συγκρίσεις γλώσσας του είναι περιγραφικές — δεν μπορούν να απομονώσουν την επίδραση της γλώσσας από διαφορές στην οξύτητα, το θέμα, την κουλτούρα ή το προφίλ χρήστη. Το σύνολο δεδομένων είναι διαθέσιμο για λήψη και κάθε παράδειγμα φέρει μια συμβολοσειρά καναρινιών, ώστε οι ερευνητές να μπορούν να εντοπίσουν εάν τα δεδομένα διαρρέουν σε μελλοντικά σώματα εκπαίδευσης.
Η εταιρεία επεσήμανε επίσης τις σχετικές προσπάθειες, συμπεριλαμβανομένων των ερευνητικών επιχορηγήσεων για εργασία ψυχικής υγείας με τεχνητή νοημοσύνη, συνεδριάσεις ειδικών με τη Συνεργασία για την τεχνητή νοημοσύνη και βοήθεια για την ανεξάρτητη προσπάθεια αξιολόγησης ψυχικής υγείας της Transluce.
Οι επιφυλάξεις είναι πραγματικές: οι συνομιλίες είναι συνθετικές, η βαθμολόγηση είναι αυτοματοποιημένη και τα μοντέλα του OpenAI ξεπερνούν ένα σημείο αναφοράς που έχει σχεδιαστεί για το OpenAI. Αλλά δημοσιεύοντας ανοιχτά τις ρουμπρίκες των ειδικών, τη μεθοδολογία βαθμολόγησης και τα δεδομένα, το OpenAI έδωσε στους ρυθμιστές, τους κλινικούς ιατρούς και τους ανταγωνιστές ένα κοινό εργαλείο για έναν τομέα όπου - όπως υποδηλώνουν οι εβδομαδιαίες αριθμοί χρήσης της εταιρείας - τα στοιχήματα συνεχίζουν να αυξάνονται.
---
Μείνετε μπροστά από την τεχνητή νοημοσύνηΛάβετε τα πιο πρόσφατα νέα, αναλύσεις και ανακαλύψεις για την τεχνητή νοημοσύνη — όλα σε ένα μέρος.
Διαβάστε περισσότερα νέα AI →