Ερευνητές στο Ινστιτούτο Επιστήμης Weizmann στο Rehovot του Ισραήλ κατασκεύασαν ένα σύστημα τεχνητής νοημοσύνης που μπορεί να ανακατασκευάσει αυτό που κοιτάζει ένα άτομο με βάση μόνο τη σάρωση εγκεφάλου fMRI και να προβλέψει την εγκεφαλική δραστηριότητα ενός ατόμου από μια εικόνα προς την άλλη κατεύθυνση.

Το εργαλείο, που αναπτύχθηκε από τον επιστήμονα υπολογιστών Michal Irani και τους συναδέλφους της, αναδημιουργεί εικόνες που έχουν προβληθεί με ακρίβεια που οι προηγούμενες προσπάθειες αποκωδικοποίησης του εγκεφάλου δεν ταιριάζουν. Σε συγκρίσεις δίπλα-δίπλα, οι ανακατασκευές του μοντέλου διατηρούν όχι μόνο το γενικό θέμα μιας σκηνής αλλά τη δομή, τη θέση και το περιεχόμενό της — μια επίμονη αδυναμία των προηγούμενων συστημάτων, που θα μπορούσαν να δημιουργήσουν μια εύλογη μπανάνα, αλλά σπάνια τη μπανάνα που είδε στην πραγματικότητα. For more context on this story, see our ongoing more AI stories.

Πώς λειτουργεί ο αποκωδικοποιητής εγκεφάλου

Το σύστημα είναι ένας «αποκωδικοποιητής εγκεφάλου» δύο κλάδων. Ο ένας κλάδος προβλέπει τη δομή της εικόνας - όπου τα χρώματα και τα σχήματα βρίσκονται στο κάδρο - ενώ το δεύτερο προβλέπει το περιεχόμενό της, για παράδειγμα ένα μάτσο μπανάνες σε ένα πιάτο. Αυτές οι συνδυασμένες προβλέψεις κατευθύνουν στη συνέχεια ένα μοντέλο διάχυσης, την ίδια οικογένεια τεχνικών παραγωγής τεχνητής νοημοσύνης πίσω από τις σύγχρονες γεννήτριες εικόνας και βίντεο, για να παραχθεί η τελική ανακατασκευή.

Η ομάδα ξεκίνησε από τα δημόσια διαθέσιμα δεδομένα σάρωσης εγκεφάλου: στους εθελοντές είχαν δείξει εκατοντάδες εικόνες ενώ ήταν ξαπλωμένοι σε σαρωτές fMRI, οι οποίοι παρακολουθούν τη ροή του οξυγονωμένου αίματος μέσω του εγκεφάλου ως υποκατάστατο της νευρικής δραστηριότητας. Η ομάδα του Irani χρησιμοποίησε νεότερα σύνολα δεδομένων που καταγράφηκαν σε σαρωτές υψηλότερης ανάλυσης, όπου κάθε voxel δραστηριότητας καλύπτει περίπου ένα κυβικό χιλιοστό ιστού αντί για τα περίπου τρία κυβικά χιλιοστά ενός τυπικού σαρωτή.

Εκπαίδευση σε δανεικά δεδομένα

Το κεντρικό εμπόδιο ήταν η πείνα δεδομένων. Οι σαρώσεις fMRI υψηλής ανάλυσης από ένα άτομο που βλέπει χιλιάδες εικόνες είναι σπάνιες και τα μοντέλα χρειάζονταν πολύ περισσότερα από όσα υπήρχαν. Η λύση των ερευνητών ήταν να εκπαιδεύσουν ένα δεύτερο μοντέλο αντίστροφα - έναν κωδικοποιητή που προβλέπει πώς θα ήταν μια σάρωση εγκεφάλου αν έδειχνε σε ένα άτομο μια δεδομένη εικόνα.

Τρέχοντας τον κωδικοποιητή και τον αποκωδικοποιητή μεταξύ τους, η ομάδα θα μπορούσε να δημιουργήσει αποτελεσματικά απεριόριστα ζεύγη προπόνησης. Ξεκινήστε με μια φωτογραφία μιας λεοπάρδαλης, προβλέψτε τη δραστηριότητα fMRI που θα παρήγαγε, ανακατασκευάστε την εικόνα από αυτή τη δραστηριότητα και βελτιώστε και τα δύο μοντέλα στις αναντιστοιχίες. Περίπου το 70 τοις εκατό των δεδομένων εκπαίδευσης προήλθαν τελικά από εικόνες που δεν εμφανίστηκαν ποτέ σε έναν σαρωμένο εθελοντή, σύμφωνα με τον Irani.

Η προσέγγιση παρήγαγε αυτό που η ομάδα αποκαλεί γενικό κωδικοποιητή εγκεφάλου και η αποτελεσματικότητά του είναι το βασικό αποτέλεσμα. Τα προηγούμενα εργαλεία αποκωδικοποίησης απαιτούσαν συνήθως περίπου 40 ώρες δεδομένων fMRI για τη βαθμονόμηση σε ένα νέο άτομο. Ο αποκωδικοποιητής της Irani χρειάζεται περίπου μία ώρα — μια διαφορά που έχει σημασία επειδή ο χρόνος του σαρωτή είναι ακριβός. «Κανείς από εμάς δεν μπορεί να αντέξει οικονομικά 40 ώρες απεικόνισης για ένα νέο θέμα», είπε ο Tommy Sprague, νευροεπιστήμονας στο Πανεπιστήμιο της Καλιφόρνια, Santa Barbara, ο οποίος δεν συμμετείχε στην έρευνα, σημειώνοντας ότι η απεικόνιση μπορεί να κοστίσει περίπου 600 έως 1.000 δολάρια την ώρα. Τα ευρήματα παρουσιάστηκαν στο συνέδριο Cognitive Computational Neuroscience στη Νέα Υόρκη τον Σεπτέμβριο.

Τι είναι σωστό — και τι λάθος

Σε συγκριτικές δοκιμές, το εργαλείο ξεπέρασε τα συστήματα αποκωδικοποίησης εγκεφάλου που περιγράφηκαν προηγουμένως «με σημαντικό περιθώριο», δήλωσε ο Ιράνι στο MIT Technology Review. Δεν είναι αλάθητο. Κατά τη διάρκεια μιας βιντεοκλήσης, έδειξε μια εικόνα μιας τούρτας που το σύστημα ανακατασκεύασε ως ένα σωρό από τρία σάντουιτς και έναν σκύλο σε μια μπανιέρα που επέστρεψε ως μια παρόμοια χρωματισμένη κατσίκα στην ίδια μπανιέρα.

Συγκεντρώνοντας δεδομένα σε πολλές μελέτες, η ομάδα εντόπισε επίσης περιοχές του εγκεφάλου που φαίνεται να μοιράζονται λειτουργίες μεταξύ ατόμων - μια περιοχή ανταποκρίθηκε σε εικόνες φαγητού και μια άλλη σε αθλήματα. Η Irani λέει ότι τώρα συνεργάζεται με νευροεπιστήμονες για να χρησιμοποιήσει τα εργαλεία για να χαρτογραφήσει πώς ο εγκέφαλος οργανώνει το νόημα πιο συστηματικά.

Υποσχέσεις για φάρμακο

Οι πιο άμεσες ελπίδες είναι κλινικές. Ο Ιράνι πιστεύει ότι η προσέγγιση θα μπορούσε τελικά να βοηθήσει τα άτομα με σύνδρομο κλειδώματος - πλήρως παράλυτους ασθενείς που δεν μπορούν να μιλήσουν ή να κινηθούν - να επικοινωνήσουν χρησιμοποιώντας μόνο την εγκεφαλική δραστηριότητα. Θέλει επίσης να επεκτείνει την τεχνική πέρα ​​από τις στατικές εικόνες σε βίντεο και ήχο, με μακροπρόθεσμο στόχο την ανακατασκευή φανταστικού περιεχομένου, συμπεριλαμβανομένων των ονείρων και του αισθητηριακού περιεχομένου των αναδρομών PTSD.

Η Judy Illes, νευροηθικός και καθηγήτρια νευρολογίας στο Πανεπιστήμιο της Βρετανικής Κολομβίας που δεν συμμετείχε στην εργασία, περιέγραψε την έρευνα ως «υπέροχη». «Η ιδέα [της χρήσης αυτής της προσέγγισης] για να βοηθηθούν άτομα με νευρολογικές παθήσεις... θεραπευτικά είναι εξαιρετικά συναρπαστική», είπε στο MIT Technology Review.

Το πρόβλημα της ιδιωτικότητας

Η ίδια ακρίβεια αυξάνει την προοπτική που φοβόταν εδώ και καιρό: η εξαγωγή της νοητικής εικόνας ενός ατόμου χωρίς ουσιαστική συναίνεση. «Τα αποτελέσματα φαίνονται πολύ εντυπωσιακά», είπε ο Sprague. «Αλλά αν υπάρχει τρόπος να εξαγάγετε κρυφά πληροφορίες για το τι σκέφτεστε, τότε... 150 χρόνια επιστημονικής φαντασίας μπορούν να γίνουν πραγματικότητα ανά πάσα στιγμή, και αυτό είναι ανησυχητικό από πολλές απόψεις».

Αυτές οι ανησυχίες παραμένουν, προς το παρόν, περιορισμένες από τη φυσική. Το σύστημα απαιτεί από ένα άτομο να βρίσκεται μέσα σε έναν μαγνήτη fMRI πολλών τόνων για ώρες και κάθε προηγούμενος αποκωδικοποιητής χρειαζόταν εκτεταμένη βαθμονόμηση ανά άτομο. Αλλά η απαίτηση βαθμονόμησης είναι ακριβώς αυτή που η ομάδα του Ιράν μόλις έκοψε κατά δεκάδες, γι' αυτό οι ηθικολόγοι δίνουν προσοχή σε ένα εργαλείο που τυγχάνει να αποτελεί και ερευνητικό επίτευγμα.

Οι επόμενοι στόχοι της ομάδας Weizmann - κινούμενες εικόνες και ήχος, στη συνέχεια φανταστικό και ονειρεμένο περιεχόμενο - θα δοκιμάσουν εάν η ακρίβεια της τεχνικής επιβιώνει εκτός των προσεκτικά ελεγχόμενων συνθηκών ενός εργαστηρίου σαρωτών. Εάν συμβεί αυτό, τόσο οι ιατρικές εφαρμογές όσο και οι συζητήσεις για την προστασία της ιδιωτικής ζωής θα κλιμακωθούν μαζί.

Ένα πεδίο που κινείται γρήγορα

Η αποκωδικοποίηση του εγκεφάλου έχει προχωρήσει από θολές, μόλις αναγνωρίσιμες προσεγγίσεις σε δομικά πιστές ανακατασκευές σε λιγότερο από μια δεκαετία, με γνώμονα τους καλύτερους σαρωτές, τα μεγαλύτερα κοινά σύνολα δεδομένων και τα παραγωγικά μοντέλα που μπορούν να συμπληρώσουν ρεαλιστικές λεπτομέρειες από χονδροειδή σήματα. Η συνεισφορά του Weizmann — χρησιμοποιώντας έναν αμφίδρομο βρόχο κωδικοποιητή-αποκωδικοποιητή για να σπάσει το σημείο συμφόρησης των δεδομένων — είναι το είδος της μηχανικής διορατικότητας που τείνει να εξαπλωθεί γρήγορα, επειδή δεν εξαρτάται από νέο υλικό. Αναμένετε από άλλα εργαστήρια να αναπαράγουν το εκπαιδευτικό σχήμα και περιμένετε το ερώτημα ποιος ελέγχει και συναινεί στα νευρωνικά δεδομένα να μετακινηθεί από το περιθώριο της πολιτικής τεχνητής νοημοσύνης προς το κέντρο τους.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →