Ένα νέο έργο ανοιχτού κώδικα εφιστά την προσοχή για την αντιμετώπιση ενός από τους πεισματικούς περιορισμούς της μηχανικής μάθησης: τη δημιουργία ενός μοντέλου γλώσσας που δεν σταματά ποτέ να μαθαίνει. Ονομάζεται mini-AGI, το έργο περιγράφει τον εαυτό του ως ένα μοντέλο γλώσσας σε επίπεδο byte συνεχούς μάθησης που συναρμολογεί τη δική του αρχιτεκτονική, εκπαιδεύεται από την αρχή σε μια ενιαία GPU με 8 GB VRAM και συνεχίζει να μαθαίνει από όλα όσα διαβάζει.

Το έργο εμφανίστηκε στο Hacker News το Σαββατοκύριακο, όπου σκαρφάλωσε σε πάνω από εκατό σημεία και το αποθετήριο του στο GitHub κυκλοφορεί με άδεια MIT. Σύμφωνα με το README του έργου, ο στόχος είναι να αποδειχθεί ότι η συνεχής μάθηση από μια ενιαία ροή δεδομένων - χωρίς καταστροφική λήθη - είναι δυνατή ακόμη και σε μέτριο, καταναλωτικό υλικό. For more context on this story, see our ongoing more AI stories.

Βάρη στο δίσκο, όχι σε VRAM

Το κεντρικό κόλπο πίσω από το mini-AGI είναι ένα μη συμβατικό σχήμα διαχείρισης μνήμης. Αντί να διατηρεί όλες τις παραμέτρους του μοντέλου στη μνήμη GPU, το σύστημα αποθηκεύει τα βάρη του ως συνηθισμένα αρχεία στο δίσκο και τα σελιδοποιεί στην κάρτα γραφικών όπως χρειάζονται.

Αυτή η επιλογή σχεδίασης έχει μια σημαντική συνέπεια: ο αριθμός παραμέτρων του μοντέλου περιορίζεται από ελεύθερο χώρο στο δίσκο και όχι από VRAM. Το README δηλώνει ότι το μοντέλο μπορεί να αναπτύξει νέα χωρητικότητα ενώ προπονείται όταν είναι σύντομη, και να κλαδεύει την ικανότητα που τίποτα δεν ζητά. Η εκπαίδευση και το συμπέρασμα διατρέχουν ακριβώς την ίδια διαδρομή κώδικα, επομένως δεν υπάρχει ξεχωριστό καθεστώς μικρορύθμισης και παγωμένο βασικό μοντέλο — η ανάγνωση και η εκπαίδευση είναι, σύμφωνα με τα λόγια του έργου, το ίδιο γεγονός.

Το σύστημα απευθύνεται σε υπολογιστή ή φορητό υπολογιστή με GPU VRAM τουλάχιστον 8 GB, υλικό που ήδη διαθέτουν πολλοί προγραμματιστές.

Γιατί η συνεχής μάθηση είναι δύσκολη

Τα περισσότερα μοντέλα γλωσσών που είναι διαθέσιμα σήμερα ακολουθούν τον ίδιο κύκλο ζωής: ένα εργαστήριο εκπαιδεύει ένα μοντέλο, το παγώνει και το αποστέλλει. Οι χρήστες μπορούν να τελειοποιήσουν τις άκρες, αλλά τα βάρη βάσης δεν αλλάζουν ποτέ ξανά. Η ενότητα κινήτρων του έργου υποστηρίζει ότι αυτό κάνει κάθε μοντέλο που ανήκει σε προσωπική ιδιοκτησία «μοντέλο κάποιου άλλου με ένα λεπτό στρώμα από εσάς» — ένα που σταματά να μαθαίνει τη μέρα που θα αποσταλεί.

Το εμπόδιο είναι πολύ γνωστό στην έρευνα της μηχανικής μάθησης: η καταστροφική λήθη, η τάση των νευρωνικών δικτύων να αντικαθιστούν τις γνώσεις που είχαν μάθει προηγουμένως όταν εκπαιδεύονται σε νέα δεδομένα. Ένα μοντέλο που μαθαίνει συνεχώς από μια καθημερινή ροή πληροφοριών συνήθως υποβαθμίζεται σε όλα όσα γνώριζε πριν.

Το README περιγράφει τους περιορισμούς που διαμόρφωσαν το σχέδιο. Το μοντέλο πρέπει να χωράει σε 8 GB VRAM — όχι με κβαντισμό, καθώς η εκπαίδευση απαιτεί κλίσεις και κατάσταση βελτιστοποίησης που προσθέτουν περίπου τριπλάσια μνήμη από τα ίδια τα βάρη. Και δεν πρέπει να ξεχνάει, κρατώντας αυτό που έχει ήδη μάθει ενώ απορροφά νέο υλικό από μια ατελείωτη ροή κειμένου.

Ένα μοντέλο σε επίπεδο byte που δημιουργείται μόνο του

Το mini-AGI λειτουργεί σε επίπεδο byte και όχι σε διακριτικά, διαβάζοντας μια ροή χαρακτήρων ένα κομμάτι τη φορά και κάνοντας ένα βήμα διαβάθμισης σε κάθε κομμάτι. Το έργο λέει επίσης ότι το μοντέλο «συναρμολογεί τη δική του αρχιτεκτονική», διακρίνοντάς το από τα συμβατικά μοντέλα των οποίων η δομή καθορίζεται από τους δημιουργούς τους πριν ξεκινήσει η εκπαίδευση.

Η προσέγγιση είναι σκόπιμα πειραματική. Είναι μια μικρής κλίμακας επίδειξη ενός καθεστώτος εκπαίδευσης, όχι μια πρόκληση για τα συνοριακά συστήματα.

Σημαντικές επιφυλάξεις

Ο συγγραφέας του έργου είναι σαφής σχετικά με την τρέχουσα κατάσταση του συστήματος. Σύμφωνα με τα ίδια τα λόγια του README, το mini-AGI είναι «ένα μικρό μοντέλο σε επίπεδο παιχνιδιού» και οι αναγνώστες δεν πρέπει να περιμένουν ικανότητες σε επίπεδο συνόρων. Ο σκοπός της άσκησης είναι να δείξει ότι η συνεχής μάθηση από μια ενιαία ροή δεδομένων χωρίς καταστροφική λήθη είναι καθόλου δυνατή — και δυνατή σε υλικό στο οποίο σχεδόν ο καθένας μπορεί να έχει πρόσβαση.

Τα βάρη του μοντέλου δεν έχουν δημοσιευθεί ακόμα. Ο κύκλος εκπαίδευσης ολοκληρώνει ακόμη το πρώτο του πέρασμα πάνω από το σώμα από το οποίο μαθαίνει και ο συγγραφέας λέει ότι τα βάρη θα απελευθερωθούν μόλις ολοκληρωθεί αυτό το πέρασμα, το οποίο με τον τρέχοντα ρυθμό απέχει μερικές εβδομάδες. Μέχρι τότε, οι παρατηρητές μπορούν να επιθεωρήσουν δείγματα από το ιστορικό της εκπαίδευσης στη σελίδα του έργου για να δουν πώς το μοντέλο έχει βελτιωθεί κατά τη διάρκεια της ανάγνωσης.

Γιατί έχει σημασία

Εάν η προσέγγιση αντέχει καθώς το μοντέλο κλιμακώνεται σε πιο ικανά μεγέθη, δείχνει προς ένα διαφορετικό είδος ιδιοκτησίας τεχνητής νοημοσύνης: προσωπικά μοντέλα που ζουν στον δικό σας υπολογιστή, συνεχίζουν να μαθαίνουν από τα έγγραφα και τα δεδομένα που τα τροφοδοτείτε και ποτέ δεν παγώνουν το βάρος τους από το πρόγραμμα κυκλοφορίας ενός προμηθευτή.

Το έργο είναι επίσης μια υπενθύμιση ότι δεν γίνονται όλες οι ενδιαφέρουσες εργασίες στον τομέα της τεχνητής νοημοσύνης στα σύνορα. Με μια μοναδική GPU καταναλωτή, συνηθισμένο χώρο στο δίσκο και άδεια MIT, το mini-AGI προσπαθεί να απαντήσει σε μια ερώτηση που τα μεγάλα εργαστήρια έχουν παρακάμψει σε μεγάλο βαθμό - εάν ένα μοντέλο μπορεί να κατασκευαστεί για να μάθει τον τρόπο που κάνουν οι άνθρωποι: συνεχώς, από ό,τι και αν συναντήσει στη συνέχεια.

Ο κώδικας και η τεκμηρίωση είναι διαθέσιμα στο GitHub για οποιονδήποτε διαθέτει συμβατό υλικό που θέλει να ακολουθήσει, να ολοκληρώσει το έργο ή να συνεχίσει να εκπαιδεύει το μοντέλο όπως νομίζει.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →