Ένα έργο ανοιχτού κώδικα έχει συμπιέσει ένα μοντέλο γλώσσας 28,9 εκατομμυρίων παραμέτρων σε έναν μικροελεγκτή που κοστίζει περίπου 8 $, δημιουργώντας κείμενο εξ ολοκλήρου στο τσιπ με περίπου εννέα διακριτικά ανά δευτερόλεπτο χωρίς καθόλου σύνδεση δικτύου. Η επίδειξη, που δημοσιεύτηκε στο GitHub και ανεβαίνει γρήγορα στην πρώτη σελίδα των Hacker News, δείχνει πόσο μακριά έχουν μετακινηθεί τα σύνορα της μικρής, τοπικής τεχνητής νοημοσύνης μέσα σε σύντομο χρονικό διάστημα.
Η δουλειά επικεντρώνεται στο ESP32-S3, ένα φθηνό ενσωματωμένο τσιπ δημοφιλές στους χομπίστες και τους κατασκευαστές υλικού. Η εκτέλεση ενός μοντέλου 28,9 εκατομμυρίων παραμέτρων σε ένα τόσο μικρό κομμάτι πυριτίου θα φαινόταν απίθανο πριν από λίγο καιρό και το έργο προσφέρει μια ζωντανή απεικόνιση της ευρύτερης ώθησης προς την τεχνητή νοημοσύνη στη συσκευή που παρακολουθούμε στην καθημερινή μας [κάλυψη βιομηχανίας AI] (https://aibuzzwire.news). Εκεί που κάποτε το σύννεφο φαινόταν υποχρεωτικό για οποιοδήποτε πραγματικό μοντέλο γλώσσας, τα ολοένα και πιο ικανά συστήματα βρίσκουν σπίτια στην άκρη.
Οι αριθμοί πίσω από την κατασκευή
Το έργο εκθέτει τις προδιαγραφές του ξεκάθαρα. Το μοντέλο αποθηκεύει 28,9 εκατομμύρια παραμέτρους, από τις οποίες περίπου 25 εκατομμύρια βρίσκονται σε έναν πίνακα αναζήτησης flash. Λειτουργεί σε ένα τσιπ ESP32-S3 με 512KB γρήγορης SRAM, 8MB PSRAM και 16MB αποθήκευσης flash. Στην πράξη φτάνει περίπου τα 9,5 tokens ανά δευτερόλεπτο από άκρο σε άκρο, ή 9,7 tokens ανά δευτερόλεπτο καθαρού υπολογισμού, και ολόκληρο το μοντέλο καταλαμβάνει μόλις 14,9 megabyte όταν αποθηκεύεται με ακρίβεια 4 bit.
Πιο εντυπωσιακή είναι η σύγκριση που κάνει ο συγγραφέας με προηγούμενη εργασία. Το τελευταίο μοντέλο γλώσσας που είναι γνωστό ότι τρέχει σε ένα τσιπ αυτής της κατηγορίας είχε μόνο 260.000 παραμέτρους. Η νέα κατασκευή χωράει περίπου εκατό φορές περισσότερο, ένα άλμα που δεν προέρχεται από ένα μεγαλύτερο τσιπ αλλά από την επανεξέταση του πού ζουν πραγματικά τα δεδομένα του μοντέλου.
Ένα κόλπο μνήμης δανεισμένο από την Gemma
Το βασικό πρόβλημα είναι ότι ένας μικροελεγκτής δεν έχει σχεδόν καθόλου γρήγορη μνήμη. Το ESP32-S3 προσφέρει μόλις 512 KB SRAM και συμβατικά ολόκληρο το μοντέλο θα έπρεπε να είναι προσβάσιμο από εκεί, γι' αυτό και οι προηγούμενες προσπάθειες είχαν κολλήσει σε μερικές εκατοντάδες χιλιάδες παραμέτρους.
Η λύση βασίζεται σε μια απλή παρατήρηση. Οι περισσότερες από τις παραμέτρους ενός μοντέλου γλώσσας βρίσκονται σε έναν πίνακα ενσωμάτωσης, από τον οποίο το μοντέλο διαβάζει αντί να υπολογίζει. Έτσι, αντί να εξαναγκάσει αυτόν τον τεράστιο πίνακα των 25 εκατομμυρίων σειρών σε σπάνια γρήγορη μνήμη, το έργο τον αφήνει σε αργή αποθήκευση flash και τραβά μόνο τις λίγες σειρές που χρειάζεται πραγματικά κάθε διακριτικό, περίπου 450 byte τη φορά. Το μικρό τμήμα του μοντέλου που εκτελεί τον πραγματικό υπολογισμό παραμένει στη γρήγορη μνήμη, ενώ το μεγαλύτερο μέρος των βαρών απλώς περιμένει σε flash, δειγματοληψία λίγο κάθε φορά.
Αυτή η τεχνική είναι γνωστή ως ενσωματώσεις ανά στρώμα και προέρχεται από τα μοντέλα Gemma της Google, συγκεκριμένα το Gemma 3n και το Gemma 4, όπου σχεδιάστηκε για τηλέφωνα και GPU. Σύμφωνα με τον συγγραφέα του έργου, κανείς δεν είχε δοκιμάσει προηγουμένως την προσέγγιση σε ένα τσιπ τόσο μικρό.
Τι μπορεί να κάνει και τι δεν μπορεί
Το μοντέλο εκπαιδεύτηκε στο TinyStories, ένα σύνολο δεδομένων από απλές παιδικές ιστορίες, επομένως οι ικανότητές του είναι σκόπιμα περιορισμένες. Γράφει σύντομες, ως επί το πλείστον συνεκτικές ιστορίες, αλλά δεν θα απαντήσει σε πραγματικές ερωτήσεις, δεν θα ακολουθήσει περίπλοκες οδηγίες, θα γράψει κώδικα ή δεν θα αιτιολογήσει τον κόσμο. Ο συγγραφέας είναι ειλικρινής ότι αυτός ο περιορισμός πηγάζει από το μικρό σκεπτικό του μοντέλου και ότι το τέχνασμα μνήμης δεν το αλλάζει.
Αυτό που κάνει το έργο ενδιαφέρον επομένως δεν είναι η ποιότητα παραγωγής του αλλά η αρχιτεκτονική του. Το επίτευγμα είναι η τοποθέτηση ενός τόσο μεγάλου μοντέλου σε ένα τόσο μικροσκοπικό τσιπ, αποδεικνύοντας ότι οι ίδιες τεχνικές που τροφοδοτούν αποτελεσματικά μοντέλα σε τηλέφωνα και διακομιστές μπορούν να ωθηθούν μέχρι το τέλος σε υλικό που κοστίζει λιγότερο από ένα σάντουιτς.
Γιατί έχει σημασία το AI στη συσκευή
Οι συνέπειες φτάνουν πολύ πέρα από μια τακτοποιημένη τεχνική επίδειξη. Επειδή το μοντέλο εκτελείται εξ ολοκλήρου στο τσιπ, τίποτα δεν αποστέλλεται ποτέ σε διακομιστή. Αυτό σημαίνει απόλυτο απόρρητο από την κατασκευή, δεν φεύγουν δεδομένα από τη συσκευή και δεν υπάρχει λογαριασμός cloud για πληρωμή. Για εφαρμογές σε απομακρυσμένες περιοχές, συσκευές χαμηλής κατανάλωσης ή ρυθμίσεις όπου η συνδεσιμότητα είναι αναξιόπιστη, αυτός ο συνδυασμός είναι πραγματικά χρήσιμος.
Υποδεικνύει επίσης ένα μέλλον στο οποίο μικρά, εξειδικευμένα μοντέλα διανέμονται σε δισεκατομμύρια φθηνές ενσωματωμένες συσκευές αντί να συγκεντρώνονται σε μια χούφτα γιγάντια κέντρα δεδομένων. Οι ίδιες πιέσεις που προκαλούν το ενδιαφέρον για την τοπική τεχνητή νοημοσύνη σε φορητούς υπολογιστές και τηλέφωνα, δηλαδή χαμηλότερη καθυστέρηση, χαμηλότερο κόστος και ισχυρότερο απόρρητο, ισχύουν ακόμη πιο έντονα στην κλίμακα μικροελεγκτή.
Μια ανοιχτή πρόσκληση για tinker
Το έργο κυκλοφορεί με την άδεια MIT και ο συγγραφέας έχει μοιραστεί τον πλήρη κώδικα στο GitHub μαζί με λεπτομερή τεκμηρίωση και αποτελέσματα συγκριτικής αξιολόγησης. Αυτό το άνοιγμα σημαίνει ότι άλλοι προγραμματιστές υλικού μπορούν να μελετήσουν την προσέγγιση, να την προσαρμόσουν σε άλλα τσιπ ή να αυξήσουν τον αριθμό των παραμέτρων.
Κυκλοφόρησε με το χειριστήριο slvDev, το έργο είχε μεγάλη απήχηση στην κοινότητα των προγραμματιστών, συγκεντρώνοντας εκατοντάδες θετικές ψήφους στο Hacker News και προκαλώντας συζήτηση σχετικά με το πού μπορεί να ταξιδέψει η τεχνική στη συνέχεια. Εάν η τάση ισχύει, η γραμμή μεταξύ ενός "μοντέλου γλώσσας" και ενός συνηθισμένου τμήματος ενσωματωμένου λογισμικού πρόκειται να γίνει πολύ πιο θολή.
Μείνετε μπροστά από την τεχνητή νοημοσύνη
Από μάρκες 8 δολαρίων έως κέντρα δεδομένων δισεκατομμυρίων δολαρίων, το ερώτημα για το πού τρέχει η τεχνητή νοημοσύνη γίνεται εξίσου σημαντικό με το τι μπορεί να κάνει η τεχνητή νοημοσύνη. Το επίπεδο υλικού εξελίσσεται ταχύτερα από ό,τι αντιλαμβάνονται οι περισσότεροι άνθρωποι, και τα έργα που μοιάζουν με αξιοπερίεργα σήμερα συχνά καθορίζουν το mainstream αύριο. Διαβάστε περισσότερες ειδήσεις τεχνητής νοημοσύνης στο AI Buzz Wire για να παρακολουθήσετε κάθε σημαντική ανακάλυψη στον υπολογισμό αιχμής, την αποτελεσματικότητα του μοντέλου και την ευφυΐα στη συσκευή.
Συνεχίστε με την επανάσταση υλικού AI — επισκεφτείτε το AI Buzz Wire


