Un proiect open-source a comprimat un model de limbaj de 28,9 milioane de parametri pe un microcontroler care costă aproximativ 8 USD, generând text în întregime pe cip la aproximativ nouă jetoane pe secundă, fără nicio conexiune la rețea. Demonstrația, publicată pe GitHub și care urcă rapid pe prima pagină a Hacker News, arată cât de departe s-a mutat granița AI locală mică în doar scurt timp.
Lucrarea se concentrează pe ESP32-S3, un cip încorporat ieftin, popular printre pasionații și producătorii de hardware. Rularea unui model de 28,9 milioane de parametri pe o bucată atât de mică de siliciu ar fi părut de neplauzibil nu cu mult timp în urmă, iar proiectul oferă o ilustrare vie a impulsului mai amplu către AI pe dispozitiv pe care îl urmărim în [acoperirea industriei AI] (https://aibuzzwire.news). Acolo unde cloud-ul s-a simțit odată obligatoriu pentru orice model de limbaj real, sistemele din ce în ce mai capabile găsesc case la margine.
Numerele din spatele construcției
Proiectul își prezintă în mod clar specificațiile. Modelul stochează 28,9 milioane de parametri, dintre care aproximativ 25 milioane trăiesc într-un tabel de căutare flash. Funcționează pe un cip ESP32-S3 cu 512KB de SRAM rapidă, 8MB de PSRAM și 16MB de stocare flash. În practică, ajunge la aproximativ 9,5 jetoane pe secundă cap la cap, sau 9,7 jetoane pe secundă de calcul pur, iar întregul model ocupă doar 14,9 megaocteți atunci când este stocat la o precizie de 4 biți.
Cea mai frapantă este comparația pe care o face autorul cu lucrările anterioare. Ultimul model de limbaj cunoscut că rulează pe un cip din această clasă a avut doar 260.000 de parametri. Noua construcție deține de aproximativ o sută de ori mai mult, un salt care nu vine de la un cip mai mare, ci de la regândirea unde se află de fapt datele modelului.
Un truc de memorie împrumutat de la Gemma
Problema de bază este că un microcontroler aproape că nu are memorie rapidă. ESP32-S3 oferă doar 512 KB de SRAM și, în mod convențional, întregul model ar trebui să fie accesibil de acolo, motiv pentru care încercările anterioare au fost blocate la câteva sute de mii de parametri.
Soluția se bazează pe o simplă observație. Majoritatea parametrilor unui model de limbaj se află într-un tabel de încorporare, din care modelul citește mai degrabă decât să calculeze. Deci, în loc să forțeze acel tabel enorm de 25 de milioane de rânduri într-o memorie rapidă limitată, proiectul îl lasă în stocare flash lentă și trage doar câteva rânduri de care fiecare jeton are de fapt nevoie, aproximativ 450 de octeți la un moment dat. Porțiunea mică a modelului care realizează calculul real rămâne în memoria rapidă, în timp ce cea mai mare parte a greutăților așteaptă pur și simplu în flash, eșantionate câte puțin.
Această tehnică este cunoscută sub numele de Per-Layer Embeddings și își are originea în modelele Gemma de la Google, în special Gemma 3n și Gemma 4, unde a fost concepută pentru telefoane și GPU. Potrivit autorului proiectului, nimeni nu a încercat anterior abordarea pe un cip atât de mic.
Ce poate face și ce nu poate
Modelul a fost antrenat pe TinyStories, un set de date de povești simple pentru copii, așa că abilitățile sale sunt în mod deliberat înguste. Scrie povești scurte, în mare parte coerente, dar nu va răspunde la întrebări concrete, nu va urma instrucțiuni complexe, nu va scrie cod sau nu va raționa despre lume. Autorul este sincer că această limitare provine din partea mică de raționament a modelului și că trucul de memorie nu o schimbă.
Prin urmare, ceea ce face ca proiectul să fie interesant nu este calitatea producției, ci arhitectura. Realizarea este montarea unui model atât de mare pe un cip atât de mic, demonstrând că aceleași tehnici care alimentează modele eficiente pe telefoane și servere pot fi împinse până la un hardware care costă mai puțin decât un sandwich.
De ce contează AI pe dispozitiv
Implicațiile depășesc cu mult o demonstrație tehnică îngrijită. Deoarece modelul rulează în întregime pe cip, nimic nu este trimis vreodată la un server. Aceasta înseamnă confidențialitate totală prin construcție, nicio dată nu părăsește dispozitivul și nu există nicio factură în cloud de plătit. Pentru aplicații din zone îndepărtate, dispozitive cu consum redus de energie sau setări în care conectivitatea nu este de încredere, această combinație este cu adevărat utilă.
De asemenea, indică un viitor în care modelele mici și specializate sunt distribuite pe miliarde de dispozitive încorporate ieftine, mai degrabă decât concentrate într-o mână de centre de date gigantice. Aceleași presiuni care determină interesul pentru IA locală pe laptopuri și telefoane, și anume latență mai mică, costuri mai mici și confidențialitate mai puternică, se aplică și mai puternic la scara microcontrolerului.
O invitație deschisă la chinuit
Proiectul este lansat sub licența permisivă MIT, iar autorul a distribuit codul complet pe GitHub împreună cu documentația detaliată și rezultatele benchmark-ului. Această deschidere înseamnă că alți dezvoltatori de hardware pot studia abordarea, o pot adapta la alte cipuri sau pot crește numărul de parametri.
Lansată sub controlul slvDev, lucrarea a rezonat puternic cu comunitatea de dezvoltatori, adunând sute de voturi pozitive pe Hacker News și provocând discuții despre unde ar putea călători tehnica în continuare. Dacă tendința se menține, linia dintre un „model de limbă” și o bucată obișnuită de software încorporat este pe cale să devină mult mai neclară.
Rămâi înaintea AI
De la cipuri de 8 USD la centre de date de miliarde de dolari, întrebarea unde rulează AI devine la fel de importantă ca ceea ce poate face AI. Stratul hardware evoluează mai repede decât își dau seama majoritatea oamenilor, iar proiectele care arată ca curiozități astăzi definesc adesea mainstreamul de mâine. Citiți mai multe știri despre AI pe AI Buzz Wire pentru a urmări fiecare descoperire în edge computing, eficiență a modelului și inteligență pe dispozitiv.
Fii pasul cu revoluția hardware AI — vizitați AI Buzz Wire


