Een open-sourceproject heeft een taalmodel met 28,9 miljoen parameters in een microcontroller geperst die ongeveer $ 8 kost, en tekst volledig op de chip genereert met ongeveer negen tokens per seconde, zonder dat er een netwerkverbinding is. De demonstratie, gepubliceerd op GitHub en snel stijgend op de voorpagina van Hacker News, laat zien hoe ver de grens van kleine, lokale AI in slechts korte tijd is verschoven.
Het werk concentreert zich op de ESP32-S3, een goedkope ingebouwde chip die populair is bij hobbyisten en hardwaremakers. Het uitvoeren van een model met 28,9 miljoen parameters op zo'n klein stukje silicium zou nog niet zo lang geleden onwaarschijnlijk hebben geleken, en het project biedt een levendige illustratie van de bredere drang naar AI op het apparaat die we volgen in onze dagelijkse [AI-industrieverslaggeving] (https://aibuzzwire.news). Waar de cloud ooit verplicht leek voor elk echt taalmodel, vinden steeds capabelere systemen hun thuis aan de rand.
De cijfers achter de build
Het project legt de specificaties duidelijk uiteen. Het model slaat 28,9 miljoen parameters op, waarvan er ongeveer 25 miljoen in een flash-opzoektabel staan. Het draait op een ESP32-S3-chip met 512 KB snel SRAM, 8 MB PSRAM en 16 MB flash-opslag. In de praktijk bereikt het ongeveer 9,5 tokens per seconde van begin tot eind, of 9,7 tokens per seconde bij pure rekenkracht, en het hele model neemt slechts 14,9 megabytes in beslag wanneer het wordt opgeslagen met een nauwkeurigheid van 4 bits.
Het meest opvallend is de vergelijking die de auteur trekt met eerder werk. Het laatste taalmodel waarvan bekend is dat het in deze klasse op een chip draaide, bevatte slechts 260.000 parameters. De nieuwe build bevat grofweg honderd keer meer, een sprong die niet voortkomt uit een grotere chip, maar uit het heroverwegen van waar de gegevens van het model zich feitelijk bevinden.
Een geheugentruc geleend van Gemma
Het kernprobleem is dat een microcontroller vrijwel geen snel geheugen heeft. De ESP32-S3 biedt slechts 512 KB SRAM, en conventioneel zou het hele model vanaf daar bereikbaar moeten zijn, wat de reden is dat eerdere pogingen bleven steken op een paar honderdduizend parameters.
De oplossing berust op een eenvoudige observatie. De meeste parameters van een taalmodel bevinden zich in een inbeddingstabel, waar het model uit leest in plaats van op te berekenen. Dus in plaats van die enorme tabel van 25 miljoen rijen in het schaarse snelle geheugen te forceren, laat het project deze in langzame flash-opslag achter en haalt alleen het handvol rijen op dat elk token daadwerkelijk nodig heeft, ongeveer 450 bytes per keer. Het kleine deel van het model dat de echte berekening uitvoert, blijft in het snelle geheugen, terwijl het grootste deel van de gewichten eenvoudigweg in flash wacht en beetje bij beetje wordt bemonsterd.
Deze techniek staat bekend als Per-Layer Embeddings en is afkomstig van de Gemma-modellen van Google, met name Gemma 3n en Gemma 4, waar deze is ontworpen voor telefoons en GPU's. Volgens de auteur van het project had niemand de aanpak eerder op zo'n kleine chip geprobeerd.
Wat het kan doen, en wat het niet kan
Het model is getraind op TinyStories, een dataset met eenvoudige kinderverhalen, dus de mogelijkheden ervan zijn bewust beperkt. Het schrijft korte, meestal samenhangende verhalen, maar het beantwoordt geen feitelijke vragen, volgt geen complexe instructies, schrijft geen code of redeneert niet over de wereld. De auteur is eerlijk dat deze beperking voortkomt uit het kleine redeneergedeelte van het model, en dat de geheugentruc daar niets aan verandert.
Wat het project interessant maakt, is dus niet de kwaliteit van de output, maar de architectuur. De prestatie is het passen van een model dat zo groot is op een zo kleine chip, wat bewijst dat dezelfde technieken die efficiënte modellen op telefoons en servers aandrijven, helemaal tot hardware kunnen worden doorgedrongen die minder kost dan een broodje.
Waarom AI op het apparaat belangrijk is
De implicaties reiken veel verder dan een nette technische demo. Omdat het model volledig op de chip draait, wordt er nooit iets naar een server gestuurd. Dat betekent totale privacy door de constructie, er verlaten geen gegevens het apparaat en er hoeft geen cloudrekening te worden betaald. Voor toepassingen in afgelegen gebieden, apparaten met een laag energieverbruik of instellingen waar de connectiviteit onbetrouwbaar is, is die combinatie echt nuttig.
Het wijst ook op een toekomst waarin kleine, gespecialiseerde modellen worden gedistribueerd over miljarden goedkope ingebedde apparaten in plaats van geconcentreerd in een handvol gigantische datacenters. Dezelfde druk die de belangstelling voor lokale AI op laptops en telefoons stimuleert, namelijk lagere latentie, lagere kosten en sterkere privacy, is zelfs nog krachtiger van toepassing op microcontrollerschaal.
Een open uitnodiging om te sleutelen
Het project is vrijgegeven onder de tolerante MIT-licentie en de auteur heeft de volledige code op GitHub gedeeld, samen met gedetailleerde documentatie en benchmarkresultaten. Die openheid betekent dat andere hardwareontwikkelaars de aanpak kunnen bestuderen, aanpassen aan andere chips of het aantal parameters nog verder kunnen verhogen.
Het werk, uitgebracht onder de naam slvDev, vond grote weerklank in de ontwikkelaarsgemeenschap, verzamelde honderden positieve stemmen op Hacker News en leidde tot discussie over waar de techniek naartoe zou kunnen reizen. Als de trend aanhoudt, zal de grens tussen een 'taalmodel' en een gewoon stukje ingebedde software een stuk vager worden.
Blijf AI een stap voor
Van $8-chips tot miljarden-dollardatacenters: de vraag waar AI draait wordt net zo belangrijk als wat AI kan doen. De hardwarelaag evolueert sneller dan de meeste mensen zich realiseren, en de projecten die vandaag de dag op curiosa lijken, bepalen vaak de mainstream van morgen. Lees meer AI-nieuws over AI Buzz Wire om elke doorbraak op het gebied van edge computing, modelefficiëntie en intelligentie op het apparaat te volgen.
Blijf op de hoogte van de AI-hardwarerevolutie – bezoek AI Buzz Wire


