Een nieuw open-sourceproject vestigt de aandacht op het aanpakken van een van de hardnekkige beperkingen van machine learning: het bouwen van een taalmodel dat nooit stopt met leren. Het project heet mini-AGI en beschrijft zichzelf als een voortdurend lerend taalmodel op byteniveau dat zijn eigen architectuur samenstelt, vanaf het begin traint op een enkele GPU met 8 GB VRAM en blijft leren van alles wat het leest.

Het project verscheen dit weekend op Hacker News, waar het naar ruim honderd punten klom, en de repository op GitHub is vrijgegeven onder de MIT-licentie. Volgens de README van het project is het doel om aan te tonen dat voortdurend leren uit een enkele gegevensstroom – zonder catastrofaal te vergeten – mogelijk is, zelfs op bescheiden hardware van consumentenkwaliteit. Voor meer context over dit verhaal, zie ons meer AI-verhalen.

Gewichten op schijf, niet in VRAM

De centrale truc achter mini-AGI is een onconventioneel geheugenbeheerschema. In plaats van alle modelparameters in het GPU-geheugen op te slaan, slaat het systeem de gewichten op als gewone bestanden op schijf en plaatst deze op de grafische kaart als ze nodig zijn.

Die ontwerpkeuze heeft een aanzienlijk gevolg: het aantal parameters van het model wordt begrensd door de vrije schijfruimte in plaats van door VRAM. De README stelt dat het model tijdens het trainen nieuwe capaciteit kan laten groeien als het tekort komt, en capaciteit snoeit waar niets om vraagt. Training en gevolgtrekking verlopen via exact hetzelfde codepad, dus er is geen afzonderlijk verfijningsregime en geen bevroren basismodel; lezen en getraind worden zijn, in de woorden van het project, dezelfde gebeurtenis.

Het systeem is gericht op een pc of laptop met minimaal een 8GB VRAM GPU, hardware die veel ontwikkelaars al bezitten.

Waarom voortdurend leren moeilijk is

De meeste taalmodellen die tegenwoordig beschikbaar zijn, volgen dezelfde levenscyclus: een laboratorium traint een model, bevriest het en verzendt het. Gebruikers kunnen de randen nauwkeurig afstemmen, maar de basisgewichten veranderen nooit meer. In de motivatiesectie van het project wordt betoogd dat dit elk persoonlijk model "het model van iemand anders maakt met een dun laagje van jou erbovenop" - een die stopt met leren op de dag dat het wordt verzonden.

Het obstakel is een bekend obstakel in onderzoek naar machinaal leren: catastrofaal vergeten, de neiging van neurale netwerken om eerder geleerde kennis te overschrijven wanneer ze worden getraind op nieuwe gegevens. Een model dat voortdurend leert van een dagelijkse stroom informatie, degradeert doorgaans op alles wat het voorheen wist.

De README schetst de beperkingen die het ontwerp hebben gevormd. Het model moet passen op 8 GB VRAM – niet met kwantisering, omdat training gradiënten en een optimalisatiestatus vereist die grofweg drie keer zoveel geheugen toevoegen als de gewichten zelf. En hij mag niet vergeten dat hij moet vasthouden aan wat hij al heeft geleerd, terwijl hij nieuw materiaal uit een eindeloze stroom tekst moet opnemen.

Een model op byteniveau dat zichzelf bouwt

mini-AGI werkt op byteniveau in plaats van op tokens, waarbij een stroom karakters stuk voor stuk wordt gelezen en op elk stuk een gradiëntstap wordt uitgevoerd. Het project zegt ook dat het model "zijn eigen architectuur samenstelt", waardoor het zich onderscheidt van conventionele modellen waarvan de structuur door de makers ervan wordt vastgelegd voordat de training begint.

De aanpak is bewust experimenteel. Het is een kleinschalige demonstratie van een trainingsregime, geen uitdaging voor grenssystemen.

Belangrijke kanttekeningen

De auteur van het project is expliciet over de huidige staat van het systeem. In de eigen woorden van de README is mini-AGI "een klein model op speelgoedniveau", en lezers mogen geen mogelijkheden op grensniveau verwachten. Het punt van de oefening is om aan te tonen dat voortdurend leren uit één enkele datastroom zonder catastrofaal vergeten überhaupt mogelijk is – en mogelijk op hardware waartoe bijna iedereen toegang heeft.

De gewichten van het model zijn nog niet gepubliceerd. De trainingsrun voltooit nog steeds zijn eerste passage over het corpus waarvan hij leert, en de auteur zegt dat de gewichten zullen worden vrijgegeven zodra die passage is voltooid, wat in het huidige tempo nog een paar weken zal duren. Tot die tijd kunnen waarnemers op de projectpagina voorbeelden uit de geschiedenis van de trainingsrun bekijken om te zien hoe het model tijdens het lezen is verbeterd.

Waarom het ertoe doet

Als de aanpak standhoudt naarmate het model schaalt naar meer capabele afmetingen, wijst het in de richting van een ander soort AI-eigendom: persoonlijke modellen die op uw eigen machine leven, blijven leren van de documenten en gegevens die u ze invoert, en waarvan de gewichten nooit worden bevroren door het releaseschema van een leverancier.

Het project herinnert ons er ook aan dat niet al het interessante werk op het gebied van AI aan de grens plaatsvindt. Met een enkele consumenten-GPU, gewone schijfruimte en een MIT-licentie probeert mini-AGI een vraag te beantwoorden die grote laboratoria grotendeels hebben omzeild: of een model kan worden gebouwd om te leren zoals mensen dat doen: continu, van wat het ook tegenkomt.

De code en documentatie zijn beschikbaar op GitHub voor iedereen met compatibele hardware die het project wil volgen, het project wil afsplitsen of het model naar eigen inzicht wil blijven trainen.

---

Blijf Voorop met AI

Het laatste AI-nieuws, analyses en doorbraken — allemaal op één plek.

Lees meer AI-nieuws →