Ett nytt projekt med öppen källkod uppmärksammar en av maskininlärningens envisa begränsningar: att bygga en språkmodell som aldrig slutar lära sig. Kallas mini-AGI, projektet beskriver sig själv som en ständigt lärande språkmodell på bytenivå som sätter ihop sin egen arkitektur, tränar från grunden på en enda GPU med 8 GB VRAM och fortsätter att lära sig av allt den läser.

Projektet dök upp på Hacker News under helgen, där det klättrade till långt över hundra poäng, och dess arkiv på GitHub släpps under MIT-licensen. Enligt projektets README är målet att visa att kontinuerligt lärande från en enda dataström – utan katastrofal förglömning – är möjligt även på blygsam hårdvara av konsumentkvalitet. For more context on this story, see our ongoing AI news.

Vikter på disk, inte i VRAM

Det centrala tricket bakom mini-AGI är ett okonventionellt minneshanteringssystem. Istället för att hålla alla modellparametrar i GPU-minnet, lagrar systemet sina vikter som vanliga filer på disken och läser in dem på grafikkortet när de behövs.

Det designvalet har en betydande konsekvens: modellens parameterantal begränsas av ledigt diskutrymme snarare än av VRAM. README säger att modellen kan öka ny kapacitet medan den tränas när den blir kort, och beskär kapacitet som ingenting kräver. Träning och slutledning går genom exakt samma kodväg, så det finns ingen separat finjusteringsregim och ingen frusen basmodell – att läsa och träna är, med projektets ord, samma händelse.

Systemet är inriktat på en PC eller bärbar dator med minst en 8GB VRAM GPU, hårdvara som många utvecklare redan äger.

Varför kontinuerligt lärande är svårt

De flesta språkmodeller som finns tillgängliga idag följer samma livscykel: ett labb tränar en modell, fryser den och skickar den. Användare kan finjustera runt kanterna, men basvikterna ändras aldrig igen. Projektets motivationssektion hävdar att detta gör varje personligt ägd modell till "någon annans modell med ett tunt lager av dig på toppen" - en som slutar lära sig den dagen den skickas.

Hindret är välkänt inom maskininlärningsforskning: katastrofal glömska, tendensen hos neurala nätverk att skriva över tidigare inlärd kunskap när de tränas på ny data. En modell som ständigt lär sig av en daglig ström av information försämrar vanligtvis allt den visste tidigare.

README beskriver de begränsningar som formade designen. Modellen måste få plats med 8 GB VRAM – inte med kvantisering, eftersom träning kräver gradienter och optimeringstillstånd som lägger till ungefär tre gånger minnet av själva vikterna. Och den får inte glömma att hålla fast vid vad den redan har lärt sig samtidigt som den absorberar nytt material från en oändlig ström av text.

En modell på bytenivå som bygger sig själv

mini-AGI fungerar på bytenivå snarare än på tokens, läser en ström av tecken en bit i taget och tar ett gradientsteg på varje bit. Projektet säger också att modellen "monterar sin egen arkitektur", vilket skiljer den från konventionella modeller vars struktur fixeras av deras skapare innan träningen börjar.

Tillvägagångssättet är medvetet experimentellt. Det är en småskalig demonstration av en träningsregim, inte en utmaning för gränssystem.

Viktiga varningar

Projektets författare är tydlig om systemets nuvarande tillstånd. Med README:s egna ord är mini-AGI "en liten modell på leksaksnivå", och läsare bör inte förvänta sig kapaciteter på gränsnivå. Poängen med övningen är att visa att kontinuerligt lärande från en enda dataström utan katastrofal glömning överhuvudtaget är möjligt – och möjligt på hårdvara som nästan alla kan komma åt.

Modellens vikter har inte publicerats ännu. Träningskörningen håller fortfarande på att slutföra sin första pass över korpusen den lär sig av, och författaren säger att vikterna kommer att släppas när passet är klart, vilket i nuvarande takt är ett par veckor bort. Fram till dess kan observatörer inspektera prover från träningsloppets historia på projektsidan för att se hur modellen har förbättrats under läsningens gång.

Varför det är viktigt

Om tillvägagångssättet håller i sig när modellen skalas till mer kapabla storlekar, pekar det mot en annan typ av AI-ägande: personliga modeller som lever på din egen maskin, fortsätter att lära sig av de dokument och data du matar dem, och aldrig få sina vikter frysta av en leverantörs releaseschema.

Projektet är också en påminnelse om att inte allt intressant arbete inom AI sker vid gränsen. Med en enda konsument-GPU, vanligt diskutrymme och en MIT-licens försöker mini-AGI att svara på en fråga som stora laboratorier till stor del har kringgått — om en modell kan byggas för att lära sig hur människor gör: kontinuerligt, från vad den än stöter på härnäst.

Koden och dokumentationen finns tillgänglig på GitHub för alla med kompatibel hårdvara som vill följa med, gå vidare med projektet eller fortsätta att träna modellen som de tycker är lämpligt.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →