Un nou proiect open-source atrage atenția pentru abordarea uneia dintre limitările persistente ale învățării automate: construirea unui model de limbă care nu se oprește niciodată să învețe. Denumit mini-AGI, proiectul se descrie ca un model de limbaj de învățare continuă, la nivel de octeți, care își asambla propria arhitectură, se antrenează de la zero pe un singur GPU cu 8 GB de VRAM și continuă să învețe din tot ceea ce citește.

Proiectul a apărut pe Hacker News în weekend, unde a urcat la peste o sută de puncte, iar depozitul său de pe GitHub este lansat sub licența MIT. Potrivit README al proiectului, scopul este de a demonstra că învățarea continuă dintr-un singur flux de date - fără uitare catastrofală - este posibilă chiar și pe hardware modest, de calitate pentru consumatori. For more context on this story, see our ongoing AI news.

Greutăți pe disc, nu în VRAM

Trucul central din spatele mini-AGI este o schemă neconvențională de gestionare a memoriei. În loc să păstreze toți parametrii modelului în memoria GPU, sistemul își stochează greutățile ca fișiere obișnuite pe disc și le plasează pe placa grafică după cum sunt necesare.

Această alegere de proiectare are o consecință semnificativă: numărul de parametri ai modelului este limitat de spațiul liber pe disc, mai degrabă decât de VRAM. README afirmă că modelul poate crește o capacitate nouă în timp ce se antrenează atunci când este scurt și reduce capacitatea pe care nimic nu o cere. Antrenamentul și inferența parcurg exact aceeași cale de cod, așa că nu există un regim separat de reglare fină și nici un model de bază înghețat - citirea și instruirea sunt, în cuvintele proiectului, același eveniment.

Sistemul este destinat unui PC sau laptop cu un GPU VRAM de cel puțin 8 GB, hardware pe care mulți dezvoltatori îl dețin deja.

De ce învățarea continuă este grea

Majoritatea modelelor de limbaj disponibile astăzi urmează același ciclu de viață: un laborator antrenează un model, îl îngheață și îl expediază. Utilizatorii pot regla fin în jurul marginilor, dar greutățile de bază nu se mai schimbă niciodată. Secțiunea de motivare a proiectului susține că acest lucru face ca fiecare model deținut personal să fie „modelul altcuiva cu un strat subțire de tine deasupra” – unul care nu mai învață în ziua în care este expediat.

Obstacolul este unul binecunoscut în cercetarea învățării automate: uitarea catastrofală, tendința rețelelor neuronale de a suprascrie cunoștințele învățate anterior atunci când sunt antrenate pe date noi. Un model care învață continuu dintr-un flux zilnic de informații se degradează de obicei pe tot ceea ce știa înainte.

README subliniază constrângerile care au modelat designul. Modelul trebuie să se potrivească pe 8 GB de VRAM – nu cu cuantizare, deoarece antrenamentul necesită gradienți și stare de optimizare care adaugă de aproximativ trei ori memoria greutăților în sine. Și nu trebuie să uite, păstrând ceea ce a învățat deja în timp ce absoarbe material nou dintr-un flux nesfârșit de text.

Un model la nivel de octeți care se construiește singur

mini-AGI operează mai degrabă la nivel de octeți decât pe token-uri, citind un flux de caractere câte o bucată și făcând un pas de gradient pe fiecare bucată. Proiectul mai spune că modelul „își asamblează propria arhitectură”, distingându-l de modelele convenționale a căror structură este fixată de creatorii lor înainte de începerea antrenamentului.

Abordarea este în mod deliberat experimentală. Este o demonstrație la scară mică a unui regim de antrenament, nu o provocare pentru sistemele de frontieră.

Avertismente importante

Autorul proiectului este explicit despre starea actuală a sistemului. În propriile cuvinte ale README, mini-AGI este „un model mic la nivel de jucărie”, iar cititorii nu ar trebui să se aștepte la capacități la nivel de frontieră. Scopul exercițiului este de a arăta că învățarea continuă dintr-un singur flux de date fără uitare catastrofală este deloc posibilă - și posibilă pe hardware-ul pe care aproape oricine îl poate accesa.

Greutățile modelului nu au fost încă publicate. Cursa de antrenament încă își finalizează prima trecere peste corpus din care învață, iar autorul spune că greutățile vor fi eliberate odată ce trecerea este finalizată, care la ritmul actual este la câteva săptămâni distanță. Până atunci, observatorii pot inspecta mostre din istoricul cursei de antrenament pe pagina proiectului pentru a vedea cum s-a îmbunătățit modelul pe parcursul citirii.

De ce contează

Dacă abordarea se menține pe măsură ce modelul crește la dimensiuni mai capabile, se îndreaptă către un alt tip de proprietate AI: modele personale care trăiesc pe propria mașină, continuă să învețe din documentele și datele pe care le furnizează și nu au greutățile înghețate niciodată de programul de lansare al unui furnizor.

Proiectul este, de asemenea, o reamintire a faptului că nu toate lucrările interesante în AI se desfășoară la frontieră. Cu un singur GPU de consum, spațiu pe disc obișnuit și o licență MIT, mini-AGI încearcă să răspundă la o întrebare pe care laboratoarele mari au ocolit-o în mare măsură - dacă un model poate fi construit pentru a învăța cum fac oamenii: în mod continuu, din orice întâmpină în continuare.

Codul și documentația sunt disponibile pe GitHub pentru oricine cu hardware compatibil care dorește să urmeze, să deschidă proiectul sau să continue antrenarea modelului după cum consideră de cuviință.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →