Un nuovo progetto open source sta attirando l'attenzione per affrontare uno dei limiti ostinati dell'apprendimento automatico: costruire un modello linguistico che non smetta mai di apprendere. Chiamato mini-AGI, il progetto si descrive come un modello linguistico a livello di byte di apprendimento continuo che assembla la propria architettura, si allena da zero su una singola GPU con 8 GB di VRAM e continua ad apprendere da tutto ciò che legge.

Il progetto è apparso nel fine settimana su Hacker News, dove ha superato il centinaio di punti, e il suo repository su GitHub è rilasciato sotto licenza MIT. Secondo il file README del progetto, l'obiettivo è dimostrare che l'apprendimento continuo da un singolo flusso di dati, senza dimenticanze catastrofiche, è possibile anche su hardware modesto e di livello consumer. Per maggiori informazioni su questa storia, consulta la nostra tendenze IA.

Pesa sul disco, non nella VRAM

Il trucco centrale dietro mini-AGI è uno schema di gestione della memoria non convenzionale. Invece di conservare tutti i parametri del modello nella memoria della GPU, il sistema ne memorizza i pesi come normali file su disco e li memorizza sulla scheda grafica quando necessario.

Questa scelta progettuale ha una conseguenza significativa: il conteggio dei parametri del modello è limitato dallo spazio libero su disco anziché dalla VRAM. Il README afferma che il modello può aumentare la nuova capacità durante l'addestramento quando si esaurisce e riduce la capacità che nulla richiede. L'addestramento e l'inferenza seguono esattamente lo stesso percorso del codice, quindi non esiste un regime di regolazione fine separato né un modello base congelato: leggere e ricevere addestramento sono, nelle parole del progetto, lo stesso evento.

Il sistema è destinato a un PC o laptop con almeno una GPU VRAM da 8 GB, hardware che molti sviluppatori già possiedono.

Perché l'apprendimento continuo è difficile

La maggior parte dei modelli linguistici oggi disponibili seguono lo stesso ciclo di vita: un laboratorio addestra un modello, lo congela e lo spedisce. Gli utenti possono perfezionare i bordi, ma i pesi di base non cambiano mai più. La sezione motivazionale del progetto sostiene che questo rende ogni modello posseduto personalmente "il modello di qualcun altro con un sottile strato di te sopra" - uno che smette di imparare il giorno in cui viene spedito.

L’ostacolo è ben noto nella ricerca sull’apprendimento automatico: l’oblio catastrofico, la tendenza delle reti neurali a sovrascrivere la conoscenza appresa in precedenza quando vengono addestrate su nuovi dati. Un modello che apprende continuamente da un flusso quotidiano di informazioni in genere degrada tutto ciò che conosceva prima.

Il README delinea i vincoli che hanno modellato il progetto. Il modello deve adattarsi a 8 GB di VRAM, non con la quantizzazione, poiché l'addestramento richiede gradienti e stato di ottimizzazione che aggiungono circa tre volte la memoria dei pesi stessi. E non deve dimenticare, aggrappandosi a ciò che ha già imparato e assorbendo nuovo materiale da un flusso infinito di testi.

Un modello a livello di byte che si costruisce da solo

mini-AGI opera a livello di byte anziché di token, leggendo un flusso di caratteri un pezzo alla volta e facendo un passo gradiente su ciascun pezzo. Il progetto afferma inoltre che il modello "assembla la propria architettura", distinguendolo dai modelli convenzionali la cui struttura viene fissata dai creatori prima che inizi la formazione.

L’approccio è volutamente sperimentale. Si tratta di una dimostrazione su piccola scala di un regime di formazione, non di una sfida ai sistemi di frontiera.

Avvertenze importanti

L'autore del progetto è esplicito sullo stato attuale del sistema. Nelle parole stesse del README, mini-AGI è "un piccolo modello a livello di giocattolo" e i lettori non dovrebbero aspettarsi funzionalità a livello di frontiera. Lo scopo dell’esercizio è dimostrare che l’apprendimento continuo da un singolo flusso di dati senza dimenticanze catastrofiche è possibile – e possibile su hardware a cui quasi chiunque può accedere.

I pesi del modello non sono stati ancora pubblicati. Il ciclo di addestramento sta ancora completando il primo passaggio sul corpus da cui sta imparando e l'autore afferma che i pesi verranno rilasciati una volta completato il passaggio, che al ritmo attuale è tra un paio di settimane. Fino ad allora, gli osservatori possono esaminare campioni della cronologia dell'esecuzione del training sulla pagina del progetto per vedere come il modello è migliorato nel corso della lettura.

Perché è importante

Se l’approccio regge quando il modello si adatta a dimensioni più capaci, punta verso un diverso tipo di proprietà dell’IA: modelli personali che vivono sulla tua stessa macchina, continuano ad apprendere dai documenti e dai dati che gli fornisci e non vengono mai congelati dal programma di rilascio di un fornitore.

Il progetto ci ricorda anche che non tutto il lavoro interessante nel campo dell’intelligenza artificiale si svolge alla frontiera. Con una singola GPU consumer, spazio su disco ordinario e una licenza MIT, mini-AGI sta tentando di rispondere a una domanda che i grandi laboratori hanno ampiamente eluso: se un modello può essere costruito per apprendere come fanno le persone: continuamente, da qualunque cosa incontri successivamente.

Il codice e la documentazione sono disponibili su GitHub per chiunque disponga di hardware compatibile e voglia seguire, eseguire il fork del progetto o continuare ad addestrare il modello come meglio crede.

---

Rimani Aggiornato sull'IA

Le ultime notizie, analisi e scoperte sull'intelligenza artificiale — tutto in un posto.

Leggi altre notizie sull'IA →