Un nouveau projet open source attire l'attention pour s'attaquer à l'une des limites tenaces de l'apprentissage automatique : créer un modèle de langage qui n'arrête jamais d'apprendre. Appelé mini-AGI, le projet se décrit comme un modèle de langage à apprentissage continu au niveau des octets qui assemble sa propre architecture, s'entraîne à partir de zéro sur un seul GPU avec 8 Go de VRAM et continue d'apprendre de tout ce qu'il lit.

Le projet est apparu sur Hacker News ce week-end, où il a grimpé à plus d'une centaine de points, et son référentiel sur GitHub est publié sous licence MIT. Selon le README du projet, l'objectif est de démontrer qu'un apprentissage continu à partir d'un seul flux de données – sans oubli catastrophique – est possible même sur du matériel grand public modeste. Pour plus de contexte sur cette histoire, consultez notre tendances IA.

Poids sur le disque, pas dans la VRAM

L’astuce centrale derrière la mini-AGI est un système de gestion de mémoire non conventionnel. Au lieu de conserver tous les paramètres du modèle dans la mémoire GPU, le système stocke ses poids sous forme de fichiers ordinaires sur le disque et les pagine sur la carte graphique selon les besoins.

Ce choix de conception a une conséquence importante : le nombre de paramètres du modèle est limité par l'espace disque libre plutôt que par la VRAM. Le README indique que le modèle peut augmenter de nouvelles capacités tout en s'entraînant lorsqu'il est insuffisant, et élague la capacité que rien ne demande. La formation et l'inférence empruntent exactement le même chemin de code, il n'y a donc pas de régime de réglage fin séparé ni de modèle de base figé : la lecture et la formation sont, selon les termes du projet, le même événement.

Le système est destiné à un PC ou un ordinateur portable doté d'au moins un GPU VRAM de 8 Go, un matériel que de nombreux développeurs possèdent déjà.

Pourquoi l'apprentissage continu est difficile

La plupart des modèles de langage disponibles aujourd'hui suivent le même cycle de vie : un laboratoire forme un modèle, le fige et l'expédie. Les utilisateurs peuvent affiner les bords, mais les poids de base ne changent plus jamais. La section de motivation du projet soutient que cela fait de chaque modèle personnel « le modèle de quelqu'un d'autre avec une fine couche de vous sur le dessus » – un modèle qui cesse d'apprendre le jour de sa livraison.

L’obstacle est bien connu dans la recherche sur l’apprentissage automatique : l’oubli catastrophique, la tendance des réseaux de neurones à écraser les connaissances précédemment acquises lorsqu’ils sont entraînés sur de nouvelles données. Un modèle qui apprend continuellement à partir d’un flux quotidien d’informations se dégrade généralement sur tout ce qu’il savait auparavant.

Le README décrit les contraintes qui ont façonné la conception. Le modèle doit tenir sur 8 Go de VRAM – pas avec quantification, car la formation nécessite des gradients et un état d'optimisation qui ajoutent environ trois fois la mémoire des poids eux-mêmes. Et il ne doit pas oublier, s’accrocher à ce qu’il a déjà appris tout en absorbant de nouveaux éléments provenant d’un flux incessant de textes.

Un modèle au niveau octet qui se construit tout seul

mini-AGI fonctionne au niveau des octets plutôt que sur les jetons, lisant un flux de caractères un morceau à la fois et prenant une étape graduelle sur chaque morceau. Le projet indique également que le modèle « assemble sa propre architecture », le distinguant des modèles conventionnels dont la structure est fixée par leurs créateurs avant le début de la formation.

L’approche est volontairement expérimentale. Il s’agit d’une démonstration à petite échelle d’un régime de formation et non d’un défi aux systèmes frontaliers.

Mises en garde importantes

L'auteur du projet est explicite sur l'état actuel du système. Selon les propres termes du README, le mini-AGI est « un petit modèle de jouet » et les lecteurs ne doivent pas s'attendre à des capacités de niveau frontière. Le but de l’exercice est de montrer qu’un apprentissage continu à partir d’un seul flux de données sans oubli catastrophique est possible – et possible sur du matériel auquel presque tout le monde peut accéder.

Les poids du modèle n'ont pas encore été publiés. L'exécution de formation est encore en train de terminer son premier passage sur le corpus à partir duquel il apprend, et l'auteur indique que les poids seront publiés une fois cette passe terminée, ce qui, au rythme actuel, est dans quelques semaines. En attendant, les observateurs peuvent inspecter des échantillons de l'historique de l'exécution de la formation sur la page du projet pour voir comment le modèle s'est amélioré au cours de la lecture.

Pourquoi c'est important

Si l'approche résiste à mesure que le modèle évolue vers des tailles plus performantes, elle pointe vers un autre type de propriété de l'IA : des modèles personnels qui vivent sur votre propre machine, continuent d'apprendre à partir des documents et des données que vous leur fournissez, et ne voient jamais leur poids gelé par le calendrier de publication d'un fournisseur.

Le projet rappelle également que tous les travaux intéressants en matière d’IA ne se déroulent pas à la frontière. Avec un seul GPU grand public, un espace disque ordinaire et une licence MIT, la mini-AGI tente de répondre à une question que les grands laboratoires ont largement éludée : savoir si un modèle peut être construit pour apprendre la façon dont les gens font : en continu, à partir de tout ce qu'ils rencontrent ensuite.

Le code et la documentation sont disponibles sur GitHub pour toute personne disposant d'un matériel compatible qui souhaite suivre, lancer le projet ou continuer à former le modèle comme bon lui semble.

---

Restez à la Pointe de l'IA

Les dernières actualités, analyses et percées en IA — au même endroit.

Lire plus d'actualités IA →