Un nuevo proyecto de código abierto está llamando la atención por abordar una de las limitaciones persistentes del aprendizaje automático: construir un modelo de lenguaje que nunca deja de aprender. Llamado mini-AGI, el proyecto se describe a sí mismo como un modelo de lenguaje de nivel de bytes de aprendizaje continuo que ensambla su propia arquitectura, se entrena desde cero en una sola GPU con 8 GB de VRAM y sigue aprendiendo de todo lo que lee.

El proyecto apareció en Hacker News durante el fin de semana, donde subió a más de cien puntos, y su repositorio en GitHub se publica bajo la licencia del MIT. Según el archivo README del proyecto, el objetivo es demostrar que el aprendizaje continuo a partir de un único flujo de datos (sin olvidos catastróficos) es posible incluso en hardware modesto de consumo. Para más contexto sobre esta historia, consulta nuestra actualidad de inteligencia artificial.

Pesos en disco, no en VRAM

El truco central detrás de mini-AGI es un esquema de gestión de memoria poco convencional. En lugar de mantener todos los parámetros del modelo en la memoria de la GPU, el sistema almacena sus pesos como archivos normales en el disco y los coloca en la tarjeta gráfica según sea necesario.

Esa elección de diseño tiene una consecuencia importante: el recuento de parámetros del modelo está limitado por el espacio libre en disco en lugar de por la VRAM. El archivo README establece que el modelo puede aumentar la capacidad nueva mientras se entrena cuando se agota y poda la capacidad que nada solicita. El entrenamiento y la inferencia se ejecutan exactamente a través de la misma ruta de código, por lo que no existe un régimen de ajuste separado ni un modelo base congelado: leer y recibir entrenamiento son, en palabras del proyecto, el mismo evento.

El sistema está dirigido a una PC o computadora portátil con al menos una GPU VRAM de 8 GB, hardware que muchos desarrolladores ya poseen.

Por qué el aprendizaje continuo es difícil

La mayoría de los modelos de lenguaje disponibles hoy en día siguen el mismo ciclo de vida: un laboratorio entrena un modelo, lo congela y lo envía. Los usuarios pueden realizar ajustes alrededor de los bordes, pero los pesos base nunca vuelven a cambiar. La sección de motivación del proyecto sostiene que esto hace que cada modelo de propiedad personal sea "el modelo de otra persona con una fina capa tuya encima", uno que deja de aprender el día que se envía.

El obstáculo es bien conocido en la investigación del aprendizaje automático: el olvido catastrófico, la tendencia de las redes neuronales a sobrescribir el conocimiento aprendido previamente cuando se entrenan con datos nuevos. Un modelo que aprende continuamente de un flujo diario de información normalmente degrada todo lo que sabía antes.

El archivo README describe las limitaciones que dieron forma al diseño. El modelo tiene que caber en 8 GB de VRAM, no con cuantificación, ya que el entrenamiento requiere gradientes y un estado optimizador que agrega aproximadamente tres veces la memoria de los propios pesos. Y no debe olvidar, aferrándose a lo que ya ha aprendido mientras absorbe material nuevo de un flujo interminable de texto.

Un modelo a nivel de bytes que se construye solo

mini-AGI opera a nivel de bytes en lugar de tokens, leyendo un flujo de caracteres un fragmento a la vez y dando un paso de gradiente en cada fragmento. El proyecto también dice que el modelo "ensambla su propia arquitectura", distinguiéndolo de los modelos convencionales cuya estructura es fijada por sus creadores antes de que comience el entrenamiento.

El enfoque es deliberadamente experimental. Es una demostración a pequeña escala de un régimen de formación, no un desafío a los sistemas fronterizos.

Advertencias importantes

El autor del proyecto es explícito sobre el estado actual del sistema. En palabras del propio README, mini-AGI es "un modelo pequeño a nivel de juguete" y los lectores no deben esperar capacidades de nivel fronterizo. El objetivo del ejercicio es mostrar que el aprendizaje continuo a partir de un único flujo de datos sin olvidos catastróficos es posible en absoluto, y posible en hardware al que casi cualquier persona puede acceder.

Los pesos del modelo aún no han sido publicados. La ejecución de entrenamiento aún está completando su primera pasada sobre el corpus del que está aprendiendo, y el autor dice que los pesos se liberarán una vez que se complete esa pasada, lo que al ritmo actual es dentro de un par de semanas. Hasta entonces, los observadores pueden inspeccionar muestras del historial de la ejecución de entrenamiento en la página del proyecto para ver cómo ha mejorado el modelo a lo largo de la lectura.

Por qué es importante

Si el enfoque se mantiene a medida que el modelo escala a tamaños más capaces, apunta hacia un tipo diferente de propiedad de la IA: modelos personales que viven en su propia máquina, siguen aprendiendo de los documentos y datos que les proporciona, y sus pesos nunca se congelan según el cronograma de lanzamiento de un proveedor.

El proyecto también es un recordatorio de que no todos los trabajos interesantes en IA se realizan en la frontera. Con una única GPU de consumo, espacio en disco ordinario y una licencia del MIT, mini-AGI intenta responder una pregunta que los grandes laboratorios han eludido en gran medida: si se puede construir un modelo para aprender de la manera en que lo hace la gente: continuamente, a partir de lo que se encuentre a continuación.

El código y la documentación están disponibles en GitHub para cualquier persona con hardware compatible que quiera seguir adelante, bifurcar el proyecto o continuar entrenando el modelo como mejor le parezca.

---

Mantente al Día con la IA

Las últimas noticias, análisis y avances de inteligencia artificial, en un solo lugar.

Leer más noticias de IA →