Um novo projeto de código aberto está chamando a atenção por lidar com uma das limitações teimosas do aprendizado de máquina: construir um modelo de linguagem que nunca pare de aprender. Chamado de mini-AGI, o projeto se descreve como um modelo de linguagem de aprendizado contínuo em nível de byte que monta sua própria arquitetura, treina do zero em uma única GPU com 8 GB de VRAM e continua aprendendo com tudo o que lê.
O projeto apareceu no Hacker News no fim de semana, onde subiu para mais de cem pontos, e seu repositório no GitHub é lançado sob a licença do MIT. De acordo com o README do projeto, o objetivo é demonstrar que o aprendizado contínuo a partir de um único fluxo de dados — sem esquecimento catastrófico — é possível mesmo em hardware modesto para consumo. Para mais contexto sobre esta história, confira nossa notícias de IA.
Pesos no disco, não na VRAM
O truque central por trás do mini-AGI é um esquema de gerenciamento de memória não convencional. Em vez de manter todos os parâmetros do modelo na memória da GPU, o sistema armazena seus pesos como arquivos comuns no disco e os pagina na placa gráfica conforme necessário.
Essa escolha de design tem uma consequência significativa: a contagem de parâmetros do modelo é limitada pelo espaço livre em disco e não pela VRAM. O README afirma que o modelo pode aumentar a nova capacidade enquanto treina quando esta é escassa e elimina a capacidade que nada pede. O treinamento e a inferência passam exatamente pelo mesmo caminho de código, portanto não existe um regime de ajuste fino separado e nenhum modelo base congelado – ler e ser treinado são, nas palavras do projeto, o mesmo evento.
O sistema é direcionado a um PC ou laptop com pelo menos 8 GB de GPU VRAM, hardware que muitos desenvolvedores já possuem.
Por que o aprendizado contínuo é difícil
A maioria dos modelos de linguagem disponíveis hoje segue o mesmo ciclo de vida: um laboratório treina um modelo, congela-o e envia-o. Os usuários podem fazer ajustes finos nas bordas, mas os pesos básicos nunca mais mudam. A seção de motivação do projeto argumenta que isso torna cada modelo de propriedade pessoal “o modelo de outra pessoa com uma fina camada de você no topo” – um modelo que para de aprender no dia em que é lançado.
O obstáculo é bem conhecido na pesquisa sobre aprendizado de máquina: o esquecimento catastrófico, a tendência das redes neurais de substituir o conhecimento previamente aprendido quando treinadas com novos dados. Um modelo que aprende continuamente a partir de um fluxo diário de informações normalmente degrada tudo o que sabia antes.
O README descreve as restrições que moldaram o design. O modelo deve caber em 8 GB de VRAM – não com quantização, já que o treinamento requer gradientes e estados de otimizador que adicionam cerca de três vezes a memória dos próprios pesos. E não pode esquecer, agarrando-se ao que já aprendeu enquanto absorve novo material de um fluxo interminável de texto.
Um modelo em nível de byte que se constrói sozinho
O mini-AGI opera no nível de bytes e não em tokens, lendo um fluxo de caracteres, um pedaço por vez, e executando uma etapa de gradiente em cada pedaço. O projeto diz ainda que o modelo “monta sua própria arquitetura”, diferenciando-o dos modelos convencionais cuja estrutura é fixada por seus criadores antes do início do treinamento.
A abordagem é deliberadamente experimental. É uma demonstração em pequena escala de um regime de formação e não um desafio aos sistemas fronteiriços.
Advertências importantes
O autor do projeto é explícito sobre o estado atual do sistema. Nas próprias palavras do README, o mini-AGI é “um pequeno modelo de nível de brinquedo” e os leitores não devem esperar capacidades de nível de fronteira. O objetivo do exercício é mostrar que o aprendizado contínuo a partir de um único fluxo de dados sem esquecimento catastrófico é possível – e possível em hardware que quase qualquer pessoa pode acessar.
Os pesos do modelo ainda não foram divulgados. A execução de treinamento ainda está completando sua primeira passagem no corpus com o qual está aprendendo, e o autor diz que os pesos serão liberados assim que a passagem for concluída, o que, no ritmo atual, levará algumas semanas. Até então, os observadores podem inspecionar amostras do histórico da execução de treinamento na página do projeto para ver como o modelo melhorou ao longo da leitura.
Por que é importante
Se a abordagem se mantiver à medida que o modelo for dimensionado para tamanhos mais capazes, ela aponta para um tipo diferente de propriedade de IA: modelos pessoais que vivem em sua própria máquina, continuam aprendendo com os documentos e dados que você os alimenta e nunca têm seus pesos congelados pelo cronograma de lançamento de um fornecedor.
O projeto também lembra que nem todo trabalho interessante em IA está acontecendo na fronteira. Com uma única GPU de consumo, espaço em disco comum e uma licença do MIT, o mini-AGI está tentando responder a uma questão que os grandes laboratórios têm evitado: se um modelo pode ser construído para aprender como as pessoas o fazem: continuamente, a partir do que quer que encontre a seguir.
O código e a documentação estão disponíveis no GitHub para qualquer pessoa com hardware compatível que queira acompanhar, bifurcar o projeto ou continuar treinando o modelo conforme acharem adequado.
---
Fique à Frente da IAAs últimas notícias, análises e avanços em inteligência artificial — tudo em um só lugar.
Ler mais notícias de IA →