Ein neues Open-Source-Projekt macht auf sich aufmerksam, weil es eine der hartnäckigsten Einschränkungen des maschinellen Lernens angeht: den Aufbau eines Sprachmodells, das nie aufhört zu lernen. Das als Mini-AGI bezeichnete Projekt beschreibt sich selbst als ein kontinuierlich lernendes Sprachmodell auf Byte-Ebene, das seine eigene Architektur aufbaut, von Grund auf auf einer einzelnen GPU mit 8 GB VRAM trainiert und ständig aus allem, was es liest, lernt.
Das Projekt erschien am Wochenende bei Hacker News, wo es weit über hundert Punkte erreichte, und sein Repository auf GitHub wird unter der MIT-Lizenz veröffentlicht. Laut der README-Datei des Projekts besteht das Ziel darin, zu zeigen, dass kontinuierliches Lernen aus einem einzigen Datenstrom – ohne katastrophales Vergessen – selbst auf bescheidener Hardware der Verbraucherklasse möglich ist. Weitere Informationen zu dieser Geschichte finden Sie in unserer KI-Nachrichten.
Gewichte auf der Festplatte, nicht im VRAM
Der zentrale Trick hinter Mini-AGI ist ein unkonventionelles Speicherverwaltungsschema. Anstatt alle Modellparameter im GPU-Speicher zu speichern, speichert das System seine Gewichtungen als gewöhnliche Dateien auf der Festplatte und speichert sie bei Bedarf auf der Grafikkarte.
Diese Designwahl hat eine erhebliche Konsequenz: Die Parameteranzahl des Modells wird durch den freien Speicherplatz und nicht durch den VRAM begrenzt. In der README-Datei heißt es, dass das Modell während des Trainings neue Kapazitäten aufbauen kann, wenn diese knapp werden, und Kapazitäten beschneidet, die nicht benötigt werden. Training und Inferenz durchlaufen genau denselben Codepfad, daher gibt es kein separates Feinabstimmungsregime und kein eingefrorenes Basismodell – Lesen und Trainieren sind, in den Worten des Projekts, dasselbe Ereignis.
Das System ist auf einen PC oder Laptop mit mindestens 8 GB VRAM-GPU ausgerichtet, Hardware, die viele Entwickler bereits besitzen.
Warum kontinuierliches Lernen schwer ist
Die meisten heute verfügbaren Sprachmodelle folgen demselben Lebenszyklus: Ein Labor trainiert ein Modell, friert es ein und versendet es. Benutzer können an den Rändern eine Feinabstimmung vornehmen, aber die Basisgewichte ändern sich nie wieder. Im Abschnitt „Motivation“ des Projekts wird argumentiert, dass dies jedes persönliche Modell zu einem „Modell von jemand anderem mit einer dünnen Schicht von Ihnen obendrauf“ macht – zu einem Modell, das an dem Tag, an dem es ausgeliefert wird, nicht mehr lernt.
Das Hindernis ist in der Forschung zum maschinellen Lernen bekannt: katastrophales Vergessen, die Tendenz neuronaler Netze, zuvor erlerntes Wissen zu überschreiben, wenn sie mit neuen Daten trainiert werden. Ein Modell, das kontinuierlich aus einem täglichen Informationsfluss lernt, verschlechtert in der Regel alles, was es zuvor wusste.
Die README-Datei beschreibt die Einschränkungen, die das Design geprägt haben. Das Modell muss auf 8 GB VRAM passen – nicht mit Quantisierung, da das Training Gradienten und Optimiererzustände erfordert, die ungefähr das Dreifache des Speichers der Gewichte selbst hinzufügen. Und es darf nicht vergessen, an dem festzuhalten, was es bereits gelernt hat, und gleichzeitig neues Material aus einem endlosen Strom von Texten aufzunehmen.
Ein Modell auf Byte-Ebene, das sich selbst aufbaut
Mini-AGI arbeitet auf Byte-Ebene und nicht auf Token-Ebene, liest einen Zeichenstrom Block für Block und macht bei jedem Block einen Gradientenschritt. Das Projekt besagt außerdem, dass das Modell „seine eigene Architektur zusammenstellt“, was es von herkömmlichen Modellen unterscheidet, deren Struktur von ihren Erstellern vor Beginn des Trainings festgelegt wird.
Der Ansatz ist bewusst experimentell. Es handelt sich um eine kleine Demonstration eines Ausbildungsprogramms und nicht um eine Herausforderung für Grenzsysteme.
Wichtige Vorbehalte
Der Autor des Projekts äußert sich explizit zum aktuellen Zustand des Systems. In den eigenen Worten der README-Datei handelt es sich bei Mini-AGI um „ein kleines Modell auf Spielzeugniveau“, und Leser sollten keine Fähigkeiten auf Grenzniveau erwarten. Ziel der Übung ist es zu zeigen, dass kontinuierliches Lernen aus einem einzigen Datenstrom ohne katastrophales Vergessen überhaupt möglich ist – und zwar auf Hardware, auf die fast jeder zugreifen kann.
Die Gewichte des Modells wurden noch nicht veröffentlicht. Der Trainingslauf führt noch seinen ersten Durchgang über den Korpus durch, von dem er lernt, und der Autor sagt, dass die Gewichte freigegeben werden, sobald dieser Durchgang abgeschlossen ist, was beim aktuellen Tempo noch ein paar Wochen dauern wird. Bis dahin können Beobachter auf der Projektseite Beispiele aus dem Verlauf des Trainingslaufs untersuchen, um zu sehen, wie sich das Modell im Laufe der Lektüre verbessert hat.
Warum es wichtig ist
Wenn der Ansatz bei der Skalierung des Modells auf leistungsfähigere Größen Bestand hat, deutet dies auf eine andere Art von KI-Eigentum hin: persönliche Modelle, die auf Ihrem eigenen Computer leben, ständig aus den Dokumenten und Daten lernen, die Sie ihnen geben, und deren Gewichte niemals durch den Veröffentlichungsplan eines Anbieters eingefroren werden.
Das Projekt ist auch eine Erinnerung daran, dass nicht alle interessanten Arbeiten im Bereich KI an der Grenze stattfinden. Mit einer einzigen Consumer-GPU, normalem Festplattenspeicher und einer MIT-Lizenz versucht Mini-AGI eine Frage zu beantworten, die große Labore weitgehend umgangen haben – ob ein Modell so gebaut werden kann, dass es auf die Art und Weise lernt, wie Menschen es tun: kontinuierlich, von allem, was ihm als nächstes begegnet.
Der Code und die Dokumentation stehen auf GitHub für jeden mit kompatibler Hardware zur Verfügung, der mitmachen, das Projekt forken oder das Modell nach eigenem Ermessen weiter trainieren möchte.
---
Bleib vorne bei KIDie neuesten KI-Nachrichten, Analysen und Durchbrüche – alles an einem Ort.
Mehr KI-Nachrichten lesen →