Nowy projekt open source zwraca uwagę na rozwiązanie jednego z uporczywych ograniczeń uczenia maszynowego: zbudowanie modelu językowego, który nigdy nie przestaje się uczyć. Projekt, nazwany mini-AGI, opisuje siebie jako model języka na poziomie bajtów, który nieustannie się uczy, tworzy własną architekturę, trenuje od zera na jednym procesorze graficznym z 8 GB pamięci VRAM i uczy się na podstawie wszystkiego, co przeczyta.

Projekt pojawił się w weekend w Hacker News, gdzie wspiął się na grubo ponad sto punktów, a jego repozytorium na GitHubie udostępniane jest na licencji MIT. Według pliku README projektu celem jest wykazanie, że ciągłe uczenie się na podstawie pojedynczego strumienia danych – bez katastrofalnego w skutkach zapomnienia – jest możliwe nawet na skromnym sprzęcie klasy konsumenckiej. Więcej kontekstu na ten temat znajdziesz w naszych trendy AI.

Wagi na dysku, a nie w pamięci VRAM

Główną sztuczką mini-AGI jest niekonwencjonalny schemat zarządzania pamięcią. Zamiast przechowywać wszystkie parametry modelu w pamięci GPU, system przechowuje jego wagi w postaci zwykłych plików na dysku i w razie potrzeby zapisuje je na karcie graficznej.

Ten wybór projektu ma znaczące konsekwencje: liczba parametrów modelu jest ograniczona raczej wolnym miejscem na dysku niż pamięcią VRAM. W pliku README stwierdza się, że model może zwiększyć pojemność podczas treningu, gdy jej zabraknie, i zmniejsza pojemność, o którą nic nie prosi. Uczenie i wnioskowanie przebiegają dokładnie tą samą ścieżką kodu, więc nie ma oddzielnego reżimu dostrajania ani zamrożonego modelu podstawowego — czytanie i trenowanie to, według słów projektu, to samo wydarzenie.

System jest przeznaczony dla komputera PC lub laptopa z co najmniej 8 GB procesorem graficznym VRAM, sprzętem, który posiada już wielu programistów.

Dlaczego ciągłe uczenie się jest trudne

Większość dostępnych obecnie modeli językowych ma ten sam cykl życia: laboratorium szkoli model, zamraża go i wysyła. Użytkownicy mogą precyzyjnie dostroić krawędzie, ale ciężary podstawowe nigdy się już nie zmienią. Sekcja motywacji projektu dowodzi, że sprawia to, że każdy model będący własnością prywatną jest „modelem kogoś innego z cienką warstwą Ciebie na wierzchu” – takim, który przestaje się uczyć w dniu wysyłki.

Przeszkoda jest dobrze znana w badaniach nad uczeniem maszynowym: katastrofalne zapominanie, tendencja sieci neuronowych do nadpisywania wcześniej wyuczonej wiedzy podczas uczenia się na nowych danych. Model, który uczy się nieustannie na podstawie codziennego strumienia informacji, zazwyczaj pogarsza się w stosunku do wszystkiego, co wiedział wcześniej.

Plik README przedstawia ograniczenia, które ukształtowały projekt. Model musi zmieścić się na 8 GB pamięci VRAM — nie z kwantyzacją, ponieważ szkolenie wymaga gradientów i stanu optymalizatora, które dodają około trzykrotność pamięci samych wag. Nie może też zapomnieć, trzymając się tego, czego się już nauczył, przyswajając nowy materiał z niekończącego się strumienia tekstu.

Model na poziomie bajtów, który buduje się sam

mini-AGI działa na poziomie bajtów, a nie na tokenach, odczytując strumień znaków po jednym fragmencie na raz i wykonując krok gradientu na każdym fragmencie. W projekcie stwierdzono również, że model „montuje własną architekturę”, odróżniając go od konwencjonalnych modeli, których strukturę ustalają twórcy przed rozpoczęciem szkolenia.

Podejście to jest celowo eksperymentalne. Jest to demonstracja systemu szkoleniowego na małą skalę, a nie wyzwanie dla systemów granicznych.

Ważne zastrzeżenia

Autor projektu jednoznacznie określa aktualny stan systemu. Według słów README mini-AGI to „model na poziomie małej zabawki” i czytelnicy nie powinni oczekiwać możliwości na poziomie pionierskim. Celem ćwiczenia jest pokazanie, że ciągłe uczenie się na podstawie pojedynczego strumienia danych bez katastrofalnego w skutkach zapomnienia jest w ogóle możliwe – i to na sprzęcie, do którego ma dostęp prawie każdy.

Wagi modelu nie zostały jeszcze opublikowane. Bieg treningowy wciąż wykonuje pierwsze przejście nad korpusem, z którego się uczy, a autor twierdzi, że ciężary zostaną zwolnione po ukończeniu przejścia, co przy obecnym tempie nastąpi za kilka tygodni. Do tego czasu obserwatorzy mogą przeglądać próbki z historii przebiegów szkoleniowych na stronie projektu, aby zobaczyć, jak model poprawił się w trakcie czytania.

Dlaczego to ma znaczenie

Jeśli podejście to sprawdzi się w miarę skalowania modelu do bardziej wydajnych rozmiarów, wskazuje to na inny rodzaj własności sztucznej inteligencji: modele osobiste, które działają na Twojej własnej maszynie, uczą się na podstawie dokumentów i danych, które im przekazujesz, i nigdy nie ulegają zamrożeniu przez harmonogram wydawniczy dostawcy.

Projekt przypomina także, że nie wszystkie interesujące prace w dziedzinie sztucznej inteligencji dzieją się na pograniczu. Dysponując pojedynczym konsumenckim procesorem graficznym, zwykłą przestrzenią dyskową i licencją MIT, mini-AGI próbuje odpowiedzieć na pytanie, które duże laboratoria w dużej mierze pomijały – czy można zbudować model tak, aby uczył się tak, jak robią to ludzie: w sposób ciągły, na podstawie wszystkiego, co napotka później.

Kod i dokumentacja są dostępne w GitHubie dla każdego, kto ma zgodny sprzęt i chce śledzić dalej, rozwidlać projekt lub kontynuować szkolenie modelu według własnego uznania.

---

Bądź na Bieżąco z AI

Najnowsze wiadomości, analizy i przełomy w dziedzinie AI — wszystko w jednym miejscu.

Czytaj więcej wiadomości AI →