Nový open-source projekt upoutá pozornost na řešení jednoho z tvrdohlavých omezení strojového učení: vytvoření jazykového modelu, který se nikdy nepřestane učit. Projekt nazvaný mini-AGI se popisuje jako kontinuální učení, jazykový model na úrovni bajtů, který sestavuje svou vlastní architekturu, trénuje od nuly na jediném GPU s 8GB VRAM a neustále se učí ze všeho, co čte.

Projekt se o víkendu objevil na Hacker News, kde se vyšplhal hodně přes sto bodů a jeho úložiště na GitHubu vychází pod licencí MIT. Podle README projektu je cílem demonstrovat, že neustálé učení se z jediného proudu dat – bez katastrofického zapomínání – je možné i na skromném hardwaru spotřebitelské úrovně. For more context on this story, see our ongoing AI industry coverage.

Hmotnosti na disku, ne ve VRAM

Ústředním trikem mini-AGI je nekonvenční schéma správy paměti. Namísto uchovávání všech parametrů modelu v paměti GPU systém ukládá své váhy jako běžné soubory na disk a podle potřeby je naskenuje na grafickou kartu.

Tato volba návrhu má významný důsledek: počet parametrů modelu je omezen spíše volným místem na disku než VRAM. Soubor README uvádí, že model může při trénování narůstat novou kapacitu, když se vyčerpá, a ořezává kapacitu, o kterou nic nežádá. Školení a odvození probíhají přesně stejnou cestou kódu, takže neexistuje žádný samostatný režim jemného ladění a žádný zmrazený základní model – čtení a školení jsou slovy projektu stejná událost.

Systém je zaměřen na PC nebo notebook s alespoň 8GB VRAM GPU, hardware, který již vlastní mnoho vývojářů.

Proč je neustálé učení těžké

Většina dnes dostupných jazykových modelů má stejný životní cyklus: laboratoř model vycvičí, zmrazí a odešle. Uživatelé mohou doladit okraje, ale základní hmotnosti se již nikdy nezmění. Motivační sekce projektu tvrdí, že díky tomu je každý model v osobním vlastnictví „modelem někoho jiného s tenkou vrstvou vás navrchu“ – modelem, který se přestane učit v den, kdy je odeslán.

Překážkou je dobře známá překážka ve výzkumu strojového učení: katastrofické zapomínání, tendence neuronových sítí přepisovat dříve naučené znalosti, když jsou trénovány na nových datech. Model, který se neustále učí z denního toku informací, obvykle degraduje vše, co znal dříve.

Soubor README nastiňuje omezení, která utvářela návrh. Model se musí vejít na 8 GB VRAM — ne s kvantizací, protože trénování vyžaduje přechody a stav optimalizátoru, které přidávají zhruba trojnásobek paměti než samotné váhy. A nesmí zapomínat, držet se toho, co se již naučilo, a zároveň vstřebávat nový materiál z nekonečného proudu textu.

Model na úrovni bajtů, který se staví sám

mini-AGI funguje na úrovni bajtů spíše než na tokenech, čte proud znaků jeden blok po druhém a na každém bloku provádí přechodový krok. Projekt také říká, že model „sestavuje svou vlastní architekturu“, čímž se odlišuje od konvenčních modelů, jejichž struktura je fixována jejich tvůrci před zahájením školení.

Přístup je záměrně experimentální. Je to ukázka tréninkového režimu v malém měřítku, nikoli výzva pro hraniční systémy.

Důležitá upozornění

Autor projektu se explicitně vyjadřuje k aktuálnímu stavu systému. Vlastními slovy souboru README je mini-AGI „model na úrovni malých hraček“ a čtenáři by neměli očekávat schopnosti na hraniční úrovni. Cílem cvičení je ukázat, že kontinuální učení z jediného datového toku bez katastrofického zapomínání je vůbec možné – a možné na hardwaru, ke kterému má přístup téměř každý.

Váhy modelky zatím nebyly zveřejněny. Tréninkový běh stále dokončuje svůj první průchod přes korpus, ze kterého se učí, a autor říká, že závaží budou uvolněna, jakmile bude tento průchod dokončen, což je při současném tempu několik týdnů. Do té doby mohou pozorovatelé na stránce projektu prohlížet vzorky z historie tréninkového běhu, aby viděli, jak se model v průběhu čtení zlepšil.

Proč na tom záleží

Pokud se tento přístup udrží, když se model zvětší na schopnější velikosti, ukazuje to na jiný druh vlastnictví AI: osobní modely, které žijí na vašem vlastním počítači, neustále se učí z dokumentů a dat, které jim dodáváte, a nikdy nebudou jejich váhy zmrazeny plánem vydání dodavatele.

Projekt je také připomínkou toho, že ne všechna zajímavá práce v AI se odehrává na hranici. S jediným spotřebitelským GPU, běžným diskovým prostorem a licencí MIT se mini-AGI pokouší odpovědět na otázku, kterou velké laboratoře do značné míry obešly – zda ​​lze model sestavit tak, aby se učil tak, jak to dělají lidé: nepřetržitě, z čehokoli, co na něj narazí.

Kód a dokumentace jsou k dispozici na GitHubu pro kohokoli s kompatibilním hardwarem, který chce pokračovat, rozvětvovat projekt nebo pokračovat ve školení modelu, jak uzná za vhodné.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →