Новий проект із відкритим вихідним кодом привертає увагу до вирішення одного з впертих обмежень машинного навчання: створення мовної моделі, яка ніколи не припиняє навчатися. Проект під назвою mini-AGI описує себе як модель мови безперервного навчання на байтовому рівні, яка збирає власну архітектуру, тренується з нуля на одному графічному процесорі з 8 ГБ відеопам’яті та продовжує навчатися з усього, що читає.
Проект з’явився на Hacker News минулих вихідних, де він піднявся на понад сто балів, а його репозиторій на GitHub випущений під ліцензією MIT. Відповідно до README проекту, мета полягає в тому, щоб продемонструвати, що безперервне навчання з єдиного потоку даних — без катастрофічного забування — можливе навіть на скромному обладнанні споживчого рівня. For more context on this story, see our ongoing AI industry coverage.
Вага на диску, а не у VRAM
Головний трюк mini-AGI — це нетрадиційна схема керування пам’яттю. Замість того, щоб зберігати всі параметри моделі в пам’яті графічного процесора, система зберігає свої ваги як звичайні файли на диску та завантажує їх на графічну карту, коли вони потрібні.
Такий вибір конструкції має суттєві наслідки: кількість параметрів моделі обмежена вільним дисковим простором, а не VRAM. У README стверджується, що модель може нарощувати нову ємність під час навчання, коли її не вистачає, і скорочує ємність, якої нічого не вимагає. Навчання та логічний висновок проходять через один і той самий кодовий шлях, тому немає окремого режиму тонкого налаштування та замороженої базової моделі — читання та навчання, за словами проекту, одна й та сама подія.
Система орієнтована на ПК або ноутбук із графічним процесором VRAM щонайменше 8 ГБ, апаратним забезпеченням, яке вже є у багатьох розробників.
Чому вчитися важко
Більшість доступних сьогодні мовних моделей мають однаковий життєвий цикл: лабораторія навчає модель, заморожує її та надсилає. Користувачі можуть точно налаштовувати краї, але базові ваги більше ніколи не змінюватимуться. У розділі про мотивацію проекту стверджується, що це робить кожну особисту модель «чужою моделлю з тонким шаром вас нагорі» — моделлю, яка перестає вчитися в день, коли її відправляють.
Ця перешкода добре відома в дослідженнях машинного навчання: катастрофічне забування, схильність нейронних мереж перезаписувати раніше отримані знання під час навчання на нових даних. Модель, яка постійно навчається на основі щоденного потоку інформації, як правило, погіршує все, що вона знала раніше.
README описує обмеження, які сформували дизайн. Модель має міститися на 8 ГБ відеопам’яті — не з квантуванням, оскільки для навчання потрібні градієнти та стан оптимізатора, які додають приблизно в три рази більше пам’яті, ніж самі ваги. І він не повинен забувати, тримаючись за те, що він уже навчився, вбираючи новий матеріал із нескінченного потоку тексту.
Модель байтового рівня, яка будується сама
mini-AGI працює на рівні байтів, а не на токенах, зчитуючи потік символів по одному фрагменту за раз і роблячи градієнтний крок для кожного фрагмента. У проекті також сказано, що модель «збирає власну архітектуру», що відрізняє її від звичайних моделей, структура яких фіксується їх творцями перед початком навчання.
Підхід навмисно експериментальний. Це невелика демонстрація режиму навчання, а не виклик прикордонним системам.
Важливі застереження
Автор проекту чітко говорить про поточний стан системи. За словами самого README, mini-AGI — це «маленька модель іграшкового рівня», і читачі не повинні очікувати можливостей передового рівня. Мета вправи полягає в тому, щоб показати, що безперервне навчання з одного потоку даних без катастрофічного забування взагалі можливе — і це можливо на апаратному забезпеченні, до якого може отримати доступ майже кожен.
Вага моделі поки не оприлюднена. Навчальний запуск все ще завершує свій перший прохід над корпусом, з якого він навчається, і автор каже, що ваги будуть оприлюднені, коли цей прохід завершиться, що за поточною швидкістю буде через пару тижнів. До того часу спостерігачі можуть переглядати зразки з історії тренувального циклу на сторінці проекту, щоб побачити, як покращилася модель під час читання.
Чому це важливо
Якщо цей підхід витримає, оскільки модель масштабується до більш придатних розмірів, це вказує на інший тип володіння штучним інтелектом: особисті моделі, які живуть на вашій власній машині, постійно навчаються на документах і даних, які ви їм надаєте, і їх вага ніколи не заморожується графіком випуску постачальника.
Проект також є нагадуванням про те, що не вся цікава робота в ШІ відбувається на кордоні. Маючи єдиний споживчий графічний процесор, звичайний дисковий простір і ліцензію Массачусетського технологічного інституту, mini-AGI намагається відповісти на питання, яке великі лабораторії здебільшого обійшли стороною — чи можна побудувати модель, щоб навчатися так, як це роблять люди: безперервно, незалежно від того, що вона зустріне далі.
Код і документація доступні на GitHub для всіх, хто має сумісне апаратне забезпечення, хто хоче слідувати, розгалужувати проект або продовжувати навчання моделі, як вважає за потрібне.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →