Новый проект с открытым исходным кодом привлекает внимание к решению одного из упрямых ограничений машинного обучения: созданию языковой модели, которая никогда не перестает учиться. Проект, получивший название mini-AGI, описывает себя как языковую модель непрерывного обучения на уровне байтов, которая собирает собственную архитектуру, обучается с нуля на одном графическом процессоре с 8 ГБ видеопамяти и продолжает учиться на всем, что читает.

На выходных проект появился на Hacker News, где он набрал более сотни баллов, а его репозиторий на GitHub выпущен под лицензией MIT. Согласно README проекта, цель состоит в том, чтобы продемонстрировать, что непрерывное обучение на основе единого потока данных — без катастрофического забывания — возможно даже на скромном оборудовании потребительского уровня. Подробнее об этой истории — в нашем последние разработки в ИИ.

Веса на диске, а не во VRAM

Главный трюк mini-AGI — нетрадиционная схема управления памятью. Вместо того, чтобы хранить все параметры модели в памяти графического процессора, система сохраняет их веса в виде обычных файлов на диске и выгружает их на видеокарту по мере необходимости.

Этот выбор дизайна имеет важное последствие: количество параметров модели ограничено свободным дисковым пространством, а не видеопамятью. В README указано, что модель может наращивать новые мощности во время обучения, когда они исчерпаны, и сокращать мощности, которые ничего не требуют. Обучение и вывод выполняются по одному и тому же пути кода, поэтому нет отдельного режима тонкой настройки и замороженной базовой модели — чтение и обучение, по словам проекта, являются одним и тем же событием.

Система предназначена для ПК или ноутбука с графическим процессором VRAM объемом не менее 8 ГБ — аппаратным обеспечением, которое уже есть у многих разработчиков.

Почему постоянно учиться сложно

Большинство доступных сегодня языковых моделей имеют один и тот же жизненный цикл: лаборатория обучает модель, замораживает ее и отправляет. Пользователи могут точно настраивать края, но базовый вес больше никогда не изменится. В разделе мотивации проекта утверждается, что это делает каждую личную модель «чьей-то моделью с тонким слоем вашего лица сверху» — моделью, которая перестает учиться в день ее выпуска.

Препятствие хорошо известно в исследованиях машинного обучения: катастрофическое забывание, тенденция нейронных сетей перезаписывать ранее полученные знания при обучении на новых данных. Модель, которая постоянно учится на ежедневном потоке информации, обычно деградирует по всему, что знала раньше.

README описывает ограничения, которые сформировали дизайн. Модель должна соответствовать 8 ГБ видеопамяти — без квантования, поскольку для обучения требуются градиенты и состояние оптимизатора, которые добавляют примерно в три раза больше памяти, чем сами веса. И ему не следует забывать, держась за то, что он уже выучил, поглощая новый материал из нескончаемого потока текста.

Модель на уровне байтов, которая строится сама

mini-AGI работает на уровне байтов, а не на токенах, считывая поток символов по одному фрагменту за раз и делая шаг градиента для каждого фрагмента. В проекте также говорится, что модель «собирает собственную архитектуру», что отличает ее от обычных моделей, структура которых фиксируется их создателями до начала обучения.

Подход намеренно экспериментальный. Это небольшая демонстрация режима тренировок, а не вызов пограничным системам.

Важные предостережения

Автор проекта откровенно рассказывает о текущем состоянии системы. По словам самого README, mini-AGI — это «небольшая модель игрушечного уровня», и читателям не следует ожидать возможностей передового уровня. Цель упражнения — показать, что непрерывное обучение на основе одного потока данных без катастрофического забывания вообще возможно — и возможно на оборудовании, к которому может получить доступ практически каждый.

Вес модели пока не опубликован. Тренировочный прогон все еще завершает свой первый проход по корпусу, на котором он обучается, и автор говорит, что веса будут опубликованы после завершения этого прохода, что при текущих темпах произойдет через пару недель. До тех пор наблюдатели могут просматривать образцы из истории обучающего прогона на странице проекта, чтобы увидеть, как модель улучшилась в ходе чтения.

Почему это важно

Если этот подход сохранится при масштабировании модели до более эффективных размеров, это указывает на другой тип владения ИИ: персональные модели, которые живут на вашей собственной машине, продолжают учиться на документах и данных, которые вы им предоставляете, и их вес никогда не замораживается графиком выпуска поставщика.

Этот проект также является напоминанием о том, что не вся интересная работа в области ИИ ведется на передовой. Имея один потребительский графический процессор, обычное дисковое пространство и лицензию MIT, mini-AGI пытается ответить на вопрос, который крупные лаборатории по большей части обходят стороной: можно ли построить модель, которая будет учиться так, как это делают люди: непрерывно, на основе того, с чем она сталкивается в следующий раз.

Код и документация доступны на GitHub для всех, у кого есть совместимое оборудование, кто хочет следовать инструкциям, разветвить проект или продолжить обучение модели по своему усмотрению.

---

Будьте в курсе ИИ

Последние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.

Читать больше новостей об ИИ →