Создан для чтения, а не просто для запуска
Как сообщает MarkTechPost, Molt измеряет примерно 8,6 тыс. строк кода RL, подсчитанных путем отслеживания графика импорта из точки входа RL каждой платформы. Тот же метод подсчитывает около 62 тыс. строк для verl, 25 тыс. для slime и 7,2 тыс. строк для OpenRLHF. Эта преднамеренная компактность является центральной темой проекта: исследование агентного RL — это постоянная модификация алгоритмов — новые оценщики, новые этапы конвейера, новые схемы развертывания — и в основных средах каждое изменение проходит через уровни обучения, распределенного бэкэнда и связующего звена развертывания. Молт стремится устранить это трение.
Фреймворк имеет лицензию Apache 2.0 и поставляется с кодами запуска, скриптами Slurm и готовым контейнером. Однако NVIDIA ясно дает понять, что в сопроводительном исследовательском документе Molt позиционируется как исследовательская инфраструктура, а не как служба производственного обучения, а аппаратное обеспечение является настоящим стражем. В поставляемых рецептах предполагается использование 2 узлов по 8 графических процессоров H100, 8 из которых разделены на обучение и 8 — на развертывание. Это делает его доступным для передовых и соседних лабораторий, хорошо финансируемых стартапов, проходящих обучение, корпоративных исследовательских групп по искусственному интеллекту и академических групп с многоузловым доступом H100 или H200.
Составленный, а не раздвоенный
Архитектура Molt объединяет три существующих инструмента, не разветвляя ни один из них, поэтому исходные улучшения происходят в виде закрепления контейнера, а не болезненного перебазирования. Он использует Ray для размещения и асинхронных очередей, vLLM для развертывания и NVIDIA AutoModel с FSDP2 для обучения. Среда выполнения состоит из пула агентов, набора механизмов vLLM за маршрутизатором запросов и одного обучаемого субъекта политики. Пул потоковой передачи удерживает группы быстрых в полете, поэтому двигатели никогда не разряжаются, пока актер тренируется.
Функция под названием частичное развертывание имеет решающее значение для повышения эффективности. Когда политика обновляется, Molt приостанавливает работу механизмов, передает обновленные сегменты актера через NCCL непосредственно каждому механизму и возобновляет сохраненные запросы, а не отбрасывает их. Это позволяет избежать расточительной практики выбрасывания незавершенных развертываний каждый раз при изменении модели.
Один модуль, две формы агента
Запуск RL в Molt называет один модуль Python, который экспортирует AgentRunner, а все остальное, включая функцию вознаграждения, представляет собой обычный код. Платформа поддерживает две формы. При использовании Env фреймворк владеет циклом LLM внутри согласованного с Gymnasium `step()`, который соответствует знакомому шаблону обучения с подкреплением. При использовании ChatAgent пользователь получает доступ к стандартному OpenAI или Anthropic SDK, что упрощает обертывание существующего агента.
Чтобы соединить оба протокола, Molt запускает loopback-сервер, который поддерживает оба проводных протокола, и каждый запрос декодируется на стороне сервера в одно точное накопление токена. Когда агент с большим горизонтом сжимает свой контекст и перезаписывает префикс (обычная операция для агентов, которые работают много ходов), сервер запечатывает текущий сегмент и автоматически открывает новый. Это своего рода сантехническая деталь, которая определяет, корректен ли запуск агентного RL на практике или просто выглядит правильно.
Три инварианта корректности
Конструкция Молта организована вокруг трех инвариантов правильности, которые устраняют тонкие недостатки асинхронного обучения агентов. Идентичность токена означает, что выбранные идентификаторы токенов определяют траекторию, а не повторно токенизированную расшифровку — это важно, поскольку сшивка текста обратно в токены может незаметно изменить данные. Семантика версии политики гарантирует, что обучаемые токены сохраняют свои вероятности журнала политики поведения, а асинхронное использование корректируется для каждого токена за шлюзом на уровне последовательности. Прямая согласованность требует, чтобы механизм развертывания и обучающий субъект согласовали семантику модели.
Этот последний инвариант имеет наибольшее значение для политики смешанных экспертов (МЭ), которая становится все более распространенной. Маршрутизаторы развертывания и обучения выбирают экспертов независимо, и небольшие численные различия могут перевернуть выбор из топ-k, вызывая несоответствие между тем, что было выбрано, и тем, на чем обучается. Molt решает эту проблему с помощью воспроизведения маршрутизации при развертывании: vLLM возвращает идентификаторы экспертов для каждого токена, а прямой проход обучения воспроизводит эти точные решения по маршрутизации, а не выводит их заново.
Для чего это нужно
Поставленные рецепты и варианты использования указывают на то, где NVIDIA ожидает внедрения Molt: агенты многооборотного использования инструментов, агенты выполнения кода, среды визуального языка (фреймворк включает в себя готовый рецепт geo3k), циклы вознаграждения LLM в качестве судьи и перегонка в соответствии с политикой на меньшую студенческую модель. Именно эти рабочие нагрузки вызвали всплеск агентного RL во всей отрасли, и каждая из них, как известно, очень сложна в условиях частичного развертывания и асинхронной выборки, которые налагает реальное обучение.
Более широкий сигнал заключается в том, что NVIDIA инвестирует не только в графические процессоры, которые обучают агентов, но и в программный стек, который исследователи используют для их создания. Сохраняя кодовую базу небольшой и читабельной — и явно проектируя ее так, чтобы помощник по кодированию с помощью искусственного интеллекта мог ее модифицировать, — Молт делает ставку на то, что будущее агентных инструментов RL будет разрабатываться совместно с моделями, которые их используют.
Будьте впереди ИИ
Чтобы узнать больше о методах обучения пограничных агентов, следите за последними разработками в области искусственного интеллекта в нашем центре.
Читать больше новостей об искусственном интеллекте →
