Створено для читання, а не просто для запуску
Як повідомляє MarkTechPost, Molt вимірює приблизно 8,6 тис. рядків коду RL, підрахованих шляхом відстеження графіка імпорту з кожної точки входу в RL фреймворка. Той самий метод підраховує приблизно 62K рядків для verl, 25K для slime і 7,2K для OpenRLHF. Ця навмисна компактність є центральною ланкою проекту: агентне дослідження RL — це постійна модифікація алгоритму — нові оцінювачі, нові етапи конвеєра, нові схеми розгортання — і в основних фреймворках кожна зміна проходить через рівні тренера, розподіленого сервера та клею розгортання. Линька має на меті усунути це тертя.
Фреймворк має ліцензію Apache 2.0 і поставляється з кодами запуску, сценаріями Slurm і попередньо зібраним контейнером. Однак у NVIDIA ясно, що супровідна дослідницька стаття позиціонує Molt як дослідницьку інфраструктуру, а не службу навчання виробництва, а апаратне забезпечення є справжнім воротарем. Поставлені рецепти передбачають 2 вузли з 8 графічних процесорів H100, розділені на 8 для навчання та 8 для розгортання. Це робить його в межах досяжності для передових і прикордонних лабораторій, добре фінансованих стартапів, які проходять післянавчання, корпоративних дослідницьких груп штучного інтелекту та академічних груп із доступом до кількох вузлів H100 або H200.
Складений, не роздвоєний
Архітектура Molt складається з трьох існуючих інструментів, не розгалужуючи жодного з них, тож удосконалення на початковому етапі постають як контейнер, а не як болісне перебазування. Він використовує Ray для розміщення та асинхронних черг, vLLM для розгортання та NVIDIA AutoModel з FSDP2 для навчання. Середовище виконання складається з пулу агентів, набору механізмів vLLM за маршрутизатором запитів і єдиного актора політики, який можна навчити. Пул потокової передачі підтримує швидкісні групи в польоті, тому двигуни ніколи не розряджаються, поки актор тренується.
Функція під назвою часткове розгортання є центральною для ефективності. Коли політика оновлюється, Molt призупиняє механізми, транслює оновлені сегменти актора через NCCL безпосередньо до кожного двигуна та відновлює збережені запити, а не відкидає їх. Це дозволяє уникнути марнотратної моделі викидання незавершених розгортань кожного разу, коли змінюється модель.
Один модуль, дві форми агента
Запуск RL у Molt називає один модуль Python, який експортує AgentRunner, а все інше, включаючи функцію винагороди, є звичайним кодом. Фреймворк підтримує дві форми. За допомогою Env структура володіє циклом LLM у вирівняному для гімназії `step()`, який відповідає знайомому шаблону навчання з підкріпленням. За допомогою ChatAgent користувач володіє циклом через стандартний OpenAI або Anthropic SDK, що спрощує обгортання існуючого агента.
Щоб поєднати обидва, Molt запускає сервер петлі, який розмовляє обома дротовими протоколами, і кожен запит декодується на стороні сервера в одне накопичення з точністю до маркера. Коли довгостроковий агент ущільнює свій контекст і переписує префікс — звичайна операція для агентів, які працюють багато ходів — сервер запечатує поточний сегмент і автоматично відкриває новий. Це тип сантехнічної деталі, яка визначає, чи правильний агентський запуск RL на практиці чи просто виглядає правильним.
Три інваріанти правильності
Дизайн Молта організований навколо трьох інваріантів правильності, які вирішують тонкі помилки асинхронного навчання агентів. Ідентифікація маркера означає, що вибіркові ідентифікатори маркерів визначають траєкторію, а не повторно розшифрована транскрипція — це важливо, оскільки зшивання тексту назад у маркери може мовчки змінити дані. Семантика версії політики гарантує, що токени, які можна навчати, зберігають свої ймовірності в журналі політики поведінки з коригуванням асинхронного використання для кожного токена за воротами на рівні послідовності. Упереджена узгодженість вимагає, щоб механізм розгортання та навчальний актор погодили семантику моделі.
Цей останній інваріант має найбільше значення для політики змішаних експертів (MoE), яка стає все більш поширеною. Маршрутизатори розгортання та навчання вибирають експертів незалежно, і невеликі чисельні відмінності можуть перевернути вибір із перших k, створюючи невідповідність між тим, що було відібрано, і тим, на чому навчається. Molt вирішує це за допомогою повторного відтворення маршрутизації: vLLM повертає свої експертні ідентифікатори для кожного маркера, а підготовка вперед відтворює ці точні рішення щодо маршрутизації, а не повторно їх виводить.
Для чого це
Надіслані рецепти та сценарії використання вказують на те, де NVIDIA очікує впровадження Molt: багатоповоротні агенти використання інструментів, агенти виконання коду, середовища на основі мови бачення (фреймворк включає в себе надісланий рецепт geo3k), цикли винагороди LLM-as-judge та дистиляцію за політикою на меншу модель студента. Саме ці робочі навантаження спричинили сплеск агентського RL у всій галузі, і кожне з них, як відомо, складно працювати в умовах часткового розгортання та асинхронної вибірки, які вимагає реальне навчання.
Більш широким сигналом є те, що NVIDIA інвестує не лише в графічні процесори, які навчають агентів, але й у програмний стек, який дослідники використовують для їх створення. Зберігаючи кодову базу невеликою та зручною для читання — і чітко проектуючи її так, щоб помічник кодування штучного інтелекту міг її модифікувати — Molt відбиває ставку на те, що майбутнє агентних інструментів RL буде розроблено спільно з моделями, які їх використовують.
Будьте попереду ШІ
Щоб дізнатися більше про структуру, яка змінює підготовку прикордонних агентів, слідкуйте за останніми розробками ШІ у нашому центрі.
Читати більше новин AI →
