Conçu pour être lu, pas seulement exécuté
Comme le rapporte MarkTechPost, Molt mesure environ 8,6 000 lignes de code RL, comptées en traçant le graphique d'importation à partir du point d'entrée RL de chaque framework. La même méthode compte environ 62 000 lignes pour verl, 25 000 pour slime et 7,2 000 pour OpenRLHF. Cette compacité délibérée est l'argument central du projet : la recherche agentique RL est une modification constante de l'algorithme - de nouveaux estimateurs, de nouvelles étapes de pipeline, de nouveaux schémas de déploiement - et dans les frameworks traditionnels, chaque changement passe par des couches d'entraîneur, de backend distribué et de colle de déploiement. Molt vise à supprimer ces frictions.
Le framework est sous licence Apache 2.0 et est livré avec des codes de lancement, des scripts Slurm et un conteneur prédéfini. NVIDIA indique cependant clairement que le document de recherche qui l'accompagne positionne Molt comme une infrastructure de recherche plutôt que comme un service de formation à la production, et que le matériel est le véritable gardien. Les recettes fournies supposent 2 nœuds de 8 GPU H100, répartis en 8 pour la formation et 8 pour le déploiement. Cela le met à la portée des laboratoires frontaliers et adjacents, des startups bien financées effectuant des post-formations, des groupes de recherche en IA d'entreprise et des groupes universitaires dotés d'un accès H100 ou H200 multi-nœuds.
Composé, non fourchu
L'architecture de Molt compose trois outils existants sans en créer aucun, de sorte que les améliorations en amont arrivent sous la forme d'une épingle de conteneur plutôt que d'un rebase douloureux. Il utilise Ray pour le placement et les files d'attente asynchrones, vLLM pour le déploiement et NVIDIA AutoModel avec FSDP2 pour la formation. Le moteur d'exécution se compose d'un pool d'agents, d'un ensemble de moteurs vLLM derrière un routeur de requêtes et d'un seul acteur politique pouvant être formé. Un pool de streaming maintient les groupes prompts en vol afin que les moteurs ne s'épuisent jamais pendant que l'acteur s'entraîne.
Une fonctionnalité appelée déploiement partiel est essentielle à l'efficacité. Lorsque la politique est mise à jour, Molt met les moteurs en pause, diffuse les fragments mis à jour de l'acteur via NCCL directement vers chaque moteur et reprend les requêtes conservées plutôt que de les ignorer. Cela évite le gaspillage consistant à abandonner les déploiements en cours à chaque fois que le modèle change.
Un module, deux formulaires d'agent
Un RL exécuté dans Molt nomme un seul module Python qui exporte un AgentRunner, et tout le reste, y compris la fonction de récompense, est du code ordinaire. Le framework prend en charge deux formulaires. Avec Env, le framework possède la boucle LLM à l'intérieur d'un `step()` aligné sur le gymnase, qui correspond au modèle familier d'apprentissage par renforcement. Avec ChatAgent, l'utilisateur possède la boucle via un SDK OpenAI ou Anthropic, ce qui facilite l'encapsulation d'un agent existant.
Pour relier les deux, Molt lance un serveur de bouclage qui parle les deux protocoles filaires, et chaque requête est décodée côté serveur en une seule accumulation exacte de jeton. Lorsqu'un agent à long terme compacte son contexte et réécrit le préfixe (opération courante pour les agents qui s'exécutent pendant plusieurs tours), le serveur scelle le segment actuel et en ouvre un nouveau automatiquement. C'est le genre de détail de plomberie qui détermine si une analyse RL agentique est correcte dans la pratique ou si elle semble simplement correcte.
Trois invariants d'exactitude
La conception de Molt est organisée autour de trois invariants de correction qui répondent aux échecs subtils de la formation agentique asynchrone. L'identité du jeton signifie que les identifiants des jetons échantillonnés définissent la trajectoire, et non une transcription retokenisée - ce qui est important car la réintégration du texte dans les jetons peut modifier silencieusement les données. La sémantique de version de politique garantit que les jetons pouvant être entraînés conservent leurs probabilités de journalisation de politique de comportement, avec une utilisation asynchrone corrigée par jeton derrière une porte au niveau de la séquence. La cohérence ascendante nécessite que le moteur de déploiement et l'acteur de formation s'accordent sur la sémantique du modèle.
Ce dernier invariant est le plus important pour les politiques de mélange d'experts (MoE), qui sont de plus en plus courantes. Les routeurs de déploiement et de formation sélectionnent les experts de manière indépendante, et de petites différences numériques peuvent inverser les choix, produisant une inadéquation entre ce qui a été échantillonné et ce sur quoi est formé. Molt résout ce problème avec la relecture de routage de déploiement : vLLM renvoie ses identifiants d'expert par jeton, et la passe de formation suivante rejoue ces décisions de routage exactes plutôt que de les rediriger.
À quoi ça sert
Les recettes et les cas d'utilisation fournis indiquent les domaines dans lesquels NVIDIA s'attend à ce que Molt soit adopté : agents d'utilisation d'outils multi-tours, agents d'exécution de code, environnements de langage de vision (le cadre comprend une recette geo3k livrée), boucles de récompense LLM en tant que juge et distillation de la politique sur un modèle d'étudiant plus petit. Ce sont précisément ces charges de travail qui ont entraîné l’essor du RL agentique dans l’industrie, et chacune d’entre elles est notoirement difficile à mettre en œuvre dans les conditions de déploiement partiel et d’échantillonnage asynchrone qu’impose une véritable formation.
Le signal plus large est que NVIDIA investit non seulement dans les GPU qui forment les agents, mais aussi dans la pile logicielle utilisée par les chercheurs pour les construire. En gardant la base de code petite et lisible – et en la concevant explicitement pour qu'un assistant de codage IA puisse la modifier – Molt reflète le pari que l'avenir des outils RL agentiques sera co-développé avec les modèles qui l'utilisent.
Gardez une longueur d'avance sur l'IA
Pour en savoir plus sur les cadres qui remodèlent la formation des agents frontaliers, suivez notre hub pour les derniers développements en IA.
Lire plus d'actualités sur l'IA →
