Construído para ser lido, não apenas executado
Conforme relata o MarkTechPost, Molt mede aproximadamente 8,6 mil linhas de código RL, contadas pelo rastreamento do gráfico de importação do ponto de entrada RL de cada estrutura. O mesmo método registra cerca de 62 mil linhas para verl, 25 mil para slime e 7,2 mil para OpenRLHF. Essa compacidade deliberada é o argumento central do projeto: a pesquisa de RL agente é a modificação constante do algoritmo - novos estimadores, novos estágios de pipeline, novos esquemas de implementação - e em estruturas convencionais, cada mudança de threads através de camadas de treinador, back-end distribuído e cola de implementação. Molt pretende remover esse atrito.
A estrutura é licenciada pelo Apache 2.0 e vem com códigos de inicialização, scripts Slurm e um contêiner pré-construído. A NVIDIA deixa claro, no entanto, que o documento de pesquisa que acompanha posiciona o Molt como uma infraestrutura de pesquisa, e não como um serviço de treinamento de produção, e o hardware é o verdadeiro guardião. As receitas enviadas assumem 2 nós de 8 GPUs H100, divididos em 8 para treinamento e 8 para implementação. Isso o coloca ao alcance de laboratórios de fronteira e adjacentes a fronteiras, startups bem financiadas que realizam pós-treinamento, grupos de pesquisa de IA empresarial e grupos acadêmicos com acesso H100 ou H200 de vários nós.
Composto, não bifurcado
A arquitetura do Molt compõe três ferramentas existentes sem bifurcar nenhuma delas, de modo que as melhorias upstream chegam como um pino de contêiner, em vez de um doloroso rebase. Ele usa Ray para posicionamento e filas assíncronas, vLLM para implementação e NVIDIA AutoModel com FSDP2 para treinamento. O tempo de execução consiste em um pool de agentes, um conjunto de mecanismos vLLM atrás de um roteador de solicitação e um único ator político treinável. Um pool de streaming mantém grupos imediatos em voo para que os motores nunca acabem enquanto o ator treina.
Um recurso chamado lançamento parcial é fundamental para a eficiência. Quando a política é atualizada, Molt pausa os mecanismos, transmite os fragmentos atualizados do ator pela NCCL diretamente para cada mecanismo e retoma as solicitações retidas em vez de descartá-las. Isso evita o desperdício de descartar implementações em andamento sempre que o modelo muda.
Um módulo, dois formulários de agente
Uma RL executada em Molt nomeia um único módulo Python que exporta um AgentRunner, e todo o resto – incluindo a função de recompensa – é código comum. A estrutura suporta dois formulários. Com Env, a estrutura possui o loop LLM dentro de um `step()` alinhado ao Gymnasium, que se ajusta ao padrão familiar de aprendizagem por reforço. Com o ChatAgent, o usuário possui o loop por meio de um OpenAI padrão ou SDK Anthropic, facilitando o encapsulamento de um agente existente.
Para conectar ambos, Molt lança um servidor de loopback que fala ambos os protocolos de conexão, e cada solicitação é decodificada no lado do servidor em um acúmulo exato de token. Quando um agente de longo horizonte compacta seu contexto e reescreve o prefixo — uma operação comum para agentes que funcionam por muitos turnos — o servidor sela o segmento atual e abre um novo segmento automaticamente. Este é o tipo de detalhe de encanamento que determina se uma execução de RL de agente está correta na prática ou apenas parece correta.
Três Invariantes de Correção
O projeto de Molt é organizado em torno de três invariantes de correção que abordam as falhas sutis do treinamento agente assíncrono. Identidade do token significa que os IDs de token amostrados definem a trajetória, não uma transcrição retokenizada – importante porque juntar o texto de volta aos tokens pode alterar silenciosamente os dados. Semântica de versão de política garante que tokens treináveis mantenham suas probabilidades de log de política de comportamento, com uso assíncrono corrigido por token atrás de uma porta de nível de sequência. A consistência futura exige que o mecanismo de implementação e o ator de treinamento concordem com a semântica do modelo.
Esta última invariante é mais importante para as políticas de mistura de especialistas (MoE), que são cada vez mais comuns. Os roteadores de implementação e treinamento selecionam especialistas de forma independente, e pequenas diferenças numéricas podem alterar as escolhas principais, produzindo uma incompatibilidade entre o que foi amostrado e o que está sendo treinado. Molt aborda isso com reprodução de roteamento de implementação: vLLM retorna seus ids de especialistas por token, e o passe de treinamento para frente reproduz essas decisões de roteamento exatas em vez de derivá-las novamente.
Para que serve
As receitas e casos de uso enviados apontam para onde a NVIDIA espera que o Molt seja adotado: agentes de uso de ferramentas multiturno, agentes de execução de código, ambientes de linguagem de visão (a estrutura inclui uma receita geo3k enviada), loops de recompensa LLM como juiz e destilação sob política em um modelo de aluno menor. Essas são precisamente as cargas de trabalho que impulsionaram o aumento da RL agente em todo o setor, e cada uma delas é notoriamente difícil de acertar sob as condições de implementação parcial e amostragem assíncrona que o treinamento real impõe.
O sinal mais amplo é que a NVIDIA está investindo não apenas nas GPUs que treinam os agentes, mas também na pilha de software que os pesquisadores usam para construí-los. Ao manter a base de código pequena e legível – e projetá-la explicitamente para que um assistente de codificação de IA possa modificá-la – Molt reflete uma aposta de que o futuro das ferramentas de RL de agência será co-desenvolvido com os modelos que as utilizam.
Fique à frente da IA
Para saber mais sobre as estruturas que remodelam a forma como os agentes de fronteira são treinados, siga nosso hub para os últimos desenvolvimentos de IA.
Leia mais notícias sobre IA →
