El equipo NeMo de NVIDIA ha lanzado Molt, un marco nativo de PyTorch para el aprendizaje por refuerzo agente con un objetivo de diseño inusual: una base de código lo suficientemente pequeña como para que un investigador pueda sostenerla en su cabeza, y un asistente de codificación de IA pueda leerla y razonar sobre ella en su totalidad. El lanzamiento aterriza cuando la RL agente se convierte en la receta dominante para enseñar a los modelos a usar herramientas, escribir código y navegar en entornos, y es uno de varios proyectos de infraestructura que remodelan la forma en que se entrenan los agentes fronterizos. Cubrimos estos cambios en nuestras noticias de última hora sobre IA.

Creado para ser leído, no sólo ejecutado

Como informa MarkTechPost, Molt mide aproximadamente 8.6K líneas de código RL, contadas rastreando el gráfico de importación desde el punto de entrada RL de cada marco. El mismo método cuenta con aproximadamente 62 000 líneas para verl, 25 000 para slime y 7,2 000 para OpenRLHF. Esa compacidad deliberada es el argumento central del proyecto: la investigación de RL agente es una modificación constante del algoritmo (nuevos estimadores, nuevas etapas de canalización, nuevos esquemas de implementación) y en los marcos principales, cada cambio pasa por capas de entrenador, backend distribuido y pegamento de implementación. Molt tiene como objetivo eliminar esa fricción.

El marco tiene licencia Apache 2.0 y se envía con códigos de lanzamiento, scripts Slurm y un contenedor prediseñado. Sin embargo, NVIDIA tiene claro que el documento de investigación adjunto posiciona a Molt como una infraestructura de investigación en lugar de un servicio de capacitación en producción, y el hardware es el verdadero guardián. Las recetas enviadas suponen 2 nodos de 8 GPU H100, divididos 8 para entrenamiento y 8 para implementación. Eso lo coloca al alcance de laboratorios fronterizos y adyacentes, empresas emergentes bien financiadas que realizan capacitación posterior, grupos de investigación de inteligencia artificial empresarial y grupos académicos con acceso a múltiples nodos H100 o H200.

Compuesto, no bifurcado

La arquitectura de Molt compone tres herramientas existentes sin bifurcar ninguna de ellas, por lo que las mejoras ascendentes llegan como un pin de contenedor en lugar de una dolorosa rebase. Utiliza Ray para la ubicación y colas asincrónicas, vLLM para la implementación y NVIDIA AutoModel con FSDP2 para la capacitación. El tiempo de ejecución consta de un grupo de agentes, un conjunto de motores vLLM detrás de un enrutador de solicitudes y un único actor de políticas entrenable. Un grupo de transmisión mantiene a los grupos en vuelo para que los motores nunca se agoten mientras el actor entrena.

Una característica llamada implementación parcial es fundamental para la eficiencia. Cuando la política se actualiza, Molt pausa los motores, transmite los fragmentos actualizados del actor a través de NCCL directamente a cada motor y reanuda las solicitudes retenidas en lugar de descartarlas. Eso evita el patrón derrochador de desechar implementaciones en progreso cada vez que cambia el modelo.

Un módulo, dos formularios de agente

Una RL ejecutada en Molt nombra un único módulo de Python que exporta un AgentRunner, y todo lo demás, incluida la función de recompensa, es código ordinario. El marco admite dos formas. Con Env, el marco posee el bucle LLM dentro de un `step()` alineado con Gymnasium, que se ajusta al patrón familiar de aprendizaje por refuerzo. Con ChatAgent, el usuario es propietario del bucle a través de un OpenAI estándar o un SDK de Anthropic, lo que facilita la integración de un agente existente.

Para unir ambos, Molt lanza un servidor loopback que habla ambos protocolos de cable, y cada solicitud se decodifica en el lado del servidor en una acumulación exacta de token. Cuando un agente de horizonte largo compacta su contexto y reescribe el prefijo (una operación común para agentes que se ejecutan durante muchos turnos), el servidor sella el segmento actual y abre uno nuevo automáticamente. Este es el tipo de detalle de plomería que determina si una ejecución de RL agente es correcta en la práctica o simplemente parece correcta.

Tres invariantes de corrección

El diseño de Molt se organiza en torno a tres invariantes de corrección que abordan los fallos sutiles del entrenamiento agente asincrónico. Identidad del token significa que los identificadores de tokens muestreados definen la trayectoria, no una transcripción retokenizada, lo cual es importante porque volver a unir texto en tokens puede cambiar los datos silenciosamente. La semántica de la versión de la política garantiza que los tokens entrenables mantengan sus probabilidades de registro de políticas de comportamiento, con el uso asincrónico corregido por token detrás de una puerta de nivel de secuencia. La coherencia directa requiere que el motor de implementación y el actor de capacitación estén de acuerdo sobre la semántica del modelo.

Esta última invariante es más importante para las políticas de combinación de expertos, que son cada vez más comunes. Los enrutadores de implementación y capacitación seleccionan a los expertos de forma independiente, y pequeñas diferencias numéricas pueden cambiar las k opciones principales, produciendo una falta de coincidencia entre lo que se muestreó y lo que se está entrenando. Molt aborda esto con repetición de enrutamiento de implementación: vLLM devuelve sus identificadores de expertos por token, y el pase de entrenamiento reproduce esas decisiones de enrutamiento exactas en lugar de volver a derivarlas.

Para qué sirve

Las recetas enviadas y los casos de uso señalan dónde NVIDIA espera que se adopte Molt: agentes de uso de herramientas de múltiples turnos, agentes de ejecución de código, entornos de lenguaje de visión (el marco incluye una receta geo3k enviada), bucles de recompensa de LLM como juez y destilación de políticas en un modelo de estudiante más pequeño. Estas son precisamente las cargas de trabajo que han impulsado el aumento de la RL agente en toda la industria, y cada una de ellas es notoriamente difícil de manejar bajo las condiciones de implementación parcial y muestreo asíncrono que impone la capacitación real.

La señal más amplia es que NVIDIA está invirtiendo no sólo en las GPU que entrenan a los agentes sino también en la pila de software que los investigadores utilizan para construirlas. Al mantener la base de código pequeña y legible, y diseñarla explícitamente para que un asistente de codificación de IA pueda modificarla, Molt refleja una apuesta de que el futuro de las herramientas RL agentes se desarrollará conjuntamente con los modelos que las utilizan.

Manténgase por delante de la IA

Para obtener más información sobre los marcos que remodelan la forma en que se capacita a los agentes fronterizos, siga nuestro centro para conocer los últimos desarrollos de IA.

Leer más noticias sobre IA →