NVIDIAs NeMo-team har släppt Molt, ett PyTorch-native ramverk för agentisk förstärkningsinlärning med ett ovanligt designmål: en kodbas som är tillräckligt liten för att en forskare kan hålla den i huvudet - och en AI-kodningsassistent kan läsa och resonera om det i sin helhet. Releasen landar när agent RL blir det dominerande receptet för att lära modeller att använda verktyg, skriva kod och navigera i miljöer, och det är ett av flera infrastrukturprojekt som omformar hur frontier agenter utbildas. Vi täcker dessa förändringar i våra bristande AI-nyheter.

Byggd för att läsas, inte bara köras

Som MarkTechPost rapporterar mäter Molt ungefär 8,6K rader med RL-kod, räknat genom att spåra importgrafen från varje ramverks RL-ingångspunkt. Samma metod motsvarar ungefär 62K linjer för verl, 25K för slime och 7,2K för OpenRLHF. Den medvetna kompaktheten är projektets centrala tonhöjd: agentisk RL-forskning är ständig modifiering av algoritmer – nya estimatorer, nya pipelinesteg, nya utrullningsscheman – och i vanliga ramverk går varje förändring genom lager av tränare, distribuerad backend och utrullningslim. Molt syftar till att ta bort den friktionen.

Ramverket är Apache 2.0-licensierat och levereras med lanseringskoder, Slurm-skript och en förbyggd container. NVIDIA är dock tydlig med att den medföljande forskningsrapporten positionerar Molt som forskningsinfrastruktur snarare än en produktionsutbildningstjänst, och hårdvaran är den verkliga gatekeepern. De levererade recepten förutsätter 2 noder med 8 H100 GPU: er, delad 8 för träning och 8 för utrullning. Det gör det inom räckhåll för gräns- och gränslaboratorier, välfinansierade startups som gör efterutbildning, företags-AI-forskningsgrupper och akademiska grupper med H100- eller H200-åtkomst med flera noder.

Komponerad, inte kluven

Molts arkitektur består av tre befintliga verktyg utan att dela någon av dem, så uppströmsförbättringar kommer som en containerstift snarare än en smärtsam rebas. Den använder Ray för placering och asynkrona köer, vLLM för utrullning och NVIDIA AutoModel med FSDP2 för träning. Körtiden består av en agentpool, en uppsättning vLLM-motorer bakom en förfrågningsrouter och en enda utbildningsbar policyaktör. En streamingpool håller snabba grupper i flyget så att motorerna aldrig töms medan skådespelaren tränar.

En funktion som kallas partiell utrullning är central för effektiviteten. När policyn uppdateras pausar Molt motorerna, sänder skådespelarens uppdaterade skärvor över NCCL direkt till varje motor och återupptar de behållna förfrågningarna istället för att kassera dem. Det undviker det slösaktiga mönstret att kasta bort pågående utrullningar varje gång modellen ändras.

En modul, två agentformulär

En RL-körning i Molt namnger en enda Python-modul som exporterar en AgentRunner, och allt annat - inklusive belöningsfunktionen - är vanlig kod. Ramverket stöder två former. Med Env äger ramverket LLM-slingan inuti en Gymnasium-aligned `step()`, som passar det välbekanta förstärkningsinlärningsmönstret. Med ChatAgent äger användaren slingan genom en stock OpenAI eller Anthropic SDK, vilket gör det enkelt att slå in en befintlig agent.

För att överbrygga båda lanserar Molt en loopback-server som talar båda trådprotokollen, och varje begäran avkodas serversidan till en token-exakt ackumulering. När en agent med lång horisont komprimerar sitt sammanhang och skriver om prefixet – en vanlig operation för agenter som kör många varv – förseglar servern det aktuella segmentet och öppnar ett nytt automatiskt. Det här är den typ av VVS-detalj som avgör om en agent RL-körning är korrekt i praktiken eller bara ser korrekt ut.

Tre korrekthetsinvarianter

Molts design är organiserad kring tre korrekthetsinvarianter som adresserar de subtila misslyckandena i asynkron agentträning. Tokenidentitet betyder att samplade token-ID definierar banan, inte en återtokeniserad transkription – viktigt eftersom att sammanfoga text tillbaka till tokens kan ändra data tyst. Semantik för policyversion säkerställer att träningsbara tokens behåller sina beteendepolicylogg-sannolikheter, med asynkron användning korrigerad per token bakom en grind på sekvensnivå. Konsistens framåt kräver att utrullningsmotorn och utbildningsaktören kommer överens om modellsemantik.

Den sista oföränderligheten är viktigast för mix-of-experts (MoE) policy, som blir allt vanligare. Utrullnings- och utbildningsroutrarna väljer experter oberoende, och små numeriska skillnader kan vända topp-k-valen, vilket skapar en oöverensstämmelse mellan det som provades och det som tränas på. Molt åtgärdar detta med utrullning av routingrepris: vLLM returnerar sina expert-ID per token, och träningspasset framåt spelar upp de exakta routingbesluten istället för att härleda om dem.

Vad det är till för

De levererade recepten och användningsfallen pekar på var NVIDIA förväntar sig att Molt kommer att användas: agenter för multi-turn-verktygsanvändning, kodexekveringsagenter, vision-språkmiljöer (ramverket inkluderar ett levererat geo3k-recept), LLM-as-judge belöningsloopar och policy-destillation till en mindre studentmodell. Det är just dessa arbetsbelastningar som har drivit ökningen av agent RL i hela branschen, och var och en är notoriskt svår att komma rätt under de partiella utrullningen, asynkrona samplingsförhållanden som verklig utbildning kräver.

Den bredare signalen är att NVIDIA investerar inte bara i grafikprocessorerna som utbildar agenter utan i mjukvarustacken som forskare använder för att bygga dem. Genom att hålla kodbasen liten och läsbar – och uttryckligen designa den så att en AI-kodningsassistent kan modifiera den – återspeglar Molt en satsning på att framtiden för agentiska RL-verktyg kommer att utvecklas tillsammans med modellerna som använder den.

Ligg före AI

För mer om ramverken som omformar hur gränsagenter utbildas, följ vårt nav för senaste AI-utvecklingen.

Läs mer AI-nyheter →