Construit pentru a fi citit, nu doar pentru a alerga
După cum raportează MarkTechPost, Molt măsoară aproximativ 8.6K linii de cod RL, numărate prin urmărirea graficului de import din punctul de intrare RL al fiecărui cadru. Aceeași metodă reprezintă aproximativ 62K de linii pentru verl, 25K pentru slime și 7,2K pentru OpenRLHF. Acea compactitate deliberată este punctul central al proiectului: cercetarea agentică RL este modificarea constantă a algoritmului - noi estimatori, noi etape de pipeline, noi scheme de lansare - și în cadrele principale fiecare schimbare se trece prin straturi de trainer, backend distribuit și lipici de lansare. Molt urmărește să elimine această frecare.
Cadrul are licență Apache 2.0 și este livrat cu coduri de lansare, scripturi Slurm și un container predefinit. NVIDIA este clar, totuși, că documentul de cercetare însoțitor poziționează Molt ca infrastructură de cercetare, mai degrabă decât un serviciu de instruire de producție, iar hardware-ul este adevăratul gardian. Rețetele livrate presupun 2 noduri a 8 GPU-uri H100, împărțite în 8 pentru antrenament și 8 pentru lansare. Acest lucru îl pune la îndemâna laboratoarelor de frontieră și adiacente frontierei, a startup-urilor bine finanțate care fac post-formare, a grupurilor de cercetare IA pentru întreprinderi și a grupurilor academice cu acces H100 sau H200 cu mai multe noduri.
Compus, nu bifurcat
Arhitectura lui Molt alcătuiește trei instrumente existente fără a bifurca niciunul dintre ele, astfel încât îmbunătățirile din amonte ajung mai degrabă ca un pin de container, mai degrabă decât o rebază dureroasă. Utilizează Ray pentru plasare și cozi asincrone, vLLM pentru lansare și NVIDIA AutoModel cu FSDP2 pentru antrenament. Timpul de execuție constă dintr-un grup de agenți, un set de motoare vLLM în spatele unui router de solicitare și un singur actor de politică care poate fi antrenat. Un bazin de streaming menține grupuri prompte în zbor, astfel încât motoarele să nu se scurgă niciodată în timp ce actorul se antrenează.
O funcție numită lansare parțială este esențială pentru eficiență. Când politica se actualizează, Molt întrerupe motoarele, difuzează fragmentele actualizate ale actorului prin NCCL direct către fiecare motor și reia solicitările reținute în loc să le renunțe. Acest lucru evită tiparul irositor de a arunca lansările în curs de fiecare dată când modelul se schimbă.
Un modul, două formulare de agent
O rulare RL în Molt numește un singur modul Python care exportă un AgentRunner și orice altceva, inclusiv funcția de recompensă, este cod obișnuit. Cadrul acceptă două forme. Cu Env, cadrul deține bucla LLM în interiorul unui „step()” aliniat la Gymnasium, care se potrivește cu modelul familiar de întărire-învățare. Cu ChatAgent, utilizatorul deține bucla printr-un SDK de stoc OpenAI sau Anthropic, ceea ce face simplă încheierea unui agent existent.
Pentru a le pune pe ambele, Molt lansează un server loopback care vorbește ambele protocoale prin cablu, iar fiecare solicitare este decodificată de partea serverului într-o acumulare exactă de token. Când un agent cu orizont lung își compactează contextul și rescrie prefixul - o operațiune obișnuită pentru agenții care rulează mai multe ture - serverul sigilează segmentul curent și deschide automat unul nou. Acesta este tipul de detaliu al instalațiilor sanitare care determină dacă o rulare agentică RL este corectă în practică sau doar arată corect.
Trei invarianți de corectitudine
Designul lui Molt este organizat în jurul a trei invarianți de corectitudine care abordează eșecurile subtile ale antrenamentului agentic asincron. Identitatea tokenului înseamnă că ID-urile token-ului eșantionate definesc traiectoria, nu o transcriere retokenizată - important pentru că asamblarea textului înapoi în jetoane poate schimba în tăcere datele. Semantica versiunii de politică asigură că token-urile antrenabile își păstrează probabilitățile de jurnal de politică de comportament, cu utilizarea asincronă corectată pe token în spatele unei porți la nivel de secvență. Consecvența în avans necesită ca motorul de lansare și actorul de formare să fie de acord cu semantica modelului.
Acest ultim invariant contează cel mai mult pentru politicile mixture-of-experts (MoE), care sunt din ce în ce mai frecvente. Ruterele de implementare și de instruire selectează experți în mod independent, iar micile diferențe numerice pot inversa alegerile de top, producând o nepotrivire între ceea ce a fost eșantionat și ceea ce este instruit. Molt abordează acest lucru cu reluare de rutare a lansării: vLLM returnează ID-urile de expert per-token, iar trecerea înainte de antrenament reluează acele decizii exacte de rutare, mai degrabă decât să le rederive.
Pentru ce este
Rețetele livrate și cazurile de utilizare indică locul în care NVIDIA se așteaptă ca Molt să fie adoptat: agenți de utilizare a instrumentelor cu mai multe rânduri, agenți de execuție a codului, medii în limbaj de viziune (cadru include o rețetă geo3k livrată), bucle de recompensă LLM-as-judge și distilare conform politicii pe un model student mai mic. Acestea sunt tocmai sarcinile de lucru care au condus la creșterea RL agentic în întreaga industrie și fiecare dintre ele este destul de dificil să se descurce în condițiile de lansare parțială, de eșantionare asincronă pe care le impune antrenamentul real.
Semnalul mai larg este că NVIDIA investește nu doar în GPU-urile care antrenează agenții, ci și în stiva de software pe care cercetătorii le folosesc pentru a le construi. Păstrând baza de cod mică și lizibilă - și proiectând-o în mod explicit astfel încât un asistent de codare AI să o poată modifica - Molt reflectă pariul că viitorul instrumentelor RL agentice va fi dezvoltat împreună cu modelele care îl folosesc.
Rămâi înaintea AI
Pentru mai multe despre cadrele care remodelează modul în care sunt pregătiți agenții de frontieră, urmăriți hub-ul nostru pentru cele mai recente evoluții AI.
Citiți mai multe știri AI →
