Tým NeMo NVIDIA vydal Molt, nativní rámec PyTorch pro učení agentů s neobvyklým designovým cílem: dostatečně malá kódová základna, aby ji výzkumník mohl udržet v hlavě – a asistent kódování AI o ní může číst a uvažovat v celém rozsahu. Vydání končí, když se agentní RL stává dominantním receptem na výuku modelů pro používání nástrojů, psaní kódu a navigaci v prostředích, a je to jeden z několika infrastrukturních projektů, které přetvářejí způsob školení hraničních agentů. Těmto posunům se věnujeme v našich přelomových zprávách o AI.

Vytvořeno pro čtení, ne pro běh

Jak uvádí MarkTechPost, Molt měří zhruba 8,6 tisíc řádků RL kódu, počítáno sledováním grafu importu ze vstupního bodu RL každého rámce. Stejná metoda obsahuje asi 62 tisíc řádků pro verl, 25 tisíc pro sliz a 7,2 tisíc pro OpenRLHF. Tato záměrná kompaktnost je ústředním bodem projektu: agentní výzkum RL je neustálá modifikace algoritmu – nové odhady, nové fáze potrubí, nová schémata zavádění – a v mainstreamových rámcích se každá změna prolíná vrstvami školicího programu, distribuovaného backendu a lepidla zavádění. Molt má za cíl odstranit toto tření.

Framework je licencován pro Apache 2.0 a je dodáván se spouštěcími kódy, skripty Slurm a předem sestaveným kontejnerem. NVIDIA je však jasné, že doprovodný výzkumný dokument staví Molt spíše jako výzkumnou infrastrukturu než jako produkční školicí službu a hardware je skutečným strážcem. Dodávané receptury předpokládají 2 uzly 8 GPU H100, rozdělených 8 pro školení a 8 pro zavedení. Díky tomu je v dosahu hraničních a hraničních laboratoří, dobře financovaných startupů provádějících post-školení, podnikových výzkumných skupin AI a akademických skupin s víceuzlovým přístupem H100 nebo H200.

Složený, ne rozvětvený

Moltova architektura se skládá ze tří existujících nástrojů, aniž by některý z nich rozvětvoval, takže upstreamová vylepšení přicházejí spíše jako kontejnerový pin, než jako bolestivé rebase. Používá Ray pro umístění a asynchronní fronty, vLLM pro zavádění a NVIDIA AutoModel s FSDP2 pro školení. Runtime se skládá z fondu agentů, sady vLLM enginů za směrovačem požadavků a jednoho trénovatelného činitele politiky. Streamovací bazén udržuje rychlé skupiny v letu, takže se motory nikdy nevyčerpají, když herec trénuje.

Funkce zvaná částečné zavedení je zásadní pro efektivitu. Když se zásady aktualizují, Molt pozastaví enginy, vysílá hercovy aktualizované útržky přes NCCL přímo do každého enginu a obnoví uchované požadavky místo toho, aby je zahodil. Vyhnete se tak zbytečnému vzoru zahazování probíhajících zavádění pokaždé, když se model změní.

Jeden modul, dva formuláře agentů

Spuštění RL v Moltu pojmenuje jeden modul Pythonu, který exportuje AgentRunner, a vše ostatní – včetně funkce odměny – je obyčejný kód. Rámec podporuje dvě formy. S Env framework vlastní smyčku LLM uvnitř `step()` zarovnaného na Gymnasium, který odpovídá známému vzoru posilování-učení. S ChatAgent uživatel vlastní smyčku prostřednictvím stock OpenAI nebo Anthropic SDK, takže je snadné zabalit existujícího agenta.

Aby bylo možné obojí překlenout, Molt spouští loopback server, který hovoří oběma drátovými protokoly a každý požadavek je dekódován na straně serveru do jednoho tokenu s přesnou akumulací. Když agent s dlouhým horizontem zhutní svůj kontext a přepíše předponu – což je běžná operace pro agenty, kteří běží po mnoho tahů – server zapečetí aktuální segment a automaticky otevře nový. Toto je druh instalatérského detailu, který určuje, zda je běh agentního RL v praxi správný, nebo jen správně vypadá.

Tři invarianty správnosti

Moltův návrh je organizován kolem tří invariantů správnosti, které řeší jemné selhání asynchronního tréninku agentů. Identita tokenu znamená, že vzorová ID tokenů definují trajektorii, nikoli retokenizovaný přepis – důležité, protože spojení textu zpět do tokenů může tiše změnit data. Sémantika verze zásad zajišťuje, že si trénovatelné tokeny udrží své pravděpodobnosti protokolu chování a zásad, přičemž asynchronní použití je opraveno na token za bránou na úrovni sekvence. Dopředná konzistence vyžaduje, aby se modul zavádění a školící hráč shodli na sémantice modelu.

Tento poslední invariant nejvíce záleží na politikách smíšených odborníků (MŽP), které jsou stále běžnější. Směrovače zavádění a školení vybírají odborníky nezávisle a malé číselné rozdíly mohou změnit výběr top-k, což vede k nesouladu mezi tím, co bylo vzorkováno, a tím, na co se trénuje. Molt to řeší pomocí přehrávání směrování při zavedení: vLLM vrací svá expertní ID pro každý token a trénovací dopředný průchod přehraje tato přesná rozhodnutí o směrování spíše než je znovu odvozuje.

K čemu to je

Dodané receptury a případy použití ukazují, kde NVIDIA očekává, že bude Molt přijat: víceotáčkoví agenti pro použití nástrojů, agenti pro spouštění kódu, prostředí vize jazyka (rámec zahrnuje dodávaný recept geo3k), smyčky odměn LLM jako soudce a destilace na základě zásad na menší studentský model. To jsou přesně ty pracovní zátěže, které způsobily prudký nárůst agentního RL v celém odvětví, a každý z nich je notoricky nešikovný, aby se dostal přímo do podmínek částečného zavádění a asynchronního vzorkování, které skutečné školení vyžaduje.

Širším signálem je, že NVIDIA investuje nejen do GPU, která trénují agenty, ale i do softwarových zásobníků, které výzkumníci používají k jejich sestavování. Tím, že je kódová základna malá a čitelná – a explicitně je navržena tak, aby ji mohl modifikovat asistent kódování AI – Molt odráží sázku, že budoucnost agentních nástrojů RL bude vyvíjena společně s modely, které je používají.

Udržujte si náskok před umělou inteligencí

Další informace o rámcích přetvářejících způsob školení hraničních agentů naleznete v našem centru pro nejnovější vývoj AI.

Přečtěte si další zprávy o AI →