Zespół NeMo firmy NVIDIA wydał Molt, natywną platformę PyTorch do agentycznego uczenia się przez wzmacnianie z nietypowym celem projektowym: bazą kodu na tyle małą, że badacz może ją utrzymać w głowie, a asystent kodowania AI może przeczytać i przemyśleć go w całości. Wydanie ukazuje się jako agentowy RL staje się dominującą receptą na uczenie modeli korzystania z narzędzi, pisania kodu i poruszania się po środowiskach, a także jest jednym z kilku projektów infrastrukturalnych zmieniających sposób szkolenia agentów granicznych. O tych zmianach informujemy w naszych najnowszych wiadomościach o sztucznej inteligencji.

Stworzony do czytania, a nie tylko do biegania

Jak podaje MarkTechPost, Molt mierzy około 8,6 tys. linii kodu RL, obliczonych poprzez śledzenie wykresu importu z punktu wejścia RL każdego frameworka. Ta sama metoda pozwala uzyskać około 62 tys. linii dla wersji Verl, 25 tys. dla śluzu i 7,2 tys. dla OpenRLHF. Ta celowa zwartość jest głównym założeniem projektu: agentyczne badania RL to ciągła modyfikacja algorytmów — nowe estymatory, nowe etapy potoku, nowe schematy wdrażania — a w głównych frameworkach każda zmiana wątków odbywa się poprzez warstwy trenera, rozproszonego backendu i kleju do wdrażania. Molt ma na celu usunięcie tego tarcia.

Platforma ma licencję Apache 2.0 i jest dostarczana z kodami startowymi, skryptami Slurm i wstępnie utworzonym kontenerem. Firma NVIDIA jasno jednak stwierdza, że ​​w towarzyszącym dokumencie badawczym Molt jest postrzegany jako infrastruktura badawcza, a nie usługa szkoleniowa w zakresie produkcji, a prawdziwym strażnikiem jest sprzęt. Dostarczone receptury zakładają 2 węzły po 8 procesorów graficznych H100, podzielone na 8 do celów szkoleniowych i 8 do wdrożenia. Dzięki temu jest w zasięgu laboratoriów przygranicznych i przygranicznych, dobrze finansowanych start-upów odbywających szkolenia poszkoleniowe, korporacyjnych grup badawczych zajmujących się sztuczną inteligencją oraz grup akademickich z dostępem do wielu węzłów H100 lub H200.

Skomponowany, nie rozwidlony

Architektura Molt składa się z trzech istniejących narzędzi, nie rozdzielając żadnego z nich, zatem udoskonalenia na wczesnym etapie projektu mają raczej charakter łącznika niż bolesnej zmiany bazy. Wykorzystuje Ray do umieszczania i kolejek asynchronicznych, vLLM do wdrażania i NVIDIA AutoModel z FSDP2 do szkolenia. Środowisko wykonawcze składa się z puli agentów, zestawu silników vLLM za routerem żądań i pojedynczego aktora strategicznego, którego można przeszkolić. Pula strumieniowa zapewnia szybkie działanie grup, dzięki czemu silniki nigdy nie wyczerpują się podczas treningu aktora.

Funkcja zwana częściowym wdrożeniem ma kluczowe znaczenie dla wydajności. Po aktualizacji zasad Molt wstrzymuje działanie silników, transmituje zaktualizowane fragmenty aktora przez NCCL bezpośrednio do każdego silnika i wznawia zachowane żądania, zamiast je odrzucać. Pozwala to uniknąć marnotrawstwa polegającego na odrzucaniu trwających wdrożeń za każdym razem, gdy zmienia się model.

Jeden moduł, dwa formularze agenta

Uruchomienie RL w Molt nazywa pojedynczy moduł Pythona, który eksportuje AgentRunner, a cała reszta — łącznie z funkcją nagrody — jest zwykłym kodem. Framework obsługuje dwa formularze. W przypadku Env framework posiada pętlę LLM wewnątrz funkcji „step()” dostosowanej do Gymnasium, która pasuje do znanego wzorca uczenia się przez wzmacnianie. Dzięki ChatAgent użytkownik jest właścicielem pętli poprzez standardowy OpenAI lub Anthropic SDK, co ułatwia zamknięcie istniejącego agenta.

Aby połączyć oba, Molt uruchamia serwer sprzężenia zwrotnego, który obsługuje oba protokoły przewodowe, a każde żądanie jest dekodowane po stronie serwera w jedną akumulację z dokładnością do tokena. Kiedy agent długoterminowy zagęszcza swój kontekst i przepisuje przedrostek – częsta operacja w przypadku agentów działających przez wiele tur – serwer zamyka bieżący segment i automatycznie otwiera nowy. Jest to rodzaj szczegółów instalacji hydraulicznej, który określa, czy agentyczny przebieg RL jest prawidłowy w praktyce, czy po prostu wygląda poprawnie.

Trzy niezmienniki poprawności

Projekt Molt'a jest zorganizowany wokół trzech niezmienników poprawności, które odnoszą się do subtelnych niepowodzeń asynchronicznego szkolenia agentycznego. Token tożsamości oznacza, że ​​próbkowane identyfikatory tokenów definiują trajektorię, a nie ponownie tokenizowany transkrypt — jest to ważne, ponieważ ponowne połączenie tekstu w tokeny może po cichu zmienić dane. Semantyka wersji zasad zapewnia, że ​​tokeny, które można trenować, zachowują prawdopodobieństwo rejestrowania zasad zachowania, a użycie asynchroniczne jest korygowane dla każdego tokenu za bramką na poziomie sekwencji. Spójność w przód wymaga, aby silnik wdrażania i aktor szkoleniowy uzgodnili semantykę modelu.

Ten ostatni niezmiennik ma największe znaczenie w przypadku polityki złożonej z ekspertów (MoE), które są coraz powszechniejsze. Routery wdrożeniowe i szkoleniowe wybierają ekspertów niezależnie, a niewielkie różnice liczbowe mogą odwrócić wybór górnego k, powodując rozbieżność między tym, co zostało pobrane, a tym, na czym jest trenowane. Molt rozwiązuje ten problem za pomocą powtórki routingu: vLLM zwraca identyfikatory ekspertów dla poszczególnych tokenów, a szkoleniowe przekazanie do przodu odtwarza dokładnie te decyzje dotyczące routingu, zamiast je ponownie wyprowadzać.

Do czego to służy

Dostarczone receptury i przypadki użycia wskazują, gdzie NVIDIA spodziewa się przyjęcia Molt: wieloobrotowi agenci korzystający z narzędzi, agenci wykonujący kod, środowiska wizyjne i językowe (framework zawiera dostarczoną recepturę geo3k), pętle nagród LLM jako sędzia oraz destylacja na podstawie polityki do mniejszego modelu studenckiego. To właśnie te obciążenia spowodowały gwałtowny wzrost liczby agentów RL w całej branży, a każde z nich jest notorycznie trudne, aby uzyskać prawo do warunków częściowego wdrożenia i próbkowania asynchronicznego, które narzuca prawdziwe szkolenie.

Szerszym sygnałem jest to, że NVIDIA inwestuje nie tylko w procesory graficzne służące do szkolenia agentów, ale także w oprogramowanie wykorzystywane przez badaczy do ich tworzenia. Utrzymując małą i czytelną bazę kodu — oraz wyraźnie projektując ją tak, aby asystent kodowania AI mógł ją modyfikować — Molt zakłada, że ​​przyszłość agentycznego narzędzia RL będzie rozwijana wspólnie z modelami, które z niego korzystają.

Wyprzedź sztuczną inteligencję

Więcej informacji na temat struktur zmieniających sposób szkolenia agentów granicznych znajdziesz w naszym centrum najnowszych osiągnięć w zakresie sztucznej inteligencji.

Przeczytaj więcej aktualności o sztucznej inteligencji →