NVIDIA의 NeMo 팀은 특이한 설계 목표를 가진 에이전트 강화 학습을 위한 PyTorch 기반 프레임워크인 Molt를 출시했습니다. 즉, 연구원이 머릿속에 집어넣을 수 있을 만큼 작은 코드베이스와 AI 코딩 도우미가 전체적으로 읽고 추론할 수 있는 것입니다. 에이전트 RL이 도구를 사용하고, 코드를 작성하고, 환경을 탐색하는 교육 모델을 위한 지배적인 방식이 되면서 릴리스가 출시되었으며, 이는 프론티어 에이전트의 훈련 방법을 재구성하는 여러 인프라 프로젝트 중 하나입니다. 우리는 AI 속보에서 이러한 변화를 다루고 있습니다.

단순히 실행하는 것이 아니라 읽을 수 있도록 제작됨

MarkTechPost 보고에 따르면 Molt는 각 프레임워크의 RL 진입점에서 가져오기 그래프를 추적하여 계산된 대략 8.6K 라인의 RL 코드를 측정합니다. 동일한 방법으로 verl의 경우 약 62K 라인, slime의 경우 25K, OpenRLHF의 경우 7.2K 라인이 계산됩니다. 이러한 고의적인 소형화는 프로젝트의 핵심입니다. 에이전트적 RL 연구는 지속적인 알고리즘 수정(새로운 추정기, 새로운 파이프라인 단계, 새로운 롤아웃 계획)이며 주류 프레임워크에서는 모든 변경 사항이 트레이너, 분산 백엔드 및 롤아웃 글루 계층을 통해 스레드됩니다. Molt는 이러한 마찰을 제거하는 것을 목표로 합니다.

프레임워크는 Apache 2.0 라이선스이며 실행 코드, Slurm 스크립트 및 사전 빌드된 컨테이너와 함께 제공됩니다. 그러나 NVIDIA는 동봉된 연구 논문에서 Molt를 생산 교육 서비스가 아닌 연구 인프라로 지정하고 하드웨어가 실제 문지기임을 분명히 밝혔습니다. 제공된 레시피에서는 H100 GPU 8개의 노드 2개를 가정하고 훈련용으로 8개, 롤아웃용으로 8개를 분할합니다. 이를 통해 선두 및 인접 연구소, 사후 교육을 수행하는 충분한 자금을 갖춘 스타트업, 엔터프라이즈 AI 연구 그룹, 다중 노드 H100 또는 H200 액세스가 가능한 학술 그룹이 접근할 수 있습니다.

구성, 포크되지 않음

Molt의 아키텍처는 세 가지 기존 도구를 포크하지 않고 구성하므로 업스트림 개선은 고통스러운 리베이스가 아닌 컨테이너 핀으로 이루어집니다. 배치 및 비동기 대기열에는 Ray를, 롤아웃에는 vLLM을, 교육에는 FSDP2가 포함된 NVIDIA AutoModel을 사용합니다. 런타임은 에이전트 풀, 요청 라우터 뒤의 vLLM 엔진 세트, 훈련 가능한 단일 정책 행위자로 구성됩니다. 스트리밍 풀은 비행 중에 즉각적인 그룹을 유지하므로 배우가 훈련하는 동안 엔진이 방전되지 않습니다.

부분 출시라는 기능은 효율성의 핵심입니다. 정책이 업데이트되면 Molt는 엔진을 일시 중지하고 행위자의 업데이트된 샤드를 NCCL을 통해 각 엔진에 직접 브로드캐스트하며 보관된 요청을 삭제하는 대신 재개합니다. 이는 모델이 변경될 때마다 진행 중인 롤아웃을 버리는 낭비적인 패턴을 방지합니다.

하나의 모듈, 두 개의 에이전트 양식

Molt에서 실행되는 RL은 AgentRunner를 내보내는 단일 Python 모듈의 이름을 지정하며 보상 함수를 포함한 다른 모든 것은 일반 코드입니다. 프레임워크는 두 가지 형식을 지원합니다. Env를 사용하면 프레임워크는 익숙한 강화 학습 패턴에 맞는 Gymnasium 정렬 `step()` 내부에 LLM 루프를 소유합니다. ChatAgent를 사용하면 사용자가 기본 OpenAI 또는 Anthropic SDK를 통해 루프를 소유하므로 기존 에이전트를 간단하게 래핑할 수 있습니다.

두 가지를 연결하기 위해 Molt는 두 유선 프로토콜을 모두 사용하는 루프백 서버를 시작하고 모든 요청은 서버 측에서 하나의 토큰에 딱 맞는 누적으로 디코딩됩니다. 장거리 에이전트가 컨텍스트를 압축하고 접두사를 다시 작성하면(여러 차례 실행되는 에이전트의 일반적인 작업) 서버는 현재 세그먼트를 봉인하고 자동으로 새 세그먼트를 엽니다. 이는 에이전트 RL 실행이 실제로 올바른지 또는 올바르게 보이는지 여부를 결정하는 일종의 배관 세부 사항입니다.

세 가지 정확성 불변성

Molt의 디자인은 비동기식 에이전트 훈련의 미묘한 실패를 해결하는 세 가지 정확성 불변성을 중심으로 구성됩니다. 토큰 ID는 샘플링된 토큰 ID가 재토큰화된 기록이 아닌 궤적을 정의한다는 것을 의미합니다. 텍스트를 토큰에 다시 연결하면 데이터가 자동으로 변경될 수 있기 때문에 중요합니다. 정책 버전 의미 체계는 훈련 가능한 토큰이 시퀀스 수준 게이트 뒤에서 토큰별로 수정된 비동기 사용을 통해 동작 정책 로그 확률을 유지하도록 보장합니다. 순방향 일관성은 출시 엔진과 교육 행위자가 모델 의미에 동의해야 합니다.

이 마지막 불변성은 점점 더 보편화되고 있는 전문가 혼합(MoE) 정책에 가장 중요합니다. 롤아웃 및 교육 라우터는 전문가를 독립적으로 선택하며, 작은 수치 차이로 인해 상위 K 선택이 바뀔 수 있으며, 샘플링된 내용과 교육 대상이 일치하지 않을 수 있습니다. Molt는 롤아웃 라우팅 재생을 통해 이 문제를 해결합니다. vLLM은 토큰별 전문가 ID를 반환하고 학습 전달 패스는 정확한 라우팅 결정을 다시 파생하는 대신 재생합니다.

용도

출시된 레시피와 사용 사례는 NVIDIA가 Molt가 채택될 것으로 예상하는 다중 회전 도구 사용 에이전트, 코드 실행 에이전트, 비전 언어 환경(프레임워크에 출시된 geo3k 레시피가 포함됨), LLM-판사 보상 루프, 소규모 학생 모델로의 정책 증류 등을 가리킵니다. 이는 바로 업계 전반에 걸쳐 에이전트 RL의 급증을 주도한 워크로드이며, 각 워크로드는 실제 훈련에서 부과하는 부분 롤아웃, 비동기 샘플링 조건에서 제대로 작동하기가 매우 까다롭습니다.

보다 광범위한 신호는 NVIDIA가 에이전트를 훈련시키는 GPU뿐만 아니라 연구자들이 에이전트를 구축하는 데 사용하는 소프트웨어 스택에도 투자하고 있다는 것입니다. 코드베이스를 작고 읽기 쉽게 유지하고 AI 코딩 보조자가 수정할 수 있도록 명시적으로 설계함으로써 Molt는 에이전트 RL 도구의 미래가 이를 사용하는 모델과 공동 개발될 것이라는 확신을 반영합니다.

AI보다 앞서 나가세요

프론티어 에이전트의 교육 방식을 재구성하는 프레임워크에 대한 자세한 내용을 보려면 최신 AI 개발 허브를 팔로우하세요.

AI 뉴스 자세히 보기 →