Dibangun kanggo Diwaca, Ora Mung Mbukak
Minangka laporan MarkTechPost, Molt ngukur kira-kira 8.6K baris kode RL, diitung kanthi nglacak grafik impor saka saben titik entri RL kerangka. Cara sing padha yaiku kira-kira 62K garis kanggo verl, 25K kanggo slime, lan 7.2K kanggo OpenRLHF. Kekompakan sing disengaja minangka fokus utama proyek: riset RL agenik yaiku modifikasi algoritma sing terus-terusan - estimator anyar, tahapan pipa anyar, skema rollout anyar - lan ing kerangka mainstream saben owah-owahan benang liwat lapisan pelatih, backend sing disebarake, lan lem rollout. Molt nduweni tujuan kanggo mbusak gesekan kasebut.
Kerangka kasebut dilisensi Apache 2.0 lan dikirim kanthi kode peluncuran, skrip Slurm, lan wadhah sing wis dibangun. NVIDIA cetha, Nanging, sing gawan riset kertas posisi Molt minangka infrastruktur riset tinimbang layanan latihan produksi, lan hardware minangka gatekeeper nyata. Resep-resep sing dikirim nganggep 2 kelenjar 8 H100 GPU , pamisah 8 kanggo latihan lan 8 kanggo rollout. Sing ndadekake iku bisa tekan labs wates lan wates, startups sing didanai kanthi apik sing nindakake latihan pasca latihan, grup riset AI perusahaan, lan kelompok akademisi kanthi akses multi-node H100 utawa H200.
Disusun, Ora Digawe
Arsitèktur Molt nyusun telung alat sing wis ana tanpa ngrusak apa-apa, saéngga dandan hulu teka minangka pin wadhah tinimbang rebase sing lara. Nggunakake Ray kanggo panggonan lan antrian asinkron, vLLM kanggo rollout, lan NVIDIA AutoModel karo FSDP2 kanggo latihan. Runtime kasusun saka blumbang agen, sakumpulan mesin vLLM ing mburi router panyuwunan, lan aktor kebijakan sing bisa dilatih. A blumbang streaming tansah kelompok cepet ing pesawat supaya mesin tau saluran nalika aktor sepur.
Fitur sing diarani parsial rollout minangka pusat efisiensi. Nalika nganyari kabijakan, Molt ngaso mesin, nyebarake shards dianyari aktor liwat NCCL langsung kanggo saben engine, lan nerusake panjalukan disimpen tinimbang discarding. Sing ngindhari pola boros kanggo mbuwang rollout sing lagi ditindakake saben model diganti.
Siji Modul, Loro Wangun Agen
Run RL ing Molt jeneng modul Python siji sing ngekspor AgentRunner , lan kabeh liya - kalebu fungsi ganjaran - kode biasa. Framework ndhukung rong wangun. Kanthi Env, kerangka kasebut nduweni loop LLM ing `langkah ()` sing didadekake Gymnasium, sing cocog karo pola sinau penguatan sing akrab. Kanthi ChatAgent, pangguna duwe daur ulang liwat saham OpenAI utawa Anthropic SDK, dadi gampang kanggo mbungkus agen sing wis ana.
Kanggo nyambungake loro, Molt ngluncurake server loopback sing ngomongake protokol kabel, lan saben panyuwunan didekode ing sisih server dadi siji akumulasi token. Nalika agen long-horizon compacts konteks lan rewrites ater-ater - operasi umum kanggo agen sing mbukak kanggo akeh giliran - server segel bagean saiki lan mbukak anyar kanthi otomatis. Iki minangka jinis detail pipa sing nemtokake manawa RL agenik bener ing praktik utawa mung katon bener.
Telung Invarian Kebeneran
Desain Molt diatur watara telung invarian bener sing ngatasi kegagalan subtle saka latihan agen asinkron. Identitas token tegese id token sampel nemtokake lintasan, dudu transkrip retokenisasi - penting amarga jahitan teks maneh dadi token bisa ngganti data kanthi meneng. Semantik versi kabijakan njamin token sing bisa dilatih njaga kemungkinan log-kabijakan prilaku, kanthi panggunaan asinkron didandani saben token ing mburi gerbang tingkat urutan. Konsistensi maju mbutuhake mesin rollout lan aktor latihan setuju babagan semantik model.
Invarian pungkasan sing paling penting kanggo kabijakan campuran-ahli (MoE), sing tambah umum. Router rollout lan latihan milih ahli kanthi mandiri, lan beda angka cilik bisa milih pilihan top-k, mrodhuksi ora cocog antarane sing diconto lan sing dilatih. Molt alamat iki karo muter maneh nuntun rollout : vLLM ngasilake id pakar saben-token, lan pass latihan nerusake muter maneh pancasan nuntun sing pas tinimbang re-derived.
Kanggo Apa
Resep-resep lan kasus panggunaan sing dikirim nuduhake ing ngendi NVIDIA ngarepake Molt diadopsi: agen panggunaan alat multi-turn, agen eksekusi kode, lingkungan basa visi (kerangka kalebu resep geo3k sing dikirim), puteran ganjaran LLM-as-judge, lan distilasi ing kebijakan menyang model siswa sing luwih cilik. Iki sabenere beban kerja sing wis mimpin mundhak ing RL agen ing saindhenging industri, lan saben siji kondhang fiddly kanggo njaluk tengen ing sebagean-rollout, kahanan async-sampling sing latihan nyata nemtokke.
Sinyal sing luwih jembar yaiku NVIDIA nandur modal ora mung ing GPU sing nglatih agen nanging ing tumpukan piranti lunak sing digunakake peneliti kanggo mbangun. Kanthi njaga basis kode cilik lan bisa diwaca - lan kanthi jelas ngrancang supaya asisten coding AI bisa ngowahi - Molt nggambarake taruhan yen masa depan alat RL agen bakal dikembangake bareng karo model sing nggunakake.
Tetep Ahead saka AI
Kanggo luwih lengkap babagan kerangka mbentuk maneh carane agen perbatasan dilatih, tindakake hub kita kanggo pangembangan AI paling anyar.
Waca liyane AI warta →
