Dibina untuk Dibaca, Bukan Hanya Dijalankan
Seperti yang dilaporkan MarkTechPost, Molt mengukur kira-kira 8.6K baris kod RL, dikira dengan mengesan graf import daripada setiap titik masuk RL rangka kerja. Kaedah yang sama mengira kira-kira 62K baris untuk verl, 25K untuk lendir dan 7.2K untuk OpenRLHF. Kekompakan yang disengajakan itu ialah tumpuan utama projek: penyelidikan RL agenik ialah pengubahsuaian algoritma yang berterusan — penganggar baharu, peringkat saluran paip baharu, skim pelancaran baharu — dan dalam rangka kerja arus perdana setiap perubahan benang melalui lapisan jurulatih, bahagian belakang teragih dan gam pelancaran. Molt bertujuan untuk menghilangkan geseran itu.
Rangka kerja adalah Apache 2.0 berlesen dan dihantar dengan kod pelancaran, skrip Slurm dan bekas terbina. NVIDIA jelas, bagaimanapun, bahawa kertas penyelidikan yang disertakan meletakkan Molt sebagai infrastruktur penyelidikan dan bukannya perkhidmatan latihan pengeluaran, dan perkakasan adalah penjaga pintu sebenar. Resipi yang dihantar menganggap 2 nod 8 H100 GPU, bahagikan 8 untuk latihan dan 8 untuk pelancaran. Itu meletakkannya dalam jangkauan makmal sempadan dan bersebelahan sempadan, syarikat pemula yang dibiayai dengan baik yang melakukan pasca latihan, kumpulan penyelidikan AI perusahaan dan kumpulan akademik dengan akses H100 atau H200 berbilang nod.
Dikarang, Tidak Bercabang
Seni bina Molt mengarang tiga alatan sedia ada tanpa memotong mana-mana daripadanya, jadi penambahbaikan huluan tiba sebagai pin bekas dan bukannya rebase yang menyakitkan. Ia menggunakan Ray untuk peletakan dan baris gilir tak segerak, vLLM untuk pelancaran dan NVIDIA AutoModel dengan FSDP2 untuk latihan. Masa jalanan terdiri daripada kumpulan ejen, satu set enjin vLLM di belakang penghala permintaan dan satu pelakon dasar boleh dilatih. Kolam penstriman memastikan kumpulan pantas dalam penerbangan supaya enjin tidak pernah kehabisan semasa pelakon berlatih.
Ciri yang dipanggil pelancaran separa adalah penting kepada kecekapan. Apabila dasar dikemas kini, Molt menjeda enjin, menyiarkan serpihan yang dikemas kini oleh pelakon melalui NCCL terus ke setiap enjin dan menyambung semula permintaan yang disimpan dan bukannya membuangnya. Itu mengelakkan corak pembaziran membuang pelancaran yang sedang berjalan setiap kali model berubah.
Satu Modul, Dua Borang Ejen
Larian RL dalam Molt menamakan modul Python tunggal yang mengeksport AgentRunner, dan segala-galanya — termasuk fungsi ganjaran — ialah kod biasa. Rangka kerja menyokong dua bentuk. Dengan Env, rangka kerja memiliki gelung LLM di dalam `step()` sejajar Gimnasium, yang sesuai dengan corak pembelajaran pengukuhan yang biasa. Dengan ChatAgent, pengguna memiliki gelung melalui OpenAI saham atau SDK Anthropic, menjadikannya mudah untuk membungkus ejen sedia ada.
Untuk merapatkan kedua-duanya, Molt melancarkan pelayan gelung balik yang bercakap kedua-dua protokol wayar, dan setiap permintaan dinyahkod bahagian pelayan menjadi satu pengumpulan tepat token. Apabila ejen long-horizon memampatkan konteksnya dan menulis semula awalan — operasi biasa untuk ejen yang dijalankan untuk banyak pusingan — pelayan mengelak segmen semasa dan membuka segmen baharu secara automatik. Ini ialah jenis butiran paip yang menentukan sama ada larian RL agen adalah betul dalam amalan atau hanya kelihatan betul.
Tiga Invarian Ketepatan
Reka bentuk Molt disusun mengikut tiga invarian ketepatan yang menangani kegagalan halus latihan agen tak segerak. Identiti token bermaksud id token sampel mentakrifkan trajektori, bukan transkrip yang dikenangkan semula — penting kerana mencantumkan semula teks ke dalam token boleh menukar data secara senyap. Semantik versi dasar memastikan token boleh dilatih mengekalkan kebarangkalian log dasar tingkah laku mereka, dengan penggunaan tak segerak diperbetulkan setiap token di belakang gerbang peringkat jujukan. Konsistensi ke hadapan memerlukan enjin pelancaran dan pelakon latihan bersetuju dengan semantik model.
Invarian terakhir itu paling penting untuk dasar campuran pakar (MoE), yang semakin biasa. Router pelancaran dan latihan memilih pakar secara bebas, dan perbezaan berangka yang kecil boleh mengubah pilihan top-k, menghasilkan ketidakpadanan antara perkara yang disampel dan perkara yang sedang dilatih. Molt menangani perkara ini dengan main semula penghalaan pelancaran: vLLM mengembalikan id pakar per-tokennya, dan pas ke hadapan latihan memainkan semula keputusan penghalaan yang tepat dan bukannya mendapatkannya semula.
Untuk Apa
Resipi dan kes penggunaan yang dihantar menunjukkan tempat NVIDIA menjangkakan Molt akan diterima pakai: ejen penggunaan alat berbilang pusingan, ejen pelaksanaan kod, persekitaran bahasa penglihatan (rangka kerja termasuk resipi geo3k yang dihantar), gelung ganjaran LLM sebagai hakim dan penyulingan atas dasar ke model pelajar yang lebih kecil. Beban kerja inilah yang telah mendorong lonjakan dalam RL ejen di seluruh industri, dan setiap satunya terkenal dengan cara yang betul-betul tidak betul di bawah keadaan pelancaran separa, pensampelan tak segerak yang dikenakan oleh latihan sebenar.
Isyarat yang lebih luas ialah NVIDIA melabur bukan sahaja dalam GPU yang melatih ejen tetapi dalam timbunan perisian yang digunakan penyelidik untuk membinanya. Dengan memastikan pangkalan kod kecil dan boleh dibaca — dan mereka bentuknya secara eksplisit supaya pembantu pengekodan AI boleh mengubah suainya — Molt mencerminkan pertaruhan bahawa masa depan alat RL agenik akan dibangunkan bersama dengan model yang menggunakannya.
Kekal Mendahului AI
Untuk mengetahui lebih lanjut tentang rangka kerja membentuk semula cara ejen sempadan dilatih, ikuti hab kami untuk perkembangan AI terkini.
Baca lebih banyak berita AI →
