Sadece Çalıştırmak İçin Değil, Okunmak İçin Tasarlandı
MarkTechPost'un bildirdiği gibi Molt, her bir çerçevenin RL giriş noktasından alınan içe aktarma grafiğinin izlenmesiyle sayılan kabaca 8,6 bin satırlık RL kodunu ölçer. Aynı yöntemde verl için yaklaşık 62K, slime için 25K ve OpenRLHF için 7,2K satır bulunur. Bu kasıtlı kompaktlık, projenin temel adımını oluşturuyor: Ajanslı RL araştırması, sürekli algoritma değişikliğidir - yeni tahminciler, yeni işlem hattı aşamaları, yeni kullanıma sunma şemaları - ve ana akım çerçevelerdeki her değişiklik, eğitici, dağıtılmış arka uç ve kullanıma sunma yapıştırıcısı katmanları aracılığıyla işlenir. Molt bu sürtünmeyi ortadan kaldırmayı amaçlıyor.Çerçeve Apache 2.0 lisanslıdır ve başlatma kodları, Slurm komut dosyaları ve önceden oluşturulmuş bir kapsayıcıyla birlikte gönderilir. Ancak NVIDIA, beraberindeki araştırma makalesinin Molt'u bir üretim eğitim hizmetinden ziyade araştırma altyapısı olarak konumlandırdığını ve donanımın gerçek bekçi olduğunu açıkça belirtiyor. Gönderilen tarifler, 8 H100 GPU'luk 2 düğümün, eğitim için 8'in ve kullanıma sunma için 8'in bölündüğünü varsaymaktadır. Bu, onu sınır ve sınır komşusu laboratuvarların, eğitim sonrası çalışmalar yapan iyi finanse edilen yeni girişimlerin, kurumsal yapay zeka araştırma gruplarının ve çok düğümlü H100 veya H200 erişimine sahip akademik grupların erişebileceği bir konuma getirir.
Oluşturulmuş, Çatallanmamış
Molt'un mimarisi, hiçbirini çatallamadan mevcut üç aracı bir araya getiriyor, bu nedenle yukarı yöndeki iyileştirmeler, acı verici bir yeniden yapılanma yerine bir kapsayıcı pim olarak geliyor. Yerleştirme ve eşzamansız kuyruklar için Ray, kullanıma sunma için vLLM ve eğitim için FSDP2'li NVIDIA AutoModel kullanır. Çalışma zamanı bir aracı havuzundan, bir istek yönlendiricisinin arkasındaki bir dizi vLLM motorundan ve eğitilebilir tek bir politika aktöründen oluşur. Bir akış havuzu, hızlı grupları uçuş halinde tutar, böylece oyuncu antrenman yaparken motorlar asla boşalmaz.
Kısmi kullanıma sunma adı verilen bir özellik verimliliğin merkezinde yer alır. Politika güncellendiğinde Molt, motorları duraklatır, aktörün güncellenen parçalarını NCCL üzerinden doğrudan her motora yayınlar ve tutulan istekleri atmak yerine devam ettirir. Bu, model her değiştiğinde devam eden kullanıma sunma işlemlerinin çöpe atılması şeklindeki israf modelini ortadan kaldırır.Bir Modül, İki Aracı Formu
Molt'taki bir RL çalıştırması, AgentRunner'ı dışa aktaran tek bir Python modülünü adlandırır ve ödül işlevi de dahil olmak üzere diğer her şey sıradan koddur. Çerçeve iki formu desteklemektedir. Env ile çerçeve, Gymnasium'a göre hizalanmış bir "step()" içindeki LLM döngüsüne sahiptir ve bu, tanıdık takviyeli öğrenme modeline uygundur. ChatAgent ile kullanıcı, hazır bir OpenAI veya Anthropic SDK aracılığıyla döngünün sahibi olur ve mevcut bir aracıyı sarmalamayı kolaylaştırır.
Her ikisini de köprülemek için Molt, her iki kablolu protokolü de konuşan bir geri döngü sunucusu başlatır ve her isteğin kodu sunucu tarafında tek bir token-tam birikimine dönüştürülür. Uzun ufuklu bir aracı, bağlamını sıkıştırdığında ve öneki yeniden yazdığında (birçok tur boyunca çalışan aracılar için yaygın bir işlem), sunucu mevcut segmenti mühürler ve otomatik olarak yeni bir segment açar. Bu, aracılı bir RL çalışmasının pratikte doğru olup olmadığını veya sadece doğru görünüp görünmediğini belirleyen türden bir tesisat detayıdır.
Üç Doğruluk Değişmezi
Molt'un tasarımı, asenkron aracılı eğitimin ince başarısızlıklarını ele alan üç doğruluk değişmezi etrafında düzenlenmiştir. Belirteç kimliği, yeniden simgeleştirilmiş bir transkriptin değil, örneklenmiş belirteç kimliklerinin yörüngeyi tanımladığı anlamına gelir; bu önemlidir, çünkü metni yeniden belirteçlere eklemek verileri sessizce değiştirebilir. Politika sürümü semantiği, sıra düzeyinde bir geçit arkasında eşzamansız kullanımın jeton başına düzeltilmesiyle, eğitilebilir jetonların davranış politikası günlük olasılıklarını korumasını sağlar. İleriye dönük tutarlılık, kullanıma sunma motorunun ve eğitim aktörünün model semantiği üzerinde anlaşmasını gerektirir.
Bu son değişmez, giderek daha yaygın hale gelen uzmanların karışımı (MEB) politikaları için en önemli husustur. Kullanıma alma ve eğitim yönlendiricileri, uzmanları bağımsız olarak seçer ve küçük sayısal farklılıklar, en iyi seçimleri tersine çevirerek örneklenen şey ile üzerinde eğitim verilen şey arasında bir uyumsuzluğa neden olabilir. Molt, yönlendirme tekrarını kullanıma sunma ile bu sorunu çözüyor: vLLM, jeton başına uzman kimliklerini döndürür ve eğitim ileri geçişi, bu yönlendirme kararlarını yeniden türetmek yerine tam olarak yeniden oynatır.
Ne İçin?
Gönderilen tarifler ve kullanım örnekleri, NVIDIA'nın Molt'un benimsenmesini beklediği yerleri gösteriyor: çok turlu araç kullanım aracıları, kod yürütme aracıları, vizyon dili ortamları (çerçeve, gönderilen bir geo3k tarifini içerir), jüri olarak LLM ödül döngüleri ve daha küçük bir öğrenci modeline politikaya uygun damıtma. Bunlar tam da sektör genelinde ajanslı RL'deki artışı tetikleyen iş yükleridir ve her biri, gerçek eğitimin dayattığı kısmi kullanıma sunma, eşzamansız örnekleme koşulları altında tam olarak ustalıkla hareket etme konusunda herkesin bildiği gibi.
Daha geniş bir sinyal, NVIDIA'nın yalnızca aracıları eğiten GPU'lara değil, aynı zamanda araştırmacıların bunları oluşturmak için kullandığı yazılım yığınına da yatırım yaptığıdır. Kod tabanını küçük ve okunabilir tutarak ve bunu bir AI kodlama asistanının değiştirebileceği şekilde açıkça tasarlayarak Molt, ajansal RL araçlarının geleceğinin onu kullanan modellerle birlikte geliştirileceği yönündeki iddiayı yansıtıyor.
Yapay Zekanın Önünde Kalın
Sınır görevlilerinin eğitilme şeklini yeniden şekillendiren çerçeveler hakkında daha fazla bilgi edinmek için en son yapay zeka gelişmeleri merkezimizi takip edin.
Daha fazla AI haberini okuyun →
