NVIDIA च्या NeMo टीम ने Molt, असामान्य डिझाइन लक्ष्यासह एजंटिक मजबुतीकरण शिक्षणासाठी PyTorch-नेटिव्ह फ्रेमवर्क जारी केले आहे: संशोधक त्यांच्या डोक्यात ठेवू शकेल इतका कोडबेस - आणि AI कोडिंग सहाय्यक संपूर्णपणे त्याबद्दल वाचू आणि तर्क करू शकतो. एजंटिक RL हे मॉडेलला टूल्स वापरणे, कोड लिहिणे आणि वातावरणात नेव्हिगेट करणे शिकवण्यासाठी प्रबळ रेसिपी बनते आणि सीमावर्ती एजंट्सना कसे प्रशिक्षित केले जाते हे बदलणारे अनेक पायाभूत प्रकल्पांपैकी एक आहे. आम्ही आमच्या ब्रेकिंग एआय न्यूज मध्ये या बदलांचा समावेश करतो.

वाचण्यासाठी तयार केलेले, फक्त धावत नाही

MarkTechPost अहवालानुसार, Molt अंदाजे 8.6K ओळी RL कोड मोजतो, प्रत्येक फ्रेमवर्कच्या RL एंट्री पॉइंटवरून आयात आलेख ट्रेस करून मोजला जातो. हीच पद्धत verl साठी सुमारे 62K रेषा, स्लाईमसाठी 25K आणि OpenRLHF साठी 7.2K रेषा आहे. मुद्दाम कॉम्पॅक्टनेस ही प्रकल्पाची मध्यवर्ती खेळपट्टी आहे: एजंटिक RL संशोधन हे सतत अल्गोरिदम बदल आहे — नवीन अंदाजकार, नवीन पाइपलाइन टप्पे, नवीन रोलआउट योजना — आणि मुख्य प्रवाहातील फ्रेमवर्कमध्ये प्रत्येक बदल थ्रेड्स ट्रेनर, डिस्ट्रिब्युटेड-बॅकएंड आणि रोलआउट ग्लूच्या स्तरांद्वारे. मोल्टचे उद्दिष्ट ते घर्षण दूर करण्याचा आहे.

फ्रेमवर्क Apache 2.0 परवानाकृत आहे आणि लाँच कोड, स्लर्म स्क्रिप्ट्स आणि पूर्वनिर्मित कंटेनरसह जहाजे आहेत. तथापि, NVIDIA हे स्पष्ट आहे की, सोबतचा शोधनिबंध मोल्टला उत्पादन प्रशिक्षण सेवेऐवजी संशोधन पायाभूत सुविधा म्हणून स्थान देतो आणि हार्डवेअर हा खरा द्वारपाल आहे. पाठवलेल्या पाककृतींमध्ये 8 H100 GPU चे 2 नोड्स, प्रशिक्षणासाठी 8 आणि रोलआउटसाठी 8 स्प्लिट केले जातात. यामुळे ते सीमावर्ती आणि सीमावर्ती-लगतच्या प्रयोगशाळा, प्रशिक्षणोत्तर काम करणाऱ्या चांगल्या अर्थसहाय्यित स्टार्टअप्स, एंटरप्राइझ एआय संशोधन गट आणि मल्टी-नोड H100 किंवा H200 प्रवेशासह शैक्षणिक गटांच्या आवाक्यात आणतात.

कंपोज केलेले, फोर्क केलेले नाही

मोल्टच्या आर्किटेक्चरमध्ये तीन अस्तित्वात असलेल्या साधनांचा कोणताही काटा न लावता तयार होतो, त्यामुळे अपस्ट्रीम सुधारणा वेदनादायक रिबेसऐवजी कंटेनर पिन म्हणून येतात. हे प्लेसमेंट आणि असिंक्रोनस रांगांसाठी रे, रोलआउटसाठी vLLM आणि प्रशिक्षणासाठी **FSDP2 सह NVIDIA ऑटोमॉडेल वापरते. रनटाइममध्ये एजंट पूल, रिक्वेस्ट राउटरच्या मागे vLLM इंजिनचा संच आणि एकच ट्रेन करण्यायोग्य पॉलिसी ॲक्टर यांचा समावेश असतो. प्रवाहित पूल प्रॉम्प्ट गटांना फ्लाइटमध्ये ठेवतो जेणेकरून अभिनेते ट्रेन करत असताना इंजिन कधीही निचरा होत नाही.

आंशिक रोलआउट नावाचे वैशिष्ट्य कार्यक्षमतेसाठी केंद्रस्थानी आहे. जेव्हा पॉलिसी अपडेट होते, तेव्हा मोल्ट इंजिनला विराम देतो, NCCL वर अभिनेत्याचे अपडेट केलेले शार्ड्स थेट प्रत्येक इंजिनवर प्रसारित करतो आणि त्या टाकून देण्याऐवजी राखून ठेवलेल्या विनंत्या पुन्हा सुरू करतो. हे प्रत्येक वेळी मॉडेल बदलल्यावर प्रगतीपथावर रोलआउट्स फेकून देण्याची फालतू पद्धत टाळते.

एक मॉड्यूल, दोन एजंट फॉर्म

Molt मध्ये चालवलेले RL एका Python मॉड्यूलचे नाव देते जे AgentRunner निर्यात करते आणि बाकी सर्व काही — रिवॉर्ड फंक्शनसह — सामान्य कोड आहे. फ्रेमवर्क दोन प्रकारांना समर्थन देते. Env सह, फ्रेमवर्कमध्ये जिम्नॅशियम-संरेखित `स्टेप()` अंतर्गत LLM लूप आहे, जो परिचित मजबुतीकरण-शिक्षण पॅटर्नमध्ये बसतो. ChatAgent सह, वापरकर्ता स्टॉक OpenAI किंवा Anthropic SDK द्वारे लूपचा मालक असतो, ज्यामुळे विद्यमान एजंट गुंडाळणे सोपे होते.

दोन्ही ब्रिज करण्यासाठी, Molt एक लूपबॅक सर्व्हर लाँच करतो जो दोन्ही वायर प्रोटोकॉल बोलतो आणि प्रत्येक विनंती सर्व्हर-साइड एका टोकन-अचूक संचयामध्ये डीकोड केली जाते. जेव्हा दीर्घ-क्षितिज एजंट त्याचा संदर्भ संकुचित करतो आणि उपसर्ग पुन्हा लिहितो — अनेक वळणांसाठी चालणाऱ्या एजंट्ससाठी एक सामान्य ऑपरेशन — सर्व्हर वर्तमान विभाग सील करतो आणि स्वयंचलितपणे नवीन उघडतो. हे अशा प्रकारचे प्लंबिंग तपशील आहे जे निर्धारित करते की एजंटिक RL रन व्यवहारात योग्य आहे की फक्त बरोबर दिसते.

तीन अचूकता अपरिवर्तनीय

मॉल्टची रचना तीन अचूकता अपरिवर्तनीयांच्या आसपास आयोजित केली आहे जी एसिंक्रोनस एजंटिक प्रशिक्षणातील सूक्ष्म अपयशांना संबोधित करते. टोकन आयडेंटिटी म्हणजे सॅम्पल टोकन आयडी प्रक्षेपण परिभाषित करतात, रीटोकनाइज्ड ट्रान्सक्रिप्ट नाही — महत्वाचे कारण मजकूर पुन्हा टोकनमध्ये स्टिच केल्याने डेटा शांतपणे बदलू शकतो. धोरण-आवृत्ती शब्दार्थ हे सुनिश्चित करते की प्रशिक्षित टोकन त्यांच्या वर्तन-पॉलिसी लॉग-संभाव्यता ठेवतात, अनुक्रम-स्तरीय गेटच्या मागे प्रति टोकन सुधारित असिंक्रोनस वापरासह. फॉरवर्ड सुसंगतता साठी रोलआउट इंजिन आणि प्रशिक्षण अभिनेत्याने मॉडेल सिमेंटिक्सवर सहमत असणे आवश्यक आहे.

तज्ञांचे मिश्रण (MoE) धोरणे साठी ते शेवटचे अपरिवर्तनीय महत्त्वाचे आहे, जे अधिकाधिक सामान्य आहेत. रोलआउट आणि ट्रेनिंग राउटर स्वतंत्रपणे तज्ञांची निवड करतात आणि लहान संख्यात्मक फरक टॉप-के निवडींना फ्लिप करू शकतात, जे सॅम्पल केले गेले होते आणि कशावर प्रशिक्षित केले जात आहे यात एक जुळत नाही. मोल्ट हे रोलआउट राउटिंग रिप्ले सह संबोधित करते: vLLM त्याचे प्रति-टोकन तज्ञ आयडी परत करते आणि प्रशिक्षण फॉरवर्ड पास ते अचूक राउटिंग निर्णय पुन्हा प्राप्त करण्याऐवजी पुन्हा प्ले करते.

हे कशासाठी आहे

पाठवलेल्या रेसिपी आणि वापर प्रकरणे NVIDIA ला Molt स्वीकारण्याची अपेक्षा करते: मल्टी-टर्न टूल-यूज एजंट्स, कोड-एक्झिक्युशन एजंट्स, व्हिजन-लँग्वेज एनवायरमेंट्स (फ्रेमवर्कमध्ये शिप केलेल्या geo3k रेसिपीचा समावेश आहे), LLM-जज-जज रिवॉर्ड लूप आणि ऑन-पॉलिसी मॉडेल ऑन-पॉलिसी डिस्टिलेशन. हे तंतोतंत वर्कलोड्स आहेत ज्यामुळे संपूर्ण उद्योगात एजंटिक RL मध्ये वाढ झाली आहे आणि प्रत्येकजण वास्तविक प्रशिक्षण लादलेल्या आंशिक-रोलआउट, असिंक-सॅम्पलिंग अटींमध्ये योग्यरित्या येण्यासाठी कुख्यात आहे.

व्यापक सिग्नल असा आहे की NVIDIA एजंटना प्रशिक्षण देणाऱ्या GPU मध्येच नाही तर सॉफ्टवेअर स्टॅक संशोधक तयार करण्यासाठी वापरत आहे. कोडबेस लहान आणि वाचनीय ठेवून — आणि स्पष्टपणे डिझाइन करून जेणेकरून एआय कोडिंग सहाय्यक त्यात बदल करू शकेल — मोल्ट हे एक पैज प्रतिबिंबित करते की एजंटिक RL टूलिंगचे भविष्य हे वापरणाऱ्या मॉडेल्ससह सह-विकसित केले जाईल.

AI च्या पुढे रहा

सीमावर्ती एजंट्सना कसे प्रशिक्षण दिले जाते या फ्रेमवर्कवर अधिक माहितीसाठी, नवीनतम AI घडामोडी साठी आमचे केंद्र फॉलो करा.

अधिक एआय बातम्या वाचा →