पढ़ने के लिए बनाया गया, न कि सिर्फ दौड़ने के लिए
जैसा कि मार्कटेकपोस्ट रिपोर्ट करता है, मोल्ट लगभग आरएल कोड की 8.6K लाइनें मापता है, जिसे प्रत्येक फ्रेमवर्क के आरएल प्रविष्टि बिंदु से आयात ग्राफ का पता लगाकर गिना जाता है। यही विधि verl के लिए लगभग 62K, स्लाइम के लिए 25K और OpenRLHF के लिए 7.2K लाइनों का मिलान करती है। वह जानबूझकर सघनता परियोजना की केंद्रीय पिच है: एजेंटिक आरएल अनुसंधान निरंतर एल्गोरिदम संशोधन है - नए अनुमानक, नए पाइपलाइन चरण, नई रोलआउट योजनाएं - और मुख्यधारा के ढांचे में ट्रेनर, वितरित-बैकएंड और रोलआउट गोंद की परतों के माध्यम से प्रत्येक परिवर्तन थ्रेड होता है। मोल्ट का लक्ष्य उस घर्षण को दूर करना है।
फ्रेमवर्क अपाचे 2.0 लाइसेंस प्राप्त है और लॉन्च कोड, स्लम स्क्रिप्ट और एक प्रीबिल्ट कंटेनर के साथ आता है। हालाँकि, NVIDIA स्पष्ट है कि संलग्न शोध पत्र मोल्ट को उत्पादन प्रशिक्षण सेवा के बजाय अनुसंधान बुनियादी ढांचे के रूप में स्थान देता है, और हार्डवेयर वास्तविक द्वारपाल है। भेजे गए व्यंजनों में 8 H100 GPU के 2 नोड्स, प्रशिक्षण के लिए 8 और रोलआउट के लिए 8 को विभाजित किया गया है। यह इसे सीमांत और सीमांत-आसन्न प्रयोगशालाओं, प्रशिक्षण के बाद अच्छी तरह से वित्त पोषित स्टार्टअप, एंटरप्राइज एआई अनुसंधान समूहों और मल्टी-नोड H100 या H200 एक्सेस वाले अकादमिक समूहों की पहुंच में रखता है।
रचित, द्विभाजित नहीं
मोल्ट का आर्किटेक्चर तीन मौजूदा उपकरणों को बिना किसी फोर्किंग के बनाता है, इसलिए अपस्ट्रीम सुधार एक दर्दनाक रिबेस के बजाय एक कंटेनर पिन के रूप में आते हैं। यह प्लेसमेंट और एसिंक्रोनस कतारों के लिए रे, रोलआउट के लिए vLLM और प्रशिक्षण के लिए FSDP2 के साथ NVIDIA ऑटोमॉडल का उपयोग करता है। रनटाइम में एक एजेंट पूल, एक अनुरोध राउटर के पीछे वीएलएलएम इंजन का एक सेट और एक एकल प्रशिक्षण योग्य नीति अभिनेता शामिल होता है। एक स्ट्रीमिंग पूल उड़ान में त्वरित समूहों को रखता है ताकि अभिनेता के प्रशिक्षण के दौरान इंजन कभी खाली न हों।
आंशिक रोलआउट नामक सुविधा दक्षता का केंद्र है। जब नीति अपडेट होती है, तो मोल्ट इंजन को रोक देता है, एनसीसीएल पर अभिनेता के अपडेट किए गए शार्ड को सीधे प्रत्येक इंजन पर प्रसारित करता है, और बनाए गए अनुरोधों को छोड़ने के बजाय उन्हें फिर से शुरू करता है। इससे हर बार मॉडल बदलने पर प्रगतिरत रोलआउट को फेंकने के बेकार पैटर्न से बचा जा सकता है।एक मॉड्यूल, दो एजेंट फॉर्म
मोल्ट में एक आरएल रन एक एकल पायथन मॉड्यूल को नाम देता है जो एक एजेंट रनर निर्यात करता है, और बाकी सब कुछ - जिसमें इनाम फ़ंक्शन भी शामिल है - साधारण कोड है। ढांचा दो रूपों का समर्थन करता है। Env के साथ, फ्रेमवर्क जिमनैजियम-संरेखित `स्टेप()` के अंदर एलएलएम लूप का मालिक है, जो परिचित सुदृढीकरण-सीखने के पैटर्न में फिट बैठता है। चैटएजेंट के साथ, उपयोगकर्ता स्टॉक ओपनएआई या एंथ्रोपिक एसडीके के माध्यम से लूप का मालिक होता है, जिससे मौजूदा एजेंट को लपेटना आसान हो जाता है।
दोनों को पाटने के लिए, मोल्ट ने एक लूपबैक सर्वर लॉन्च किया जो दोनों वायर प्रोटोकॉल को बोलता है, और प्रत्येक अनुरोध को सर्वर-साइड पर एक टोकन-सटीक संचय में डिकोड किया जाता है। जब एक लंबा-क्षितिज एजेंट अपने संदर्भ को संकुचित करता है और उपसर्ग को फिर से लिखता है - एजेंटों के लिए एक सामान्य ऑपरेशन जो कई मोड़ों तक चलता है - सर्वर वर्तमान खंड को सील कर देता है और स्वचालित रूप से एक नया खोल देता है। यह एक प्रकार का प्लंबिंग विवरण है जो यह निर्धारित करता है कि एजेंटिक आरएल रन व्यवहार में सही है या सिर्फ सही दिखता है।
तीन शुद्धता अपरिवर्तनीय
मोल्ट का डिज़ाइन तीन शुद्धता आक्रमणकारियों के आसपास व्यवस्थित है जो अतुल्यकालिक एजेंटिक प्रशिक्षण की सूक्ष्म विफलताओं को संबोधित करता है। टोकन पहचान का मतलब है कि नमूनाकृत टोकन आईडी प्रक्षेपवक्र को परिभाषित करते हैं, न कि एक पुन:टोकनीकृत प्रतिलेख - महत्वपूर्ण है क्योंकि पाठ को वापस टोकन में सिलाई करने से डेटा चुपचाप बदल सकता है। नीति-संस्करण शब्दार्थ यह सुनिश्चित करता है कि प्रशिक्षित टोकन अपनी व्यवहार-नीति लॉग-संभावनाएं बनाए रखें, अनुक्रम-स्तरीय गेट के पीछे प्रति टोकन अतुल्यकालिक उपयोग को सही किया जाए। आगे की स्थिरता के लिए आवश्यक है कि रोलआउट इंजन और प्रशिक्षण अभिनेता मॉडल शब्दार्थ पर सहमत हों।
वह अंतिम अपरिवर्तनीयता विशेषज्ञों के मिश्रण (एमओई) नीतियों के लिए सबसे अधिक मायने रखती है, जो तेजी से सामान्य होती जा रही हैं। रोलआउट और प्रशिक्षण राउटर स्वतंत्र रूप से विशेषज्ञों का चयन करते हैं, और छोटे संख्यात्मक अंतर टॉप-के विकल्पों को पलट सकते हैं, जिससे जो नमूना लिया गया था और जिस पर प्रशिक्षण दिया जा रहा है, उसके बीच एक बेमेल पैदा होता है। मोल्ट इसे रोलआउट रूटिंग रिप्ले के साथ संबोधित करता है: वीएलएलएम अपनी प्रति-टोकन विशेषज्ञ आईडी लौटाता है, और प्रशिक्षण फॉरवर्ड पास उन सटीक रूटिंग निर्णयों को फिर से प्राप्त करने के बजाय उन्हें दोहराता है।
यह किस लिए है
शिप किए गए व्यंजन और उपयोग के मामले उस ओर इशारा करते हैं जहां एनवीआईडीआईए मोल्ट को अपनाने की अपेक्षा करता है: मल्टी-टर्न टूल-उपयोग एजेंट, कोड-निष्पादन एजेंट, विज़न-भाषा वातावरण (फ्रेमवर्क में शिप किए गए जियो 3k रेसिपी शामिल हैं), एलएलएम-ए-जज रिवॉर्ड लूप, और एक छोटे छात्र मॉडल पर ऑन-पॉलिसी डिस्टिलेशन। ये वास्तव में कार्यभार हैं जिन्होंने पूरे उद्योग में एजेंटिक आरएल में वृद्धि को प्रेरित किया है, और प्रत्येक आंशिक-रोलआउट, एसिंक-सैंपलिंग स्थितियों के तहत सही होने के लिए कुख्यात है जो वास्तविक प्रशिक्षण लागू करता है।
व्यापक संकेत यह है कि एनवीआईडीआईए न केवल उन जीपीयू में निवेश कर रहा है जो एजेंटों को प्रशिक्षित करते हैं, बल्कि सॉफ्टवेयर स्टैक शोधकर्ता उन्हें बनाने के लिए उपयोग करते हैं। कोडबेस को छोटा और पठनीय रखकर - और इसे स्पष्ट रूप से डिज़ाइन करके ताकि एक एआई कोडिंग सहायक इसे संशोधित कर सके - मोल्ट एक शर्त को दर्शाता है कि एजेंटिक आरएल टूलींग का भविष्य उन मॉडलों के साथ सह-विकसित किया जाएगा जो इसका उपयोग करते हैं।
एआई से आगे रहें
फ्रंटियर एजेंटों को कैसे प्रशिक्षित किया जाता है, इसकी रूपरेखा के बारे में अधिक जानकारी के लिए, नवीनतम एआई विकास के लिए हमारे हब का अनुसरण करें।
अधिक AI समाचार पढ़ें →
