படிக்கக் கட்டப்பட்டது, ஓடுவது மட்டுமல்ல
MarkTechPost அறிக்கையின்படி, Molt தோராயமாக 8.6K RL குறியீடுகளை அளவிடுகிறது, ஒவ்வொரு கட்டமைப்பின் RL நுழைவுப் புள்ளியிலிருந்தும் இறக்குமதி வரைபடத்தைக் கண்டறிந்து கணக்கிடப்படுகிறது. இதே முறையானது verl க்கு 62K வரிகளையும், slime க்கு 25K வரிகளையும், OpenRLHFக்கு 7.2K வரிகளையும் கணக்கிடுகிறது. அந்த வேண்டுமென்றே கச்சிதமானதுதான் திட்டத்தின் மைய சுருதி: ஏஜென்டிக் RL ஆராய்ச்சி என்பது நிலையான அல்காரிதம் மாற்றமாகும் - புதிய மதிப்பீட்டாளர்கள், புதிய பைப்லைன் நிலைகள், புதிய வெளியீடு திட்டங்கள் - மற்றும் பிரதான கட்டமைப்பில் பயிற்சியாளர், விநியோகிக்கப்பட்ட பின்தளம் மற்றும் ரோல்அவுட் க்ளூவின் அடுக்குகள் மூலம் ஒவ்வொரு மாற்றும் இழைகள். மோல்ட் அந்த உராய்வை அகற்றுவதை நோக்கமாகக் கொண்டுள்ளது.கட்டமைப்பானது அப்பாச்சி 2.0 உரிமம் பெற்றது மற்றும் வெளியீட்டு குறியீடுகள், ஸ்லர்ம் ஸ்கிரிப்ட்கள் மற்றும் முன்பே கட்டப்பட்ட கொள்கலன் ஆகியவற்றைக் கொண்டுள்ளது. எவ்வாறாயினும், அதனுடன் வரும் ஆராய்ச்சிக் கட்டுரையானது உற்பத்திப் பயிற்சி சேவையாக இல்லாமல் ஆராய்ச்சி உள்கட்டமைப்பாக மோல்ட்டை நிலைநிறுத்துகிறது என்பதும், வன்பொருள்தான் உண்மையான கேட் கீப்பர் என்பதும் என்விடியா தெளிவாக உள்ளது. அனுப்பப்பட்ட ரெசிபிகள் 8 H100 GPUகளின் 2 முனைகள், பயிற்சிக்காக 8 மற்றும் ரோல் அவுட்டுக்காக 8 பிரிக்கப்படுகின்றன. இது எல்லைப்புற மற்றும் எல்லைக்கு அருகில் உள்ள ஆய்வகங்கள், நன்கு நிதியளிக்கப்பட்ட தொடக்கப் பயிற்சிக்குப் பிந்தைய பயிற்சி, நிறுவன AI ஆராய்ச்சி குழுக்கள் மற்றும் மல்டி-நோட் H100 அல்லது H200 அணுகலைக் கொண்ட கல்விக் குழுக்களின் அணுகலை அடைய வைக்கிறது.
இயற்றப்பட்டது, முட்கரண்டி அல்ல
மோல்ட்டின் கட்டிடக்கலை ஏற்கனவே உள்ள மூன்று கருவிகளை அவற்றில் எதையும் பிரிக்காமல் உருவாக்குகிறது, எனவே அப்ஸ்ட்ரீம் மேம்பாடுகள் வலிமிகுந்த மறுசீரமைப்பைக் காட்டிலும் கொள்கலன் பின்னாக வருகின்றன. இது வேலை வாய்ப்பு மற்றும் ஒத்திசைவற்ற வரிசைகளுக்கு ரே, ரோல்அவுட்டிற்கு vLLM மற்றும் பயிற்சிக்காக NVIDIA AutoModel with FSDP2 ஆகியவற்றைப் பயன்படுத்துகிறது. இயக்க நேரம் ஒரு ஏஜென்ட் பூல், ஒரு கோரிக்கை திசைவிக்கு பின்னால் உள்ள vLLM இன்ஜின்களின் தொகுப்பு மற்றும் ஒரு பயிற்சியளிக்கக்கூடிய கொள்கை நடிகர் ஆகியவற்றைக் கொண்டுள்ளது. ஒரு ஸ்ட்ரீமிங் குளம் உடனடி குழுக்களை பறக்க வைக்கிறது, எனவே நடிகர் பயிற்சியின் போது என்ஜின்கள் ஒருபோதும் வெளியேறாது.
பகுதி வெளியீடு எனப்படும் அம்சம் செயல்திறனுக்கு மையமானது. கொள்கை புதுப்பிக்கப்படும் போது, மோல்ட் என்ஜின்களை இடைநிறுத்துகிறார், நடிகரின் புதுப்பிக்கப்பட்ட துண்டுகளை NCCL மூலம் நேரடியாக ஒவ்வொரு இன்ஜினிலும் ஒளிபரப்புகிறார், மேலும் தக்கவைக்கப்பட்ட கோரிக்கைகளை நிராகரிக்காமல் மீண்டும் தொடங்குகிறார். ஒவ்வொரு முறையும் மாதிரி மாறும் போது, செயல்பாட்டில் உள்ள வெளியீடுகளை தூக்கி எறியும் வீணான வடிவத்தைத் தவிர்க்கிறது.ஒரு தொகுதி, இரண்டு முகவர் படிவங்கள்
மோல்ட்டில் இயங்கும் RL ஆனது AgentRunnerஐ ஏற்றுமதி செய்யும் ஒற்றை பைதான் தொகுதிக்கு பெயரிடுகிறது, மற்ற அனைத்தும் - வெகுமதி செயல்பாடு உட்பட - சாதாரண குறியீடாகும். கட்டமைப்பு இரண்டு வடிவங்களை ஆதரிக்கிறது. Env உடன், ஜிம்னாசியம்-சீரமைக்கப்பட்ட `படி()` உள்ளே உள்ள LLM லூப்பை ஃப்ரேம்வொர்க் கொண்டுள்ளது, இது பழக்கமான வலுவூட்டல்-கற்றல் முறைக்கு பொருந்தும். ChatAgent உடன், பயனர் OpenAI அல்லது Anthropic SDK மூலம் லூப்பைச் சொந்தமாக வைத்திருக்கிறார், இது ஏற்கனவே உள்ள முகவரை நேரடியாக மடக்குகிறது.
இரண்டையும் இணைக்க, மோல்ட் ஒரு லூப்பேக் சர்வரை தொடங்குகிறார், அது இரண்டு வயர் நெறிமுறைகளையும் பேசுகிறது, மேலும் ஒவ்வொரு கோரிக்கையும் சர்வர்-பக்கம் ஒரு டோக்கன்-சரியான குவிப்பாக டிகோட் செய்யப்படுகிறது. ஒரு நீண்ட அடிவான முகவர் அதன் சூழலைச் சுருக்கி, முன்னொட்டை மீண்டும் எழுதும் போது - பல திருப்பங்களுக்கு இயங்கும் முகவர்களுக்கான பொதுவான செயல்பாடு - சேவையகம் தற்போதைய பிரிவை சீல் செய்து தானாகவே புதிய ஒன்றைத் திறக்கும். ஏஜென்டிக் RL ரன் நடைமுறையில் சரியானதா அல்லது சரியாகத் தோன்றுகிறதா என்பதைத் தீர்மானிக்கும் பிளம்பிங் விவரம் இதுவாகும்.
மூன்று திருத்தங்கள் மாறாதவை
மோல்ட்டின் வடிவமைப்பு, ஒத்திசைவற்ற முகவர் பயிற்சியின் நுட்பமான தோல்விகளை நிவர்த்தி செய்யும் மூன்று சரியான மாறுபாடுகளைச் சுற்றி ஒழுங்கமைக்கப்பட்டுள்ளது. டோக்கன் அடையாளம் என்பது மாதிரியான டோக்கன் ஐடிகள் பாதையை வரையறுக்கிறது, மறுதொடக்கம் செய்யப்பட்ட டிரான்ஸ்கிரிப்ட் அல்ல - முக்கியமானது, ஏனெனில் உரையை மீண்டும் டோக்கன்களாக தைப்பது தரவை அமைதியாக மாற்றும். கொள்கை-பதிப்பு சொற்பொருள் பயிற்சியளிக்கக்கூடிய டோக்கன்கள் அவற்றின் நடத்தை-கொள்கை பதிவு-நிகழ்தகவுகளை வைத்திருப்பதை உறுதிசெய்கிறது, ஒரு வரிசை-நிலை கேட் பின்னால் ஒரு டோக்கனுக்கு ஒத்திசைவற்ற பயன்பாடு சரி செய்யப்படுகிறது. முன்னோக்கி நிலைத்தன்மைக்கு ரோல் அவுட் இயந்திரமும் பயிற்சி நடிகரும் மாதிரி சொற்பொருளில் உடன்பட வேண்டும்.
நிபுணர்களின் கலவை (MoE) கொள்கைகளுக்கு கடைசி மாறாதது மிகவும் முக்கியமானது. ரோல்அவுட் மற்றும் பயிற்சி ரவுட்டர்கள் நிபுணர்களைத் தேர்ந்தெடுக்கின்றன, மேலும் சிறிய எண்ணிக்கையிலான வேறுபாடுகள் டாப்-கே தேர்வுகளை புரட்டலாம், இது மாதிரி எடுக்கப்பட்டதற்கும் பயிற்சியளிக்கப்பட்டவற்றுக்கும் இடையே பொருந்தாத தன்மையை உருவாக்குகிறது. மோல்ட் இதை ரோல்அவுட் ரூட்டிங் ரீப்ளே மூலம் நிவர்த்தி செய்கிறது: vLLM அதன் ஒவ்வொரு டோக்கன் நிபுணத்துவ ஐடிகளையும் வழங்குகிறது, மேலும் பயிற்சி முன்னோக்கி அனுப்புவது அந்த சரியான ரூட்டிங் முடிவுகளை மீண்டும் பெறுவதற்குப் பதிலாக மீண்டும் இயக்குகிறது.இது எதற்காக
அனுப்பப்பட்ட சமையல் குறிப்புகளும் பயன்பாட்டு நிகழ்வுகளும் மோல்ட் ஏற்றுக்கொள்ளப்பட வேண்டும் என்று NVIDIA எதிர்பார்க்கிறது: மல்டி-டர்ன் டூல்-யூஸ் ஏஜென்ட்கள், கோட்-எக்ஸிகியூஷன் ஏஜெண்டுகள், பார்வை-மொழி சூழல்கள் (கட்டமைப்பில் அனுப்பப்பட்ட ஜியோ3கே செய்முறையும் அடங்கும்), LLM-ஆக-நீதிபதி ரிவார்டு லூப்கள் மற்றும் ஒரு சிறிய மாணவர் மாதிரியில் பாலிசி வடிகட்டுதல். இவை துல்லியமாக தொழில்துறை முழுவதும் முகவர் RL இன் எழுச்சியை உந்திய பணிச்சுமையாகும், மேலும் ஒவ்வொன்றும் உண்மையான பயிற்சி விதிக்கும் பகுதி-வெளியேற்றம், ஒத்திசைவு-மாதிரி நிலைமைகளின் கீழ் சரியாகப் பெறுவதற்கு மிகவும் மோசமானவை.
NVIDIA ஆனது முகவர்களைப் பயிற்றுவிக்கும் GPU களில் மட்டும் முதலீடு செய்யாமல், மென்பொருள் அடுக்கு ஆராய்ச்சியாளர்கள் அவற்றை உருவாக்கப் பயன்படுத்துகிறது என்பது பரந்த சமிக்ஞையாகும். குறியீட்டுத் தளத்தை சிறியதாகவும் படிக்கக்கூடியதாகவும் வைத்திருப்பதன் மூலம் - மற்றும் AI குறியீட்டு உதவியாளர் அதை மாற்றியமைக்கும் வகையில் வெளிப்படையாக வடிவமைப்பதன் மூலம் - முகவர் RL கருவியின் எதிர்காலம் அதைப் பயன்படுத்தும் மாதிரிகளுடன் இணைந்து உருவாக்கப்படும் என்று மோல்ட் ஒரு பந்தயத்தை பிரதிபலிக்கிறது.
AIக்கு முன்னால் இருங்கள்
எல்லைப்புற முகவர்கள் எவ்வாறு பயிற்சியளிக்கப்படுகிறார்கள் என்பதை மாற்றியமைக்கும் கட்டமைப்பைப் பற்றி மேலும் அறிய, சமீபத்திய AI மேம்பாடுகளுக்கு எங்கள் மையத்தைப் பின்தொடரவும்.
மேலும் AI செய்திகளைப் படிக்கவும் →
