ဖတ်ရန်တည်ဆောက်ထားရုံသာမဟုတ်ဘဲ Run ပါ။
MarkTechPost အစီရင်ခံစာအတိုင်း Molt သည် အကြမ်းဖျင်းအားဖြင့် RL ကုဒ်၏ 8.6K လိုင်းများ ကို တိုင်းတာပြီး framework ၏ RL entry point တစ်ခုစီမှ တင်သွင်းဂရပ်ကို ခြေရာခံခြင်းဖြင့် ရေတွက်သည်။ အလားတူနည်းလမ်းသည် verl အတွက် 62K လိုင်းများ၊ slime အတွက် 25K နှင့် OpenRLHF အတွက် 7.2K ခန့်ရှိသည်။ ထိုတမင်သက်သက် ကျစ်လျစ်မှုမှာ ပရောဂျက်၏ အဓိကအချက်ဖြစ်သည်- အေးဂျင့် RL သုတေသနသည် စဉ်ဆက်မပြတ် algorithm ပြုပြင်မွမ်းမံခြင်း— ခန့်မှန်းချက်အသစ်များ၊ ပိုက်လိုင်းအဆင့်အသစ်များ၊ ထုတ်လွှင့်မှုအစီအစဉ်များ — နှင့် ပင်မဘောင်ဘောင်များတွင် သင်တန်းဆရာအလွှာများ၊ ဖြန့်ဝေထားသော နောက်ခံအစွန်းများနှင့် ကော်ပြန့်သည့်အလွှာများမှတစ်ဆင့် အပိုင်းများကို ပြောင်းလဲသည်။ Molt သည် ထိုပွတ်တိုက်မှုကို ဖယ်ရှားရန် ရည်ရွယ်သည်။မူဘောင်သည် Apache 2.0 လိုင်စင်ရ ဖြစ်ပြီး လွှတ်တင်ကုဒ်များ၊ Slurm scripts နှင့် ကြိုတင်တည်ဆောက်ထားသော ကွန်တိန်နာများပါရှိသည်။ သို့သော် NVIDIA သည် သုတေသနစာတမ်းတွင် Molt အား ထုတ်လုပ်မှုလေ့ကျင့်ရေးဝန်ဆောင်မှုထက် သုတေသနအခြေခံအဆောက်အအုံအဖြစ် ရပ်တည်နေပြီး ဟာ့ဒ်ဝဲသည် စစ်မှန်သောတံခါးစောင့်ဖြစ်ကြောင်း NVIDIA မှ ရှင်းလင်းထားသည်။ ပေးပို့ထားသော ချက်ပြုတ်နည်းများသည် 8 H100 GPUs ၏ 2 node များကို လေ့ကျင့်ရန်အတွက် 8 ခု ခွဲပြီး 8 ကို စတင်အသုံးပြုနိုင်သည်ဟု ယူဆပါသည်။ ၎င်းသည် နယ်နိမိတ်နှင့် နယ်နိမိတ်ချင်းကပ်လျက် ဓာတ်ခွဲခန်းများ၊ လေ့ကျင့်ရေးအပြီးတွင် လုပ်ဆောင်နေသည့် ကောင်းစွာရန်ပုံငွေထောက်ပံ့ထားသော လုပ်ငန်းစတင်သူများ၊ လုပ်ငန်း AI သုတေသနအဖွဲ့များနှင့် ဘက်စုံ-node H100 သို့မဟုတ် H200 အသုံးပြုခွင့်ရှိသော ပညာရပ်ဆိုင်ရာအဖွဲ့များထံ ရောက်ရှိစေပါသည်။
##ဖွဲ့စည်းထားတယ်၊
Molt ၏ ဗိသုကာပညာသည် ၎င်းတို့ကို မည်ကဲ့သို့မျှ မခွဲဘဲ ရှိပြီးသား ကိရိယာ သုံးခုကို ပေါင်းစပ်ထားသောကြောင့် နာကျင်စွာ ပြန်လည် အခြေစိုက်ခြင်းထက် ကွန်တိန်နာ ပင်နံပါတ်ကဲ့သို့ တိုးတက်မှုများ ရောက်ရှိလာပါသည်။ ၎င်းသည် နေရာချထားခြင်းနှင့် အညီအမျှ တန်းစီခြင်းအတွက် Ray၊ လွှင့်တင်ရန်အတွက် vLLM နှင့် လေ့ကျင့်ရေးအတွက် NVIDIA AutoModel နှင့်အတူ FSDP2 ကို အသုံးပြုသည်။ runtime တွင် အေးဂျင့်ပေါင်းစုတစ်ခု၊ တောင်းဆိုချက်ရောက်တာနောက်ကွယ်ရှိ vLLM အင်ဂျင်အစုံနှင့် လေ့ကျင့်နိုင်သော မူဝါဒတစ်ခုတည်း ပါဝင်ပါသည်။ တိုက်ရိုက်ထုတ်လွှင့်သည့်ရေကန်သည် ပျံသန်းမှုတွင် အုပ်စုများကို အချက်ပြနေစေသောကြောင့် သရုပ်ဆောင်ရထားစီးနေချိန်တွင် အင်ဂျင်များ မည်သည့်အခါမျှ ယိုယွင်းမည်မဟုတ်ပေ။
partial rollout ဟုခေါ်သော လုပ်ဆောင်ချက်သည် ထိရောက်မှု အတွက် အဓိကဖြစ်သည်။ မူဝါဒကို အပ်ဒိတ်လုပ်သည့်အခါ Molt သည် အင်ဂျင်များကို ခေတ္တရပ်လိုက်ပြီး NCCL မှ သရုပ်ဆောင်များ၏ မွမ်းမံထားသောအပိုင်းများကို အင်ဂျင်တစ်ခုစီသို့ တိုက်ရိုက်ထုတ်လွှင့်ပြီး ၎င်းတို့ကို စွန့်ပစ်မည့်အစား သိမ်းဆည်းထားသည့် တောင်းဆိုချက်များကို ပြန်လည်စတင်သည်။ ၎င်းသည် မော်ဒယ်ပြောင်းလဲသည့်အခါတိုင်း လုပ်ဆောင်ဆဲ ဖြန့်ချိမှုများကို စွန့်ပစ်ခြင်း၏ ဖြုန်းတီးသည့်ပုံစံကို ရှောင်ရှားသည်။မော်ဂျူးတစ်ခု၊ ကိုယ်စားလှယ်ပုံစံနှစ်ခု
Molt တွင် လည်ပတ်နေသော RL တစ်ခုသည် AgentRunner ကို တင်ပို့သည့် Python module တစ်ခုအား အမည်ပေးမည်ဖြစ်ပြီး၊ ဆုပေးသည့်လုပ်ဆောင်ချက်အပါအဝင် အခြားအရာအားလုံးသည် သာမန်ကုဒ်ဖြစ်သည်။ မူဘောင်သည် ပုံစံနှစ်မျိုးကို ပံ့ပိုးပေးသည်။ Env ဖြင့်၊ မူဘောင်သည် ရင်းနှီးသော အားဖြည့်-သင်ယူမှုပုံစံနှင့် ကိုက်ညီသည့် Gymnasium-aligned `step()` အတွင်း LLM ကွင်းဆက်ကို ပိုင်ဆိုင်ပါသည်။ ChatAgent ဖြင့်၊ အသုံးပြုသူသည် စတော့ခ် OpenAI သို့မဟုတ် Anthropic SDK မှတဆင့် ကွင်းဆက်ကို ပိုင်ဆိုင်ပြီး ရှိပြီးသား အေးဂျင့်ကို ထုပ်ပိုးရန် ရိုးရှင်းစေသည်။
နှစ်ခုလုံးကို ပေါင်းကူးရန်အတွက် Molt သည် ဝါယာကြိုး ပရိုတိုကော နှစ်ခုလုံးကို ပြောသော loopback ဆာဗာ ကို ဖွင့်လိုက်ပြီး တောင်းဆိုမှုတိုင်းကို server-side မှ တိုကင်-အတိအကျ စုဆောင်းမှုတစ်ခုအဖြစ် သရုပ်ဖော်ထားသည်။ ရှည်လျားသောမိုးကုပ်စက်ဝိုင်း အေးဂျင့်သည် ၎င်း၏အကြောင်းအရာကို ကျစ်ကျစ်လျစ်လျစ်ပြီး အလှည့်အပြောင်းများစွာ လုပ်ဆောင်သည့် အေးဂျင့်များအတွက် ဘုံလုပ်ဆောင်ချက်—ရှေ့ဆက်ကို ပြန်လည်ရေးသားသည့်အခါ—ဆာဗာသည် လက်ရှိအပိုင်းကို တံဆိပ်ခတ်ပြီး အသစ်အသစ်တစ်ခုကို အလိုအလျောက်ဖွင့်ပေးသည်။ ဤသည်မှာ အေးဂျင့် RL လည်ပတ်မှု မှန်ကန်ခြင်း ရှိ၊ မရှိ ဆုံးဖြတ်ပေးသည့် ရေပိုက်အသေးစိတ် အမျိုးအစား ဖြစ်ပါသည်။
မှန်ကန်မှုပုံစံ ၃ မျိုး
Molt ၏ ဒီဇိုင်းသည် ပြတ်တောက်နေသော အေးဂျင့်လေ့ကျင့်မှု၏ သိမ်မွေ့သော ကျရှုံးမှုများကို ဖြေရှင်းပေးသည့် မှန်ကန်မှုမျိုးကွဲ (၃)မျိုးဖြင့် ဖွဲ့စည်းထားသည်။ token အထောက်အထား ဆိုသည်မှာ နမူနာပြထားသော တိုကင်အိုင်ဒီများသည် လမ်းကြောင်းကို သတ်မှတ်ခြင်းမဟုတ်ဘဲ ပြန်လည်တိုကင်ထားသော စာသားကို ပြန်လည်သတ်မှတ်ခြင်းဖြစ်သည် — အရေးကြီးသောအချက်မှာ တိုကင်များသို့ စာသားကို ပြန်လည်ပေါင်းစည်းခြင်းသည် ဒေတာကို တိတ်တဆိတ် ပြောင်းလဲနိုင်သောကြောင့် ဖြစ်သည်။ ပေါ်လစီ-ဗားရှင်း ဝေါဟာရများ သည် လေ့ကျင့်နိုင်သော တိုကင်များသည် ၎င်းတို့၏ အပြုအမူ-မူဝါဒ မှတ်တမ်း-ဖြစ်နိုင်ချေများကို ဆက်လက်ထိန်းသိမ်းထားရန် သေချာစေပြီး၊ ဆက်တိုက်-အဆင့် ဂိတ်တစ်ခု၏ နောက်ကွယ်တွင် တိုကင်တစ်ခုလျှင် အပြိုင်အဆိုင် အသုံးပြုမှုကို ပြုပြင်ထားသည်။ ရှေ့သို့ လိုက်လျောညီထွေဖြစ်မှု သည် စတင်ထုတ်လုပ်သည့်အင်ဂျင်နှင့် လေ့ကျင့်ရေးသရုပ်ဆောင်သည် မော်ဒယ်အသုံးအနှုန်းများအပေါ် သဘောတူညီရန် လိုအပ်သည်။
ဤနောက်ဆုံးပုံစံကွဲသည် ပိုများလာလေ့ရှိသည့် ပေါင်းစပ်ကျွမ်းကျင်သူများ (MoE) မူဝါဒများ အတွက် အရေးအကြီးဆုံးဖြစ်သည်။ မိတ်ဆက်ခြင်းနှင့် လေ့ကျင့်ရေးရောက်တာများသည် ကျွမ်းကျင်သူများကို လွတ်လပ်စွာရွေးချယ်ကြပြီး သေးငယ်သော ဂဏန်းကွဲပြားမှုများသည် နမူနာယူထားသည့်အရာနှင့် လေ့ကျင့်သင်ကြားထားသည့်အရာတို့ကြား မကိုက်ညီသည့် ထိပ်တန်းရွေးချယ်မှုများကို ဖြစ်ပေါ်စေနိုင်သည်။ Molt သည် ၎င်းကို စတင်ခြင်းလမ်းကြောင်းပြန်ဖွင့်ခြင်း ဖြင့်ဖြေရှင်းသည်- vLLM သည် ၎င်း၏တစ်ဦးချင်းစီတိုကင်ကျွမ်းကျင်သူ ids များကိုပြန်ပေးသည်၊ နှင့်လေ့ကျင့်ရေးရှေ့ဆင့်ဖြတ်သန်းမှုသည် ၎င်းတို့ကိုပြန်လည်ရယူခြင်းထက် တိကျသောလမ်းကြောင်းပေါ်ဆုံးဖြတ်ချက်များကိုပြန်လည်ပြသသည်။
##ဒါက ဘာအတွက်လဲ။
တင်ပို့ထားသော ချက်ပြုတ်နည်းများနှင့် အသုံးပြုမှုကိစ္စများသည် NVIDIA မှ Molt ကို လက်ခံကျင့်သုံးရန် မျှော်လင့်သည့်နေရာကို ညွှန်ပြသည်- ဘက်စုံသုံးကိရိယာ-အသုံးပြုမှုအေးဂျင့်များ၊ ကုဒ်လုပ်ဆောင်မှုအေးဂျင့်များ၊ အမြင်-ဘာသာစကားပတ်ဝန်းကျင်များ (မူဘောင်တွင် တင်ပို့ထားသော geo3k စာရွက်ပါဝင်သည်)၊ LLM-as-judge reward loops နှင့် သေးငယ်သော ကျောင်းသားပုံစံသို့ မူဝါဒပိုင်းဆိုင်ရာ ပေါင်းခံခြင်း။ ဤအရာများသည် လုပ်ငန်းခွင်အနှံ့ အေးဂျင့် RL တွင် အရှိန်အဟုန်မြင့်လာစေရန် တွန်းအားပေးသည့် အလုပ်ဝန်များဖြစ်ပြီး တစ်ခုစီသည် တစ်စိတ်တစ်ပိုင်း-စတင်ခြင်း၊ လေ့ကျင့်မှုပြုလုပ်သော async-sampling အခြေအနေများအောက်တွင် မှန်ကန်စွာရရှိရန် နာမည်ဆိုးဖြင့်ကျော်ကြားသည်။
ပိုမိုကျယ်ပြန့်သောအချက်မှာ NVIDIA သည် အေးဂျင့်များကိုလေ့ကျင့်ပေးသည့် GPU များတွင်သာမက ၎င်းတို့ကိုတည်ဆောက်ရန်အတွက် သုတေသီများအသုံးပြုသည့်ဆော့ဖ်ဝဲအစုအဝေးတွင်ပါ ရင်းနှီးမြှုပ်နှံနေခြင်းဖြစ်သည်။ ကုဒ်ဘေ့စ်ကို သေးငယ်ပြီး ဖတ်ရလွယ်ကူအောင်ထားရှိခြင်းဖြင့် — AI ကုဒ်ဒင်းလက်ထောက်က ၎င်းကိုမွမ်းမံနိုင်စေရန် အတိအလင်း ဒီဇိုင်းရေးဆွဲခြင်းဖြင့် — Molt သည် အေးဂျင့် RL tooling ၏ အနာဂတ်ကို ၎င်းကိုအသုံးပြုသည့် မော်ဒယ်များနှင့် တွဲဖက်တီထွင်မည့် အလောင်းအစားတစ်ခုကို ထင်ဟပ်စေသည်။
AI ထက်သာလွန်နေပါစေ။
နယ်ခြားစောင့်အေးဂျင့်များအား လေ့ကျင့်သင်ကြားပုံကို ပြန်လည်ပုံဖော်ခြင်းဆိုင်ရာ မူဘောင်များအကြောင်း နောက်ထပ်သိရှိရန်၊ နောက်ဆုံးပေါ် AI ဖွံ့ဖြိုးတိုးတက်မှုများ အတွက် ကျွန်ုပ်တို့၏ဗဟိုချက်ကို လိုက်နာပါ။
AI သတင်းအပြည့်အစုံကို ဖတ်ရှုရန် →
