Imejengwa Ili Isomwe, Sio Kukimbia Tu
Kama MarkTechPost inavyoripoti, Molt hupima takribani mistari 8.6K ya msimbo wa RL, inayohesabiwa kwa kufuatilia grafu ya kuingiza kutoka kwa kila sehemu ya RL ya mfumo. Mbinu hiyo hiyo inajumlisha takriban mistari 62K kwa verl, 25K kwa slime, na 7.2K kwa OpenRLHF. Ushikamano huo wa kimakusudi ndio msingi mkuu wa mradi: utafiti wa RL wa kikali ni urekebishaji wa kanuni za mara kwa mara - wakadiriaji wapya, hatua mpya za bomba, miradi mipya ya uchapishaji - na katika mifumo ya kawaida kila mabadiliko ya nyuzi kupitia safu za mkufunzi, rudufu iliyosambazwa, na gundi ya uchapishaji. Molt inalenga kuondoa msuguano huo.
Mfumo huu una Apache 2.0 iliyopewa leseni na meli zilizo na misimbo ya uzinduzi, hati za Slurm, na kontena lililoundwa awali. NVIDIA ni wazi, hata hivyo, kwamba karatasi ya utafiti inayoandamana inaweka Molt kama miundombinu ya utafiti badala ya huduma ya mafunzo ya uzalishaji, na maunzi ndio mlinda lango halisi. Mapishi yanayosafirishwa huchukua nodi 2 za GPU 8 za H100, zikigawanyika 8 kwa mafunzo na 8 kwa uchapishaji. Hiyo inaiweka ndani ya kufikia mipaka na maabara zinazopakana na mipaka, wanaoanza wanaofadhiliwa vyema wanaofanya mafunzo ya baada ya mafunzo, vikundi vya utafiti vya AI vya biashara, na vikundi vya wasomi vilivyo na ufikiaji wa nodi nyingi H100 au H200.
Imetungwa, Haijagawanyika
Usanifu wa Molt unajumuisha zana tatu zilizopo bila kugawa yoyote kati yao, kwa hivyo uboreshaji wa mkondo hufika kama pini ya kontena badala ya uondoaji chungu. Inatumia Ray kwa uwekaji na foleni zisizolingana, vLLM kwa uchapishaji, na NVIDIA AutoModel iliyo na FSDP2 kwa mafunzo. Muda wa utekelezaji unajumuisha kundi la wakala, seti ya injini za vLLM nyuma ya kipanga njia cha ombi, na mwigizaji mmoja wa sera anayeweza kufunzwa. Bwawa la kutiririsha hudumisha vikundi vya arifa ili injini zisichoke wakati mwigizaji akifanya mazoezi.
Kipengele kiitwacho utoaji sehemu ni kitovu cha ufanisi. Sera inaposasishwa, Molt husitisha injini, hutangaza vipande vilivyosasishwa vya mwigizaji juu ya NCCL moja kwa moja kwa kila injini, na kurejesha maombi yaliyorejeshwa badala ya kuyatupa. Hiyo huepuka mtindo mbaya wa kutupa uchapishaji unaoendelea kila wakati muundo unapobadilika.
Moduli Moja, Fomu Mbili za Wakala
RL inayoendeshwa katika Molt inataja moduli moja ya Python ambayo husafirisha AgentRunner, na kila kitu kingine - ikiwa ni pamoja na kazi ya zawadi - ni msimbo wa kawaida. Mfumo unaunga mkono fomu mbili. Kwa Env, mfumo huu unamiliki kitanzi cha LLM ndani ya `hatua()` iliyopangiliwa kwa Gymnasium, ambayo inalingana na mchoro unaojulikana wa uimarishaji-kujifunza. Kwa ChatAgent, mtumiaji anamiliki kitanzi kupitia OpenAI ya hisa au Anthropic SDK, na kuifanya iwe rahisi kufunga wakala aliyepo.
Ili kuunganisha zote mbili, Molt huzindua seva ya kurudi nyuma ambayo inazungumza itifaki zote mbili za waya, na kila ombi huwekwa kwenye upande wa seva kuwa mkusanyiko mmoja wa tokeni. Wakati wakala wa upeo wa macho unachanganya muktadha wake na kuandika upya kiambishi awali - operesheni ya kawaida kwa mawakala ambao hufanya zamu nyingi - seva hufunga sehemu ya sasa na kufungua mpya kiotomatiki. Hii ni aina ya maelezo ya mabomba ambayo huamua kama kikali RL kukimbia ni sahihi katika mazoezi au inaonekana tu sahihi.
Vigezo vitatu vya Usahihi
Muundo wa Molt umepangwa karibu na vibadilishio vitatu vya usahihi ambavyo hushughulikia hitilafu za hila za mafunzo ya mawakala yasiyolingana. Utambulisho wa ishara unamaanisha vitambulisho vya sampuli vya tokeni vinavyofafanua mwelekeo, si manukuu yaliyopewa alama tena - muhimu kwa sababu kuunganisha maandishi kwenye tokeni kunaweza kubadilisha data kimyakimya. Semantiki za toleo la sera huhakikisha tokeni zinazoweza kufunzwa zinaweka uwezekano wa kumbukumbu ya sera ya tabia, huku matumizi yasiyolingana yakisahihishwa kwa kila tokeni nyuma ya lango la kiwango cha mfuatano. Uthabiti wa mbele unahitaji kwamba injini ya uchapishaji na mwigizaji wa mafunzo wakubaliane kuhusu semantiki za modeli.
Tofauti hiyo ya mwisho ni muhimu zaidi kwa sera za mchanganyiko wa wataalam (MoE), ambazo zinazidi kuwa maarufu. Vipanga njia vya uchapishaji na mafunzo huchagua wataalam kwa kujitegemea, na tofauti ndogo za nambari zinaweza kubadilisha chaguo za juu, na kusababisha kutolingana kati ya kile kilichotolewa na kile kinachofunzwa. Molt hushughulikia hili kwa uchezaji wa uelekezaji wa uchapishaji: vLLM hurejesha vitambulisho vyake vya kitaalamu kwa kila tokeni, na pasi ya kupeleka mbele ya mafunzo inarudia yale maamuzi kamili ya uelekezaji badala ya kuyapata tena.
##Ni Kwa Ajili Ya Nini
Mapishi yaliyosafirishwa na matukio ya utumiaji yanaelekeza ambapo NVIDIA inatarajia kupitishwa kwa Molt: mawakala wa matumizi ya zana mbalimbali, mawakala wa utekelezaji wa kanuni, mazingira ya lugha ya maono (mfumo unajumuisha kichocheo cha geo3k kilichosafirishwa), vitanzi vya malipo ya LLM-as-judge, na utegaji wa sera kwenye mtindo mdogo wa mwanafunzi. Hizi ndizo mzigo wa kazi ambao umesababisha kuongezeka kwa RL ya kiajenti katika tasnia nzima, na kila moja ina sifa mbaya kupata haki chini ya uwasilishaji wa sehemu, masharti ya sampuli zisizolingana ambayo mafunzo halisi huweka.
Ishara pana ni kwamba NVIDIA haiwekezaji tu katika GPU zinazotoa mafunzo kwa mawakala bali pia katika programu ya rafu ya watafiti kuziunda. Kwa kuweka msingi wa msimbo kuwa mdogo na unaoweza kusomeka - na kuusanifu kwa uwazi ili msaidizi wa usimbaji wa AI aweze kuirekebisha - Molt inaonyesha dau kwamba mustakabali wa zana za kikali za RL utaundwa pamoja na miundo inayoitumia.
Kaa Mbele ya AI
Kwa maelezo zaidi kuhusu mifumo ya kuunda upya jinsi mawakala wa mipakani wanavyofunzwa, fuata kitovu chetu cha maendeleo ya hivi punde ya AI.
Soma habari zaidi za AI →
