បង្កើតឡើងដើម្បីអាន មិនមែនគ្រាន់តែដំណើរការទេ។
ដូចដែល MarkTechPost រាយការណ៍ Molt វាស់ប្រហែល 8.6K បន្ទាត់នៃកូដ RL រាប់ដោយការតាមដានក្រាហ្វនាំចូលពីចំណុចចូល RL របស់ក្របខ័ណ្ឌនីមួយៗ។ វិធីសាស្ត្រដូចគ្នានេះមានកំពស់ប្រហែល 62K សម្រាប់ verl, 25K សម្រាប់ slime និង 7.2K សម្រាប់ OpenRLHF ។ ការបង្រួមដោយចេតនានោះគឺជាចំណុចកណ្តាលរបស់គម្រោង៖ ការស្រាវជ្រាវ RL ភ្នាក់ងារគឺជាការកែប្រែក្បួនដោះស្រាយថេរ — ការប៉ាន់ប្រមាណថ្មី ដំណាក់កាលបំពង់ថ្មី គ្រោងការណ៍ដាក់ចេញថ្មី — និងនៅក្នុងក្របខ័ណ្ឌសំខាន់ៗ រាល់ការផ្លាស់ប្តូរខ្សែស្រលាយតាមរយៈស្រទាប់គ្រូបង្វឹក ការចែកចាយខាងក្រោយ និងកាវដាក់ចេញ។ Molt មានបំណងដកការកកិតនោះចេញ។
ក្របខ័ណ្ឌនេះគឺ កម្មវិធី Apache 2.0 មានអាជ្ញាប័ណ្ណ និងដឹកជញ្ជូនជាមួយនឹងលេខកូដចាប់ផ្តើម ស្គ្រីប Slurm និងធុងដែលបានសាងសង់ជាមុន។ ទោះជាយ៉ាងណាក៏ដោយ NVIDIA ច្បាស់ណាស់ថាឯកសារស្រាវជ្រាវដែលភ្ជាប់មកជាមួយដាក់ Molt ជាហេដ្ឋារចនាសម្ព័ន្ធស្រាវជ្រាវជាជាងសេវាកម្មបណ្តុះបណ្តាលផលិតកម្ម ហើយផ្នែករឹងគឺជាអ្នកការពារពិតប្រាកដ។ រូបមន្តដែលបានដឹកជញ្ជូនសន្មត់ថា 2 ថ្នាំងនៃ 8 H100 GPUs បំបែក 8 សម្រាប់ការបណ្តុះបណ្តាល និង 8 សម្រាប់ដំណើរការ។ ដែលធ្វើឱ្យវាអាចទៅដល់មន្ទីរពិសោធន៍ដែលនៅជាប់ព្រំដែន និងជាប់ព្រំដែន ការចាប់ផ្តើមអាជីវកម្មដែលទទួលបានមូលនិធិល្អដែលកំពុងធ្វើការក្រោយការបណ្តុះបណ្តាល ក្រុមស្រាវជ្រាវ AI សហគ្រាស និងក្រុមសិក្សាដែលមានការចូលប្រើពហុថ្នាំង H100 ឬ H200 ។
ផ្សំឡើង មិនមែនចង
ស្ថាបត្យកម្មរបស់ Molt ផ្សំឡើងនូវឧបករណ៍ដែលមានស្រាប់ចំនួនបីដោយមិនចាំបាច់បិទពួកវាណាមួយឡើយ ដូច្នេះការកែលម្អចរន្តមកដល់ជាម្ជុលកុងតឺន័រ ជាជាងការស្តារឡើងវិញដ៏ឈឺចាប់។ វាប្រើ Ray សម្រាប់ការដាក់ និងជួរអសមកាល vLLM សម្រាប់ការដាក់ឱ្យដំណើរការ និង NVIDIA AutoModel ជាមួយ FSDP2 សម្រាប់ការបណ្តុះបណ្តាល។ ពេលវេលាដំណើរការមានក្រុមភ្នាក់ងារមួយ សំណុំនៃម៉ាស៊ីន vLLM នៅពីក្រោយរ៉ោតទ័រសំណើ និងតួអង្គគោលនយោបាយដែលអាចហ្វឹកហាត់បានតែមួយ។ អាងស្ទ្រីមរក្សាក្រុមភ្លាមៗក្នុងការហោះហើរ ដូច្នេះម៉ាស៊ីនមិនបង្ហូរចេញទេពេលតួសម្តែងកំពុងហ្វឹកហាត់។
លក្ខណៈពិសេសមួយហៅថា ការចេញផ្សាយដោយផ្នែក គឺជាចំណុចសំខាន់នៃប្រសិទ្ធភាព។ នៅពេលដែលគោលការណ៍ធ្វើបច្ចុប្បន្នភាព Molt ផ្អាកម៉ាស៊ីន ផ្សាយការអាប់ដេតរបស់តួសម្តែងនៅលើ NCCL ដោយផ្ទាល់ទៅកាន់ម៉ាស៊ីននីមួយៗ ហើយបន្តសំណើដែលបានរក្សាទុកជាជាងការបោះបង់ពួកគេ។ នោះជៀសវាងគំរូខ្ជះខ្ជាយនៃការបោះចោលការចេញផ្សាយដែលកំពុងដំណើរការរាល់ពេលដែលការផ្លាស់ប្តូរគំរូ។
ម៉ូឌុលមួយ ទម្រង់ភ្នាក់ងារពីរ
RL រត់ក្នុង Molt ដាក់ឈ្មោះម៉ូឌុល Python តែមួយដែលនាំចេញ AgentRunner ហើយអ្វីៗផ្សេងទៀត — រួមទាំងមុខងាររង្វាន់ — គឺជាកូដធម្មតា។ ក្របខ័ណ្ឌគាំទ្រទម្រង់ពីរ។ ជាមួយនឹង Env ក្របខ័ណ្ឌគ្រប់គ្រង LLM នៅខាងក្នុង 'ជំហាន()' ដែលតម្រឹមកន្លែងហាត់ប្រាណ ដែលសមនឹងលំនាំការពង្រឹងការរៀនសូត្រដែលធ្លាប់ស្គាល់។ ជាមួយនឹង ChatAgent អ្នកប្រើប្រាស់ជាម្ចាស់រង្វិលជុំតាមរយៈភាគហ៊ុន OpenAI ឬ Anthropic SDK ដែលធ្វើឱ្យវាមានភាពត្រង់ក្នុងការរុំភ្នាក់ងារដែលមានស្រាប់។
ដើម្បីភ្ជាប់ទាំងពីរ Molt បើកដំណើរការ ម៉ាស៊ីនមេរង្វិលជុំ ដែលនិយាយទាំងពិធីការខ្សែ ហើយរាល់សំណើទាំងអស់ត្រូវបានឌិកូដផ្នែកខាងម៉ាស៊ីនមេទៅជាសញ្ញាសម្ងាត់តែមួយ។ នៅពេលដែលភ្នាក់ងារផ្តេកវែងបង្រួមបរិបទរបស់វា ហើយសរសេរបុព្វបទឡើងវិញ — ប្រតិបត្តិការទូទៅសម្រាប់ភ្នាក់ងារដែលដំណើរការជាច្រើនវេន — ម៉ាស៊ីនមេបិទផ្នែកបច្ចុប្បន្ន ហើយបើកថ្មីដោយស្វ័យប្រវត្តិ។ នេះគឺជាប្រភេទនៃព័ត៌មានលម្អិតអំពីបរិក្ខារដែលកំណត់ថាតើការដំណើរការភ្នាក់ងារ RL ត្រឹមត្រូវក្នុងការអនុវត្ត ឬគ្រាន់តែមើលទៅត្រឹមត្រូវ។
ការកែតម្រូវបីយ៉ាង
ការរចនារបស់ Molt ត្រូវបានរៀបចំឡើងជុំវិញបំរែបំរួលភាពត្រឹមត្រូវចំនួន 3 ដែលដោះស្រាយការបរាជ័យតិចតួចនៃការបណ្តុះបណ្តាលភ្នាក់ងារអសមកាល។ អត្តសញ្ញាណសញ្ញាសម្ងាត់ មានន័យថា លេខសម្គាល់និមិត្តសញ្ញាគំរូកំណត់គន្លង មិនមែនជាប្រតិចារិកដែលបានកំណត់ឡើងវិញទេ - សំខាន់ព្រោះការភ្ជាប់អត្ថបទត្រឡប់ទៅជាសញ្ញាសម្ងាត់អាចផ្លាស់ប្តូរទិន្នន័យដោយស្ងៀមស្ងាត់។ គោលការណ៍កំណែគោលនយោបាយ ធានាបាននូវសញ្ញាសម្ងាត់ដែលអាចបណ្តុះបណ្តាលបានរក្សានូវប្រូបាប៊ីលីតេនៃកំណត់ហេតុអាកប្បកិរិយា-គោលការណ៍របស់ពួកគេ ជាមួយនឹងការប្រើប្រាស់អសមកាលត្រូវបានកែតម្រូវក្នុងមួយសញ្ញាសម្ងាត់នៅពីក្រោយច្រកកម្រិតលំដាប់។ ភាពស៊ីសង្វាក់គ្នានៃការបញ្ជូនបន្ត តម្រូវឱ្យម៉ាស៊ីនដាក់ចេញ និងអ្នកហ្វឹកហាត់បានយល់ព្រមលើអត្ថន័យគំរូ។
ការប្រែប្រួលចុងក្រោយនេះមានសារៈសំខាន់បំផុតសម្រាប់ គោលនយោបាយចម្រុះនៃអ្នកជំនាញ (MoE) ដែលជារឿងធម្មតាកាន់តែខ្លាំងឡើង។ រ៉ោតទ័រដាក់ចេញ និងបណ្ដុះបណ្ដាលជ្រើសរើសអ្នកជំនាញដោយឯករាជ្យ ហើយភាពខុសគ្នាជាលេខតូចអាចត្រឡប់ជម្រើសកំពូលៗ ដែលបង្កើតឱ្យមានភាពមិនស៊ីគ្នារវាងអ្វីដែលបានយកគំរូតាម និងអ្វីដែលកំពុងបណ្តុះបណ្តាល។ Molt ដោះស្រាយវាជាមួយនឹង ការបញ្ជូនបន្ត routing replay: vLLM ត្រឡប់លេខសម្គាល់អ្នកជំនាញតាមសញ្ញាសម្ងាត់របស់វា ហើយការបញ្ជូនបន្តការបណ្តុះបណ្តាល ចាក់សារឡើងវិញនូវការសម្រេចចិត្តផ្លូវពិតប្រាកដទាំងនោះ ជាជាងយកពួកវាឡើងវិញ។
តើវាសម្រាប់អ្វី
រូបមន្តដែលបានដឹកជញ្ជូន និងករណីប្រើប្រាស់ចង្អុលទៅកន្លែងដែល NVIDIA រំពឹងថា Molt នឹងត្រូវបានអនុម័ត៖ ភ្នាក់ងារប្រើប្រាស់ឧបករណ៍ពហុវេន ភ្នាក់ងារប្រតិបត្តិកូដ បរិស្ថាននៃចក្ខុវិស័យ (ក្របខ័ណ្ឌរួមមានរូបមន្ត geo3k ដែលបានដឹកជញ្ជូន) រង្វិលជុំរង្វាន់ LLM ជាអ្នកវិនិច្ឆ័យ និងការចម្រាញ់តាមគោលការណ៍ទៅលើគំរូសិស្សតូចជាង។ ទាំងនេះគឺជាបន្ទុកការងារដែលបានជំរុញឱ្យមានការកើនឡើងនៃភ្នាក់ងារ RL នៅទូទាំងឧស្សាហកម្ម ហើយពួកគេម្នាក់ៗមានភាពមិនច្បាស់លាស់ក្នុងការទទួលបានសិទ្ធិក្រោមលក្ខខណ្ឌគំរូអសមកាលកម្មដែលការបណ្តុះបណ្តាលពិតប្រាកដដាក់ចេញដោយផ្នែក។
សញ្ញាកាន់តែទូលំទូលាយគឺថា NVIDIA កំពុងវិនិយោគមិនត្រឹមតែនៅក្នុង GPUs ដែលបណ្តុះបណ្តាលភ្នាក់ងារប៉ុណ្ណោះទេ ប៉ុន្តែនៅក្នុងកម្មវិធីដែលក្រុមអ្នកស្រាវជ្រាវប្រើដើម្បីបង្កើតពួកវា។ ដោយរក្សាមូលដ្ឋានកូដតូច និងអាចអានបាន — និងរចនាវាយ៉ាងច្បាស់ដើម្បីឱ្យអ្នកជំនួយការសរសេរកូដ AI អាចកែប្រែវាបាន — Molt ឆ្លុះបញ្ចាំងពីការភ្នាល់ដែលអនាគតនៃឧបករណ៍ RL ភ្នាក់ងារនឹងត្រូវបានបង្កើតឡើងរួមគ្នាជាមួយនឹងម៉ូដែលដែលប្រើវា។
នាំមុខ AI
សម្រាប់ព័ត៌មានបន្ថែមអំពីក្របខ័ណ្ឌនៃការរៀបចំឡើងវិញពីរបៀបដែលភ្នាក់ងារព្រំដែនត្រូវបានបណ្តុះបណ្តាល សូមតាមដានមជ្ឈមណ្ឌលរបស់យើងសម្រាប់ ការវិវត្តន៍ AI ចុងក្រោយបំផុត។
អានព័ត៌មាន AI បន្ថែម →
