ការរចនាចម្រុះពីអ្នកជំនាញតូច ប៉ុន្តែធំទូលាយ
យោងតាមការវិភាគលម្អិតនៅក្នុង MarkTechPost Instella-MoE-16B-A3B គឺជាគំរូ MoE សម្រាប់តែឌិកូដដែលមាន 16 ពាន់លានប៉ារ៉ាម៉ែត្រសរុបដែលធ្វើសកម្មភាពត្រឹមតែ 2.8 ពាន់លានក្នុងមួយនិមិត្តសញ្ញា។ ស្រទាប់ 27 នីមួយៗរបស់វាប្រើ អ្នកជំនាញចែករំលែក 2 នាក់ បូកនឹងអ្នកជំនាញផ្លូវ 6 នាក់ដែលត្រូវបានជ្រើសរើសពីក្រុម 64 ដែលមានទំហំលាក់នៃ 2048 ក្បាលយកចិត្តទុកដាក់ 16 និងវាក្យសព្ទនិមិត្តសញ្ញា 128,896 ។ គោលបំណង Multi-Token Prediction ត្រូវបានប្រើកំឡុងពេលហ្វឹកហាត់មុន និងពាក់កណ្តាលវគ្គបណ្តុះបណ្តាល។
ស្ថាបត្យកម្មតូចតាចនោះ ដែលជាកន្លែងតូចមួយនៃបណ្តាញ "ភ្ញាក់ឡើង" សម្រាប់សញ្ញាសម្ងាត់នីមួយៗ - គឺជាតក្កវិជ្ជាប្រសិទ្ធភាពដូចគ្នានៅពីក្រោយម៉ូដែលបើកចំហដែលមានតម្លៃថោកដែលបានដំណើរការទីផ្សារឡើងវិញកាលពីឆ្នាំមុន។ AMD បានបណ្តុះបណ្តាលគំរូនៅលើ 7.1 trillion tokens ដែលត្រូវបានដកចេញពីសាជីវកម្មបើកចំហ រួមមាន Nemotron-CC-v2, MegaMath, FineMath, RefineCode, និង TxT360 បន្ទាប់មកបានដំណើរការវគ្គបណ្តុះបណ្តាលពាក់កណ្តាលនៅលើ Dolma3 Dolmino 100B ឆ្លងកាត់វ៉ារ្យ៉ង់ទិន្នន័យចំនួនបីដែលត្រូវបានបញ្ចូលគ្នាដោយទម្ងន់មធ្យម។ ដំណាក់កាលបរិបទវែងលាតសន្ធឹងពី 4K ទៅ 64K tokens ដោយប្រើ YaRN ។
ការច្នៃប្រឌិតកម្រិតប្រព័ន្ធពីរ
ការចេញផ្សាយនេះមានជម្រើសរចនាសម្ព័ន្ធពីរដែល AMD គូសបញ្ជាក់ថាជាវិស្វកម្មដ៏មានអត្ថន័យឈ្នះ។ ទីមួយគឺ Gated Multi-head Latent Attention (Gated MLA) ដែលបន្ថែមច្រកចេញលទ្ធផលដែលបានរៀនស្រាលទៅ Multi-head Latent Attention។ ការព្យាករលីនេអ៊ែរដែលខិតខំប្រឹងប្រែងទទួលបានច្រកលក្ខខណ្ឌបញ្ចូលដែលត្រូវបានអនុវត្តច្រើនដងមុនពេលការព្យាករលទ្ធផល។
ទីពីរ FarSkip-Collective គឺជាគ្រោងការណ៍ការតភ្ជាប់ដែលហួសសម័យ និងដំណើរការដោយផ្នែកទៅក្នុង MoE និងស្រទាប់យកចិត្តទុកដាក់ ដោយត្រួតលើទំនាក់ទំនងអ្នកជំនាញ-ប៉ារ៉ាឡែលជាមួយការគណនា។ AMD រាយការណ៍ពី 12.7% ល្បឿននៃការបណ្តុះបណ្តាលមុន និងរហូតដល់ 39.2% កាត់បន្ថយពេលវេលាដើម្បីនិមិត្តសញ្ញាដំបូង នៅពេលបម្រើជាមួយអ្នកជំនាញស្របគ្នា។ សម្រាប់ក្រុមហ៊ុនដែលដាក់ Hardware របស់ខ្លួនលើតម្លៃដំណើរការ នោះគឺជាលេខដែលអ្នកទិញចង់ឃើញ។
គំរូគោលដ៏រឹងមាំសម្រាប់ម៉ូដែលបើកចំហពេញលេញ
នៅលើចំណុចត្រួតពិនិត្យមូលដ្ឋាន Instella-MoE ជាមធ្យម 76.7 ឆ្លងកាត់ការវាយតម្លៃដែល AMD ហៅថាលទ្ធផលខ្លាំងបំផុតក្នុងចំណោមម៉ូដែលដែលបើកចំហពេញលេញ។ ដែលធ្វើឱ្យវានាំមុខ Moonlight-16B-A3B (76.2), SmolLM3-3B-Base (70.5), OLMo-3-7B (70.1) និង OLMoE-1B-7B (61.9) ទោះបីជាវានៅតែដើរតាម Qwen3.5-4B-Base (79.5) ក៏ដោយ។ វានាំមុខនៅលើ WinoGrande ជាមួយនឹងពិន្ទុ 86.5 និងប្រកាស 65.7 នៅលើ HumanEval+ ។ សម្រាប់កិច្ចការបរិបទវែង វាជាមធ្យម 41.5 នៅលើ HELMET និង 79.4 នៅលើ RULER ។
ក្រោយការហ្វឹកហ្វឺនធ្វើឲ្យគំរូកាន់តែច្បាស់។ ពិន្ទុជាមធ្យមកើនឡើងពី 71.58 បន្ទាប់ពីការលៃតម្រូវការផាកពិន័យទៅ 72.67 បន្ទាប់ពី DPO និង 73.22 នៅក្នុងការកំណត់រចនាសម្ព័ន្ធ "Think" ដោយយកឈ្នះ Olmo3-7B-Think (71.97), Gemma-4-E4B Think (70.47) និង Qwen3.5-73B (6. តាមការណែនាំ IFEval កើនឡើងពី 77.08 ទៅ 83.70។
រូបមន្តក្រោយការបណ្តុះបណ្តាលគឺគួរឱ្យកត់សម្គាល់។ បន្ទាប់ពី SFT លើល្បាយ Dolci-Think-SFT-7B និង Nemotron នោះ AMD ដំណើរការ DPO ជាមួយនឹងការអាប់ដេតលើរ៉ោតទ័រ ហើយការបាត់បង់តុល្យភាពផ្ទុកជំនួយត្រូវបានបិទ ដើម្បីជៀសវាងការរិចរិល។ ការរៀនពង្រឹងបន្ទាប់មកបន្តនៅក្នុង Miles framework របស់ AMD៖ ជំហាន 1,400 នៃការណែនាំ RLVR បន្តដោយ Multi-Teacher On-Policy Distillation ដែលធ្វើអោយការទទួលបានមកវិញដោយមិនលះបង់ការអនុវត្តគណិតវិទ្យា ឬកូដ។
ការចាប់អាជ្ញាបណ្ណ
មានការព្រមានដែលសំខាន់សម្រាប់អ្នកប្រើប្រាស់ពាណិជ្ជកម្ម។ គំរូទម្ងន់ដឹកជញ្ជូនក្រោមអាជ្ញាប័ណ្ណ ResearchRAIL ដែលដាក់កម្រិតលើការប្រើប្រាស់ក្នុងគោលបំណងសិក្សា និងស្រាវជ្រាវតែប៉ុណ្ណោះ ដូច្នេះ Instella-MoE មិនមែនជាគំរូធ្លាក់ចុះសម្រាប់ការដាក់ពង្រាយផលិតកម្មនោះទេ។ ទោះជាយ៉ាងណាក៏ដោយ មូលដ្ឋានកូដបណ្តុះបណ្តាលគឺ MIT ទទួលបានអាជ្ញាប័ណ្ណ ហើយនោះគឺជាទ្រព្យសម្បត្តិដែលអាចប្រើឡើងវិញបានកាន់តែច្រើន — វាផ្តល់ឱ្យមន្ទីរពិសោធន៍ផ្សេងទៀតនូវប្លង់ជាក់ស្តែងសម្រាប់ការបណ្តុះបណ្តាលលើស៊ីលីកុន AMD ។
AMD បានបោះពុម្ពផ្សាយនូវទម្ងន់ពេញលេញពីគ្រប់ដំណាក់កាលបណ្តុះបណ្តាល ល្បាយទិន្នន័យ ការកំណត់រចនាសម្ព័ន្ធការបណ្តុះបណ្តាល និងកូដសន្និដ្ឋាននៅទូទាំងការប្រមូលមុខ Hugging, ឃ្លាំង GitHub និងប្លុក ROCm របស់វា។ កម្រិតនៃការបើកទូលាយនោះ — វគ្គបណ្តុះបណ្តាល-ដំណាក់កាលដោយវគ្គបណ្តុះបណ្តាល មិនមែនគ្រាន់តែជាកន្លែងត្រួតពិនិត្យចុងក្រោយនោះទេ — គឺជាអ្វីដែលសម្គាល់ការចេញផ្សាយ "បើកចំហពេញលេញ" ពីទម្ងន់បើកចំហធម្មតា។
ហេតុអ្វីរឿងនេះសំខាន់លើសពីស្តង់ដារ
អត្ថបទរងនៃការចេញផ្សាយគឺការប្រកួតប្រជែងផ្នែករឹង។ ប្រព័ន្ធអេកូឡូស៊ី CUDA របស់ Nvidia និង GPUs ថ្នាក់ H100 គឺជាស្រទាប់ខាងក្រោមលំនាំដើមសម្រាប់ការបណ្តុះបណ្តាលគំរូព្រំដែន ហើយអ្នកប្រកួតប្រជែងបានចំណាយពេលជាច្រើនឆ្នាំដើម្បីព្យាយាមបង្ហាញថាឧបករណ៍បង្កើនល្បឿនរបស់ពួកគេអាចគ្រប់គ្រងការហ្វឹកហាត់ពេញលេញ។ Instella-MoE គឺជាវត្ថុបុរាណដែលអាចជឿទុកចិត្តបានដែលបន្ទាត់ Instinct របស់ AMD - ត្រូវបានដាក់ពង្រាយតាមខ្នាតដោយ hyperscalers និងមន្ទីរពិសោធន៍ជាតិ - អាចធ្វើបានច្រើនជាងបន្ទុកការងារ។ ប្រសិនបើ AMD អាចបន្តផលិតម៉ូដែលបើកចំហដែលមានការប្រកួតប្រជែងដែលត្រូវបានបណ្តុះបណ្តាលលើផ្នែករឹងរបស់វានោះ វាពង្រឹងករណីសម្រាប់អ្នកទិញដែលកំពុងស្វែងរកការបំបែកការក្តាប់របស់ Nvidia នៅលើទីផ្សារកុំព្យូទ័រ AI ។
សម្រាប់អ្នកស្រាវជ្រាវ ការអំពាវនាវគឺជាតម្លាភាព។ ការចេញផ្សាយដែលបើកចំហយ៉ាងពេញលេញដែលចងក្រងឯកសារនៃល្បាយទិន្នន័យ ការបញ្ចូលគ្នារវាងការបណ្តុះបណ្តាលពាក់កណ្តាល យុទ្ធសាស្រ្តចម្រោះ និងកម្មវិធីសិក្សា RL នៅតែកម្រ ហើយពួកគេបានអនុញ្ញាតឱ្យសហគមន៍ធ្វើសវនកម្ម និងបង្កើតការទាមទារឡើងវិញជាជាងយកពាក្យរបស់មន្ទីរពិសោធន៍សម្រាប់វា។ Instella-MoE ចូលរួមជាមួយបញ្ជីឈ្មោះតូចមួយ ប៉ុន្តែកំពុងកើនឡើង — រួមទាំងម៉ូដែល Instella ក្រាស់មុនរបស់ AMD ផ្ទាល់ផងដែរ ដែលជំរុញឱ្យស្តង់ដារនោះទៅមុខ។
នាំមុខ AI
ចង់បានការគ្របដណ្តប់បច្ចេកទេសជ្រៅបែបនេះដូចដែលវាកើតឡើងទេ? ចំណាំមជ្ឈមណ្ឌលរបស់យើងសម្រាប់ ការអភិវឌ្ឍន៍ AI ចុងក្រោយបំផុត ហើយកុំខកខានការចេញផ្សាយ។
អានព័ត៌មាន AI បន្ថែម →

