តើមានអ្វីកើតឡើងនៅពេលដែលគំរូភាសាដ៏ធំមួយមិនដែលឃើញសម្ភារៈលើសពីថ្នាក់ទីប្រាំ? ក្រុមអ្នកស្រាវជ្រាវប្រាំពីរនាក់បានឆ្លើយសំណួរនោះតាមន័យត្រង់៖ ពួកគេបានបង្កើត LittleLearner ដែលជាប៉ារ៉ាម៉ែត្រ 5 ពាន់លាន LLM ដែលត្រូវបានបណ្តុះបណ្តាលពីដំបូងនៅលើរាងកាយដែលបានត្រងទៅកម្មវិធីសិក្សាបឋមសិក្សារបស់សហរដ្ឋអាមេរិក ហើយបន្ទាប់មកបានសាកល្បងថាតើមានអ្វីខ្លះ — ប៉ារ៉ាម៉ែត្រច្រើនទៀត ការបណ្តុះបណ្តាលក្រោយការបណ្តុះបណ្តាលកាន់តែច្រើន កាន់តែឆ្លាតជាងមុន — វាអាចរុញច្រានទិន្នន័យពីមុនមក។ ចម្លើយ​ដែល​គេ​រាយការណ៍​គឺ​ទេ។

ក្រដាស "LittleLearner: Language Models Under Pedagogically-Controlled Knowledge Exposure" ត្រូវបានដាក់ជូន arXiv នៅថ្ងៃទី 13 ខែសីហា ដោយ Fanfei Li, Jana Zeller, Manuel Prada-Corral, Thaddäus Wiedemer, Prasanna Mayilvahanan, Ryan Cotterell, និង Wieland Brendel ។ ត្រឹមថ្ងៃទី 16 ខែសីហា វាជាប្រធានបទនៃការពិភាក្សាអំពីព័ត៌មាន Hacker ដែលកំពុងកើនឡើងយ៉ាងឆាប់រហ័សជាមួយនឹងការបោះឆ្នោតគាំទ្រជាង 200 នៅពេលដែលអ្នកស្រាវជ្រាវ និងអ្នកអនុវត្តបានពិភាក្សាអំពីអត្ថន័យរបស់វាសម្រាប់ការសន្មត់ដែលចូលចិត្តរបស់ឧស្សាហកម្ម - ថាការបណ្តុះបណ្តាលក្រោយការបណ្តុះបណ្តាលអាចសន្មត់សមត្ថភាពចេញពីខ្យល់ស្តើង។ វាគឺជាប្រភេទនៃការពិសោធដ៏ប្រុងប្រយ័ត្ន និងផ្ទុយគ្នាដែលយើងមើលនៅក្នុង [ការគ្របដណ្តប់លើការស្រាវជ្រាវ AI] (https://aibuzzwire.news) របស់យើង។

ប្រអប់ខ្សាច់ដែលមានព្រំដែនចំណេះដឹង

LLMs ទំនើបត្រូវបានបណ្តុះបណ្តាលលើអ្វីៗគ្រប់យ៉ាងសំខាន់ៗ ដែលធ្វើឱ្យវាស្ទើរតែមិនអាចប្រាប់បានថាតើជំនាញដែលបានបង្ហាញត្រូវបានរៀនយ៉ាងពិតប្រាកដក្នុងអំឡុងពេលបណ្តុះបណ្តាល ឬគ្រាន់តែត្រូវបានបញ្ជាក់ដោយការបំផុសគំនិតត្រឹមត្រូវ។ ដំណោះ​ស្រាយ​របស់​ក្រុម​គឺ​ដើម្បី​រឹត​បន្តឹង​ការ​ចែក​ចាយ​ការ​បណ្តុះ​បណ្តាល​ខ្លួន​ឯង។ ចាប់ផ្តើមពី FineWeb-Edu ពួកគេបានចម្រោះសាកសពសញ្ញាសម្ងាត់ 88 ពាន់លាន ដែលត្រូវបានគេហៅថា LittleCurriculum — តាមរយៈបំពង់ចម្រោះ 5 ដំណាក់កាលដែលស្របតាមស្តង់ដារស្នូលទូទៅសម្រាប់ថ្នាក់មត្តេយ្យដល់ថ្នាក់ទី 5 ។ គោលគំនិត ការពិត និងវាក្យសព្ទដែលបានបង្រៀននៅខាងលើថ្នាក់ទី 5 គឺមិនច្បាស់លាស់។

នៅលើសាកសពនេះ ពួកគេបានបណ្ដុះបណ្ដាលគំរូតាមមាត្រដ្ឋានចំនួនបី (0.6B, 1.3B និង 5B ប៉ារ៉ាម៉ែត្រ) ពីដំបូង ដែលនីមួយៗបានដឹកជញ្ជូនរួមជាមួយគំរូត្រួតពិនិត្យដែលត្រូវគ្នាដែលត្រូវបានបណ្តុះបណ្តាលលើទិន្នន័យដែលមិនបានត្រងជាមួយនឹងថវិកាស្ថាបត្យកម្ម និងសញ្ញាសម្ងាត់ដូចគ្នា។ លទ្ធផលគឺជាគំរូដែលស្ទាត់ជំនាញគ្រប់គ្រាន់សម្រាប់ការវាយតម្លៃបើកចំហ - អ្នកអាចជជែកជាមួយកំណែ 5B ដែលរៀបចំនៅក្នុងកម្មវិធីរុករក - ប៉ុន្តែមានព្រំដែនចំណេះដឹងច្បាស់លាស់ដែលអាចបកស្រាយបាន៖ ប្រសិនបើវាមិននៅក្នុងកម្មវិធីសិក្សាបឋមទេ គំរូមិនដែលឃើញវាទេ។

ការ​ទាមទារ​មិនមែន​ការ​ទទួល​យក​ទេ។

ការស្វែងរកស្នូលគឺមិនច្បាស់លាស់៖ កញ្ចប់ឧបករណ៍ស្តង់ដារសម្រាប់បង្កើតគំរូកាន់តែឆ្លាតវៃបានពង្រីកអ្វីដែល LittleLearner បានដឹងរួចមកហើយ ប៉ុន្តែមិនមានអត្ថន័យណាមួយដែលធ្វើអោយប្រសើរឡើងនូវការអនុវត្តក្រៅវិសាលភាពនោះទេ។

ការធ្វើមាត្រដ្ឋាន បានធ្វើឱ្យប្រសើរឡើងនូវភាពត្រឹមត្រូវក្នុងចំនេះដឹងដែលបានគ្រប់គ្រងរបស់គំរូ ហើយបានពង្រីកបន្តិចម្តងៗតាមគន្លងនៃការសិក្សាដូចគ្នា ប៉ុន្តែបានធ្វើតិចតួចសម្រាប់បញ្ហាដែលទាមទារសមត្ថភាពលើសពីសម្ភារៈថ្នាក់ទី 5 ។ ក្រោយការបណ្តុះបណ្តាល ជាមួយ GRPO — វិធីសាស្រ្តពង្រឹងការរៀនសូត្រនៅពីក្រោយការរីកចំរើននៃគំរូហេតុផលជាច្រើន — បានជំរុញយ៉ាងខ្លាំងនូវសមត្ថភាព K-5 ក្នុងវិសាលភាព ប៉ុន្តែនៅតែបរាជ័យក្នុងការស្តារសមត្ថភាពលើសពី K-5 បើទោះបីជាត្រូវបានបណ្តុះបណ្តាលដោយទិន្នន័យក្រៅវិសាលភាពក៏ដោយ។ ហើយ ការរៀនក្នុងបរិបទ ដែលជាវេទមន្តប្រចាំថ្ងៃនៃការបញ្ចូលចំណេះដឹងទៅក្នុងប្រអប់បញ្ចូលបានជួយឱ្យគំរូប្រើប្រាស់អ្វីដែលវាមាន ប៉ុន្តែមិនបានដោះសោហេតុផលថ្មីហួសពីព្រំដែននោះទេ។

និយាយឱ្យខ្លី តម្រង pretraining កំណត់ពិដានសមត្ថភាពប្រកបដោយប្រសិទ្ធភាព។ អ្នកនិពន្ធដាក់លទ្ធផលជាភ័ស្តុតាងសម្រាប់ភាពខុសគ្នា វាលធ្វើឱ្យព្រិលឥតឈប់ឈរ៖ ការបណ្តុះបណ្តាលក្រោយការបណ្តុះបណ្តាល និងការជំរុញឱ្យមានការបំផុសគំនិត; ការបណ្តុះបណ្តាលមុនទទួលបាន។

ការត្រួតពិនិត្យស្អាត ប៉ុស្តិ៍ត្រួតពិនិត្យសាធារណៈ

វិធីសាស្រ្តគឺជាអ្វីដែលផ្តល់កម្លាំងទាមទាររបស់ពួកគេ។ ដោយសារតែគ្រប់ម៉ូដែល LittleLearner ដឹកជញ្ជូនជាមួយនឹងការគ្រប់គ្រងដែលមិនបានត្រងដែលត្រូវគ្នា — ស្ថាបត្យកម្មដូចគ្នា ចំនួននិមិត្តសញ្ញាដូចគ្នា រូបមន្តបណ្តុះបណ្តាលដូចគ្នា — ក្រុមអាចកំណត់ភាពខុសគ្នានៃអាកប្បកិរិយាចំពោះតម្រងកម្មវិធីសិក្សាតែម្នាក់ឯង។ អ្នកឯកទេសគណិតវិទ្យាក្រោយការបណ្តុះបណ្តាលលើតារាងពិន្ទុ MathCAMPS អនុញ្ញាតឱ្យអ្នកស្រាវជ្រាវវាយតម្លៃការអនុវត្តតាមថ្នាក់សាលា ដោយតាមដានយ៉ាងពិតប្រាកដនូវកន្លែងដែលសមត្ថភាពក្នុងវិសាលភាពបញ្ចប់។ ហើយមិនដូចឯកសារព្រំដែនភាគច្រើនទេ អ្វីគ្រប់យ៉ាងគឺសាធារណៈ៖ សាកសព មូលដ្ឋាន និងប៉ុស្តិ៍ត្រួតពិនិត្យក្រោយការបណ្តុះបណ្តាលនៅគ្រប់មាត្រដ្ឋានទាំងបីនៅលើ HuggingFace និងការបង្ហាញការជជែកជាម្ចាស់ផ្ទះ ដូច្នេះក្រុមឯករាជ្យអាចស៊ើបអង្កេតព្រំដែនដោយខ្លួនឯង។

ភាពបើកចំហនោះកំពុងជំរុញឱ្យមានការជជែកវែកញែកអំពីព័ត៌មានរបស់ពួក Hacker ។ អ្នកអត្ថាធិប្បាយបាននឹងកំពុងសាកល្បងឥរិយាបថរបស់គំរូបង្ហោះនៅគែមចំណេះដឹងរបស់វា — មិនថាវាអត់ឱន ស្មាន ឬការយល់ច្រលំនៅពេលដែលបានឆ្លងកាត់ថ្នាក់ទី 5 — និងការជជែកវែកញែកអំពីផលប៉ះពាល់៖ អ្នកខ្លះបានអានលទ្ធផលថាជាព័ត៌មានអាក្រក់សម្រាប់ការបំផ្លើសគំរូហេតុផល អ្នកផ្សេងទៀតចង្អុលបង្ហាញថាទិន្នន័យការបណ្តុះបណ្តាលតាមមាត្រដ្ឋានគេហទំព័រមានច្រើនជាងគោលគំនិតនៃថ្នាក់បឋមសិក្សាទៅទៀត។ អ្នកនិពន្ធកាសែតខ្លួនឯងមានការប្រុងប្រយ័ត្នចំពោះចំណុចនេះ៖ ការអះអាងរបស់ពួកគេគឺអំពីអ្វីដែលអន្តរាគមន៏ស្តង់ដារមិនអាចធ្វើសម្រាប់គំរូដែលមានការអប់រំដែលស្គាល់ និងគ្រប់គ្រង មិនមែនជាការព្យាករណ៍ដោយផ្ទាល់អំពីមន្ទីរពិសោធន៍ព្រំដែននោះទេ។

ហេតុអ្វីវាសំខាន់លើសពីថ្នាក់រៀន

ការពិសោធន៍និយាយដោយផ្ទាល់ទៅនឹងការជជែកពិភាក្សាផ្ទាល់នៅក្នុង AI ។ មន្ទីរពិសោធន៍ AI ចំណាយប្រាក់រាប់ពាន់លានលើរបបក្រោយការបណ្តុះបណ្តាល ដែលផ្អែកលើគំនិតដែលថាការរៀនពង្រឹងអាចជំរុញគំរូមូលដ្ឋានបានយ៉ាងល្អលើសពីសមត្ថភាពឆៅរបស់វា។ LittleLearner ណែនាំថាការទទួលបានទាំងនោះភាគច្រើនអាចរស់នៅក្នុង - និងត្រូវបានកំណត់ដោយ - អ្វីដែលទិន្នន័យការបណ្តុះបណ្តាលគាំទ្រ។ នោះគឺជាអំណះអំណាងមួយសម្រាប់ការយកចិត្តទុកដាក់បន្ថែមទៀតអំពីការរៀបចំទិន្នន័យ និងសម្រាប់ការព្យាបាលការអះអាងនៃសមត្ថភាពក្រោយការបណ្តុះបណ្តាល "បន្ទាន់" ជាមួយនឹងការសង្ស័យ។

ការចេញផ្សាយនេះក៏ជាឧបករណ៍ស្រាវជ្រាវពិតប្រាកដមួយ មិនមែនគ្រាន់តែជាក្រដាសនោះទេ។ ក្រុមការងារបានចេញផ្សាយកម្មវិធីសិក្សា LittleCurriculum និងចំណុចត្រួតពិនិត្យគំរូទាំងអស់ដោយបើកចំហ ហើយទំព័រគម្រោងបង្ហាញការពិសោធន៍ដែលប្រអប់ខ្សាច់អនុញ្ញាត៖ ថាតើ RL ពិតជាអាចបង្កើតសមត្ថភាពជាជាងផ្តល់រង្វាន់ដល់វាយ៉ាងដូចម្តេច របៀបដែលគំរូគំរូរៀនពីគោលគំនិតថ្មីពិតប្រាកដ ដូចជាលេខអវិជ្ជមាននៅពេលដែលវាត្រូវបានណែនាំ និងថាតើម៉ាស៊ីន និងកុមារត្រូវការការបង្ហាញស្រដៀងគ្នា ឬធ្វើកំហុសស្រដៀងគ្នា — នៅពេលរៀនប្រភាគ។

សម្រាប់វិស័យដែលកម្រទទួលបានការគ្រប់គ្រងស្អាត គំរូដែលមានការអប់រំច្បាស់លាស់គឺជាអំណោយដ៏កម្រមួយ។ ហើយសម្រាប់អ្នកផ្សេងទៀត វាជាការរំលឹកដែលមានតម្លៃដាក់ពីលើតុ៖ គ្មានគំរូ ឬមនុស្សណាម្នាក់អាចវែកញែកផ្លូវរបស់ពួកគេចេញពីអ្វីដែលពួកគេមិនធ្លាប់បានបង្រៀននោះទេ។

នាំមុខ AI

ការគ្របដណ្ដប់លើការវាយតម្លៃពីមិត្តភ័ក្តិនៃការស្រាវជ្រាវកែទម្រង់ AI ដែលត្រូវបានចែកចាយជារៀងរាល់ថ្ងៃ។ ចំណាំមជ្ឈមណ្ឌលរបស់យើងសម្រាប់ [ការអភិវឌ្ឍន៍ AI ចុងក្រោយបំផុត] (https://aibuzzwire.news)

អានព័ត៌មាន AI បន្ថែម →