ကြီးမားသောဘာသာစကားပုံစံတစ်ခုသည် ပဉ္စမတန်းထက်ကျော်လွန်သည့်အရာများကို ဘယ်သောအခါမှ မမြင်သောအခါ ဘာဖြစ်သွားသနည်း။ သုတေသီခုနစ်ယောက်ပါသော အဖွဲ့တစ်ဖွဲ့သည် အဆိုပါမေးခွန်းကို စာသားအတိုင်းဖြေဆိုခဲ့သည်- ၎င်းတို့သည် 5 ဘီလီယံတန်သော ကန့်သတ်ဘောင် LLM ကိုတည်ဆောက်ခဲ့သည့် LittleLearner၊ US မူလတန်း-ကျောင်းသင်ရိုးညွှန်းတမ်းတွင် စစ်ထုတ်ထားသော ကော်ပိုရိတ်တစ်ခုမှ အစမှ လေ့ကျင့်ထားသော 5 ဘီလီယံတန်ဖိုးရှိ၊ ကန့်သတ်ချက်များ၊ ပိုပို၊ လေ့ကျင့်ပြီးနောက်ပိုင်း၊ ထက်မြက်သောအချက်အလက်များကို ကြိုတင်လေ့ကျင့်ပေးနိုင်သည်။ သူတို့ပြောသည့် အဖြေမှာ မရှိပါ။
"LittleLearner: သင်ကြားနည်းဖြင့် ထိန်းချုပ်ထားသော အသိပညာ ထုတ်ဖော်မှုအောက်တွင် ဘာသာစကားပုံစံများ" စာတမ်းကို Fanfei Li၊ Jana Zeller၊ Manuel Prada-Corral၊ Thaddäus Wiedemer၊ Prasanna Mayilvahanan၊ Ryan Cotterell နှင့် Wieland Brendel တို့မှ သြဂုတ်လ 13 ရက်နေ့တွင် arXiv သို့ တင်သွင်းခဲ့ပါသည်။ သုတေသီများနှင့် လေ့ကျင့်သူများသည် လုပ်ငန်း၏အနှစ်သက်ဆုံးယူဆချက်အတွက် မည်ကဲ့သို့ဆိုလိုသည်ကို အခြေအတင်ဆွေးနွေးခဲ့ကြရာ ဩဂုတ်လ 16 တွင် ၎င်းသည် ဟက်ကာသတင်းများ လျင်မြန်စွာတက်နေသော ဟက်ကာသတင်းများအကြောင်း ဆွေးနွေးမှုတစ်ခုဖြစ်သည်။ ကျွန်ုပ်တို့၏ AI သုတေသနလွှမ်းခြုံမှု တွင် ကျွန်ုပ်တို့ စောင့်ကြည့်နေသည့် သတိထား၊ ဆန့်ကျင်ဘက်စမ်းသပ်မှုမျိုးဖြစ်သည်။
အသိပညာဘောင်တစ်ခုပါရှိသော Sandbox
ခေတ်မီ LLMs များကို အခြေခံအားဖြင့် အရာရာတိုင်းတွင် လေ့ကျင့်ထားသောကြောင့် သရုပ်ပြကျွမ်းကျင်မှုသည် လေ့ကျင့်နေစဉ်အတွင်း စစ်မှန်စွာ သင်ယူခြင်း သို့မဟုတ် မှန်ကန်သောအချက်ဖြင့် ထုတ်ယူခြင်းမျှသာဖြစ်ကြောင်း ပြောရန်မဖြစ်နိုင်ပေ။ အသင်း၏ဖြေရှင်းချက်မှာ လေ့ကျင့်ရေးဖြန့်ဝေမှုကို ကန့်သတ်ရန်ဖြစ်သည်။ FineWeb-Edu မှစတင်၍ ၎င်းတို့သည် LittleCurriculum ဟုအမည်ပေးထားသော 88-billion-billion-token corpus——ကို သူငယ်တန်းမှ 5 တန်းအထိ Common Core စံနှုန်းများနှင့် ကိုက်ညီသော အဆင့်ငါးဆင့်စီထုတ်သည့်ပိုက်လိုင်းမှတစ်ဆင့် ပေါင်းထည့်ခဲ့သည်။ သဘောတရားများ၊ အချက်အလက်များနှင့် ဝေါဟာရများကို 5 တန်းအထက်တွင် သီးသန့်ဖော်ပြထားသည်။
ဤဖွဲ့စည်းပုံတွင် ၎င်းတို့သည် စကေးသုံးခု (0.6B၊ 1.3B၊ နှင့် 5B ကန့်သတ်ချက်များ) ဖြင့် လေ့ကျင့်သင်ကြားခဲ့ပြီး တစ်ခုစီသည် တူညီသောဗိသုကာနှင့် တိုကင်ဘတ်ဂျက်ဖြင့် လေ့ကျင့်ထားသော ကိုက်ညီသော ထိန်းချုပ်မှုပုံစံတစ်ခုနှင့်အတူ ပေးပို့ခဲ့သည်။ ရလဒ်သည် အဖွင့်အဆုံးအကဲဖြတ်ရန်အတွက် လုံလောက်သော ကျွမ်းကျင်သော မော်ဒယ်တစ်ခုဖြစ်သည် — သင်သည် ဘရောက်ဆာတစ်ခုတွင် လက်ခံထားသည့် 5B ဗားရှင်းနှင့် ချတ်လုပ်နိုင်သည် — ပြတ်သားပြီး နားလည်နိုင်သော အသိပညာနယ်နိမိတ် ရှိသည်- မူလတန်းသင်ရိုးညွှန်းတမ်းတွင် မရှိလျှင် မော်ဒယ်က ၎င်းကို မမြင်ဖူးပါ။
ခေါ်ယူခြင်း၊ ရယူခြင်းမဟုတ်ပါ။
ပင်မရှာဖွေတွေ့ရှိမှုသည် တုံးတိတိဖြစ်သည်- မော်ဒယ်များကို စမတ်ကျကျဖြစ်စေရန်အတွက် စံနမူနာကိရိယာအစုံသည် LittleLearner သိထားပြီးဖြစ်သည့်အရာကို ချဲ့ထွင်ထားသော်လည်း မည်သည့်အရာကမှ နယ်ပယ်ပြင်ပစွမ်းဆောင်ရည်ကို အဓိပ္ပါယ်ရှိစွာ မြှင့်တင်ထားခြင်းမရှိပါ။
စကေးချဲ့ခြင်း သည် မော်ဒယ်၏ ထိန်းချုပ်ထားသော အသိပညာအတွင်း တိကျမှုကို မြှင့်တင်ပေးပြီး တူညီသော သင်ယူမှုလမ်းကြောင်းတစ်လျှောက် ကျိုးနွံစွာ ချဲ့ထွင်ခဲ့သော်လည်း အတန်း-5 ပစ္စည်းများထက် စွမ်းရည်များ လိုအပ်သည့် ပြဿနာများအတွက် အနည်းငယ်သာ လုပ်ဆောင်ခဲ့သည်။ Post-training ဖြင့် GRPO — ကျိုးကြောင်းဆင်ခြင်ခြင်း-မော်ဒယ် boom အများစု၏ နောက်ကွယ်မှ အားဖြည့်-သင်ယူမှုနည်းလမ်း— — နယ်ပယ်အတွင်း K-5 စွမ်းရည်များကို သိသိသာသာ မြှင့်တင်ပေးခဲ့သော်လည်း နယ်ပယ်ပြင်ပဒေတာဖြင့် လေ့ကျင့်ထားသည့်တိုင် K-5 စွမ်းရည်များကို ပြန်လည်ရယူရန် ပျက်ကွက်ခဲ့သည်။ နှင့် ဆက်စပ်လေ့လာသင်ယူခြင်း၊ အချက်ပြမှုတွင် အသိပညာများထည့်သွင်းခြင်း၏နေ့စဉ်မှော်ဆန်မှုသည် မော်ဒယ်အား ၎င်းတွင်ရှိသောအရာများကို အသုံးပြုရန် ကူညီပေးခဲ့သော်လည်း နယ်နိမိတ်ကိုကျော်လွန်၍ အကြောင်းပြချက်အသစ်များကို ဖွင့်မပေးခဲ့ပါ။အတိုချုပ်ပြောရလျှင် ကြိုတင်လေ့ကျင့်ခြင်း စစ်ထုတ်ခြင်း သည် ထိရောက်သော လုပ်ဆောင်နိုင်စွမ်း မျက်နှာကျက်ကို သတ်မှတ်ပေးသည် ။ စာရေးဆရာများသည် ရလဒ်ကို နယ်ပယ်ခြားနားချက်အတွက် သက်သေအဖြစ် အဆက်မပြတ် မှုန်ဝါးစေသည်- လေ့ကျင့်မှုအပြီးနှင့် နှိုးဆော်ချက်ထုတ်ခြင်း၊ pretraining ဆည်းပူးသည်။
သန့်ရှင်းသောထိန်းချုပ်မှုများ၊ အများသူငှာစစ်ဆေးရေးဂိတ်များ
နည်းစနစ်သည် တောင်းဆိုချက်များကို ၎င်းတို့၏ အင်အားကို ပေးဆောင်သည်။ LittleLearner မော်ဒယ်တိုင်းသည် တူညီသောဗိသုကာပညာ၊ တူညီသော တိုကင်အရေအတွက်၊ တူညီသောလေ့ကျင့်ရေးချက်ပြုတ်နည်း — ကိုက်ညီမှုမရှိသော ထိန်းချုပ်မှုတစ်ခုဖြင့် ပို့ဆောင်ပေးသောကြောင့် - အဖွဲ့သည် သင်ရိုးစစ်ထုတ်ခြင်းတစ်ခုတည်းအတွက် အပြုအမူဆိုင်ရာ ကွဲပြားမှုကို သတ်မှတ်ပေးနိုင်ပါသည်။ MathCAMPS စံညွှန်းတွင် လေ့ကျင့်သင်ကြားပြီးနောက် သင်္ချာကျွမ်းကျင်သူများသည် သုတေသီများကို ကျောင်းအဆင့်အလိုက် စွမ်းဆောင်ရည်အဆင့်သတ်မှတ်ကာ နယ်ပယ်အတွင်းစွမ်းရည်ပြီးဆုံးသည့်နေရာကို အတိအကျခြေရာခံခွင့်ပြုသည်။ နယ်ခြားစာရွက်အများစုနှင့်မတူဘဲ၊ အရာအားလုံးသည် အများသူငှာဖြစ်သည်- HuggingFace ပေါ်ရှိ စကေးသုံးခုလုံးရှိ လူသေအလောင်းများ၊ အခြေစိုက်စခန်းနှင့် လေ့ကျင့်ပြီးစစ်ဆေးရေးဂိတ်များ၊ နှင့် လက်ခံထားသည့် ချတ်သရုပ်ပြသရုပ်ပြဖြစ်သောကြောင့် သီးခြားအဖွဲ့များသည် နယ်နိမိတ်ကို ၎င်းတို့ကိုယ်တိုင် စုံစမ်းစစ်ဆေးနိုင်သည်။
ထိုပွင့်လင်းမှုသည် Hacker News ငြင်းခုံမှုကို လှုံ့ဆော်ပေးသည်။ မှတ်ချက်ပေးသူများသည် 5 တန်းလွန်သွားသောအခါတွင် ရှောင်နေခြင်း၊ မှန်းဆခြင်း သို့မဟုတ် အမြင်မှားခြင်းရှိမရှိ - အသိပညာအစွန်းတွင် လက်ခံထားသည့် မော်ဒယ်၏အပြုအမူကို စမ်းသပ်နေပြီး အကျိုးဆက်များနှင့်ပတ်သက်၍ ငြင်းခုံနေကြသည်- အချို့က ရလဒ်များကို ကျိုးကြောင်းဆင်ခြင်ခြင်း-မော်ဒယ်ဖောင်ဒေးရှင်းအတွက် သတင်းဆိုးအဖြစ် ဖတ်နေကြပြီး အချို့က ဝဘ်စကေးကြိုတင်လေ့ကျင့်ခြင်းဒေတာတွင် မူလတန်းကျောင်းမော်ဒယ်များထက် ပိုမိုမြင့်မားသော သဘောတရားများပါရှိသည်ကို ထောက်ပြကြသည်။ စာတမ်း၏စာရေးဆရာများကိုယ်တိုင်က ဤအချက်ကို သတိပြုမိသည်- ၎င်းတို့၏ပြောဆိုချက်မှာ လူသိများပြီး ထိန်းချုပ်ထားသော ပညာရေးပုံစံတစ်ခုအတွက် စံပြု၍မရသော စံပြုမှုများ၊ နယ်ခြားဓာတ်ခွဲခန်းများအကြောင်း တိုက်ရိုက်ခန့်မှန်းချက်မဟုတ်ပါ။
စာသင်ခန်းထက် ဘာကြောင့်အရေးကြီးတာလဲ။
အဆိုပါစမ်းသပ်ချက်သည် AI တွင် တိုက်ရိုက်အခြေအတင်ဆွေးနွေးမှုများကို တိုက်ရိုက်ပြောပါသည်။ AI ဓာတ်ခွဲခန်းများသည် အားဖြည့်သင်ကြားမှုအား ၎င်း၏ကုန်ကြမ်းစွမ်းရည်များထက် ပိုမိုကောင်းမွန်စွာ တွန်းပို့နိုင်သည်ဟူသော အယူအဆအပေါ် အခြေတည်ထားသည့် လေ့ကျင့်မှုလွန်စနစ်များအတွက် ဘီလီယံနှင့်ချီ၍ သုံးစွဲပါသည်။ LittleLearner က အဆိုပါ အမြတ်များသည် အထဲမှာ အများစု နေထိုင်နိုင်ပြီး — ကြိုတင်လေ့ကျင့်ခြင်း ဒေတာကို ပံ့ပိုးပေးသည့် အရာဖြင့် ကန့်သတ်ထားသည်။ ၎င်းသည် ဒေတာပြင်ဆင်ခြင်းနှင့်ပတ်သက်၍ ပိုမိုဂရုစိုက်ရန်နှင့် "အရေးပေါ်" လေ့ကျင့်ရေးလွန်စွမ်းရည်များ၏ တောင်းဆိုချက်များကို သံသယစိတ်ဖြင့် ကုသရန်အတွက် အငြင်းအခုံတစ်ခုဖြစ်သည်။
ထုတ်ဝေမှုသည် စာရွက်တစ်ခုမျှသာမဟုတ်ဘဲ စစ်မှန်သော သုတေသနကိရိယာတစ်ခုလည်းဖြစ်သည်။ အဖွဲ့သည် LittleCurriculum နှင့် မော်ဒယ်စစ်ဆေးရေးဂိတ်များအားလုံးကို ပွင့်ပွင့်လင်းလင်းထုတ်ပြပြီး ပရောဂျက်စာမျက်နှာသည် သဲပုံးဖွင့်ထားသည့် စမ်းသပ်မှုများကို ပုံကြမ်းရေးဆွဲသည်- RL သည် ၎င်းကို ဆုချမည့်အစား အမှန်တကယ် စွမ်းဆောင်နိုင်မှု ဖန်တီးနိုင်သလား၊ အပိုင်းများကို မိတ်ဆက်သည့်အခါ နမူနာ-အနုတ်ကိန်းများကဲ့သို့ စစ်မှန်သော သဘောတရားအသစ်ကို မည်ကဲ့သို့ လေ့လာသည်၊ နှင့် စက်များနှင့် ကလေးများသည် အလားတူ ထိတွေ့မှု လိုအပ်သည်ဖြစ်စေ — သို့မဟုတ် အပိုင်းကိန်းများကို သင်ယူသည့်အခါ—တူညီသောအမှားများ ပြုလုပ်နိုင်မလား။
သန့်ရှင်းသော ထိန်းချုပ်မှု နည်းပါးသော နယ်ပယ်တစ်ခုအတွက်၊ အတိအလင်း သတ်မှတ်ထားသော ပညာရေးပုံစံတစ်ခုသည် ရှားပါးလက်ဆောင်တစ်ခုဖြစ်သည်။ အခြားလူတိုင်းအတွက်၊ ၎င်းသည် စားပွဲခုံထက်တွင် ချိတ်ထားထိုက်သည့် သတိပေးချက်ဖြစ်သည်- မော်ဒယ် သို့မဟုတ် လူတစ်ဦးတစ်ယောက်မျှ ၎င်းတို့သည် တစ်ခါမျှ မသင်ကြားဖူးသည့်အရာမှ ၎င်းတို့၏လမ်းကို အကြောင်းပြချက်မပေးနိုင်ပါ။
AI ထက်သာလွန်နေပါစေ။
AI ကို ပြန်လည်ပုံဖော်ခြင်း သုတေသန၏ သက်တူရွယ်တူ သုံးသပ်ချက်အဆင့် လွှမ်းခြုံမှုကို နေ့စဉ်ပေးပို့သည်။ နောက်ဆုံးပေါ် AI ဖွံ့ဖြိုးတိုးတက်မှုများ အတွက် ကျွန်ုပ်တို့၏ဗဟိုကို မှတ်သားပါ။
AI သတင်းအပြည့်အစုံကို ဖတ်ရှုရန် →