ဂျာမန်သုတေသနအဖွဲ့အစည်းများနှင့် AI ကုမ္ပဏီများ၏ လုပ်ငန်းစုတစ်ခုသည် အပြည့်အဝဖွင့်ထားသော မော်ဒယ်များကြားတွင် အင်္ဂလိပ်နှင့် ဂျာမန်စံနှုန်းများတွင် အမြင့်ဆုံးရမှတ်များရရှိသည်ဟု ပရောဂျက်က ဖွင့်ဆိုထားသည့် အဖွင့်ဘာသာစကားမော်ဒယ် Soofi S 30B-A3B ကို ထုတ်ပြန်ခဲ့သည်။ ဂျာမနီနိုင်ငံ၏ အမျိုးသား AI အသင်းအဖွဲ့ KI Bundesverband မှ ပေါင်းစပ်ညှိနှိုင်းပေးသည့် ထုတ်ဝေမှုသည် မြူးနစ်ရှိ Deutsche Telekom ၏ Industrial AI Cloud တွင် လုံးလုံးလေ့ကျင့်ထားသည့် ပထမဆုံးကြီးမားသော ဘာသာစကားမော်ဒယ်များထဲမှ တစ်ခုဖြစ်ပြီး လွှမ်းမိုးကြီးစိုးသော အမေရိကန်နှင့် တရုတ်တို့၏ အချုပ်အခြာအာဏာပိုင် ဥရောပရွေးချယ်မှုတစ်ခုအဖြစ် နေရာယူထားသည်။ [နောက်ဆုံးပေါ် AI တိုးတက်မှုများ] (https://aibuzzwire.news) ကို ခြေရာခံသည့် developer များအတွက်၊ လွှတ်တင်မှုသည် ဗိသုကာလက်ရာအတွင်း ပုံမှန်မဟုတ်သော ထိရောက်မှုနှင့် ဘာသာစကားအာရုံစူးစိုက်မှုတို့အတွက်ထက် အကြမ်းစကေးအတွက် သိသိသာသာ နည်းပါးပါသည်။
တက်ကြွသောဘောင်များ 3.2 ဘီလီယံသာရှိသော ပေါင်းစပ်ဒီဇိုင်း
Soofi S သည် စုစုပေါင်းအတိုင်းအတာ 31.6 ဘီလီယံပါသော ပေါင်းစပ်ကျွမ်းကျင်သူများ (MoE) မော်ဒယ်တစ်ခုဖြစ်ပြီး ထုတ်ပေးထားသော တိုကင်တစ်ခုလျှင် 3.2 ဘီလီယံခန့်သာ အသက်ဝင်ပါသည်။ ၎င်းသည် သမရိုးကျ 30-billion-parmeter သိပ်သည်းသောမော်ဒယ်ထက် 3-billion-parmeter မော်ဒယ်နှင့် ၎င်း၏တွက်ချက်မှုကုန်ကျစရိတ်ကို ပိုမိုနီးစပ်စေသည်၊၊ ပြည်ပက cloud ပံ့ပိုးပေးသူများကို မှီခိုစရာမလိုဘဲ ဥရောပအခြေခံအဆောက်အအုံပေါ်တွင် လည်ပတ်နိုင်လောက်အောင် စျေးပေါနေစေရန် ရည်ရွယ်သည့် ဒီဇိုင်းရွေးချယ်မှုဖြစ်သည်။
ဗိသုကာလက်ရာကို Nvidia ၏ Nemotron 3 Nano မှ ချေးယူထားပြီး Mamba-2 အလွှာများကို ပေါင်းစပ်ဖွဲ့စည်းပုံတွင် စံအာရုံစူးစိုက်မှုအလွှာများနှင့် ပေါင်းစပ်ထားသည်။ ပရောဂျက်၏ ကြိုတင်လေ့ကျင့်မှု အစီရင်ခံစာအရ၊ မော်ဒယ်၏ အလွှာ 52 တွင် 6 ကသာ သော့တန်ဖိုး (KV) ကက်ရှ်—အာရုံစူးစိုက်မှုတွက်ချက်မှုအတွက် ယခင်တိုကင်များကို သိမ်းဆည်းထားသည့် မှတ်ဉာဏ်ဖွဲ့စည်းပုံဖြစ်သည်။ သမားရိုးကျ ထရန်စဖော်မာများတွင်၊ ထို cache သည် ဆက်စပ်အရှည်ဖြင့် မျဉ်းသားစွာ ကြီးထွားလာပြီး ရှည်လျားသော ဆက်စပ်မှု အနုမာနအတွင်း အဓိက ပိတ်ဆို့မှုတစ်ခု ဖြစ်လာသည်။
လက်တွေ့ကျသော ပေးချေမှုသည် ဖြတ်သန်းမှုတွင် ပေါ်လာသည်။ အပြိုင်တောင်းဆိုမှု 32 ခုပါသော တိုကင်အရှည် 40,000 တွင်၊ Soofi S သည် 14-မှ 24-billion-ပါရာမီတာအကွာအဝေးရှိ သိပ်သည်းသောမော်ဒယ်များထက် GPU အတွက် တစ်စက္ကန့်လျှင် တိုကင်ရှစ်ဆခန့် ပိုထုတ်ပေးပါသည်။ အကြောင်းအရာများ ကြီးထွားလာသည်နှင့်အမျှ သမားရိုးကျ မော်ဒယ်များအတွက် မျိုးဆက်မြန်နှုန်း သိသိသာသာ ကျဆင်းသွားသော်လည်း Soofi S သည် တိုကင်ပေါင်း 4,000 မှ 256,000 တိုကင်အထိ တူညီနေပါသည်။ လုပ်ငန်းစု၏ တိုင်းတာမှုများတွင် နှိုင်းယှဉ်နိုင်သော တစ်ခုတည်းသော မော်ဒယ်မှာ Alibaba ၏ Qwen3.5 35B-A3B ဖြစ်ပြီး ပေါင်းစပ်ဗိသုကာကိုလည်း အသုံးပြုထားသည်။
အင်္ဂလိပ်ဘာသာကို မစွန့်စားဘဲ ဂျာမန်ဘာသာအတွက် လေ့ကျင့်ပါ။
ဂျာမန်အပေါ် တမင်တကာ အာရုံစိုက်ခြင်းသည် စီမံကိန်းအတွက် အဓိကဖြစ်သည်။ ပထမလေ့ကျင့်ရေးအဆင့်တွင် ဂျာမန်လူမျိုးသည် ဒေတာရောနှောမှု၏ 7.2 ရာခိုင်နှုန်းအထိ ပါဝင်ပါသည်။ ဒုတိယအဆင့်တွင် ထိုရှယ်ယာသည် 15.3 ရာခိုင်နှုန်းအထိ မြင့်တက်လာသည်။ နှိုင်းယှဉ်ကြည့်လျှင် Nvidia ၏ Nemotron ကိုးကားချက်စာရွက်တွင် အင်္ဂလိပ်မဟုတ်သော ဘာသာစကားများ ပေါင်းစပ်ထားသော လေ့ကျင့်ရေးပေါင်းစပ်မှု၏ 5 ရာခိုင်နှုန်းခန့်သာရှိသည်။
ဒေတာရင်းမြစ်များတွင် HPLT corpus မှ ဂျာမန်ဝဘ်စာသားများ၊ ပွင့်လင်းမြင်သာစွာ လိုင်စင်ရ German Commons corpus၊ FinePDFs နှင့် FineWiki တို့၏ ဂျာမန်အပိုင်းများနှင့် စီးပွားဖြစ်လိုင်စင်ရ Genios မော်ကွန်းတိုက်တို့ ပါဝင်သည်။ စက်ဖြင့်ဘာသာပြန်ပြီး ပေါင်းစပ်ထုတ်လုပ်ထားသော ဂျာမန်စာသားများကို ရောနှောထားသည်။
မော်ဒယ်သည် လေ့ကျင့်ရေးအဆင့်သုံးဆင့်တွင် အကြမ်းဖျင်းအားဖြင့် 27 ထရီလီယံတိုကင်များကို လုပ်ဆောင်ခဲ့သည်- ပထမအဆင့်တွင် ကျယ်ပြန့်သော ဝဘ်၊ ကုဒ်၊ သင်္ချာနှင့် ဒိုမိန်းဆိုင်ရာ သီးသန့်စာသား 20 ထရီလျံခန့်၊ ဒုတိယတွင် အရည်အသွေးမြင့် တိုကင် 6 ထရီလီယံခန့်၊ တိုကင်တစ်သန်းအထိ ရှည်လျားသော စာရွက်စာတမ်းများကို အသုံးပြု၍ ဆက်စပ်ဝင်းဒိုးကို ချဲ့ထွင်သည့် တတိယအဆင့် ပိုတိုသည်။
Benchmark ရလဒ်များ- ဂျာမန်နှင့် အင်္ဂလိပ်ဘာသာဖြင့် ရှေ့တန်း၊ သင်္ချာတွင် အားနည်းသည်။
အခြားအဖွင့်မော်ဒယ် 16 ခုကို အကဲဖြတ်ရာတွင် Soofi S သည် ဂျာမန်နှင့် အင်္ဂလိပ် နှစ်ဘာသာစလုံးအတွက် စုစုပေါင်းရမှတ်များပေါ်တွင် အပြည့်အ၀ဖွင့်ထားသော မော်ဒယ်များကို ဦးဆောင်နေကြောင်း လုပ်ငန်းစုမှ သိရသည်။ ၎င်းတွင် ETH Zurich နှင့် EPFL မှ AI အတွက် Allen Institute မှ OLMo 3 32B နှင့် Apertus 70B ပါဝင်သည်။ ဥရောပ၏ အချုပ်အခြာအာဏာအခြေခံမျဥ်းတိုင်းကို ဆန့်ကျင်၍ မော်ဒယ်သည် တစ်ခါတစ်ရံတွင် ဂဏန်းနှစ်လုံးပါသော အနားသတ်များဖြင့် အတွဲလိုက်ရှိ ဂျာမန်စံနှုန်းများအားလုံးတွင် ရှေ့သို့ထွက်လာသည်။
ကုဒ်လုပ်ဆောင်မှုများတွင်၊ Soofi S သည် HumanEval တွင် 73.8 ရာခိုင်နှုန်း၊ MBPP တွင် 70.2 နှင့် German MBPP မျိုးကွဲတွင် 84.2 ရထားသည် — open-source ရွယ်တူများအကြား အကောင်းဆုံးရလဒ်များဖြစ်သည်။ INCLUDE-DE၊ ဂျာမနီနိုင်ငံအလိုက် ဒေသဆိုင်ရာအသိပညာအတွက် စမ်းသပ်မှုတစ်ခုတွင်၊ ပိုကြီး Qwen3.5 35B-A3B နှင့် ပထမနေရာအတွက် Soofi S သည် 61.2 မှတ်ဖြင့် ချိတ်ဆက်ထားသည်။ Nemotron အခြေခံစာကြောင်းနှင့် နှိုင်းယှဉ်ပါက German-weighted data recipe သည် ဘာသာစကားကျွမ်းကျင်မှု 15.1 မှတ် နှင့် GPQA-Diamond သိပ္ပံစံညွှန်းကို 9.6 မှတ် ဖြင့် အင်္ဂလိပ် စွမ်းဆောင်ရည်ကို မထိခိုက်စေဘဲ တိုးတက်စေသည်။
ပြတ်သားတဲ့ အားနည်းချက်တွေရှိတယ်။ ဂျာမန်ပြိုင်ဆိုင်မှုသင်္ချာ (Minerva MATH-DE) တွင် Soofi S က ရမှတ် 56 မှတ်၊ Qwen3.5 35B-A3B တွင် 76.5 နှင့် Gemma 3 27B တွင် 65.6 မှတ်တို့နောက်တွင် ရှိသည်။ ၎င်းသည် အဖွဲ့သည် 3 ဘီလီယံခန့်သာ တက်ကြွသော ဘောင်များပါရှိခြင်းကြောင့်ဟု သတ်မှတ်သည့် NaturalQuestions တွင် ပွင့်လင်းမြင်သာသော အချက်အလက်ကို ပြန်လည်ရယူခြင်းကိုလည်း လုပ်ဆောင်ပြီး ထို့ကြောင့် သိပ်သည်းသော 27B မော်ဒယ်ထက် သိမ်းဆည်းထားသော ကမ္ဘာ့အသိပညာနည်းပါးသည်။ RULER long-context test သည် အခြားကွာဟချက်ကို ပေါ်လွင်စေသည်- မော်ဒယ်သည် ရှည်လျားသော စာသားများမှ မကြာခဏ ဖြစ်ပေါ်နေသော စကားလုံးများကို ထုတ်ယူသည့်အခါ၊ ၎င်း၏ hit rate သည် 32,000 tokens ထက် 3 ရာခိုင်နှုန်းအထိ ကျဆင်းသွားကာ နှိုင်းယှဉ်နိုင်သော Nemotron မော်ဒယ်သည် 60 မှ 64 ရာခိုင်နှုန်းအထိ စီမံခန့်ခွဲဆဲဖြစ်သည်။
မြူးနစ်တွင် 512 Nvidia B200 GPU များကို လေ့ကျင့်သင်ကြားခဲ့သည်။
လေ့ကျင့်ရေးအပြေးသည် 2026 ခုနှစ် မတ်လမှ မေလအတွင်း မြူးနစ်မြို့ရှိ Deutsche Telekom ၏စက်မှု AI Cloud တွင် Nvidia B200 GPU 512 ခုအထိ ပြုလုပ်ခဲ့ပြီး စုစုပေါင်း 253,000 GPU နာရီများဖြစ်သည်။ အဆိုပါစက်ရုံသည် ပြန်လည်ပြည့်ဖြိုးမြဲစွမ်းအင်ဖြင့် လုံးလုံးလျားလျားလည်ပတ်နေပြီး Eisbach တူးမြောင်းမှရေဖြင့် အအေးခံကာ ပတ်ဝန်းကျင်ရှိ Tucherpark ရပ်ကွက်အတွင်းသို့ စွန့်ပစ်ပစ္စည်းများကို အပူများပေးဆောင်သည်ဟု အစီရင်ခံစာတွင် ဖော်ပြထားသည်။ Soofi S သည် ဤအခြေခံအဆောက်အအုံအတွက် ပထမဆုံးအဓိကလေ့ကျင့်မှုတစ်ခုဖြစ်သည်။
မော်ဒယ်နောက်ကွယ်ရှိ လုပ်ငန်းစုကို ဥရောပ IPCEI-CIS ပရိုဂရမ်၏ တစ်စိတ်တစ်ပိုင်းအဖြစ် ဂျာမန်ဗဟိုစီးပွားရေးနှင့် စွမ်းအင်ဝန်ကြီးဌာနက ရန်ပုံငွေပံ့ပိုးထားသည်။ ပါဝင်သူများသည် Fraunhofer Institutes IAIS နှင့် IIS၊ Artificial Intelligence (DFKI) အတွက် ဂျာမန်သုတေသနစင်တာ၊ TU Darmstadt၊ University of Würzburg၊ L3S သုတေသနစင်တာ၊ Berlin University of Applied Sciences နှင့် AI ကုမ္ပဏီ Ellamind နှင့် Merantix Momentum တို့ ပါဝင်သည်။
' overtraining ' အကြောင်း ငြင်းခုံခြင်း၊
လွှင့်တင်ပြီးနောက် မကြာမီတွင်၊ Soofi S သည် Google DeepMind မှထုတ်ဝေသော 2022 ခုနှစ်တွင်ထုတ်ဝေသော ဂန္တဝင် Chinchilla အတိုင်းအတာဥပဒေများ၏စံနှုန်းများဖြင့် ပြင်းထန်စွာလေ့ကျင့်ထားသည်ဟု ဝေဖန်သူများက စောဒကတက်ခဲ့ကြသည်။ တိုကင် ၂၇ ထရီလီယံနှင့် အကြမ်းဖျင်းအားဖြင့် ကန့်သတ်ဘောင် ၃၀ ဘီလီယံဖြင့်၊ Soofi S သည် ကန့်သတ်ချက်တစ်ခုလျှင် ရာဂဏန်းဖြင့် ဆင်းသက်သည်။ 3.2 billion active parameters များကိုသာရေတွက်ခြင်းက အချိုးကို ထောင်ပေါင်းများစွာသို့ တွန်းပို့ပါသည်။
ပရောဂျက်၏နည်းပညာပိုင်းဆိုင်ရာခေါင်းဆောင်မှု၏တစ်စိတ်တစ်ပိုင်းဖြစ်သော Michael Fromm သည် အဆိုပါစည်းမျဉ်းများကို MoE ဗိသုကာများထံမလွှဲပြောင်းပေးကြောင်း ငြင်းခုံကာ အဆိုပါဝေဖန်မှုများကို ပြန်လည်တွန်းလှန်ခဲ့သည်။ "သိပ်သည်းသောမော်ဒယ်များမှစကေးချဲ့ခြင်းဥပဒေအဟောင်းများသည် MoE ဗိသုကာများနှင့်သက်ဆိုင်ခြင်းမရှိတော့ကြောင်းပြသသည့် သုတေသနအသစ်တစ်ခုရှိသည်" ဟု Fromm မှ ပြောကြားပြီး ကျွမ်းကျင်သူများသည် ကြီးမားပြီး အရည်အသွေးမြင့်ဒေတာအတွဲတွင် တူညီသောစာရွက်စာတမ်းများကို ထပ်ခါတလဲလဲကြည့်ရှုခြင်းမှ အကျိုးကျေးဇူးရရှိကြောင်း Fromm မှပြောကြားခဲ့သည်။ နှိုင်းယှဉ်ချက်တစ်ခုအနေဖြင့်၊ သူသည် တိုကင် 25 ထရီလီယံအထိ ကိုယ်ပိုင်မော်ဒယ်များကို လေ့ကျင့်ပေးထားသည့် Nvidia ကို ညွှန်ပြခဲ့သည်။
ဘယ်ဟာက လွတ်လာသလဲ၊
သုတေသီများသည် ရွေးချယ်ထားသော အလယ်အလတ်စစ်ဆေးရေးဂိတ်များ၊ ပြီးပြည့်စုံသော လေ့ကျင့်ရေးနှင့် အကဲဖြတ်ကုဒ်များ၊ ကုန်ကြမ်းတိုကင်အရေအတွက်များ၊ ခေတ်နံပါတ်များနှင့် အရင်းအမြစ်အလိုက် ထိရောက်သောပံ့ပိုးမှုများကို ဖော်ပြသည့် အသေးစိတ်အချက်အလက်များစာရင်းကို သုတေသီများက မော်ဒယ်အလေးများ ထုတ်လွှတ်လျက်ရှိသည်။ အဖွဲ့၏အဆိုအရ၊ ဆိုလိုသည်မှာ Soofi S သည် Open Source Initiative မှ Open Source AI Definition 1.0 နှင့် ကိုက်ညီပါသည်။
လေ့ကျင့်ရေးတိုကင်တစ်ခုစီတိုင်းကို လွတ်လပ်စွာဖြန့်ဝေရန် လိုအပ်မည့် ဥရောပဒေတာဖွင့်ဆိုချက်အတွက် တင်းကျပ်သောအဆိုပြုချက်သည် ရောနှောမှု၏ 1.3 ရာခိုင်နှုန်းသည် စီးပွားရေးအရလိုင်စင်ရ Genios corpus မှ လာသောကြောင့် မလိုက်လျောပါ။ လေ့ကျင့်ရေးအချက်အလက်များ၏ 99 ရာခိုင်နှုန်းခန့်ကို လွတ်လပ်စွာ ပြန်လည်တည်ဆောက်နိုင်သည်ဟု အစီရင်ခံစာက ဆိုသည်။ မော်ဒယ်၏ ထုတ်ဝေမှုအတွက် လိုင်စင်အတိအကျကို ထုတ်ဝေသည့်အချိန်တွင် အပြီးသတ်နိုင်ခြင်း မရှိသေးပါ။
ယခုအခါ အဆိုပါလုပ်ငန်းစုသည် နည်းပညာဆိုင်ရာစာရွက်စာတမ်းများ၊ ကုဒ်ထုတ်လုပ်ခြင်းနှင့် အေးဂျင့်အခြေခံစနစ်များပါ၀င်သည့် အက်ပ်လီကေးရှင်းများတွင် Soofi S ကို စမ်းသပ်ရန်အတွက် နောက်အဆင့်အတွက် လုပ်ငန်းမိတ်ဖက်များကို ရှာဖွေလျက်ရှိသည်။ ပွင့်လင်းမြင်သာသော မော်ဒယ်ထုတ်ပြန်မှုများ၊ အချုပ်အခြာအာဏာပိုင် AI အခြေခံအဆောက်အအုံနှင့် ဥရောပ AI ဂေဟစနစ်ဆိုင်ရာ နောက်ထပ်အချက်အလက်များအတွက်၊ ဤနေရာတွင် ထုတ်ပြန်ထားသည့် AI လုပ်ငန်းဆိုင်ရာ လွှမ်းခြုံမှု ကို ဆက်လက်ဖတ်ရှုပါ။
open-source AI ကို ရှေ့ဆက်ပါ။
Open-weight ဖြန့်ချိမှုများသည် အမေရိကန်၊ တရုတ်နှင့် ယခုဥရောပရှိ ဓာတ်ခွဲခန်းများမှ အပတ်စဉ်နီးပါး ရောက်ရှိနေပြီး အကြီးဆုံးသော သီးသန့်မော်ဒယ်များနှင့် အကောင်းဆုံး အဖွင့်ရွေးချယ်မှုများကြား ကွာဟချက်မှာ ကျဉ်းမြောင်းနေပါသည်။ ထူးခြားသော AI သတင်း နှင့် ပုံအပြည့်အစုံအတွက် ဤနေရာတွင် စံနှုန်းခွဲခြမ်းစိတ်ဖြာမှုကို လိုက်နာပါ။
AI မော်ဒယ်လွှမ်းခြုံမှု →


