Ornith အဖွဲ့သည် ပုံမှန်မဟုတ်သော အိုင်ဒီယာတစ်ခုကို ဖန်တီးတည်ဆောက်ထားသော အလွတ်အလေးချိန် ဘာသာစကား မော်ဒယ်မိသားစုဖြစ်သည့် Ornith-1.5 ကို ထုတ်ဝေလိုက်သည်- မော်ဒယ်သည် ၎င်း၏ကိုယ်ပိုင် လေ့ကျင့်ရေးတာဝန်များကို ထုတ်ပေးသည်၊ ၎င်း၏ကိုယ်ပိုင် ငြမ်းများကို ဒီဇိုင်းထုတ်ကာ စဉ်ဆက်မပြတ် လည်ပတ်နေသည့် ကွင်းဆက်တစ်ခုအတွင်း ၎င်း၏ ကိုယ်ပိုင်ဖြေရှင်းနည်းများမှ သင်ယူခဲ့သည်။ အဖွဲ့၏ကိုယ်ပိုင်အကဲဖြတ်ချက်များအရ အထင်ကရ Ornith-1.5-397B သည် Terminal-Bench 2.1 (Terminus-2) တွင် 86.1 ရမှတ်) ဖြင့် Anthropic's Claude Opus 4.8 တွင် 85.0 နှင့် နှိုင်းယှဉ်နိုင်သော အရွယ်အစားရှိ အခြားသော open-source မော်ဒယ်တိုင်းထက် သာလွန်ပါသည်။
ယခုအပတ်တွင် Ornith ဘလော့ဂ်နှင့် MIT လိုင်စင်အောက်တွင် ထုတ်ဝေထားသော Hugging Face သည် နယ်ခြားဓာတ်ခွဲခန်း၏ဘတ်ဂျက်မပါဘဲ မဖြစ်နိုင်ဖူးဟု တစ်ချိန်က ထင်ထားသည့်ရလဒ်များကို ပုံမှန်ထုတ်ပေးခဲ့သော open-source AI ပြိုင်ပွဲတွင် နောက်ဆုံးထွက်ရှိထားသော salvo တစ်ခုဖြစ်သည်။ [နောက်ဆုံးပေါ် AI မော်ဒယ်သတင်း] (https://aibuzzwire.news) ကို ခြေရာခံသည့် developer များနှင့် လုပ်ငန်းများအတွက် အဓိပ္ပာယ်မှာ နှစ်ဆဖြစ်သည်- ထိပ်တန်းပိတ်မော်ဒယ်နှင့် စံနှုန်းတူညီမှု၊ ပွင့်လင်းမော်ဒယ်ဖွံ့ဖြိုးတိုးတက်မှုနောက်သို့ ဦးတည်သွားမည့် လေ့ကျင့်ရေးစာရွက်။
အရွယ်အစားသုံးမျိုး၊ ချက်နည်းတစ်ခု
Ornith-1.5 သည် 397B ပါရာမီတာ အရောအနှော-ကျွမ်းကျင်သူများ၏ အထင်ကရ စွမ်းဆောင်ရည်၊ 35B MoE သင်္ကေတတစ်ခုလျှင် 3B ဘောင်များကိုသာ အသက်ဝင်စေသော၊ နှင့် ကျစ်လစ်သိပ်သည်းသော 9B သိပ်သည်းသော မော်ဒယ်ကို iPhone နှင့် Android စက်ပစ္စည်းများတွင် တိုက်ရိုက်လည်ပတ်ရန် ဒီဇိုင်းထုတ်ထားသည့် "မိုဘိုင်း" ဗားရှင်းဖြင့် တိုက်ရိုက်အသုံးပြုနိုင်ပါသည်။ သုံးခုလုံးကို GGUF၊ MLX နှင့် NVFP4 တည်ဆောက်မှုများနှင့်အတူ Hugging Face တွင် ရရှိနိုင်ပြီး မော်ဒယ်ကတ်များသည် မိသားစုကို Qwen3.5 MoE ဗိသုကာဖြင့် တည်ဆောက်ထားကြောင်း ညွှန်ပြသည်။
မျိုးရိုးက ဒီမှာ အရေးကြီးတယ်။ ယခုနှစ်အစောပိုင်းတွင်ထွက်ရှိခဲ့သော Ornith-1.0 သည် အေးဂျင့်ကုဒ်ရေးခြင်းအတွက် "ကိုယ်တိုင်ငြမ်းဆင်ခြင်း" ချဉ်းကပ်မှုကို ရေပန်းစားလာခဲ့ပြီး ၎င်း၏ 9B GGUF တည်ဆောက်မှုသည် Hugging Face တွင် ဒေါင်းလုဒ်ငါးသန်းကျော်ဝင်ရောက်ခဲ့သည်။ Ornith-1.5 သည် ထိုမူဘောင်ကို ငြမ်းများနှင့် လွှတ်တင်မှုများကို ပိုမိုကောင်းမွန်အောင်ပြုလုပ်ခြင်းမှ အပြည့်အဝ မိမိကိုယ်ကို ပြုပြင်မွမ်းမံထားသော ပိုက်လိုင်းတစ်ခုသို့ တိုးချဲ့သည်။
Self-Improvement Loop ကို ရှင်းပြထားသည်။
သမားရိုးကျ လေ့ကျင့်ရေးလွန် ပိုက်လိုင်းတစ်ခုတွင်၊ အားဖြည့်သင်ကြားမှုသည် လူရွေးချယ်ထားသော အလုပ်များကို ပုံသေသတ်မှတ်ထားသော အလုပ်များနှင့် ဆန့်ကျင်သည်။ ၎င်းအစား Ornith-1.5 တွင် အလုပ်အသစ်များကို အဆိုပြုကာ၊ အလုပ်-သတ်သတ်မှတ်မှတ် ငြမ်းတစ်ခု—ပြဿနာကို တိုက်ခိုက်ရန် အသုံးပြုသည့် ညွှန်ကြားချက်များ၊ ကိရိယာများနှင့် ပြိုကွဲပျက်စီးခြင်းဆိုင်ရာ ဗျူဟာ—တို့ကို ဖန်တီးပြီးနောက် ၎င်းတည်ဆောက်ထားသော ငြမ်းမှ အမှတ်ရရှိသည့် အဖြေထုတ်ပေးမှုများကို ထုတ်လုပ်ပါ။ GRPO ကို အသုံးပြု၍ အဆင့်သုံးဆင့်စလုံးဖြင့် ဆုလာဘ်ကို ပြန်လည်ဖြန့်ဝေပေးသည်၊ ထို့ကြောင့် စနစ်သည် ပိုမိုကောင်းမွန်သောလုပ်ဆောင်စရာများ၊ ပိုမိုကောင်းမွန်သော ငြမ်းများနှင့် ပိုမိုကောင်းမွန်သောဖြေရှင်းချက်များကို ရေးသားတတ်ရန် သင်ယူနေပါသည်။
အလုပ်မျိုးဆက်ဆုလာဘ်သည် ဒီဇိုင်း၏ နှလုံးသားဖြစ်သည်။ အဆိုပြုထားသည့်လုပ်ငန်းတစ်ခုစီကို ပွားများသည့်အချက်သုံးချက်ဖြင့် အမှတ်ပေးသည်- တရားဝင်မှု (Scaffold ကို လုပ်ဆောင်ပြီး မှန်ကန်စွာ အကဲဖြတ်မလား။)၊ Frontier အခက်အခဲ (မော်ဒယ်၏ ပင်ကိုယ်အောင်မြင်မှုနှုန်းသည် အကြမ်းဖျင်းအားဖြင့် 20 ရာခိုင်နှုန်း ရည်မှန်းထားသည်၊ စိန်ခေါ်မှုရှိသော်လည်း သင်ယူနိုင်သော အလုပ်များကို ထိန်းထားနိုင်သည်လား။) နှင့် အသစ်အဆန်း (၎င်းသည် ယခင်လုပ်ဆောင်ခဲ့သော လုပ်ဆောင်စရာများအားလုံးနှင့် လုံလောက်စွာ ကွာခြားပါသလား။ မော်ဒယ်၏ လက်ရှိအောင်မြင်မှုနှုန်းနှင့် အခက်အခဲကို တိုင်းတာသောကြောင့်၊ မော်ဒယ်တိုးတက်သည်နှင့်အမျှ သင်ရိုးညွှန်းတမ်းသည် အလိုအလျောက် ကြီးထွားလာသည်။
အဖွဲ့သည် အကဲဖြတ်နေစဉ်အတွင်း တိကျပြတ်သားသော ဟက်ကင်းမှုဆိုင်ရာ အစီအမံများကို အစီရင်ခံတင်ပြသည်- git မှတ်တမ်းကို သိုလှောင်ပုံများမှ ဖယ်ထုတ်ထားသောကြောင့် မော်ဒယ်များသည် ယခင်ဖြေရှင်းချက်များအား ပြန်လည်ရယူ၍မရသည့်အပြင် မော်ဒယ်များမှ ပြင်ပအဖြေများကို ရယူခြင်းမှ ကာကွယ်ရန်အတွက် ကွန်ရက်ဝင်ရောက်မှုကို ပိတ်ထားသည်။ ရလဒ်အားလုံးသည် ပျမ်းမျှ အမှီအခိုကင်းသော အပြေးငါးခုကျော်ရှိသည်။
##နံပါတ်များ
အေးဂျင့်ကုဒ်ရေးခြင်းတွင်၊ ထိပ်တန်းအစီရင်ခံသည့်ရလဒ်များသည် ပွင့်လင်းအရင်းအမြစ်အကွက်၏ထိပ်တွင် အစုအဝေးဖြစ်သည်။ Terminal-Bench 2.1 တွင် Terminus-2 ကြိုးကြိုးကိုဖြတ်၍ Ornith-1.5-397B ၏ 86.1 အစွန်းများသည် Claude Opus 4.8 (85.0), DeepSeek-V4-Flash-0731 (82.7) နှင့် GLM-5.2 (81) တို့ဖြစ်သည်။ Claude Code ကြိုးကြိုးကိုဖြတ်၍ တူညီသောစံနှုန်းတွင်၊ Ornith-1.5 သည် Opus 4.8 ၏ 78.9 ကိုဆန့်ကျင်သည့် 85.2 ကို တင်ထားသည်။ SWE-bench Verified တွင်၊ နှစ်ခုကို 86.0 နှင့် 85.8 တွင် ထိထိရောက်ရောက် ချိတ်ဆက်ထားပြီး Kimi K3 သည် 86.2 တွင် အနည်းငယ်ရှေ့ရောက်နေပါသည်။
ပိုမိုခက်ခဲသော အေးဂျင့်အတွဲများတွင် ကွာဟချက်များ ကျယ်ပြန့်လာသည်။ DeepSWE တွင် Ornith-1.5-397B သည် 56.0 ရမှတ်ဖြစ်သည် — Opus 4.8 (59.0) နှင့် Kimi K3 (67.5) တို့၏နောက်တွင် GLM-5.2 ၏ 46.2 ထက်သာလွန်သည်။ အထူးခြားဆုံးခုန်သည် မျိုးဆက်အလိုက်ဖြစ်သည်- Ornith-1.0 သည် DeepSWE တွင် 8.0 သာရခဲ့သည်၊ ဆိုလိုသည်မှာ ထပ်ခါထပ်ခါအသစ်က တူညီသောစံနှုန်းမိသားစုတွင် ခုနစ်ဆတိုးတက်မှုကို ပေးစွမ်းသည်။
မော်ဒယ်ငယ်လေးတွေက သူတို့ရဲ့ ဇာတ်လမ်းကို ပြောပြတယ်။ Ornith-1.5-35B-A3B၊ တိုကင်တစ်ခုလျှင် 3B ဘောင်များကိုသာ အသက်သွင်းခြင်းဖြင့် Terminal-Bench 2.1 (Claude Code) တွင် 68.5 ရမှတ်သည် Google ၏ Gemma 4-31B အတွက် 43.4 နှင့် Meta's Muse Glimmer-30B အတွက် 51.7 ရမှတ်ဖြစ်သည်။ နှင့် Post-Verse 9B မော်ဒယ်သည် Terminal-Bench 2.1၊ SWE-bench Verified တွင် 70.6 နှင့် GPQA Diamond တွင် 86.4 အထိ ရောက်ရှိသည် — နံပါတ်များသည် desktop-class ပြိုင်ဘက်များနှင့် အကွာအဝေးအတွင်း ဖုန်းအတန်းအစားမော်ဒယ်ကို ထင်ရှားစေသည်။
သတိပေးချက်များနှင့် အကြောင်းအရာ
၎င်းတို့သည် အမှီအခိုကင်းစွာ စစ်ဆေးထားသော ရလဒ်များမဟုတ်ဘဲ ဆော့ဖ်ဝဲရေးသားသူမှ လုပ်ဆောင်သော စံသတ်မှတ်ချက်များဖြစ်ပြီး နှိုင်းယှဉ်မှုပုံစံများကို ၎င်း၏ကိုယ်ပိုင်ကြိုးကြိုးဆက်တင်များအောက်တွင် Ornith အဖွဲ့မှ အကဲဖြတ်ခဲ့သည်။ ပြိုင်ဘက်ဓာတ်ခွဲခန်းများသည် မတူညီသော အပေးအယူများကို ညှိပေးသည်။ DeepSWE တွင် Kimi K3 ၏ ဦးဆောင်မှုမှာ အေးဂျင့်ဆော့ဖ်ဝဲအလုပ်၏ နယ်နိမိတ်သည် ပြိုင်ဆိုင်နေဆဲဖြစ်ကြောင်း အကြံပြုသည်။ သို့သော် ထုတ်ဝေမှု၏ ဇယားအပြည့် ပွင့်လင်းမြင်သာမှု— ပျမ်းမျှငါးကြိမ်၊ ထုတ်ဝေထားသော ကြိုးစည်းဖွဲ့စည်းပုံများ၊ ထုတ်ဖော်ကာကွယ်မှုများ — သည် လွတ်လပ်သောမျိုးပွားမှုကို ထူးထူးခြားခြား ရိုးရှင်းစေသည်။
လူမှုအသိုင်းအဝိုင်း၏ တုံ့ပြန်မှုမှာ ကြီးမားသည်။ ထုတ်ဝေလိုက်သော ကြေငြာချက်သည် နာရီပိုင်းအတွင်း Hacker News တွင် အချက်တစ်ရာကျော် ရရှိခဲ့ပြီး၊ ဆွေးနွေးမှုတွင် စံနှုန်းတောင်းဆိုမှုများထက် စံနှုန်းတောင်းဆိုမှုများအပေါ် အာရုံစိုက်မှု နည်းပါးခဲ့ပြီး၊ မှတ်ချက်ပေးသူအများအပြားက recursive-style task generation ၏ ပိုမိုယုံကြည်စိတ်ချရသော ပွင့်လင်းမြင်သာမှုရှိသော အကောင်အထည်ဖော်မှုများထဲမှ တစ်ခုဖြစ်သည်ဟု မှတ်ချက်ပေးသူအများအပြားက ဖော်ပြထားသည့် self-improvement methodology ထက် လျော့နည်းသွားခဲ့သည်။
Open-source ဂေဟစနစ်အတွက်၊ Ornith-1.5 သည် တရုတ်နိုင်ငံ၏ ဓာတ်ခွဲခန်းများနှင့် အနောက်တိုင်း အမှီအခိုကင်းသော အဖွဲ့များမှ ဖွင့်ထားသော မော်ဒယ်လ်များသည် ကုဒ်ရေးခြင်း နှင့် အေးဂျင့်လုပ်စရာများဆိုင်ရာ လုပ်ငန်းဆောင်တာများအတွက် ပိတ်ထားသော နယ်နိမိတ်များနှင့်အတူ ကွာဟချက်ကို ပိတ်လိုက်ပါသည်။ Terminal-Bench တွင် ထိပ်တန်းပိတ်မော်ဒယ်လ်နှင့် ကိုက်ညီသည့် MIT လိုင်စင်ရ မိသားစုတစ်ခု — နှင့် ဖုန်း-အဆင်သင့် 9B မျိုးကွဲတစ်ခုကို တင်ပို့သည် — ထိုကွာဟချက်ကို ပိုမိုကျဉ်းမြောင်းစေပြီး မည်သူမဆို စစ်ဆေးခြင်း၊ မျိုးပွားခြင်းနှင့် တိုးချဲ့နိုင်သည့် လေ့ကျင့်ရေးနည်းလမ်းဖြင့် လုပ်ဆောင်ပါသည်။
---
AI ၏ရှေ့တွင်နေရန်နောက်ဆုံးပေါ် AI သတင်းများ၊ ခွဲခြမ်းစိတ်ဖြာမှုနှင့် အောင်မြင်မှုများ—အားလုံးကို တစ်နေရာတည်းတွင် ရယူပါ။
AI သတင်းအပြည့်အစုံကို ဖတ်ရှုရန် →