Inception Labs သည် ကုမ္ပဏီမှ စျေးကွက်တွင် စွမ်းရည်အရှိဆုံး diffusion LLM အဖြစ် ဖော်ပြထားသည့် ၎င်း၏ စီးပွားဖြစ် diffusion language model ၏ ဗားရှင်းအသစ်ဖြစ်သော Mercury 2.5 ကို အင်္ဂါနေ့တွင် ထုတ်ပြန်ခဲ့ပြီး ၎င်း၏ အသိပညာအရ လေ့ကျင့်ထားသမျှ အကြီးမားဆုံး diffusion language model ဖြစ်သည်။ ကုမ္ပဏီ၏ကြေညာချက်အရ၊ မော်ဒယ်သည် ၎င်း၏ယခင် Mercury 2 ထက် ဥာဏ်ရည်ဥာဏ်သွေး 40% တိုးလာကာ တူညီသော latency နည်းပါးပြီး ကုန်ကျစရိတ်နည်းသော ဝန်ဆောင်မှုပရိုဖိုင်ကို ဆက်လက်ထိန်းသိမ်းထားကာ ပမာဏမြင့်မားသောအလုပ်များအတွက် ပျံ့နှံ့မှုဗိသုကာကို ဆွဲဆောင်မှုဖြစ်စေသည်။
CEO Stefano Ermon ဦးဆောင်သော ကုမ္ပဏီသည် Mercury 2.5 သည် GPT-5.6 Luna (Low)၊ Gemini 3.5 Flash-Lite နှင့် Claude Haiku 4.5 အပါအဝင် ကုန်ကျစရိတ်-အကောင်းဆုံးသော Frontier မော်ဒယ်များနှင့် နှိုင်းယှဉ်နိုင်သည်ဟု ဆိုထားသည်။ အဆိုပါ နှိုင်းယှဉ်မှုများကို ရောင်းချသူ-အစီရင်ခံတင်ပြထားပြီး သီးခြားစံနှုန်းများဖြင့် အတည်မပြုရသေးသော်လည်း ၎င်းတို့သည် ရှည်လျားသော သုတေသနပြုချင်စိတ်ပြင်းပြမှု—- autoregressive incumbents များအတွက် ထုတ်လုပ်မှုအစားထိုးတစ်ခုအဖြစ် ပျံ့နှံ့မှုပုံစံကို နေရာယူထားသည်။ နောက်ဆုံးထွက် AI မော်ဒယ်သတင်းအတွက် AI Buzz Wire ၏ လက်ရှိမော်ဒယ်လွှမ်းခြုံမှုကို လိုက်နာပါ။ နောက်ဆုံးပေါ် AI မော်ဒယ်သတင်း
မြန်နှုန်း၊ အကြောင်းအရာနှင့်စျေးနှုန်း
ခေါင်းစီးနံပါတ်များသည် ပြင်းထန်သည်။ Inception Labs မှ Mercury 2.5 သည် ကျယ်ကျယ်ပြန့်ပြန့်ရရှိနိုင်သော NVIDIA GPU များတွင် တစ်စက္ကန့်လျှင် တိုကင် 1,107 ထုတ်ပေးပြီး ဆက်စပ်ဝင်းဒိုး 260,000 တိုကင်များ ထုတ်ပေးသည်ဟု Inception Labs မှပြောကြားခဲ့သည်။ စျေးနှုန်းသည် ထည့်သွင်းမှုတိုကင်တစ်သန်းလျှင် $0.20 နှင့် output tokens တစ်သန်းလျှင် $0.75 သတ်မှတ်ထားပြီး၊ model ကို 80% မှ $0.04 per million per input နှင့် output တစ်သန်းလျှင် $0.15 အထိ လျှော့စျေးဖြင့် သတ်မှတ်ပါသည်။
စွမ်းဆောင်ရည်ဘက်တွင်၊ မော်ဒယ်သည် ညှိယူနိုင်သော ကျိုးကြောင်းဆီလျော်မှုဖြင့် ပေးပို့သည် — တောင်းဆိုချက်တစ်ခုချင်းအတွက် အတိမ်အနက်အတွက် ဆော့ဖ်ဝဲရေးသားသူများအား latency ကုန်သွယ်မှုပြုစေသည် — အပြိုင်တူးလ်ခေါ်ဆိုမှုများနှင့် ဖွဲ့စည်းတည်ဆောက်ထားသည့်မျိုးဆက်အတွက် schema-aligned JSON အထွက်များနှင့်အတူ ပေးပို့သည်။ ကုမ္ပဏီသည် ထုတ်လုပ်မှု တယ်လီမီတာဖြင့် မောင်းနှင်သည့် လေ့ကျင့်ရေးကွင်း၏ ပထမဆုံးရလဒ်အဖြစ် ထုတ်ဝေမှုကို ဘောင်ခတ်သည်- Mercury 2 ကို စတင်ထုတ်လုပ်ကတည်းက ထောင်နှင့်ချီသော developer များက ၎င်းကို တည်ဆောက်ခဲ့ပြီး၊ လုပ်ငန်းပေါင်း ဒါဇင်ပေါင်းများစွာက ၎င်းကို အသုံးပြုခဲ့ကြပြီး အသုံးပြုမှုမှာလည်း အတိုင်းအတာတစ်ခုထက်ပို၍ ကြီးထွားလာခဲ့သည်။
ဘာကြောင့် Diffusion Models တွေက Text ကို ပိုမြန်အောင်လုပ်တာလဲ။
OpenAI၊ Google နှင့် Anthropic တို့မှ ပင်မ LLM များသည် အလိုအလျောက် ဆုတ်ယုတ်သွားသည်- ၎င်းတို့သည် တစ်ကြိမ်လျှင် တိုကင်တစ်ခုစီကို ထုတ်ပေးပြီး ၎င်းတို့သည် တိုကင်တစ်ခုစီကို ၎င်းတို့ရှေ့မှ ထုတ်လုပ်လိုက်သည့်အရာအားလုံးတွင် သတ်မှတ်ပေးထားသည့် စာသားတစ်ခုစီကို ထုတ်ပေးသည်။ ထိုဆင့်ကဲ မှီခိုမှုသည် မျိုးဆက်အမြန်နှုန်းအောက်တွင် ခက်ခဲသောကြမ်းပြင်ကို ဖြစ်စေသည်။ Diffusion ဘာသာစကားမော်ဒယ်များသည် ဆူညံသံပိတ်ဆို့ခြင်းမှအစပြုပြီး ၎င်းအစား တိုကင်များအားလုံးကို အပြိုင်အထပ်ထပ် သန့်စင်စေပြီး၊ မော်ဒယ်ကို သန့်ရှင်းစွာ ပေါင်းစည်းရန် လေ့ကျင့်ထားသည်နှင့် သမားရိုးကျ GPU ဟာ့ဒ်ဝဲတွင် ပိုမိုမြင့်မားသော ပမာဏကို ခွင့်ပြုပေးပါသည်။
အပေးအယူသည် သမိုင်းကြောင်းအရ အရည်အသွေးများဖြစ်သည်- ပျံ့နှံ့မှုပုံစံများသည် ကျိုးကြောင်းဆင်ခြင်ခြင်းနှင့် ညွှန်ကြားချက်များအတိုင်း စံနှုန်းများပေါ်တွင် အလိုအလျောက်နောက်ပြန်ဆုတ်သွားခြင်းများကို နောက်ကောက်ချခဲ့သည်။ Inception Labs ၏ အဓိက လောင်းကြေး - နှင့် Mercury 2.5 ၏ အရင်းခံ တောင်းဆိုချက် - သည် ဤကွာဟချက်သည် ဝင်ရိုးပေါ်တွင် သုံးစွဲသူအများစု အမှန်တကယ်ခံစားရသည့် ပျံ့နှံ့မှုအား အောင်နိုင်သည်- ဤကွာဟချက်သည် ဝင်ရိုးပေါ်ရှိ ကြာမြင့်ချိန်နှင့် ကုန်ကျစရိတ်တို့ဖြစ်သည်။
အစောပိုင်းဖောက်သည်များထံမှ ထုတ်လုပ်မှုတောင်းဆိုမှုများ
ကြေညာချက်သည် စံနှုန်းဇယားများထက် သုံးစွဲသူများ၏ ဖြန့်ကျက်မှုအပေါ် ကြီးကြီးမားမား သက်ရောက်မှုရှိသည်။ တိုက်ရိုက်ဖောက်သည်ခေါ်ဆိုမှုအတွက် AI ဖုန်းအေးဂျင့်များကိုတည်ဆောက်သည့် OpenCall သည် Mercury သို့ပြောင်းရွှေ့ခြင်းသည် ၎င်း၏ပျမ်းမျှမော်ဒယ်တုံ့ပြန်မှုကြာချိန်ကို အကြမ်းဖျင်း 170 မီလီစက္ကန့်အထိ ယူဆောင်လာကြောင်း အစီရင်ခံတင်ပြခဲ့သည်။ OpenCall ၏ပူးတွဲတည်ထောင်သူနှင့် CEO ဖြစ်သူ Oliver Silverstein က ကုမ္ပဏီ၏ P99 တုံ့ပြန်ချိန်သည် မိနစ်များစွာမှ တစ်စက္ကန့်သို့ ကျဆင်းသွားပြီး ၎င်း၏ပျမ်းမျှ 0.4 စက္ကန့်မှ 0.2 အောက်သို့ — ကျိုးကြောင်းဆင်ခြင်ခြင်းဖွင့်ထားမှုအပါအဝင် ကုမ္ပဏီမှစမ်းသပ်ထားသည့် အခြားဝန်ဆောင်မှုပေးသူများထက် သိသိသာသာမြန်သည်ဟု ဖော်ပြခဲ့သည်။
AI ကုဒ်ရေးသည့် လက်ထောက်ထုတ်လုပ်သူဖြစ်သည့် Augment Code သည် အကြောင်းအရာအသေးစိတ်၊ မော်ဒယ်လမ်းကြောင်းသတ်မှတ်ခြင်းနှင့် MCP တူးလ်ရှာဖွေမှုအတွက် Mercury ကို အသုံးပြုသည်။ Inception Labs ၏ အဆိုအရ၊ မာကျူရီသို့ သေးငယ်သော ပမာဏကို ရွှေ့ခြင်းသည် ထိုအဆင့်၏ latency ကို 82% မှ 150 စက္ကန့်မှ 27 စက္ကန့်အထိ လျှော့ချပြီး အရည်အသွေးကို ထိန်းသိမ်းထားစဉ် ၎င်း၏ကုန်ကျစရိတ်ကို 90% လျှော့ချခဲ့သည်။ အသုံးပြုမှုကိစ္စသည် စီးပွားရေးအကိုက်အခဲခံရသည့်နေရာကို သရုပ်ဖော်သည်- coding အေးဂျင့်များသည် မူလမျိုးဆက်တစ်ခုစီတွင် သေးငယ်သောပံ့ပိုးမှုပုံစံခေါ်ဆိုမှုများစွာကို ပြုလုပ်ကြပြီး ယင်းခေါ်ဆိုမှုများတွင် latency နှင့် ကုန်ကျစရိတ်များ ပေါင်းစပ်ထားသည်။
မော်ဒယ်၏ ဟာ့ဒ်ဝဲကို လုပ်ဆောင်သည့် NVIDIA သည် လည်း အလေးချိန်လည်း ပါသည်။ NVIDIA ၏ Accelerated Computing Group မှ ထုတ်ကုန်အကြီးတန်းမန်နေဂျာ Shruti Koparkar က Inception သည် NVIDIA AI အခြေခံအဆောက်အအုံတွင် အဆင့်မြင့် diffusion-based language model များရှိပြီး Mercury 2.5 ၏ အရည်အသွေးကို အရှိန်မြှင့်လိုက်ခြင်းဖြင့် ထုတ်လုပ်မှုစနစ်သစ်များ မည်မျှ လျင်မြန်စွာ ဖြစ်ထွန်းနိုင်သည်ကို ပြသနေပါသည်။
Mercury Voice နှင့် Mercury Router အစမ်းကြည့်ရှုမှုများ
မော်ဒယ်နှင့်အတူ၊ Inception Labs သည် ထုတ်ကုန်အသစ်နှစ်ခု၏ အစမ်းကြည့်ရှုမှုများကို ကြေညာခဲ့သည်။ Mercury Voice သည် အတင်းကျပ်ဆုံး latency ဘတ်ဂျက်များ၊ 170 မီလီစက္ကန့်အောက် ကြော်ငြာဆိုင်းဘုတ်များအောက်ရှိ အသံအေးဂျင့်များအတွက် အကောင်းဆုံးပြုလုပ်ထားသည့် ပျံ့နှံ့မှု LLM ဖြစ်သည်။ Mercury Router သည် ဝင်လာသော အချက်ပြမှုများကို နားလည်ရန်နှင့် ၎င်းတို့အား မည်သည့်မော်ဒယ်လ်သို့ — အဖွင့် သို့မဟုတ် ပိတ်သည်ဖြစ်စေ — အရည်အသွေး၊ မြန်နှုန်းနှင့် ကုန်ကျစရိတ်ကို အကောင်းဆုံးပေါင်းစပ်ပေးကာ Inception ကို ၎င်း၏ပြိုင်ဘက်များထက် အလွှာတစ်ခုအဖြစ် သတ်မှတ်ပေးသည့်အပြင် ၎င်းတို့ထဲမှတစ်ခုဖြစ်သည်။
Mercury 2.5 ကို Inception ၏ကိုယ်ပိုင် API အပြင် Baseten နှင့် OpenRouter မှတဆင့် ရရှိနိုင်ပါသည်။ လုပ်ငန်း ဖြန့်ကျက်မှုများတွင် သီးခြားစွမ်းရည်၊ အလိုအလျောက် အတိုင်းအတာ၊ လိုက်လျောညီထွေမှု ထိန်းချုပ်မှုများ နှင့် ပြင်ဆင်သတ်မှတ်နိုင်သော ဒေတာ ထိန်းသိမ်းမှုတို့ကို ပေါင်းထည့်ပါသည်။ ကုမ္ပဏီသည် API ကိုကြိုးစားနေသော developer များအား အခမဲ့ တိုကင်ပေါင်း သန်း 100 ကို ပေးဆောင်နေသည်။
ကုမ္ပဏီသည် ၎င်း၏နောက်ထပ်မော်ဒယ်ကို လေ့ကျင့်မှုစတင်နေပြီဖြစ်သည်—၎င်း၏အကြီးဆုံးဖြစ်သော၊ လာမည့်လများအတွင်းထွက်ရှိရန်ပစ်မှတ်ထားသည်—ပျံ့နှံ့မှု၏အမြန်နှုန်း သို့မဟုတ် တိုကင်ထိရောက်မှုတို့ကို မပေးဆောင်နိုင်သည့်စွမ်းရည်ခုန်တက်မှုတစ်ခုအဖြစ်ဖော်ပြသည်။ ယင်းတောင်းဆိုမှုအား ဆက်လက်ထိန်းသိမ်းထားမည်ဆိုပါက၊ စျေးနှုန်းနှင့် latency အများစုသည် စာချုပ်အများစုကို ဆုံးဖြတ်သည့် စျေးကွက်၏ ကုန်စည်အဆင့်များတွင် autoregressive ဖိအားများကို ဦးစွာခံစားရမည်ဖြစ်ပါသည်။
AI ၏ရှေ့တွင်နေရန်
မော်ဒယ်ဗိသုကာအသစ်များ ထုတ်လုပ်မှုတွင် အပြိုင်အဆိုင် ယှဉ်ပြိုင်နေစဉ် နောက်ဆုံးပေါ် AI တိုးတက်မှုများကို လိုက်နာပြီး ဉာဏ်ရည်တုဆိုင်ရာ သတင်းများကို ချိုးဖောက်လိုက်ပါ။
AI သတင်းအပြည့်အစုံကို ဖတ်ရှုရန် →