Google သည် ယခုအပတ်အတွင်း သိသာထင်ရှားသော Gemini မော်ဒယ်မွမ်းမံမှုနှစ်ခုကို တိတ်တဆိတ် ပေးပို့ခဲ့ပြီး နှစ်ခုစလုံးသည် developer များ ထုတ်လုပ်မှုဆိုင်ရာ အပလီကေးရှင်းများတည်ဆောက်ခြင်းအတွက် ရည်ရွယ်ပါသည်။ Gemini 3.5 Transcribe သည် သြဂုတ်လ 26 ရက်နေ့တွင် မိတ်ဆက်ခဲ့သည်၊ သည် ကုမ္ပဏီ၏ ယနေ့အထိ အတိကျဆုံး စကားပြောမှစာသားပုံစံဖြစ်သည် ဟု Google ၏တရားဝင်ဘလော့ဂ်အရ သိရသည်။ Gemini Omni 1.1 Flash သည် သြဂုတ်လ 27 ရက်နေ့တွင် ကြေညာခဲ့ပြီး၊ စက္ကန့် 40 အထိ မြင်ကွင်းတိုးချဲ့မှုနှင့် 4K ချဲ့ထွင်မှုအပါအဝင် ပရော်ဖက်ရှင်နယ်အဆင့် ထိန်းချုပ်မှုများကို မျိုးဆက်သစ်ဗီဒီယိုသို့ ယူဆောင်လာသည်။ မော်ဒယ်နှစ်မျိုးလုံးကို Google AI Studio နှင့် Gemini Enterprise Agent Platform ရှိ Gemini API မှတဆင့် ရရှိနိုင်ပါသည်။
Gemini 3.5 စာသားမှတ်တမ်း- သူ့အလိုလို သန့်စင်သွားသော စကားမှ စာသား For more context on this story, see our ongoing artificial intelligence updates.
Gemini 3.5 သည် သမားရိုးကျ စကားပြောမှတ်သားခြင်းမှ စာသားမှတ်တမ်းကို ခွဲခြားသိမြင်စေသည့်အချက်မှာ ၎င်းသည် အကြမ်းထည်အသံကို စာသားအကြမ်းမဟုတ်ဘဲ ဖော်မက်လုပ်ထားသည့် စာသားအဖြစ်သို့ တိုက်ရိုက်ပြောင်းလဲပေးခြင်းဖြစ်ကြောင်း Google က ဆိုသည်။ မော်ဒယ်သည် နောက်ခံဆူညံသံ၊ ရှုပ်ထွေးသော ဗန်းစကားနှင့် ညစ်ညမ်းရှင်းလင်းမှုကို မူရင်းအတိုင်း ကိုင်တွယ်သည် — ၎င်းသည် "ums" နှင့် "ahs" ကဲ့သို့သော အဖြည့်စကားလုံးများကို ဖယ်ရှားပေးကာ "အင်္ဂါနေ့တွင် တွေ့ဆုံကြပါစို့၊ ဗုဒ္ဓဟူးနေ့" ကဲ့သို့သော ကိုယ်တိုင်ပြင်ဆင်မှုများကို ဖြေရှင်းပေးကာ အထွက်ကို အလိုအလျောက်ဖော်မတ်ပေးပါသည်။
Google ကိုးကားထားသော စံနှုန်းနံပါတ်များသည် မှတ်သားဖွယ်ကောင်းသည်။ အတုအယောင် ခွဲခြမ်းစိတ်ဖြာမှုဖြင့် တိုင်းတာသည့်အတိုင်း၊ မော်ဒယ်သည် တိုက်ရိုက်လွှင့်အသုံးပြုမှုကိစ္စများအတွက် 4.0 ရာခိုင်နှုန်းနှင့် ထုတ်လွှင့်ခြင်းမဟုတ်သော အသံအတွက် 2.6 ရာခိုင်နှုန်း ရရှိသည်။ ထိပ်တန်းဘာသာစကားများတစ်လျှောက်ရှိ FLEURS ဘာသာပေါင်းစုံ စံသတ်မှတ်ချက်တွင်၊ ၎င်းသည် ထုတ်လွှင့်ခြင်းမုဒ်တွင် 5.50 ရာခိုင်နှုန်း WER နှင့် 5.04 ရာခိုင်နှုန်း ထုတ်လွှင့်ခြင်းမဟုတ်သော 5.04 ရာခိုင်နှုန်းတို့ကို Google ၏ယခင်စာသားမှတ်တမ်းပုံစံ Chirp 3 တွင် ပိုမိုကောင်းမွန်စေပါသည်။ နောက်ဆုံးဘာသာပြန်ဆိုခြင်းအချိန်သည် Chirp 3 နှင့် နှိုင်းယှဉ်ပါက 70 ရာခိုင်နှုန်း တိုးတက်လာသည်၊ Artificial Analysis မှ တိုင်းတာသည့်အတိုင်း ထပ်မံလုပ်ဆောင်ပါသည်။
မော်ဒယ်သည် အလုပ်အသွားအလာ နှစ်ခုအတွက် ဗားရှင်းနှစ်မျိုးဖြင့် ပေးပို့သည်။ တိုက်ရိုက်ထုတ်လွှင့်သည့်အက်ပ်လီကေးရှင်းများအတွက်၊ `gemini-3.5-transcribe-live` သည် Live API မှတစ်ဆင့် စက္ကန့်ခွဲကြာနေချိန်ဖြင့် အသံအေးဂျင့်များကို ပစ်မှတ်ထားပြီး အချိန်နှင့်တစ်ပြေးညီ စာတန်းထိုးခြင်းကို ပေးဆောင်သည်။ မှတ်တမ်းတင်ထားသော အသံအတွက် — အစည်းအဝေးများ၊ ခေါ်ဆိုမှုမှတ်တမ်းများ၊ မော်ကွန်းတိုက်များ — `gemini-3.5-transcribe` သည် စပီကာသုံးပုံအထိ (စမ်းသပ်မှုမုဒ်တွင် နောက်ထပ်ပံ့ပိုးမှုနှင့်အတူ) နှင့် အပြန်အလှန်တုံ့ပြန်မှု API မှတစ်ဆင့် စကားလုံးအဆင့်အချိန်တံဆိပ်များကို စပီကာသုံးပုံအထိ ထည့်သွင်းပေးထားပါသည်။
အခြားစွမ်းရည်များတွင် အသံထွက်နှင့် ဒေသိယစကား ကိုင်တွယ်မှုဖြင့် ဘာသာစကား 85 ကျော်တွင် အလိုအလျောက်သိရှိနိုင်ခြင်းနှင့် စာသားမှတ်တမ်းနှင့် စိတ်ကြိုက်ဝေါဟာရပံ့ပိုးမှုတို့ ပါဝင်သောကြောင့် မော်ဒယ်သည် အထူးပြုသော ဗန်းစကားနှင့် ထူးခြားသောစာလုံးပေါင်းများကို လိုက်လျောညီထွေဖြစ်စေသည်။ Google မှလည်း စံပြပုံစံကို မျက်စိကျစေသည်- လုပ်ဆောင်ချက်ခေါ်ဆိုခြင်းဖြင့်၊ ၎င်းသည် ရုပ်ပုံထုတ်လုပ်ခြင်း သို့မဟုတ် ဖိုင်ခွဲခြမ်းစိတ်ဖြာခြင်းကဲ့သို့သော လုပ်ငန်းဆောင်တာများကို အခြားသော Gemini မော်ဒယ်များသို့ လွှဲအပ်နိုင်သည် — macOS တွင် Gemini အက်ပ်တွင် လက်ရှိရရှိနိုင်သည့် အင်္ဂါရပ်တစ်ခုဖြစ်သည်။
Gemini Omni 1.1 Flash- ဗီဒီယိုမျိုးဆက်သည် အချိန်ဇယားတစ်ခုတိုးလာသည်။
ဒုတိယ လွှတ်တင်မှုသည် AI ဗီဒီယိုနှင့် ပတ်သက်၍ အဖြစ်အများဆုံး တိုင်ကြားချက်ကို ဖြေရှင်းသည်- ထိန်းချုပ်မှု။ Gemini Omni 1.1 Flash သည် ယခင်မျိုးဆက်များမဟုတ်သည့် ပုံစံအတိုင်း မျိုးဆက်သစ်ဗီဒီယိုကို ထိန်းညှိပေးသည့် ထုတ်လုပ်မှုကို အာရုံစိုက်သည့် အပ်ဒိတ်တစ်ခုဖြစ်ပြီး Google DeepMind ထုတ်ကုန်မန်နေဂျာ Anish Nangia နှင့် Alisa Fortin တို့က Omni 1.1 "ထုတ်လုပ်မှု- ပရော်ဖက်ရှင်နယ်အသုံးပြုရန်အတွက် အဆင်သင့်ဖြစ်စေသည်" ဟု ဖော်ပြထားပါသည်။
Scene extension သည် ခေါင်းစီးအင်္ဂါရပ်ဖြစ်သည်။ ဆော့ဖ်ဝဲရေးသားသူများသည် ယခုနောက်ဆုံးစက္ကန့်ကိုသာ ရည်ညွှန်းသည့် ယခင်မော်ဒယ်များမှ ခုန်ပျံကျော်လွှားကာ မော်ဒယ်သည် ယခင်အကြောင်းအရာ၏ 10 စက္ကန့်အထိ ခွဲခြမ်းစိတ်ဖြာခြင်းဖြင့် လက်ရှိကလစ်တစ်ခုမှ ချောမွေ့စွာ ဆက်လက်ရိုက်ကူးနိုင်ပြီဖြစ်သည်။ ဗီဒီယိုများကို 10 စက္ကန့်တိုး၍ တိုးမြှင့်နိုင်ပြီး ရှည်လျားသော စက္ကန့် 40 အထိ၊ ရုပ်ပိုင်းဆိုင်ရာ လိုက်လျောညီထွေရှိမှုနှင့် ရှည်လျားသောဇာတ်လမ်းများအတွက် ဇာတ်ကြောင်းတည်မှုကို ပိုမိုကောင်းမွန်စေပါသည်။
အပ်ဒိတ်တွင် ပထမနှင့် နောက်ဆုံး-ဖရိန် ပေါင်းစပ်ထည့်သွင်းမှုကိုလည်း ထည့်သွင်းပေးထားပြီး၊ ဆော့ဖ်ဝဲအင်ဂျင်နီယာများသည် ရိုက်ချက်များကြားတွင် ချောမွေ့ပြီး တမင်တကာ ကင်မရာလှုပ်ရှားမှုများနှင့် အကူးအပြောင်းများကို ဖန်တီးရန်အတွက် အစနှင့်အဆုံးဘောင်များကို သတ်မှတ်ခွင့်ပြုသည်။ ပေးပို့မှုအတွက်၊ ပြီးသွားသော ပရောဂျက်များကို 4K ရုပ်ထွက်အဆင့်အထိ မြှင့်တင်နိုင်ပြီး 360p အစမ်းကြည့်ရှုသည့်မုဒ်တွင် ထုတ်လုပ်သူများသည် နောက်ဆုံးတင်ဆက်မှုများကို မလုပ်ဆောင်မီ အချက်ပြမှုများကို မြန်မြန်ဆန်ဆန်နှင့် ဈေးပေါပေါဖြင့် ထပ်တလဲလဲ ပြုလုပ်နိုင်ပါသည်။
API မှနေ့စဉ်မျက်နှာပြင်များအထိ
Google သည် ၎င်း၏ ဖြန့်ဖြူးရေး အားသာချက်ကို ပြသသည့်နေရာတွင် မော်ဒယ်နှစ်မျိုးလုံးကို ၎င်း၏ စားသုံးသူထုတ်ကုန်များသို့ ချိတ်ဆက်ပေးနေသည်။ Android တွင်၊ Gboard ရှိ "Rambler" အင်္ဂါရပ်အသစ်သည် 3.5 စာသားမှတ်တမ်းကို အသုံးပြုထားပြီး အဖြည့်ခံစကားလုံးများကို စစ်ထုတ်နေစဉ် စကားပြောအတွေးများကို ဖော်မတ်ကောင်းမွန်သောစာသားအဖြစ်သို့ ပြောင်းလဲနိုင်သည် — အသုံးပြုသူများသည် အသံဖြင့် တည်းဖြတ်မှုများပင် ပြုလုပ်နိုင်ပါသည်။ မော်ဒယ်သည် macOS ပေါ်ရှိ Gemini အက်ပ်တွင် သတ်ပုံသတ်နည်းကို ပါဝါပေးထားပြီး၊ Google Antigravity ရှိ မျက်နှာပြင်အကြောင်းအရာနှင့် တွဲလျက်အလုပ်လုပ်ကာ Chrome တွင် ပေါင်းစပ်ထားသည်။
ဆော့ဖ်ဝဲရေးသားသူများအတွက်၊ လွှင့်တင်မှုနှစ်ခုကို မဟာဗျူဟာတစ်ခုအနေဖြင့် ဖတ်ရသည်- Google သည် သင်ပြောဆိုသော chatbot မှ Gemini ကို မြင်နိုင်၊ ကြားနိုင်၊ မီဒီယာထုတ်လုပ်သည့် အခြေခံအဆောက်အအုံအဖြစ်သို့ တွန်းပို့နေသည်။ OpenAI၊ ElevenLabs နှင့် တူညီသောနယ်မြေတွင် ယှဉ်ပြိုင်နေသော ဗီဒီယိုစတင်သည့်အုပ်စုတစ်စုနှင့်အတူ၊ 2.6 ရာခိုင်နှုန်းသော စကားလုံးအမှားနှုန်းနှင့် စက္ကန့် 40 ပေါင်းစပ်ထားသော မြင်ကွင်းများသည် ဝင်ငွေအမှန်တကယ်ရရှိသည့် ထုတ်လုပ်ရေးအလုပ်များဖြစ်သည့်အတွက် Google ၏ အဖွင့်လေလံဖြစ်သည့် အသံအေးဂျင့်များ၊ စာတန်းထိုးပိုက်လိုင်းများနှင့် တီထွင်ဖန်တီးမှုဆိုင်ရာ ကိရိယာများဖြစ်သည်။ Developer များသည် ယနေ့တွင် Google AI Studio တွင် မော်ဒယ်နှစ်မျိုးလုံးဖြင့် စတင်တည်ဆောက်နိုင်ပါသည်။
စကားလုံးအမှားအယွင်းနှုန်းက ဘာကြောင့် အရေးကြီးနေသေးလဲ။
စကားလုံးအမှားအယွင်းနှုန်းသည် ပညာရပ်ဆိုင်ရာ ကိန်းဂဏန်းတစ်ခုကဲ့သို့ ထင်ရသော်လည်း ထုတ်လုပ်မှုတွင် ၎င်းသည် အလုပ်လုပ်သော အသံထွက်ပစ္စည်းနှင့် စိတ်ပျက်စေသည့်အရာတို့ကြား ကွာခြားချက်ဖြစ်သည်။ အသံအေးဂျင့်တစ်ခုရှိ နားလည်မှုလွဲသောစကားတိုင်းသည် အလုပ်တစ်ခုကို ပျက်စေသည်- မှားယွင်းသောအမိန့် ID သည် မအောင်မြင်သောရှာဖွေမှုကို အစပျိုးပေးသည်၊ ဗလုံးဗထွေးလိပ်စာသည် မှားယွင်းသောမြို့သို့ အထုပ်တစ်ခုကို ပို့ပေးသည်။ ထို့ကြောင့် ထုတ်လွှင့်ခြင်းမဟုတ်သော အသံတွင် 2.6 ရာခိုင်နှုန်း WER နှင့် လွန်ခဲ့သည့် မော်ဒယ်များ၏ မျိုးဆက်တစ်ခုတွင် ဖြစ်လေ့ဖြစ်ထရှိသော ဂဏန်းအမြင့်နှုန်းထားများအကြား ကွာဟချက်သည် သုံးစွဲနိုင်မှုတွင် ပြင်းအားအစီအစဥ် ကွာခြားချက်အဖြစ်သို့ ပေါင်းစပ်သွားသည်။
Google က ဖော်ပြသော မုဒ်နှစ်ခုကြား ခြားနားမှုသည် ဗိသုကာပညာရှင်များအတွက် အရေးကြီးပါသည်။ တိုက်ရိုက်ထုတ်လွှင့်သော အသံအေးဂျင့်များ လိုအပ်သည့် အပြန်အလှန်တုံ့ပြန်အသုံးပြုမှုကိစ္စများဖြစ်သည့် ဒုတိယစက္ကန့်ခွဲကြာချိန်အတွက် တိကျမှုအချို့ကို ထုတ်လွှင့်ခြင်း— 4.0 ရာခိုင်နှုန်း WER ကိန်းဂဏန်းသည် အရောင်းအ၀ယ်ပြုလုပ်သည်။ မှတ်တမ်းတင်ထားသော အသံ၏ အစုလိုက် ကူးယူဖော်ပြမှုသည် နှေးကွေးသော်လည်း 2.6 ရာခိုင်နှုန်းအထိ ရောက်ရှိသောကြောင့် ခေါ်ဆိုမှုနောက်ပိုင်း ပိုင်းခြားစိတ်ဖြာချက်နှင့် မှတ်တမ်းပြုစုခြင်း လုပ်ဆောင်ခြင်းသည် ပို၍ တောင်းဆိုလာနိုင်သည်။ ချိန်ညှိနိုင်သော ဆက်တင်တစ်ခုထက် နှစ်ခုလုံးကို သီးခြားမော်ဒယ်အဆုံးမှတ်များအဖြစ် ထုတ်ပြရန် Google ၏ ဆုံးဖြတ်ချက်သည် developer များသည် ထိုကုန်သွယ်မှု၏ တစ်ဖက်တစ်ချက်တွင် မတူညီသော ထုတ်ကုန်များကို ဖန်တီးထားကြောင်း အသိအမှတ်ပြုပါသည်။
ဗီဒီယိုထုတ်လုပ်ခြင်းအတွက် အဆင့်လိုက်လုပ်ဆောင်မှုတစ်ခု
Omni 1.1 Flash အပ်ဒိတ်သည် ဖန်တီးမှုအလုပ် အမှန်တကယ်ဖြစ်လာပုံနှင့်ပတ်သက်၍ အညီအမျှ လက်တွေ့ကျသည်။ မျိုးဆက်သစ်ဗီဒီယိုသည် ထပ်တလဲလဲလုပ်ရန် စျေးကြီးသည်- နှိုးဆော်စမ်းသပ်မှုတိုင်းသည် အပြည့်အစုံ တင်ဆက်မှုကို ဆိုလိုသည်။ 360p အစမ်းကြည့်ရှုခြင်းမုဒ်အသစ်သည် စူးစမ်းရှာဖွေခြင်းမှ ပေးပို့ခြင်းမှ ပိုင်းခြားထားပြီး ထုတ်လုပ်သူများသည် ချက်ခြင်းပုံစံများကို စျေးသက်သက်သာသာဖြင့် လည်ပတ်စေပြီး ပြန်လည်သုံးသပ်ခြင်းတွင် 4K တိုးမြှင့်ခြင်းအတွက်သာ ပေးဆောင်စေပါသည်။
အခင်းအကျင်း တိုးချဲ့မှု စက်ပြင်များသည် ကလစ်အရွယ်အစားရှိ ဂတ်တိုတွင် AI ဗီဒီယိုကို သိမ်းဆည်းထားသည့် ပေါင်းစပ်မှုပြဿနာကို ဖြေရှင်းပေးသည်။ နောက်ဆုံးဘောင်အစား ရှေ့အကြောင်းအရာ၏ 10 စက္ကန့်ကို ပိုင်းခြားစိတ်ဖြာခြင်းဖြင့်၊ မော်ဒယ်သည် ဇာတ်ကောင်များ၊ အလင်းရောင်နှင့် အမြင်စတိုင်ကို တသမတ်တည်းရှိနေစေပြီး 10 စက္ကန့်တိုးကာ 40 စက္ကန့်အထိ မြင်ကွင်းတစ်ခုကို တိုးချဲ့နိုင်သည်။ တည်းဖြတ်သူများကို အဆုံးအဖြတ်ပေးသည့် ထိန်းချုပ်မှုအချက်များပေးသည့် ပထမဘောင်နှင့် နောက်ဆုံးဘောင်ကြားဖြတ်ပေါင်းစပ်ခြင်းဖြင့်၊ သမားရိုးကျတည်းဖြတ်မှုတွင် အဝင်အထွက်နည်းလမ်းများ အလုပ်လုပ်သည် — AI မှထုတ်လုပ်ထားသော ဗီဒီယိုသည် ၎င်းတို့ကို လက်ကားရောင်းချမည့်အစား ထုတ်လုပ်မှုလွန်ပိုက်လိုင်းများနှင့် အံဝင်ခွင်ကျဖြစ်လာသည်။
ယှဉ်ပြိုင်ပုံ
နှစ်ခုစလုံးသည် Google ကို ဦးတည်ရာထက် အခြေခံအဆောက်အအုံအဖြစ် နေရာယူထားသည်။ စကားတွင်၊ Google သည် ၎င်း၏ developer များအသုံးပြုပြီးဖြစ်သော Gemini API တွင် ခေတ်မီတိကျမှန်ကန်မှုကို စုစည်းခြင်းဖြင့် ၎င်း၏ cloud ပြိုင်ဖက်များ၏ အသံအစီအစဥ်များကို အထူးပြုထားသော ကူးယူရောင်းချသူများနှင့် ၎င်း၏ cloud ပြိုင်ဘက်များ၏ စကားသံများကို ရယူနေပါသည်။ ဗီဒီယိုတွင်၊ ၎င်းသည် ကုန်ကြမ်းမျက်မှန်ထက် ထိန်းချုပ်မှုနှင့် အလုပ်အသွားအလာပေါင်းစည်းမှုကို အလေးပေးခြင်းဖြင့် ရန်ပုံငွေကောင်းကောင်းရရှိထားသော startups များဖြင့် ပြည့်ကျပ်နေသော စျေးကွက်တွင် ယှဉ်ပြိုင်နေသည်။
ဖြန့်ဖြူးခြင်း၏ အားသာချက်မှာ အဆုံးအဖြတ်ပေးသည့် အချက်ဖြစ်နိုင်သည်။ Gemini API မှ developer များခေါ်ဆိုနိုင်သည့် တူညီသော စာသားမှတ်တမ်းပုံစံသည် Android ရှိ Gboard ၏ Rambler သတ်ပုံသတ်နည်းကို စွမ်းအားပေးထားပြီးဖြစ်သည် — ဆိုလိုသည်မှာ Google သည် ၎င်းကို ဆက်လက်တိုးတက်စေမည့် မတူကွဲပြားသော ကမ္ဘာပေါ်ရှိ အသံများကို စုဆောင်းနေစဉ်တွင် Google သည် အသုံးပြုသူအပြန်အလှန်ဆက်သွယ်မှုများ၏ ဘီလီယံနှင့်ချီသော မော်ဒယ်ဖွံ့ဖြိုးတိုးတက်မှုကို လျှော့စျေးပေးနိုင်သည်။ 2026 ခုနှစ်တွင် စကားပြော သို့မဟုတ် ဗီဒီယိုအစုအဝေးကို ရွေးချယ်သည့် developer များအတွက်၊ အဆိုပါ flywheel သည် ယခုအခါ ကွင်းအတွင်း၏ တစ်စိတ်တစ်ပိုင်းဖြစ်သည်။
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →