Baidu သုတေသီများသည် အဆက်မပြတ်မှတ်ဉာဏ်အသုံးပြုမှုနှင့် တသမတ်တည်းအမြန်နှုန်းကို ထိန်းသိမ်းထားစဉ်တွင် စာရွက်စာတမ်းစာမျက်နှာ ဒါဇင်ပေါင်းများစွာကို မှတ်တမ်းမှတ်ရာဖြတ်ချက်တစ်ခုတွင် လုပ်ဆောင်နိုင်သည့် optical character recognition (OCR) မော်ဒယ်ကို တီထွင်ခဲ့သည်။ Unlimited OCR ဟုခေါ်သော စနစ်သည် လူသားများသည် စာရွက်စာတမ်း AI တွင် သိသာထင်ရှားသော တိုးတက်မှုကို ကိုယ်စားပြုသည့် စာသားကို လက်ဖြင့်ကူးယူပုံပေးသည့် ဆန်းသစ်သောအာရုံစူးစိုက်မှုယန္တရားတစ်ခုမှတစ်ဆင့် ၎င်းကို ရရှိသည်။ AI သုတေသနနှင့် နည်းပညာဆိုင်ရာ နောက်ဆုံးပေါ်တိုးတက်မှုများအတွက်၊ AI Buzz Wire သို့ ဝင်ရောက်ကြည့်ရှုပါ။

KV Cache Bottleneck ကို ကျော်လွှားခြင်း။

၎င်းတို့၏ ကုဒ်ဒါများသည် အခြေခံဗိသုကာဆိုင်ရာ ကန့်သတ်ချက်တစ်ခုနှင့် ရင်ဆိုင်ရသောကြောင့် ဘာသာစကားမော်ဒယ်များကို အသုံးပြုသည့် လက်ရှိ အဆုံးမှအဆုံး OCR စနစ်များ။ မော်ဒယ်သည် စာသားကို လုပ်ဆောင်သည်နှင့်အမျှ၊ ၎င်းသည် မျိုးဆက်အတွင်း အစောပိုင်းအကြောင်းအရာများကို ကိုးကားရန် KV ဟုခေါ်သော ကြားခံတစ်ခုတွင် ယခင်က လုပ်ဆောင်ခဲ့သော တိုကင်များအကြောင်း အချက်အလက်များကို သိမ်းဆည်းထားသည်။ ဤကြားခံသည် စာသားမျဉ်းအသစ်တိုင်းဖြင့် ကြီးထွားလာပြီး မှတ်ဉာဏ်သုံးစွဲမှု မှန်မှန်တိုးလာကာ မျိုးဆက်နှုန်းကို နှေးကွေးစေသည်။

လက်တွေ့တွင်၊ ရှိပြီးသားစနစ်များသည် စာမျက်နှာတစ်ခုစီကို ပြီးစီးပြီးနောက် စာမျက်နှာတစ်ခုစီတွင် စာမျက်နှာတစ်ခုစီဖြင့် စာရွက်စာတမ်းများကို လှည့်ပတ်လုပ်ဆောင်ခြင်းဖြင့်၊ စာမျက်နှာတစ်ခုစီကို ပြီးစီးပြီးနောက် ကက်ရှ်ကို ပြန်လည်သတ်မှတ်ခြင်းဖြင့် ဤပြဿနာကို ရပ်တန့်စေသည်။ ဤချဉ်းကပ်မှုသည် အလုပ်လုပ်သော်လည်း ထိရောက်မှုမရှိမှုများကို မိတ်ဆက်ပြီး စာမျက်နှာဘောင်များတစ်လျှောက် အကြောင်းအရာများကို မော်ဒယ်ကို ထိန်းသိမ်းခြင်းမှ တားဆီးသည်။ လက်ရှိ OCR မော်ဒယ်သည် ဖြတ်သန်းမှုတစ်ခုတွင် ခန့်မှန်းခြေအားဖြင့် ဆယ်မျက်နှာထက်ပို၍ မကိုင်တွယ်နိုင်ဟု Baidu သုတေသီများက ၎င်းတို့၏ နည်းပညာဆိုင်ရာ အစီရင်ခံစာတွင် မှတ်သားထားသည်။

အကန့်အသတ်မရှိ OCR သည် ဤကန့်သတ်ချက်ကို လုံးဝဖယ်ရှားပေးသည်။ မော်ဒယ်သည် ၎င်း၏ ကက်ရှ်ကို ဝင်ရောက်ပုံကို ထိန်းချုပ်သည့် အာရုံစူးစိုက်မှု ယန္တရားအား ပြန်လည် ဒီဇိုင်းထုတ်ခြင်းဖြင့်၊ ၎င်းသည် စာမျက်နှာ မည်မျှပင် လုပ်ဆောင်သည်ဖြစ်စေ စနစ်သည် မှတ်ဉာဏ်အသုံးပြုမှုကို အဆက်မပြတ် ထိန်းသိမ်းပေးသည်။

Reference Sliding Window Attention အလုပ်လုပ်ပုံ

အဓိက တီထွင်ဆန်းသစ်မှုမှာ Baidu အဖွဲ့သည် Reference Sliding Window Attention (R-SWA) ဟုခေါ်သည်။ ယန္တရားသည် လူသား၏ သရုပ်ဖော်မှုမှ ရေးဆွဲထားသော ရိုးရှင်းသော်လည်း အားကောင်းသည့် ထိုးထွင်းသိမြင်မှုဖြင့် တည်ဆောက်ထားခြင်းဖြစ်သည်- လူတစ်ဦးသည် စာအုပ်တစ်အုပ်မှ စာသားကို ကူးယူသောအခါတွင် ၎င်းတို့ရေးထားပြီးသော အရာအားလုံးကို စဉ်ဆက်မပြတ် ပြန်လည်ဖတ်ရှုခြင်းမပြုပါ။ ယင်းအစား၊ ၎င်းတို့သည် အရင်းအမြစ်အကြောင်းအရာ၊ ၎င်းတို့ရေးသားထားသော နောက်ဆုံးစာလုံးအနည်းငယ်နှင့် ရေးရန်နောက်ထပ်ဇာတ်ကောင်များအပေါ် အာရုံစိုက်ထားကြသည်။ ပျော့ပျောင်းသော မေ့ပျောက်ခြင်းတစ်မျိုးကြောင့် အသက်ကြီးသော လမ်းကြောင်းများသည် သဘာဝအတိုင်း ပျောက်ကွယ်သွားပါသည်။

R-SWA သည် မတူညီသော တိုကင်အမျိုးအစားများကို ကွဲပြားစွာ ဆက်ဆံခြင်းဖြင့် ဤမူကို အကောင်အထည်ဖော်သည်။ ထုတ်ပေးထားသော တိုကင်တစ်ခုစီသည် ရည်ညွှန်းတိုကင်များအားလုံးကို အာရုံစူးစိုက်မှုအပြည့်ရှိနေသည် — စာရွက်စာတမ်းအား ကုဒ်ဝှက်ခြင်းနှင့် လုပ်ဆောင်ခြင်းဆိုင်ရာ အချက်ပြသည့် အမြင်အာရုံဆိုင်ရာ ရုပ်ပုံတိုကင်များ။ သို့သော်ယခင်ကထုတ်လုပ်ထားသော output စာသားနှင့်ပတ်သက်လာသောအခါမော်ဒယ်သည်နောက်ဆုံးပေါ်တိုကင် 128 ခုကိုသာပြန်ကြည့်သည်။

ဤဒီဇိုင်းသည် KV ကက်ရှ်ကို စာသားမည်မျှထုတ်ပေးသည်ဖြစ်စေ ရှေ့ဆက်အလျားနှင့် ဝင်းဒိုးအရွယ်အစား၏ ပေါင်းလဒ်နှင့်ညီမျှသော ပုံသေအရွယ်အစားတွင် ထားရှိထားသည်။ ကက်ရှ်သည် တိုကင်အသစ်တစ်ခုစီသည် ရှေးအကျဆုံးတစ်ခုစီကို တွန်းထုတ်ခြင်းဖြင့် ပုံမှန်အာရုံစူးစိုက်မှုယန္တရားများကို ဘေးဒဏ်ဖြစ်စေသည့် အကန့်အသတ်မဲ့မှတ်ဉာဏ်ကြီးထွားမှုကို ဟန့်တားခြင်းဖြင့် တန်းစီတစ်ခုအဖြစ် လုပ်ဆောင်သည်။

Visual Information ကို ကာကွယ်ပေးခြင်း။

R-SWA တွင် အရေးကြီးသော ဒီဇိုင်းရွေးချယ်မှုမှာ ၎င်းသည် ရုပ်ပုံဆိုင်ရာ တိုကင်များကို ကိုင်တွယ်ပုံဖြစ်သည်။ ပုံမှန်လျှောပြတင်းပေါက်အာရုံစူးစိုက်မှုသည် တိုကင်အားလုံးကို လက်ရှိအခြေအနေသို့ ပြောင်းလဲစေသည်၊ ရုပ်ပုံအင်္ဂါရပ်များကို တဖြည်းဖြည်းမှုန်ဝါးစေကာ အချိန်ကြာလာသည်နှင့်အမျှ အသိအမှတ်ပြုမှု တိကျမှုကို ကျဆင်းစေသည်။ R-SWA သည် ဤအကူးအပြောင်းများမှ အမြင်အာရုံဆိုင်ရာ တိုကင်များကို ကင်းလွတ်ခွင့်ပေးသည် — ၎င်းတို့ကို တစ်ကြိမ်ကုဒ်လုပ်ထားပြီး ကုဒ်ရေးခြင်းလုပ်ငန်းစဉ်တစ်ခုလုံးတွင် မပြောင်းလဲပါ။

OCR တိကျမှုအတွက် ဤအမြင်အာရုံအချက်အလက်များကို ထိန်းသိမ်းခြင်းသည် မရှိမဖြစ်လိုအပ်ပါသည်။ မော်ဒယ်ကို ၎င်း၏ကိုယ်ပိုင်အထွက်တွင် မည်မျှပြန်မြင်ရသည်ကို ကန့်သတ်ထားချိန်တွင် မူရင်းပုံကိုယ်စားပြုပုံကို နဂိုအတိုင်းထားခြင်းဖြင့်၊ R-SWA သည် ကမ္ဘာနှစ်ခုစလုံး၏ အကောင်းဆုံးဖြစ်သည်- တည်ငြိမ်သောမှတ်ဉာဏ်အသုံးပြုမှုနှင့် ယုံကြည်စိတ်ချရသော စာသားမှတ်သားမှုတို့ကို ရရှိစေသည်။

ဗိသုကာသင်တန်း

အကန့်အသတ်မရှိ OCR ကို open-source Deepseek OCR မော်ဒယ်၏ထိပ်တွင် တည်ဆောက်ထားသည်။ Baidu သည် 1024-by-1024-pixel PDF ပုံကို တိုကင်ပေါင်း 256 ခုအထိ ချုံ့ပေးသည့် DeepEncoder ကို ထိန်းသိမ်းထားပြီး ၎င်းကို ရောနှော-ကျွမ်းကျင်ပညာရှင်များ (MoE) ဗိသုကာနှင့် တွဲထားသည်။ ဒီကုဒ်ဒါသည် စုစုပေါင်း ကန့်သတ်ဘောင်ပေါင်း သုံးဘီလီယံရှိသော်လည်း ခန့်မှန်းခြေအားဖြင့် သန်း 500 ခန့်သာ တွက်ချက်လုပ်ဆောင်နိုင်ပြီး တွက်ချက်မှုကုန်ကျစရိတ်များကို စီမံခန့်ခွဲနိုင်သည်။

စနစ်သည် ကြည်လင်ပြတ်သားမှုမုဒ်နှစ်ခုကို ပေးဆောင်သည်။ စာမျက်နှာပေါင်းများစွာ စာရွက်စာတမ်းများအတွက် အခြေခံမုဒ်ကို ပိုမိုကောင်းမွန်အောင်ပြုလုပ်ထားပြီး Gundam မုဒ်သည် စာမျက်နှာတစ်ခုတည်းလုပ်ဆောင်ခြင်းအတွက် dynamic resolution ကိုအသုံးပြုသည်။ ဒီကုဒ်ဒါရှိ စံအာရုံစူးစိုက်မှု အလွှာတိုင်းကို R-SWA ဖြင့် အစားထိုးထားသည်။

စာရွက်စာတန်းနမူနာ နှစ်သန်းခန့်တွင် သင်တန်းကို စာမျက်နှာတစ်ခုတည်းနှင့် စာမျက်နှာပေါင်းများစွာဒေတာကြား ကိုးပုံမှတစ်ခုသို့ ခွဲထားသည်။ PaddleOCR handled annotation for single pages, while multi-page data was constructed synthetically by stitching single pages together into documents ranging from two to fifty pages. လေ့ကျင့်ရေးဒေတာအားလုံးကို တိုကင် 32,000 ၏ အစီအစဥ်အဖြစ် ထုပ်ပိုးထားပြီး Nvidia A800 GPUs 16 စုံတွင် 4,000 လှမ်းဖြင့် လေ့ကျင့်မှုကို လုပ်ဆောင်ခဲ့သည်။ DeepEncoder သည် လေ့ကျင့်မှုတစ်လျှောက်လုံး အေးခဲနေခဲ့ပြီး ဘာသာစကား မော်ဒယ်ကန့်သတ်ချက်များကိုသာ အပ်ဒိတ်လုပ်ထားသည်။

စံနှုန်းရလဒ်များ

အကန့်အသတ်မရှိ OCR သည် အကဲဖြတ်တိုင်းတာမှုအများအပြားတွင် ခိုင်မာသောစွမ်းဆောင်ရည်ကို ရရှိသည်။ OmniDocBench v1.5 စာရွက်စာတမ်းစံနှုန်းတွင်၊ မော်ဒယ်သည် အလုံးစုံရမှတ် 93 ရာခိုင်နှုန်း၊ Deepseek OCR အခြေခံလိုင်းထက် ခြောက်ရာခိုင်နှုန်းရမှတ်ရှိသည်။

In the critical long-horizon test — where the model processes many pages in a single pass — the error rate stays below 0.11 even beyond 40 pages. The researchers attribute remaining errors not to lost context but to the DeepEncoder's resolution limit in Base mode, where extremely small text becomes difficult to recognize.

ကန့်သတ်ထားသော အာရုံစူးစိုက်မှုပြတင်းပေါက်သည် မျှော်လင့်မထားသော အကျိုးကျေးဇူးကို ပေးသည်။ စာမျက်နှာတစ်ခုတည်းရှိ စာရွက်စာတမ်းများတွင်၊ window ကို 128 တိုကင်များကို ကန့်သတ်ခြင်းသည် တိကျမှုကို မထိခိုက်စေဘဲ အမှန်တကယ်အားဖြင့် အနည်းငယ် တိုးတက်စေသည်။ The researchers hypothesize that R-SWA forces the model to focus more tightly on the dense OCR task, while full attention tends toward divergence as output length grows.

မြန်နှုန်းမြှင့်တင်မှုများသည် တူညီစွာ မှတ်သားဖွယ်ရာဖြစ်သည်။ Base မုဒ်တွင်၊ အကန့်အသတ်မရှိ OCR သည် Deepseek OCR အတွက် 4,951 နှင့် နှိုင်းယှဉ်ပါက တစ်စက္ကန့်လျှင် တိုကင် 5,580 ရရှိပြီး 12.7 ရာခိုင်နှုန်း တိုးတက်မှုရှိသည်။ စံပြမျဉ်းပြိုင်ဝါဒနှင့် သီအိုရီဆိုင်ရာ အပေါ်ပိုင်းဘောင်ကို နှိုင်းယှဉ်မှုများတွင်၊ မော်ဒယ်သည် ခန့်မှန်းခြေ အထွက်တိုကင် 6,000 တွင် အခြေခံလိုင်းကို 35 ရာခိုင်နှုန်းဖြင့် ဦးဆောင်သည်။

ပိုမိုကျယ်ပြန့်သော အဓိပ္ပါယ်ရှိသည်။

အကန့်အသတ်မရှိ OCR ဗိသုကာသည် စာရွက်စာတမ်းလုပ်ဆောင်ခြင်းထက် သက်ရောက်မှုများရှိသည့် နိယာမတစ်ခုကို သရုပ်ပြသည်။ The idea of keeping memory constant through selective attention — inspired by cognitive science rather than pure scaling — could inform the design of more efficient AI systems across a range of applications.

As organizations grapple with the computational costs of deploying large language models, approaches that reduce memory consumption without sacrificing quality are increasingly valuable. Baidu ၏ လက်ရာသည် သင်္ချာယန္တရားများအဖြစ် ဘာသာပြန်သည့်အခါ ဇီဝဗေဒဆိုင်ရာ နိမိတ်ပုံများသည် လက်တွေ့ကျသော အင်ဂျင်နီယာဆိုင်ရာ အောင်မြင်မှုများကို ထုတ်ပေးနိုင်သည်ဟု အကြံပြုထားသည်။

သုတေသနသည် အခြေခံ AI သုတေသနတွင် တရုတ်နိုင်ငံ၏ ကြီးထွားလာသော သြဇာလွှမ်းမိုးမှုကို မီးမောင်းထိုးပြသည်။ While much attention has focused on Chinese achievements in large language models, work like Unlimited OCR demonstrates that Chinese researchers are also making significant contributions to specialized AI systems with immediate practical applications.

AI ၏ရှေ့တွင်နေပါ။

AI သုတေသန၊ စာရွက်စာတမ်း AI နှင့် နည်းပညာဆိုင်ရာ အောင်မြင်မှုများ၏ နောက်ထပ်အကြောင်းအရာများအတွက်၊ AI Buzz Wire သို့ ဝင်ရောက်ကြည့်ရှုပါ။

AI သတင်းအပြည့်အစုံကို ဖတ်ရှုရန် →