អ្នកស្រាវជ្រាវ Baidu បានបង្កើតគំរូការទទួលស្គាល់តួអក្សរអុបទិក (OCR) ដែលមានសមត្ថភាពដំណើរការទំព័រឯកសាររាប់សិបនៅក្នុងឯកសារយោងតែមួយ ខណៈពេលដែលរក្សាការប្រើប្រាស់អង្គចងចាំថេរ និងល្បឿនជាប់លាប់។ ប្រព័ន្ធនេះត្រូវបានគេហៅថា Unlimited OCR សម្រេចបានវាតាមរយៈយន្តការយកចិត្តទុកដាក់ប្រលោមលោកដែលត្រូវបានបំផុសគំនិតដោយរបៀបដែលមនុស្សចម្លងអត្ថបទដោយដៃ ដែលតំណាងឱ្យការជឿនលឿនដ៏សំខាន់នៅក្នុងឯកសារ AI ។ សម្រាប់ការអភិវឌ្ឍន៍ចុងក្រោយបង្អស់ក្នុងការស្រាវជ្រាវ និងបច្ចេកវិទ្យា AI សូមចូលទៅកាន់ AI Buzz Wire។
យកឈ្នះលើ KV Cache Bottleneck
ប្រព័ន្ធ OCR ពីចុងដល់ចុងបច្ចុប្បន្នដែលប្រើគំរូភាសា នៅពេលដែលអ្នកឌិកូដរបស់ពួកគេប្រឈមនឹងការកំណត់ផ្នែកស្ថាបត្យកម្មជាមូលដ្ឋាន។ ក្នុងនាមជាគំរូដំណើរការអត្ថបទ វារក្សាទុកព័ត៌មានអំពីសញ្ញាសម្ងាត់ដែលបានដំណើរការពីមុននៅក្នុងសតិបណ្ដោះអាសន្នដែលហៅថាឃ្លាំងសម្ងាត់ KV ដែលអនុញ្ញាតឱ្យវាយោងខ្លឹមសារមុនក្នុងជំនាន់។ សតិបណ្ដោះអាសន្ននេះរីកចម្រើនជាមួយរាល់បន្ទាត់ថ្មីនៃអត្ថបទ បង្កើនការប្រើប្រាស់អង្គចងចាំជាលំដាប់ និងល្បឿននៃការបង្កើតយឺត។
នៅក្នុងការអនុវត្ត ប្រព័ន្ធដែលមានស្រាប់ដំណើរការជុំវិញបញ្ហាស្ទះនេះដោយដំណើរការឯកសារមួយទំព័រក្នុងរង្វង់មួយ កំណត់ឃ្លាំងសម្ងាត់ឡើងវិញបន្ទាប់ពីទំព័រនីមួយៗត្រូវបានបញ្ចប់។ វិធីសាស្រ្តនេះដំណើរការ ប៉ុន្តែណែនាំពីភាពគ្មានប្រសិទ្ធភាព និងរារាំងគំរូមិនឱ្យរក្សាបរិបទឆ្លងកាត់ព្រំដែនទំព័រ។ អ្នកស្រាវជ្រាវ Baidu កត់សម្គាល់នៅក្នុងរបាយការណ៍បច្ចេកទេសរបស់ពួកគេ។
OCR គ្មានដែនកំណត់លុបបំបាត់ឧបសគ្គនេះទាំងស្រុង។ តាមរយៈការរៀបចំឡើងវិញនូវយន្តការយកចិត្តទុកដាក់ដែលគ្រប់គ្រងពីរបៀបដែលម៉ូដែលចូលប្រើឃ្លាំងសម្ងាត់របស់វា ប្រព័ន្ធរក្សាការប្រើប្រាស់អង្គចងចាំថេរដោយមិនគិតពីចំនួនទំព័រដែលវាដំណើរការ។
របៀបដែលការរំកិលសេចក្តីយោង Window Attention ដំណើរការ
ការច្នៃប្រឌិតសំខាន់គឺជាអ្វីដែលក្រុម Baidu ហៅថា Reference Sliding Window Attention (R-SWA) ។ យន្តការនេះត្រូវបានបង្កើតឡើងនៅលើការយល់ដឹងដ៏សាមញ្ញ ប៉ុន្តែមានអានុភាពដែលទាញចេញពីភាពស្រដៀងគ្នារបស់មនុស្ស៖ នៅពេលដែលមនុស្សម្នាក់ចម្លងអត្ថបទពីសៀវភៅ ពួកគេមិនបន្តអានឡើងវិញនូវអ្វីគ្រប់យ៉ាងដែលពួកគេបានសរសេររួចហើយនោះទេ។ ផ្ទុយទៅវិញ ពួកគេរក្សាការយកចិត្តទុកដាក់របស់ពួកគេដោយផ្តោតលើសម្ភារៈប្រភព តួអក្សរពីរបីចុងក្រោយដែលពួកគេបានចម្លង និងតួអក្សរបន្ទាប់ដែលត្រូវសរសេរ។ វគ្គចាស់ៗបាត់ដោយធម្មជាតិពីការចងចាំសកម្ម តាមរយៈប្រភេទនៃការភ្លេចភ្លាំង។
R-SWA អនុវត្តគោលការណ៍នេះដោយការព្យាបាលប្រភេទផ្សេងគ្នានៃសញ្ញាសម្ងាត់ផ្សេងគ្នា។ សញ្ញាសម្ងាត់ដែលបានបង្កើតនីមួយៗរក្សាការយកចិត្តទុកដាក់ពេញលេញចំពោះនិមិត្តសញ្ញាយោងទាំងអស់ — និមិត្តសញ្ញារូបភាពដែលមើលឃើញដែលអ៊ិនកូដឯកសារ និងប្រអប់បញ្ចូលដំណើរការ។ ប៉ុន្តែនៅពេលដែលវាមកដល់អត្ថបទលទ្ធផលដែលបានបង្កើតពីមុន ម៉ូដែលនេះមើលទៅក្រោយត្រឹមតែ 128 tokens ថ្មីៗបំផុតប៉ុណ្ណោះ។
ការរចនានេះរក្សាឃ្លាំងសម្ងាត់ KV ក្នុងទំហំថេរស្មើនឹងផលបូកនៃប្រវែងបុព្វបទ និងទំហំបង្អួច ដោយមិនគិតពីចំនួនអត្ថបទត្រូវបានបង្កើត។ ឃ្លាំងសម្ងាត់ដំណើរការជាជួរ ដោយនិមិត្តសញ្ញាថ្មីនីមួយៗរុញចេញនូវអ្វីដែលចាស់ជាងគេ ការពារការលូតលាស់នៃអង្គចងចាំដែលគ្មានដែនកំណត់ ដែលធ្វើឲ្យប៉ះពាល់ដល់យន្តការយកចិត្តទុកដាក់ស្តង់ដារ។
ការការពារព័ត៌មានដែលមើលឃើញ
ជម្រើសរចនាដ៏សំខាន់នៅក្នុង R-SWA គឺជារបៀបដែលវាគ្រប់គ្រងនិមិត្តសញ្ញាដែលមើលឃើញ។ ការយកចិត្តទុកដាក់លើបង្អួចស្ដង់ដារនឹងដាក់សញ្ញាសម្ងាត់ទាំងអស់ទៅនឹងការផ្លាស់ប្តូរស្ថានភាពដែលកំពុងដំណើរការ ធ្វើឱ្យលក្ខណៈរូបភាពព្រិលបន្តិចម្តងៗ និងធ្វើឱ្យភាពត្រឹមត្រូវនៃការទទួលស្គាល់ថយចុះតាមពេលវេលា។ R-SWA លើកលែងនិមិត្តសញ្ញាដែលមើលឃើញពីការផ្លាស់ប្តូរទាំងនេះ — ពួកគេត្រូវបានអ៊ិនកូដម្តងហើយនៅតែមិនផ្លាស់ប្តូរពេញមួយដំណើរការឌិកូដទាំងមូល។
ការរក្សាទុកព័ត៌មានដែលមើលឃើញនេះគឺចាំបាច់សម្រាប់ភាពត្រឹមត្រូវ OCR ។ ដោយរក្សាការតំណាងរូបភាពដើមនៅដដែល ខណៈពេលដែលកំណត់ថាតើម៉ូដែលមើលទៅឆ្ងាយប៉ុណ្ណានៅក្នុងលទ្ធផលរបស់វា R-SWA សម្រេចបាននូវភាពល្អបំផុតនៃពិភពលោកទាំងពីរ៖ ការប្រើប្រាស់អង្គចងចាំមានស្ថេរភាព និងការទទួលស្គាល់អត្ថបទដែលអាចទុកចិត្តបាន។
ស្ថាបត្យកម្ម និងការបណ្តុះបណ្តាល
OCR គ្មានដែនកំណត់ត្រូវបានបង្កើតឡើងនៅលើកំពូលនៃប្រភពបើកចំហនៃគំរូ Deepseek OCR ។ Baidu រក្សា DeepEncoder របស់ខ្លួន ដែលបង្រួមរូបភាព PDF កម្រិត 1024 គុណនឹង 1024-pixel ចុះដល់ 256 tokens ហើយផ្គូផ្គងវាជាមួយស្ថាបត្យកម្ម mix-of-experts (MoE) ។ ឧបករណ៍ឌិកូដមានប៉ារ៉ាម៉ែត្រសរុបចំនួន 3 ពាន់លាន ប៉ុន្តែមានតែប្រហែល 500 លានប៉ុណ្ណោះដែលសកម្មក្នុងអំឡុងពេលការសន្និដ្ឋាន ដោយរក្សាការចំណាយលើការគណនាអាចគ្រប់គ្រងបាន។
ប្រព័ន្ធផ្តល់នូវរបៀបដោះស្រាយពីរ។ របៀបមូលដ្ឋានត្រូវបានធ្វើឱ្យប្រសើរសម្រាប់ឯកសារច្រើនទំព័រ ខណៈពេលដែលរបៀប Gundam ប្រើដំណោះស្រាយថាមវន្តសម្រាប់ដំណើរការតែមួយទំព័រ។ រាល់ស្រទាប់យកចិត្តទុកដាក់ស្តង់ដារនៅក្នុងឧបករណ៍ឌិកូដត្រូវបានជំនួសដោយ R-SWA ។
ការបណ្តុះបណ្តាលត្រូវបានធ្វើឡើងលើគំរូឯកសារប្រមាណជាពីរលាន ដោយបំបែកពីប្រាំបួនទៅមួយរវាងទិន្នន័យតែមួយទំព័រ និងច្រើនទំព័រ។ PaddleOCR គ្រប់គ្រងចំណារពន្យល់សម្រាប់ទំព័រតែមួយ ខណៈពេលដែលទិន្នន័យច្រើនទំព័រត្រូវបានបង្កើតដោយសំយោគដោយភ្ជាប់ទំព័រតែមួយជាមួយគ្នាទៅក្នុងឯកសារដែលមានចាប់ពីពីរទៅហាសិបទំព័រ។ ទិន្នន័យបណ្តុះបណ្តាលទាំងអស់ត្រូវបានខ្ចប់ជាលំដាប់នៃនិមិត្តសញ្ញា 32,000 ហើយការបណ្តុះបណ្តាលបានដំណើរការសម្រាប់ 4,000 ជំហានលើ 8 សំណុំនៃ 16 Nvidia A800 GPUs ។ DeepEncoder នៅតែជាប់គាំងពេញមួយវគ្គបណ្តុះបណ្តាល ដោយមានតែប៉ារ៉ាម៉ែត្រគំរូភាសាប៉ុណ្ណោះដែលត្រូវបានធ្វើបច្ចុប្បន្នភាព។
លទ្ធផលគោល
OCR គ្មានដែនកំណត់ សម្រេចបាននូវការអនុវត្តដ៏រឹងមាំនៅទូទាំងរង្វាស់វាយតម្លៃជាច្រើន។ នៅលើឯកសារគោល OmniDocBench v1.5 ម៉ូដែលនេះទទួលបានពិន្ទុ 93 ភាគរយជារួម ប្រាំមួយភាគរយលើសពីបន្ទាត់មូលដ្ឋាន Deepseek OCR ។
នៅក្នុងការសាកល្បងរយៈពេលវែងដ៏សំខាន់ - ដែលជាកន្លែងដែលគំរូដំណើរការទំព័រជាច្រើននៅក្នុងការឆ្លងកាត់តែមួយ - អត្រាកំហុសនៅតែស្ថិតនៅក្រោម 0.11 សូម្បីតែលើសពី 40 ទំព័រ។ អ្នកស្រាវជ្រាវសន្មតថាកំហុសដែលនៅសេសសល់មិនបាត់បង់បរិបទទេ ប៉ុន្តែចំពោះកម្រិតដំណោះស្រាយរបស់ DeepEncoder នៅក្នុងរបៀបមូលដ្ឋាន ដែលអត្ថបទតូចខ្លាំងពិបាកសម្គាល់។
បង្អួចយកចិត្តទុកដាក់ដែលបានដាក់កម្រិតក៏ផ្តល់អត្ថប្រយោជន៍ដែលមិនរំពឹងទុកផងដែរ។ នៅលើឯកសារតែមួយទំព័រ ការកំណត់បង្អួចត្រឹម 128 tokens មិនប៉ះពាល់ដល់ភាពត្រឹមត្រូវទេ ហើយពិតជាធ្វើអោយវាប្រសើរឡើងបន្តិច។ អ្នកស្រាវជ្រាវសន្មតថា R-SWA បង្ខំគំរូឱ្យផ្តោតយ៉ាងតឹងរ៉ឹងលើកិច្ចការ OCR ដ៏ក្រាស់ ខណៈដែលការយកចិត្តទុកដាក់ពេញលេញមានទំនោរទៅរកការខុសគ្នានៅពេលដែលប្រវែងទិន្នផលកើនឡើង។
ការបង្កើនល្បឿនគឺគួរឱ្យកត់សម្គាល់ដូចគ្នា។ នៅក្នុងរបៀបមូលដ្ឋាន OCR គ្មានដែនកំណត់សម្រេចបាន 5,580 ថូខឹនក្នុងមួយវិនាទីធៀបនឹង 4,951 សម្រាប់ Deepseek OCR ដែលជាការធ្វើឱ្យប្រសើរឡើង 12.7 ភាគរយ។ នៅក្នុងការប្រៀបធៀបទ្រឹស្ដីខាងលើជាមួយនឹងភាពស្របគ្នាដ៏ល្អ គំរូនេះនាំមុខ 35 ភាគរយនៅប្រហែល 6,000 និមិត្តសញ្ញាទិន្នផល។
សារៈសំខាន់កាន់តែទូលំទូលាយ
ស្ថាបត្យកម្ម OCR គ្មានដែនកំណត់បង្ហាញពីគោលការណ៍ដែលមានផលប៉ះពាល់លើសពីដំណើរការឯកសារ។ គំនិតនៃការរក្សាការចងចាំឱ្យថេរតាមរយៈការយកចិត្តទុកដាក់ជ្រើសរើស - បំផុសគំនិតដោយវិទ្យាសាស្ត្រការយល់ដឹងជាជាងការធ្វើមាត្រដ្ឋានសុទ្ធ - អាចជូនដំណឹងដល់ការរចនានៃប្រព័ន្ធ AI ដែលមានប្រសិទ្ធភាពជាងនៅទូទាំងកម្មវិធីជាច្រើន។
នៅពេលដែលអង្គការកំពុងប្រឈមមុខនឹងការចំណាយលើការគណនានៃការដាក់ពង្រាយគំរូភាសាធំៗ វិធីសាស្រ្តដែលកាត់បន្ថយការប្រើប្រាស់អង្គចងចាំដោយមិនបាត់បង់គុណភាពគឺមានតម្លៃកាន់តែខ្លាំងឡើង។ ការងាររបស់ Baidu ណែនាំថា ពាក្យប្រៀបធៀបជីវសាស្រ្ត នៅពេលបកប្រែទៅជាយន្តការគណិតវិទ្យា អាចផ្តល់លទ្ធផលវិស្វកម្មជាក់ស្តែង។
ការស្រាវជ្រាវក៏បានបង្ហាញពីឥទ្ធិពលដែលកំពុងកើនឡើងរបស់ប្រទេសចិនក្នុងការស្រាវជ្រាវ AI ជាមូលដ្ឋាន។ ខណៈពេលដែលការយកចិត្តទុកដាក់ជាច្រើនបានផ្តោតលើសមិទ្ធិផលរបស់ចិននៅក្នុងគំរូភាសាធំៗ ការងារដូចជា Unlimited OCR បង្ហាញថាអ្នកស្រាវជ្រាវចិនក៏កំពុងរួមចំណែកយ៉ាងសំខាន់ចំពោះប្រព័ន្ធ AI ឯកទេសជាមួយនឹងការអនុវត្តជាក់ស្តែងភ្លាមៗផងដែរ។
នាំមុខ AI
សម្រាប់ការគ្របដណ្តប់បន្ថែមទៀតនៃការស្រាវជ្រាវ AI ឯកសារ AI និងរបកគំហើញបច្ចេកវិទ្យា សូមចូលទៅកាន់ AI Buzz Wire។
អានព័ត៌មាន AI បន្ថែម →
