Baidu ஆராய்ச்சியாளர்கள் ஒரு ஆப்டிகல் கேரக்டர் ரெகக்னிஷன் (OCR) மாதிரியை உருவாக்கியுள்ளனர், இது நிலையான நினைவகப் பயன்பாடு மற்றும் சீரான வேகத்தை பராமரிக்கும் அதே வேளையில் ஒரே அனுமான பாஸில் டஜன் கணக்கான ஆவணப் பக்கங்களை செயலாக்கும் திறன் கொண்டது. அன்லிமிடெட் OCR எனப்படும் அமைப்பு, AI ஆவணத்தில் குறிப்பிடத்தக்க முன்னேற்றத்தைக் குறிக்கும் வகையில், மனிதர்கள் உரையை கையால் நகலெடுக்கும் விதத்தால் ஈர்க்கப்பட்ட ஒரு புதிய கவன பொறிமுறையின் மூலம் இதை அடைகிறது. AI ஆராய்ச்சி மற்றும் தொழில்நுட்பத்தின் சமீபத்திய முன்னேற்றங்களுக்கு, AI Buzz Wire ஐப் பார்வையிடவும்.
கேவி கேச் தடையை சமாளித்தல்
மொழி மாதிரிகளை அவற்றின் குறிவிலக்கிகளாகப் பயன்படுத்தும் தற்போதைய எண்ட்-டு-எண்ட் OCR அமைப்புகள் அடிப்படை கட்டடக்கலை வரம்புகளை எதிர்கொள்கின்றன. ஒரு மாதிரியானது உரையைச் செயலாக்கும்போது, KV கேச் எனப்படும் இடையகத்தில் முன்பு செயலாக்கப்பட்ட டோக்கன்களைப் பற்றிய தகவலைச் சேமித்து, தலைமுறையின் போது முந்தைய உள்ளடக்கத்தைக் குறிப்பிட அனுமதிக்கிறது. இந்த இடையக உரையின் ஒவ்வொரு புதிய வரியிலும் வளர்கிறது, நினைவக நுகர்வு சீராக அதிகரிக்கிறது மற்றும் தலைமுறை வேகத்தை குறைக்கிறது.
நடைமுறையில், ஒவ்வொரு பக்கமும் முடிந்தபின், தற்காலிக சேமிப்பை மீட்டமைத்து, ஒரு சுழற்சியில் பக்கம் பக்கமாக ஆவணங்களைச் செயலாக்குவதன் மூலம், ஏற்கனவே உள்ள அமைப்புகள் இந்த இடையூறுகளைச் சமாளிக்கின்றன. இந்த அணுகுமுறை வேலை செய்கிறது ஆனால் திறமையின்மைகளை அறிமுகப்படுத்துகிறது மற்றும் பக்க எல்லைகளுக்குள் சூழலைப் பராமரிப்பதில் இருந்து மாதிரியைத் தடுக்கிறது. தற்போதைய எந்த OCR மாதிரியும் ஒரே பாஸில் ஏறக்குறைய பத்து பக்கங்களுக்கு மேல் கையாள்வதில்லை என்று Baidu ஆராய்ச்சியாளர்கள் தங்கள் தொழில்நுட்ப அறிக்கையில் குறிப்பிடுகின்றனர்.
வரம்பற்ற OCR இந்த தடையை முழுவதுமாக நீக்குகிறது. மாடல் அதன் தற்காலிக சேமிப்பை எவ்வாறு அணுகுகிறது என்பதை நிர்வகிக்கும் கவனம் பொறிமுறையை மறுவடிவமைப்பதன் மூலம், கணினி எத்தனை பக்கங்களை செயலாக்குகிறது என்பதைப் பொருட்படுத்தாமல் நினைவக பயன்பாட்டை நிலையானதாக வைத்திருக்கும்.
குறிப்பு ஸ்லைடிங் சாளர கவனம் எவ்வாறு செயல்படுகிறது
முக்கிய கண்டுபிடிப்பு என்னவென்றால், Baidu குழு ரெஃபரன்ஸ் ஸ்லைடிங் விண்டோ அட்டென்ஷன் (R-SWA) என்று அழைக்கிறது. மனித ஒப்புமையிலிருந்து பெறப்பட்ட எளிய ஆனால் சக்திவாய்ந்த நுண்ணறிவின் அடிப்படையில் இந்த பொறிமுறை கட்டமைக்கப்பட்டுள்ளது: ஒரு நபர் ஒரு புத்தகத்திலிருந்து உரையை நகலெடுக்கும்போது, அவர்கள் ஏற்கனவே எழுதிய அனைத்தையும் தொடர்ந்து மீண்டும் படிக்க மாட்டார்கள். அதற்குப் பதிலாக, அவர்கள் மூலப் பொருள், கடைசியாகப் படியெடுத்த சில எழுத்துக்கள் மற்றும் எழுத வேண்டிய அடுத்த எழுத்து ஆகியவற்றில் கவனம் செலுத்துகிறார்கள். பழைய பத்திகள் இயற்கையாகவே ஒரு வகையான மென்மையான மறதியின் மூலம் செயலில் உள்ள நினைவகத்திலிருந்து மங்கிவிடும்.
R-SWA இந்த கொள்கையை பல்வேறு வகையான டோக்கன்களை வித்தியாசமாக கையாளுகிறது. உருவாக்கப்படும் ஒவ்வொரு டோக்கனும் அனைத்து குறிப்பு டோக்கன்களிலும் முழு கவனத்தைத் தக்கவைத்துக் கொள்கிறது - ஆவணம் மற்றும் செயலாக்க வரியில் குறியாக்கம் செய்யும் காட்சி பட டோக்கன்கள். ஆனால் முன்பு உருவாக்கப்பட்ட வெளியீட்டு உரைக்கு வரும்போது, மாடல் மிக சமீபத்திய 128 டோக்கன்களை மட்டுமே பார்க்கிறது.
இந்த வடிவமைப்பு KV தற்காலிக சேமிப்பை முன்னொட்டு நீளம் மற்றும் சாளர அளவின் கூட்டுத்தொகைக்கு சமமாக நிலையான அளவில் வைத்திருக்கும், எவ்வளவு உரை உருவாக்கப்பட்டுள்ளது என்பதைப் பொருட்படுத்தாமல். கேச் ஒரு வரிசையாக செயல்படுகிறது, ஒவ்வொரு புதிய டோக்கனும் பழமையானதை வெளியே தள்ளுகிறது, இது நிலையான கவனம் செயல்முறைகளை பாதிக்கும் வரம்பற்ற நினைவக வளர்ச்சியைத் தடுக்கிறது.
காட்சித் தகவலைப் பாதுகாத்தல்
காட்சி டோக்கன்களை எப்படிக் கையாள்கிறது என்பது R-SWAவில் முக்கியமான வடிவமைப்புத் தேர்வாகும். நிலையான ஸ்லைடிங் சாளர கவனம் அனைத்து டோக்கன்களையும் தற்போதைய நிலை மாற்றங்களுக்கு உட்படுத்தும், படிப்படியாக பட அம்சங்களை மங்கலாக்கும் மற்றும் காலப்போக்கில் அங்கீகாரத்தின் துல்லியத்தை சிதைக்கும். R-SWA இந்த மாற்றங்களிலிருந்து காட்சி டோக்கன்களுக்கு விலக்கு அளிக்கிறது - அவை ஒரு முறை குறியாக்கம் செய்யப்பட்டு முழு டிகோடிங் செயல்முறையிலும் மாறாமல் இருக்கும்.
OCR துல்லியத்திற்கு காட்சித் தகவலைப் பாதுகாப்பது அவசியம். அசல் படப் பிரதிநிதித்துவத்தை அப்படியே வைத்திருப்பதன் மூலம், மாடல் அதன் சொந்த வெளியீட்டில் எவ்வளவு தூரம் திரும்பி இருக்கிறது என்பதைக் கட்டுப்படுத்துவதன் மூலம், R-SWA இரண்டு உலகங்களிலும் சிறந்ததை அடைகிறது: நிலையான நினைவக பயன்பாடு மற்றும் நம்பகமான உரை அங்கீகாரம்.
கட்டிடக்கலை மற்றும் பயிற்சி
ஓப்பன் சோர்ஸ் டீப்சீக் OCR மாதிரியின் மேல் வரம்பற்ற OCR கட்டமைக்கப்பட்டுள்ளது. Baidu அதன் DeepEncoder ஐத் தக்க வைத்துக் கொண்டுள்ளது, இது 1024-by-1024-pixel PDF படத்தை 256 டோக்கன்களாக சுருக்கி, அதை நிபுணர்களின் கலவையுடன் (MoE) இணைக்கிறது. டிகோடரில் மூன்று பில்லியன் மொத்த அளவுருக்கள் உள்ளன, ஆனால் தோராயமாக 500 மில்லியன் அளவுருக்கள் மட்டுமே அனுமானத்தின் போது செயலில் உள்ளன, கணக்கீட்டு செலவுகளை நிர்வகிக்க முடியும்.
கணினி இரண்டு தெளிவுத்திறன் முறைகளை வழங்குகிறது. அடிப்படை பயன்முறை பல பக்க ஆவணங்களுக்கு உகந்ததாக உள்ளது, அதே சமயம் குண்டம் பயன்முறையானது ஒற்றை பக்க செயலாக்கத்திற்கு மாறும் தெளிவுத்திறனைப் பயன்படுத்துகிறது. டிகோடரில் உள்ள ஒவ்வொரு நிலையான கவன அடுக்கும் R-SWA உடன் மாற்றப்பட்டது.
ஏறக்குறைய இரண்டு மில்லியன் ஆவண மாதிரிகளில் பயிற்சி நடத்தப்பட்டது, ஒற்றைப் பக்க மற்றும் பல பக்க தரவுகளுக்கு இடையே ஒன்பது முதல் ஒன்று வரை பிரிக்கப்பட்டது. PaddleOCR ஆனது ஒற்றைப் பக்கங்களுக்கான சிறுகுறிப்பைக் கையாண்டது, அதே சமயம் பல பக்கத் தரவுகள் இரண்டு முதல் ஐம்பது பக்கங்கள் வரையிலான ஆவணங்களாக ஒற்றைப் பக்கங்களை ஒன்றாக இணைத்து செயற்கையாகக் கட்டமைக்கப்பட்டது. அனைத்து பயிற்சி தரவுகளும் 32,000 டோக்கன்களின் வரிசைகளில் நிரம்பியுள்ளன, மேலும் 16 Nvidia A800 GPUகளின் 8 செட்களில் 4,000 படிகளுக்கு பயிற்சி நடத்தப்பட்டது. பயிற்சி முழுவதும் DeepEncoder உறைந்த நிலையில் இருந்தது, மொழி மாதிரி அளவுருக்கள் மட்டுமே புதுப்பிக்கப்பட்டன.
பெஞ்ச்மார்க் முடிவுகள்
வரம்பற்ற OCR பல மதிப்பீட்டு அளவீடுகளில் வலுவான செயல்திறனை அடைகிறது. OmniDocBench v1.5 டாகுமெண்ட் பெஞ்ச்மார்க்கில், மாடல் ஒட்டுமொத்தமாக 93 சதவீத மதிப்பெண்களைப் பெற்றுள்ளது, Deepseek OCR அடிப்படையை விட ஆறு சதவீத புள்ளிகள்.
முக்கியமான நீண்ட-அடிவான சோதனையில் - மாடல் ஒரே பாஸில் பல பக்கங்களைச் செயலாக்குகிறது - பிழை விகிதம் 40 பக்கங்களுக்கு அப்பால் 0.11க்குக் கீழே இருக்கும். ஆராய்ச்சியாளர்கள் மீதமுள்ள பிழைகளை இழந்த சூழல் அல்ல, ஆனால் அடிப்படை பயன்முறையில் உள்ள டீப்என்கோடரின் தெளிவுத்திறன் வரம்புக்கு காரணம் என்று கூறுகிறார்கள், அங்கு மிகச் சிறிய உரையை அடையாளம் காண்பது கடினம்.
தடைசெய்யப்பட்ட கவனம் சாளரமும் எதிர்பாராத பலனைத் தருகிறது. ஒற்றைப் பக்க ஆவணங்களில், சாளரத்தை 128 டோக்கன்களாகக் கட்டுப்படுத்துவது துல்லியத்தை பாதிக்காது மற்றும் உண்மையில் சிறிது மேம்படுத்துகிறது. R-SWA மாதிரியானது அடர்த்தியான OCR பணியின் மீது மிகவும் இறுக்கமாக கவனம் செலுத்தும்படி கட்டாயப்படுத்துகிறது என்று ஆராய்ச்சியாளர்கள் அனுமானிக்கின்றனர்.
வேக மேம்பாடுகள் சமமாக குறிப்பிடத்தக்கவை. அடிப்படை பயன்முறையில், அன்லிமிடெட் OCR வினாடிக்கு 5,580 டோக்கன்களை அடைகிறது, இது டீப்சீக் OCRக்கான 4,951 உடன் ஒப்பிடும்போது 12.7 சதவீதம் முன்னேற்றம். ஐடியல் பேரலலிசத்துடன் கோட்பாட்டு ரீதியிலான மேல்-பவுண்ட் ஒப்பீடுகளில், மாதிரியானது 6,000 அவுட்புட் டோக்கன்களில் 35 சதவிகிதம் அடிப்படையை வழிநடத்துகிறது.
பரந்த முக்கியத்துவம்
வரம்பற்ற OCR கட்டமைப்பு ஆவண செயலாக்கத்திற்கு அப்பாற்பட்ட தாக்கங்களைக் கொண்ட ஒரு கொள்கையை நிரூபிக்கிறது. தேர்ந்தெடுக்கப்பட்ட கவனத்தின் மூலம் நினைவகத்தை நிலையானதாக வைத்திருக்கும் யோசனை - தூய அளவிடுதலைக் காட்டிலும் அறிவாற்றல் அறிவியலால் ஈர்க்கப்பட்டு - பலவிதமான பயன்பாடுகளில் மிகவும் திறமையான AI அமைப்புகளின் வடிவமைப்பை தெரிவிக்கலாம்.
பெரிய மொழி மாதிரிகளைப் பயன்படுத்துவதற்கான கணக்கீட்டுச் செலவுகளுடன் நிறுவனங்கள் பிடிபடுவதால், தரத்தை தியாகம் செய்யாமல் நினைவக நுகர்வு குறைக்கும் அணுகுமுறைகள் பெருகிய முறையில் மதிப்புமிக்கவை. பைடுவின் பணி, உயிரியல் உருவகங்கள், கணித வழிமுறைகளாக மொழிபெயர்க்கப்படும் போது, நடைமுறைப் பொறியியல் முன்னேற்றங்களைத் தரும்.
அடிப்படை AI ஆராய்ச்சியில் சீனாவின் வளர்ந்து வரும் செல்வாக்கையும் இந்த ஆராய்ச்சி எடுத்துக்காட்டுகிறது. பெரிய மொழி மாதிரிகளில் சீன சாதனைகள் மீது அதிக கவனம் செலுத்தப்பட்டாலும், அன்லிமிடெட் OCR போன்ற பணிகள், உடனடி நடைமுறை பயன்பாடுகளுடன் கூடிய சிறப்பு AI அமைப்புகளுக்கு சீன ஆராய்ச்சியாளர்களும் குறிப்பிடத்தக்க பங்களிப்பை வழங்குகிறார்கள் என்பதை நிரூபிக்கிறது.
AIக்கு முன்னால் இருங்கள்
AI ஆராய்ச்சி, ஆவண AI மற்றும் தொழில்நுட்ப முன்னேற்றங்கள் பற்றிய கூடுதல் தகவல்களுக்கு, AI Buzz Wire ஐப் பார்வையிடவும்.
மேலும் AI செய்திகளைப் படிக்கவும் →
