Baidu शोधकर्ताओं ने एक ऑप्टिकल कैरेक्टर रिकग्निशन (ओसीआर) मॉडल विकसित किया है जो निरंतर मेमोरी उपयोग और लगातार गति को बनाए रखते हुए एक ही अनुमान पास में दर्जनों दस्तावेज़ पृष्ठों को संसाधित करने में सक्षम है। सिस्टम, जिसे अनलिमिटेड ओसीआर कहा जाता है, इसे एक उपन्यास ध्यान तंत्र के माध्यम से प्राप्त करता है जो इस बात से प्रेरित है कि मनुष्य हाथ से पाठ की नकल कैसे करते हैं, जो दस्तावेज़ एआई में एक महत्वपूर्ण प्रगति का प्रतिनिधित्व करता है। एआई अनुसंधान और प्रौद्योगिकी में नवीनतम विकास के लिए, [एआई बज़ वायर] (https://aibuzzwire.news) पर जाएं।

केवी कैश बाधा पर काबू पाना

वर्तमान एंड-टू-एंड ओसीआर सिस्टम जो अपने डिकोडर के रूप में भाषा मॉडल का उपयोग करते हैं, उन्हें एक मौलिक वास्तुशिल्प सीमा का सामना करना पड़ता है। चूंकि एक मॉडल पाठ को संसाधित करता है, यह केवी कैश नामक बफर में पहले से संसाधित टोकन के बारे में जानकारी संग्रहीत करता है, जिससे इसे पीढ़ी के दौरान पहले की सामग्री को संदर्भित करने की अनुमति मिलती है। यह बफ़र पाठ की प्रत्येक नई पंक्ति के साथ बढ़ता है, जिससे मेमोरी की खपत लगातार बढ़ती है और पीढ़ी की गति धीमी हो जाती है।

व्यवहार में, मौजूदा प्रणालियाँ एक लूप में दस्तावेज़ों को पृष्ठ दर पृष्ठ संसाधित करके, प्रत्येक पृष्ठ के पूरा होने के बाद कैश को रीसेट करके इस बाधा को दूर करने का काम करती हैं। यह दृष्टिकोण काम करता है लेकिन अक्षमताओं का परिचय देता है और मॉडल को पृष्ठ सीमाओं के पार संदर्भ बनाए रखने से रोकता है। Baidu शोधकर्ताओं ने अपनी तकनीकी रिपोर्ट में नोट किया है कि कोई भी मौजूदा OCR मॉडल एक बार में लगभग दस पृष्ठों से अधिक को संभाल नहीं पाता है।

असीमित ओसीआर इस बाधा को पूरी तरह से समाप्त कर देता है। ध्यान तंत्र को फिर से डिज़ाइन करके जो यह नियंत्रित करता है कि मॉडल अपने कैश तक कैसे पहुंचता है, सिस्टम मेमोरी उपयोग को स्थिर रखता है, भले ही वह कितने पृष्ठों को संसाधित करता हो।

रेफरेंस स्लाइडिंग विंडो अटेंशन कैसे काम करता है

मुख्य नवाचार वह है जिसे Baidu टीम रेफरेंस स्लाइडिंग विंडो अटेंशन (R-SWA) कहती है। तंत्र मानव सादृश्य से ली गई एक सरल लेकिन शक्तिशाली अंतर्दृष्टि पर बनाया गया है: जब कोई व्यक्ति किसी पुस्तक से पाठ की प्रतिलिपि बनाता है, तो वे लगातार वह सब कुछ दोबारा नहीं पढ़ते हैं जो उन्होंने पहले ही लिखा है। इसके बजाय, वे अपना ध्यान स्रोत सामग्री, उनके द्वारा लिखे गए अंतिम कुछ पात्रों और लिखने के लिए अगले चरित्र पर केंद्रित रखते हैं। पुराने अंश स्वाभाविक रूप से एक प्रकार की नरम विस्मृति के माध्यम से सक्रिय स्मृति से फीके पड़ जाते हैं।

आर-एसडब्ल्यूए विभिन्न प्रकार के टोकन का अलग-अलग व्यवहार करके इस सिद्धांत को लागू करता है। प्रत्येक उत्पन्न टोकन सभी संदर्भ टोकन पर पूरा ध्यान रखता है - दृश्य छवि टोकन जो दस्तावेज़ और प्रसंस्करण संकेत को एन्कोड करते हैं। लेकिन जब पहले जेनरेट किए गए आउटपुट टेक्स्ट की बात आती है, तो मॉडल केवल सबसे हाल के 128 टोकन को देखता है।

यह डिज़ाइन केवी कैश को उपसर्ग लंबाई और विंडो आकार के योग के बराबर एक निश्चित आकार पर रखता है, भले ही कितना पाठ उत्पन्न हुआ हो। कैश एक कतार के रूप में कार्य करता है, जिसमें प्रत्येक नया टोकन सबसे पुराने टोकन को बाहर धकेलता है, जिससे मानक ध्यान तंत्र को प्रभावित करने वाली असीमित मेमोरी वृद्धि को रोका जा सकता है।

दृश्य सूचना की सुरक्षा करना

आर-एसडब्ल्यूए में एक महत्वपूर्ण डिज़ाइन विकल्प यह है कि यह विज़ुअल टोकन को कैसे संभालता है। मानक स्लाइडिंग विंडो ध्यान सभी टोकन को चल रहे राज्य परिवर्तनों, धीरे-धीरे छवि सुविधाओं को धुंधला करने और समय के साथ पहचान सटीकता में गिरावट के अधीन करेगा। आर-एसडब्ल्यूए विज़ुअल टोकन को इन बदलावों से छूट देता है - वे एक बार एन्कोड किए जाते हैं और पूरी डिकोडिंग प्रक्रिया के दौरान अपरिवर्तित रहते हैं।

ओसीआर सटीकता के लिए दृश्य जानकारी का यह संरक्षण आवश्यक है। मूल छवि प्रतिनिधित्व को बरकरार रखते हुए यह सीमित करते हुए कि मॉडल अपने आउटपुट में कितना पीछे दिखता है, आर-एसडब्ल्यूए दोनों दुनियाओं में सर्वश्रेष्ठ हासिल करता है: स्थिर मेमोरी उपयोग और विश्वसनीय पाठ पहचान।

वास्तुकला और प्रशिक्षण

अनलिमिटेड ओसीआर ओपन-सोर्स डीपसीक ओसीआर मॉडल के शीर्ष पर बनाया गया है। Baidu ने अपने DeepEncoder को बरकरार रखा है, जो 1024-बाई-1024-पिक्सेल पीडीएफ छवि को 256 टोकन तक संपीड़ित करता है, और इसे विशेषज्ञों के मिश्रण (MoE) आर्किटेक्चर के साथ जोड़ता है। डिकोडर में कुल तीन अरब पैरामीटर हैं, लेकिन अनुमान के दौरान केवल लगभग 500 मिलियन ही सक्रिय होते हैं, जिससे कम्प्यूटेशनल लागत प्रबंधनीय रहती है।

सिस्टम दो रिज़ॉल्यूशन मोड प्रदान करता है। बेस मोड बहु-पृष्ठ दस्तावेज़ों के लिए अनुकूलित है, जबकि गुंडम मोड एकल-पृष्ठ प्रसंस्करण के लिए गतिशील रिज़ॉल्यूशन का उपयोग करता है। डिकोडर में प्रत्येक मानक ध्यान परत को आर-एसडब्ल्यूए से बदल दिया गया था।

प्रशिक्षण लगभग दो मिलियन दस्तावेज़ नमूनों पर आयोजित किया गया था, एकल-पृष्ठ और बहु-पृष्ठ डेटा के बीच नौ-से-एक विभाजित किया गया था। पैडलओसीआर ने एकल पृष्ठों के लिए एनोटेशन को संभाला, जबकि बहु-पृष्ठ डेटा का निर्माण एकल पृष्ठों को दो से पचास पृष्ठों तक के दस्तावेज़ों में एक साथ जोड़कर कृत्रिम रूप से किया गया था। सभी प्रशिक्षण डेटा को 32,000 टोकन के अनुक्रम में पैक किया गया था, और प्रशिक्षण 16 एनवीडिया ए800 जीपीयू के 8 सेटों पर 4,000 चरणों तक चला। डीपएनकोडर पूरे प्रशिक्षण के दौरान स्थिर रहा, केवल भाषा मॉडल पैरामीटर अपडेट किए गए।

बेंचमार्क परिणाम

अनलिमिटेड ओसीआर कई मूल्यांकन मेट्रिक्स में मजबूत प्रदर्शन हासिल करता है। ओमनीडॉकबेंच v1.5 दस्तावेज़ बेंचमार्क पर, मॉडल का कुल स्कोर 93 प्रतिशत है, जो डीपसीक ओसीआर बेसलाइन से छह प्रतिशत अंक ऊपर है।

महत्वपूर्ण दीर्घ-क्षितिज परीक्षण में - जहां मॉडल एक ही पास में कई पृष्ठों को संसाधित करता है - त्रुटि दर 40 पृष्ठों से परे भी 0.11 से नीचे रहती है। शोधकर्ता शेष त्रुटियों का कारण खोए हुए संदर्भ को नहीं बल्कि बेस मोड में डीपएनकोडर की रिज़ॉल्यूशन सीमा को मानते हैं, जहां बेहद छोटे पाठ को पहचानना मुश्किल हो जाता है।

प्रतिबंधित ध्यान खिड़की से अप्रत्याशित लाभ भी मिलता है। एकल-पृष्ठ दस्तावेज़ों पर, विंडो को 128 टोकन तक सीमित करने से सटीकता पर कोई असर नहीं पड़ता है और वास्तव में इसमें थोड़ा सुधार होता है। शोधकर्ताओं का अनुमान है कि आर-एसडब्ल्यूए मॉडल को घने ओसीआर कार्य पर अधिक मजबूती से ध्यान केंद्रित करने के लिए मजबूर करता है, जबकि आउटपुट लंबाई बढ़ने पर पूरा ध्यान विचलन की ओर जाता है।

गति में सुधार भी समान रूप से उल्लेखनीय हैं। बेस मोड में, अनलिमिटेड ओसीआर प्रति सेकंड 5,580 टोकन प्राप्त करता है, जबकि डीपसीक ओसीआर के लिए यह 4,951 है, जो 12.7 प्रतिशत का सुधार है। आदर्श समानता के साथ सैद्धांतिक ऊपरी सीमा की तुलना में, मॉडल लगभग 6,000 आउटपुट टोकन पर बेसलाइन से 35 प्रतिशत आगे है।

व्यापक महत्व

अनलिमिटेड ओसीआर आर्किटेक्चर दस्तावेज़ प्रसंस्करण से परे निहितार्थ वाले एक सिद्धांत को प्रदर्शित करता है। चयनात्मक ध्यान के माध्यम से स्मृति को स्थिर रखने का विचार - शुद्ध स्केलिंग के बजाय संज्ञानात्मक विज्ञान से प्रेरित - अनुप्रयोगों की एक श्रृंखला में अधिक कुशल एआई सिस्टम के डिजाइन को सूचित कर सकता है।

जैसे-जैसे संगठन बड़े भाषा मॉडल को तैनात करने की कम्प्यूटेशनल लागत से जूझ रहे हैं, गुणवत्ता से समझौता किए बिना मेमोरी खपत को कम करने वाले दृष्टिकोण तेजी से मूल्यवान हो रहे हैं। Baidu के काम से पता चलता है कि जैविक रूपकों, जब गणितीय तंत्र में अनुवादित किया जाता है, तो व्यावहारिक इंजीनियरिंग सफलताएं मिल सकती हैं।

यह शोध मूलभूत एआई अनुसंधान में चीन के बढ़ते प्रभाव पर भी प्रकाश डालता है। जबकि बड़े भाषा मॉडल में चीनी उपलब्धियों पर अधिक ध्यान केंद्रित किया गया है, अनलिमिटेड ओसीआर जैसे काम से पता चलता है कि चीनी शोधकर्ता तत्काल व्यावहारिक अनुप्रयोगों के साथ विशेष एआई सिस्टम में भी महत्वपूर्ण योगदान दे रहे हैं।

एआई से आगे रहें

एआई अनुसंधान, दस्तावेज़ एआई और प्रौद्योगिकी सफलताओं के अधिक कवरेज के लिए, [एआई बज़ वायर] (https://aibuzzwire.news) पर जाएं।

अधिक AI समाचार पढ़ें →