Baidu संशोधकांनी एक ऑप्टिकल कॅरेक्टर रिकग्निशन (OCR) मॉडेल विकसित केले आहे जे एकल अनुमान पासमध्ये डझनभर दस्तऐवज पृष्ठांवर प्रक्रिया करण्यास सक्षम आहे आणि सतत मेमरी वापर आणि सातत्यपूर्ण गती राखते. अनलिमिटेड ओसीआर नावाची प्रणाली, मानव हाताने मजकूर कसा कॉपी करतात यावरून प्रेरित नवीन लक्ष तंत्राद्वारे हे साध्य करते, दस्तऐवज AI मध्ये लक्षणीय प्रगती दर्शवते. AI संशोधन आणि तंत्रज्ञानातील नवीनतम घडामोडींसाठी, AI Buzz Wire ला भेट द्या.

केव्ही कॅशे बॉटलनेकवर मात करणे

सध्याच्या एंड-टू-एंड OCR सिस्टीम ज्या भाषा मॉडेल्सचा वापर करतात त्यांच्या डीकोडरना मूलभूत वास्तुशास्त्रीय मर्यादांचा सामना करावा लागतो. मॉडेल मजकूरावर प्रक्रिया करत असताना, ते KV कॅशे नावाच्या बफरमध्ये पूर्वी प्रक्रिया केलेल्या टोकनची माहिती संग्रहित करते, ज्यामुळे जनरेशन दरम्यान पूर्वीच्या सामग्रीचा संदर्भ घेता येतो. हा बफर मजकूराच्या प्रत्येक नवीन ओळीसह वाढतो, सतत मेमरीचा वापर वाढतो आणि जनरेशनचा वेग कमी होतो.

व्यवहारात, विद्यमान प्रणाली प्रत्येक पृष्ठ पूर्ण झाल्यानंतर दस्तऐवज पृष्ठानुसार पृष्ठावर प्रक्रिया करून, प्रत्येक पृष्ठ पूर्ण झाल्यानंतर कॅशे रीसेट करून या अडथळ्यावर काम करतात. हा दृष्टीकोन कार्य करतो परंतु अकार्यक्षमतेचा परिचय करून देतो आणि मॉडेलला पृष्ठ सीमा ओलांडून संदर्भ राखण्यापासून प्रतिबंधित करतो. कोणतेही वर्तमान OCR मॉडेल एका पासमध्ये अंदाजे दहा पृष्ठांपेक्षा जास्त हाताळत नाही, Baidu संशोधकांनी त्यांच्या तांत्रिक अहवालात नमूद केले आहे.

अमर्यादित OCR ही मर्यादा पूर्णपणे काढून टाकते. मॉडेल त्याच्या कॅशेमध्ये कसे प्रवेश करते हे नियंत्रित करणारी लक्ष यंत्रणा पुन्हा डिझाइन करून, सिस्टम किती पृष्ठांवर प्रक्रिया करते याकडे दुर्लक्ष करून मेमरी वापर स्थिर ठेवते.

संदर्भ स्लाइडिंग विंडो लक्ष कसे कार्य करते

Baidu टीम ज्याला रेफरन्स स्लाइडिंग विंडो अटेंशन (R-SWA) म्हणतो तो मुख्य नवकल्पना आहे. मानवी सादृश्यातून काढलेल्या साध्या पण शक्तिशाली अंतर्दृष्टीवर ही यंत्रणा तयार केली गेली आहे: जेव्हा एखादी व्यक्ती पुस्तकातील मजकूर कॉपी करते, तेव्हा त्यांनी आधीच लिहिलेले सर्व काही ते सतत पुन्हा वाचत नाहीत. त्याऐवजी, ते त्यांचे लक्ष स्त्रोत सामग्रीवर केंद्रित करतात, त्यांनी लिप्यंतरण केलेले शेवटचे काही वर्ण आणि पुढील वर्ण लिहून ठेवतात. जुने परिच्छेद नैसर्गिकरित्या सक्रिय स्मृतीतून एक प्रकारचे मऊ विसरणे द्वारे मिटतात.

R-SWA वेगवेगळ्या प्रकारच्या टोकन्सवर वेगळ्या पद्धतीने उपचार करून हे तत्त्व लागू करते. प्रत्येक व्युत्पन्न केलेले टोकन सर्व संदर्भ टोकन्सवर पूर्ण लक्ष ठेवते - दृश्य प्रतिमा टोकन जे दस्तऐवज आणि प्रक्रिया प्रॉम्प्ट एन्कोड करतात. परंतु जेव्हा पूर्वी व्युत्पन्न केलेल्या आउटपुट मजकूराचा विचार केला जातो, तेव्हा मॉडेल फक्त सर्वात अलीकडील 128 टोकन्सकडे पाहतो.

किती मजकूर व्युत्पन्न झाला आहे याची पर्वा न करता हे डिझाइन केव्ही कॅशेला उपसर्ग लांबी आणि खिडकीच्या आकाराच्या बेरीजच्या समान आकारात ठेवते. कॅशे रांगेच्या रूपात कार्य करते, प्रत्येक नवीन टोकन सर्वात जुने बाहेर ढकलते, असीमित मेमरी वाढीस प्रतिबंध करते ज्यामुळे मानक लक्ष देण्याची यंत्रणा त्रास देते.

व्हिज्युअल माहितीचे संरक्षण करणे

R-SWA मधील एक महत्त्वपूर्ण डिझाइन निवड म्हणजे ते व्हिज्युअल टोकन कसे हाताळते. स्टँडर्ड स्लाइडिंग विंडो अटेन्शन सर्व टोकन्स चालू स्थितीतील बदलांच्या अधीन करेल, हळूहळू प्रतिमा वैशिष्ट्ये अस्पष्ट होईल आणि कालांतराने ओळख अचूकता कमी होईल. R-SWA या संक्रमणांमधून व्हिज्युअल टोकन्सला सूट देते — ते एकदा एन्कोड केले जातात आणि संपूर्ण डीकोडिंग प्रक्रियेदरम्यान अपरिवर्तित राहतात.

OCR अचूकतेसाठी व्हिज्युअल माहितीचे हे संरक्षण आवश्यक आहे. मॉडेल त्याच्या स्वतःच्या आउटपुटमध्ये किती मागे दिसते हे मर्यादित करून मूळ प्रतिमेचे प्रतिनिधित्व अबाधित ठेवून, R-SWA दोन्ही जगातील सर्वोत्तम साध्य करते: स्थिर मेमरी वापर आणि विश्वासार्ह मजकूर ओळख.

आर्किटेक्चर आणि प्रशिक्षण

अमर्यादित OCR ओपन-सोर्स डीपसीक OCR मॉडेलच्या शीर्षस्थानी तयार केले आहे. Baidu त्याचे DeepEncoder राखून ठेवते, जे 1024-by-1024-पिक्सेल PDF प्रतिमा 256 टोकनपर्यंत संकुचित करते आणि तज्ञांच्या मिश्रणासह (MoE) आर्किटेक्चर जोडते. डीकोडरमध्ये एकूण तीन अब्ज पॅरामीटर्स आहेत, परंतु अंदाजे अंदाजे 500 दशलक्ष मापदंड अनुमानादरम्यान सक्रिय असतात, संगणकीय खर्च व्यवस्थापित करता येतात.

सिस्टम दोन रिझोल्यूशन मोड ऑफर करते. बेस मोड मल्टी-पेज दस्तऐवजांसाठी अनुकूल आहे, तर गुंडम मोड सिंगल-पेज प्रक्रियेसाठी डायनॅमिक रिझोल्यूशन वापरतो. डीकोडरमधील प्रत्येक मानक लक्ष स्तर R-SWA ने बदलला.

प्रशिक्षण अंदाजे दोन दशलक्ष दस्तऐवज नमुन्यांवर आयोजित केले गेले, एकल-पृष्ठ आणि बहु-पृष्ठ डेटामध्ये नऊ-टू-वन विभाजित केले. PaddleOCR ने एकल पृष्ठांसाठी भाष्य हाताळले, तर बहु-पृष्ठ डेटा दोन ते पन्नास पृष्ठांपर्यंतच्या दस्तऐवजांमध्ये एकल पृष्ठे एकत्र जोडून सिंथेटिक पद्धतीने तयार केले गेले. सर्व प्रशिक्षण डेटा 32,000 टोकन्सच्या अनुक्रमांमध्ये पॅक केला गेला आणि प्रशिक्षण 16 Nvidia A800 GPU च्या 8 संचांवर 4,000 चरणांसाठी चालले. संपूर्ण प्रशिक्षणामध्ये DeepEncoder गोठवले गेले, फक्त भाषा मॉडेल पॅरामीटर्स अपडेट केले गेले.

बेंचमार्क परिणाम

अमर्यादित OCR एकाधिक मूल्यमापन मेट्रिक्समध्ये मजबूत कार्यप्रदर्शन प्राप्त करते. OmniDocBench v1.5 दस्तऐवज बेंचमार्कवर, मॉडेलने एकूण 93 टक्के गुण मिळवले, डीपसीक ओसीआर बेसलाइनपेक्षा सहा टक्के गुण.

गंभीर दीर्घ-क्षितिज चाचणीमध्ये — जेथे मॉडेल एकाच पासमध्ये अनेक पृष्ठांवर प्रक्रिया करते — त्रुटी दर 40 पृष्ठांच्या पुढेही 0.11 च्या खाली राहतो. संशोधकांनी उरलेल्या त्रुटींचे श्रेय हरवलेला संदर्भ नाही तर बेस मोडमधील DeepEncoder च्या रिझोल्यूशन मर्यादेला दिले आहे, जिथे अत्यंत लहान मजकूर ओळखणे कठीण होते.

प्रतिबंधित लक्ष विंडो देखील अनपेक्षित लाभ देते. सिंगल-पेज दस्तऐवजांवर, विंडोला 128 टोकनपर्यंत मर्यादित ठेवल्याने अचूकतेला हानी पोहोचत नाही आणि प्रत्यक्षात ती थोडी सुधारते. संशोधकांनी असे गृहीत धरले आहे की R-SWA मॉडेलला दाट OCR टास्कवर अधिक घट्टपणे लक्ष केंद्रित करण्यास भाग पाडते, तर आउटपुटची लांबी जसजशी वाढते तसतसे संपूर्ण लक्ष विचलनाकडे झुकते.

वेगातील सुधारणा तितक्याच उल्लेखनीय आहेत. बेस मोडमध्ये, अमर्यादित OCR डीपसीक OCR साठी 4,951 च्या तुलनेत 5,580 टोकन प्रति सेकंद मिळवते, 12.7 टक्के सुधारणा. आदर्श समांतरतेसह सैद्धांतिक वरच्या-बाउंड तुलनांमध्ये, मॉडेल अंदाजे 6,000 आउटपुट टोकनवर 35 टक्क्यांनी बेसलाइन आघाडीवर आहे.

व्यापक महत्त्व

अमर्यादित OCR आर्किटेक्चर दस्तऐवज प्रक्रियेच्या पलीकडे असलेल्या परिणामांसह एक तत्त्व प्रदर्शित करते. निवडक लक्षाद्वारे स्मृती स्थिर ठेवण्याची कल्पना — शुद्ध स्केलिंग ऐवजी संज्ञानात्मक विज्ञानाद्वारे प्रेरित — अनुप्रयोगांच्या श्रेणीमध्ये अधिक कार्यक्षम AI प्रणालींच्या डिझाइनची माहिती देऊ शकते.

मोठ्या भाषा मॉडेल्सच्या उपयोजनाच्या संगणकीय खर्चाचा सामना करताना संघटना, गुणवत्तेचा त्याग न करता मेमरी वापर कमी करणारे दृष्टीकोन वाढत्या प्रमाणात मौल्यवान आहेत. Baidu चे कार्य असे सुचविते की जैविक रूपकांचे गणितीय यंत्रणेत भाषांतर केल्यावर ते व्यावहारिक अभियांत्रिकी यश मिळवू शकतात.

हे संशोधन पायाभूत AI संशोधनात चीनच्या वाढत्या प्रभावावरही प्रकाश टाकते. मोठ्या भाषेच्या मॉडेल्समध्ये चिनी यशांवर जास्त लक्ष केंद्रित केले जात असताना, अमर्यादित OCR सारखे कार्य हे दाखवते की चीनी संशोधक तत्काळ व्यावहारिक अनुप्रयोगांसह विशेष AI प्रणालींमध्ये देखील महत्त्वपूर्ण योगदान देत आहेत.

AI च्या पुढे रहा

AI संशोधन, दस्तऐवज AI आणि तंत्रज्ञानातील प्रगतीच्या अधिक कव्हरेजसाठी, AI Buzz Wire ला भेट द्या.

अधिक AI बातम्या वाचा →