Baidu গবেষকরা একটি অপটিক্যাল ক্যারেক্টার রিকগনিশন (OCR) মডেল তৈরি করেছেন যা স্থির মেমরি ব্যবহার এবং সামঞ্জস্যপূর্ণ গতি বজায় রেখে একক অনুমান পাসে কয়েক ডজন নথি পৃষ্ঠা প্রক্রিয়াকরণ করতে সক্ষম। আনলিমিটেড ওসিআর নামক সিস্টেম, মানুষ কীভাবে হাত দিয়ে টেক্সট কপি করে তা দ্বারা অনুপ্রাণিত একটি অভিনব মনোযোগ প্রক্রিয়ার মাধ্যমে এটি অর্জন করে, যা নথি AI-তে উল্লেখযোগ্য অগ্রগতির প্রতিনিধিত্ব করে। AI গবেষণা এবং প্রযুক্তির সাম্প্রতিক উন্নয়নের জন্য, AI Buzz Wire দেখুন।

কেভি ক্যাশে বটলনেক কাটিয়ে ওঠা

বর্তমান এন্ড-টু-এন্ড OCR সিস্টেমগুলি যেগুলি ভাষা মডেলগুলিকে তাদের ডিকোডার হিসাবে ব্যবহার করে একটি মৌলিক স্থাপত্য সীমাবদ্ধতার সম্মুখীন হয়৷ একটি মডেল টেক্সট প্রসেস করার সময়, এটি কেভি ক্যাশে নামক একটি বাফারে পূর্বে প্রসেস করা টোকেন সম্পর্কে তথ্য সংরক্ষণ করে, এটি প্রজন্মের সময় আগের বিষয়বস্তুকে রেফারেন্স করার অনুমতি দেয়। এই বাফারটি পাঠ্যের প্রতিটি নতুন লাইনের সাথে বৃদ্ধি পায়, ক্রমাগতভাবে মেমরি খরচ বৃদ্ধি করে এবং প্রজন্মের গতি কমিয়ে দেয়।

বাস্তবে, বিদ্যমান সিস্টেমগুলি একটি লুপে পৃষ্ঠার পৃষ্ঠায় ডকুমেন্ট প্রক্রিয়াকরণ করে, প্রতিটি পৃষ্ঠা সম্পূর্ণ হওয়ার পরে ক্যাশে রিসেট করে এই বাধাকে ঘিরে কাজ করে। এই পদ্ধতিটি কাজ করে কিন্তু অদক্ষতার পরিচয় দেয় এবং মডেলটিকে পৃষ্ঠার সীমানা জুড়ে প্রসঙ্গ বজায় রাখতে বাধা দেয়। কোনো বর্তমান OCR মডেল একক পাসে আনুমানিক দশ পৃষ্ঠার বেশি পরিচালনা করে না, Baidu গবেষকরা তাদের প্রযুক্তিগত প্রতিবেদনে উল্লেখ করেছেন।

সীমাহীন OCR এই সীমাবদ্ধতাকে সম্পূর্ণরূপে দূর করে। মডেলটি কীভাবে তার ক্যাশে অ্যাক্সেস করে তা নিয়ন্ত্রণ করে এমন মনোযোগের প্রক্রিয়াটিকে পুনরায় ডিজাইন করে, সিস্টেমটি কতগুলি পৃষ্ঠা প্রক্রিয়া করুক না কেন মেমরির ব্যবহারকে স্থির রাখে।

কিভাবে রেফারেন্স স্লাইডিং উইন্ডো মনোযোগ কাজ করে

মূল উদ্ভাবন হল যাকে Baidu দল রেফারেন্স স্লাইডিং উইন্ডো অ্যাটেনশন (R-SWA) বলে। মেকানিজমটি একটি সাধারণ কিন্তু শক্তিশালী অন্তর্দৃষ্টির উপর তৈরি করা হয়েছে একটি মানুষের সাদৃশ্য থেকে আঁকা: যখন একজন ব্যক্তি একটি বই থেকে পাঠ্য অনুলিপি করে, তখন তারা ইতিমধ্যেই লেখা সমস্ত কিছু ক্রমাগত পুনরায় পড়ে না। পরিবর্তে, তারা তাদের মনোযোগ উত্স উপাদানের উপর নিবদ্ধ রাখে, শেষ কয়েকটি অক্ষর তারা প্রতিলিপি করেছে এবং পরবর্তী অক্ষর লিখতে হবে। পুরানো প্যাসেজগুলি স্বাভাবিকভাবেই এক ধরণের নরম ভুলে যাওয়ার মাধ্যমে সক্রিয় স্মৃতি থেকে বিবর্ণ হয়ে যায়।

R-SWA বিভিন্ন ধরনের টোকেনকে ভিন্নভাবে ব্যবহার করে এই নীতি প্রয়োগ করে। প্রতিটি উত্পন্ন টোকেন সমস্ত রেফারেন্স টোকেনগুলিতে সম্পূর্ণ মনোযোগ ধরে রাখে — ভিজ্যুয়াল ইমেজ টোকেন যা নথি এবং প্রক্রিয়াকরণ প্রম্পটকে এনকোড করে। কিন্তু যখন এটি পূর্বে উত্পন্ন আউটপুট পাঠ্য আসে, মডেলটি শুধুমাত্র সাম্প্রতিক 128 টোকেনগুলির দিকে ফিরে তাকায়৷

এই ডিজাইনটি KV ক্যাশেকে একটি নির্দিষ্ট আকারে রাখে উপসর্গের দৈর্ঘ্য এবং উইন্ডোর আকারের সমষ্টির সমান, যত টেক্সট তৈরি করা হয়েছে তা নির্বিশেষে। ক্যাশে একটি সারি হিসাবে কাজ করে, প্রতিটি নতুন টোকেন সবচেয়ে পুরানোটিকে ঠেলে দেয়, সীমাহীন মেমরির বৃদ্ধি রোধ করে যা স্ট্যান্ডার্ড মনোযোগের প্রক্রিয়াকে জর্জরিত করে।

ভিজ্যুয়াল তথ্য রক্ষা করা

আর-এসডাব্লুএ-তে একটি সমালোচনামূলক নকশা পছন্দ হল এটি কীভাবে ভিজ্যুয়াল টোকেনগুলি পরিচালনা করে। স্ট্যান্ডার্ড স্লাইডিং উইন্ডো মনোযোগ সমস্ত টোকেনকে চলমান অবস্থার পরিবর্তনের সাপেক্ষে, ধীরে ধীরে চিত্রের বৈশিষ্ট্যগুলিকে ঝাপসা করে এবং সময়ের সাথে সাথে স্বীকৃতির সঠিকতা হ্রাস করে। R-SWA এই রূপান্তরগুলি থেকে ভিজ্যুয়াল টোকেনগুলিকে ছাড় দেয় — এগুলি একবার এনকোড করা হয় এবং পুরো ডিকোডিং প্রক্রিয়া জুড়ে অপরিবর্তিত থাকে।

OCR নির্ভুলতার জন্য ভিজ্যুয়াল তথ্যের এই সংরক্ষণ অপরিহার্য। মডেলটি তার নিজস্ব আউটপুটে কতটা পিছনে দেখায় তা সীমিত করার সময় আসল চিত্র উপস্থাপনা অক্ষত রেখে, R-SWA উভয় জগতের সেরা অর্জন করে: স্থিতিশীল মেমরি ব্যবহার এবং নির্ভরযোগ্য পাঠ্য স্বীকৃতি।

স্থাপত্য এবং প্রশিক্ষণ

ওপেন সোর্স ডিপসিক ওসিআর মডেলের উপরে আনলিমিটেড ওসিআর তৈরি করা হয়েছে। Baidu তার DeepEncoder ধরে রেখেছে, যা একটি 1024-বাই-1024-পিক্সেল পিডিএফ ইমেজকে 256 টোকেন পর্যন্ত সংকুচিত করে এবং এটিকে একটি মিক্সচার-অফ-এক্সপার্টস (MoE) আর্কিটেকচারের সাথে যুক্ত করে। ডিকোডারের মোট তিন বিলিয়ন পরামিতি রয়েছে, কিন্তু অনুমানের সময় প্রায় 500 মিলিয়ন সক্রিয় থাকে, গণনামূলক খরচগুলি পরিচালনাযোগ্য রাখে।

সিস্টেমটি দুটি রেজোলিউশন মোড অফার করে। বেস মোড বহু-পৃষ্ঠা নথিগুলির জন্য অপ্টিমাইজ করা হয়েছে, যখন গুন্ডাম মোড একক-পৃষ্ঠা প্রক্রিয়াকরণের জন্য গতিশীল রেজোলিউশন ব্যবহার করে। ডিকোডারের প্রতিটি মানক মনোযোগ স্তর R-SWA দিয়ে প্রতিস্থাপিত হয়েছিল।

প্রশিক্ষণ আনুমানিক দুই মিলিয়ন নথির নমুনার উপর পরিচালিত হয়েছিল, একক-পৃষ্ঠা এবং বহু-পৃষ্ঠা ডেটার মধ্যে নয়-থেকে-এক ভাগে। PaddleOCR একক পৃষ্ঠাগুলির জন্য টীকা পরিচালনা করে, যখন বহু-পৃষ্ঠার ডেটা একক পৃষ্ঠাগুলিকে একত্রে দুই থেকে পঞ্চাশ পৃষ্ঠার নথিতে সেলাই করে কৃত্রিমভাবে তৈরি করা হয়েছিল। সমস্ত প্রশিক্ষণ ডেটা 32,000 টোকেনের ক্রমানুসারে প্যাক করা হয়েছিল, এবং 16টি Nvidia A800 GPU-এর 8 সেটে 4,000টি ধাপে প্রশিক্ষণ চলে। ডিপ এনকোডারটি প্রশিক্ষণ জুড়ে হিমায়িত ছিল, শুধুমাত্র ভাষা মডেল পরামিতি আপডেট করা হচ্ছে।

বেঞ্চমার্ক ফলাফল

আনলিমিটেড ওসিআর একাধিক মূল্যায়ন মেট্রিক্স জুড়ে শক্তিশালী কর্মক্ষমতা অর্জন করে। OmniDocBench v1.5 ডকুমেন্ট বেঞ্চমার্কে, মডেলটি সামগ্রিকভাবে 93 শতাংশ স্কোর করেছে, ডিপসিক ওসিআর বেসলাইন থেকে ছয় শতাংশ পয়েন্ট উপরে।

সমালোচনামূলক দীর্ঘ-দিগন্ত পরীক্ষায় — যেখানে মডেলটি একক পাসে অনেকগুলি পৃষ্ঠা প্রক্রিয়া করে — ত্রুটির হার 0.11 এর নিচে এমনকি 40 পৃষ্ঠারও বেশি থাকে। গবেষকরা অবশিষ্ট ত্রুটিগুলিকে হারানো প্রসঙ্গ নয় বরং বেস মোডে DeepEncoder-এর রেজোলিউশন সীমাকে দায়ী করেছেন, যেখানে অত্যন্ত ছোট পাঠ্য সনাক্ত করা কঠিন হয়ে পড়ে।

সীমাবদ্ধ মনোযোগ উইন্ডোটি একটি অপ্রত্যাশিত সুবিধাও দেয়। একক-পৃষ্ঠার নথিতে, উইন্ডোটিকে 128 টোকেনে সীমিত করা নির্ভুলতার ক্ষতি করে না এবং আসলে এটিকে কিছুটা উন্নত করে। গবেষকরা অনুমান করেন যে R-SWA মডেলটিকে ঘন ওসিআর টাস্কে আরও শক্তভাবে ফোকাস করতে বাধ্য করে, যখন আউটপুট দৈর্ঘ্য বৃদ্ধির সাথে সাথে সম্পূর্ণ মনোযোগ ভিন্নতার দিকে থাকে।

গতির উন্নতি সমানভাবে উল্লেখযোগ্য। বেস মোডে, আনলিমিটেড ওসিআর প্রতি সেকেন্ডে 5,580 টোকেন অর্জন করে ডিপসিক ওসিআর-এর জন্য 4,951 এর তুলনায়, একটি 12.7 শতাংশ উন্নতি। আদর্শ সমান্তরালতার সাথে তাত্ত্বিক উপরের-বাউন্ড তুলনাতে, মডেলটি প্রায় 6,000 আউটপুট টোকেনে 35 শতাংশ বেসলাইনে নেতৃত্ব দেয়।

ব্যাপক তাৎপর্য

আনলিমিটেড OCR আর্কিটেকচার ডকুমেন্ট প্রসেসিং এর বাইরেও প্রভাব সহ একটি নীতি প্রদর্শন করে। বাছাইকৃত মনোযোগের মাধ্যমে মেমরিকে স্থির রাখার ধারণা - বিশুদ্ধ স্কেলিং এর পরিবর্তে জ্ঞানীয় বিজ্ঞান দ্বারা অনুপ্রাণিত - বিভিন্ন অ্যাপ্লিকেশন জুড়ে আরও দক্ষ AI সিস্টেমের নকশাকে অবহিত করতে পারে।

যেহেতু সংস্থাগুলি বৃহৎ ভাষার মডেল স্থাপনের গণনামূলক খরচের সাথে লড়াই করে, সেই পদ্ধতিগুলি যা গুণমানকে ত্যাগ না করেই মেমরির খরচ কমায় তা ক্রমবর্ধমান মূল্যবান। Baidu এর কাজ পরামর্শ দেয় যে জৈবিক রূপকগুলি, যখন গাণিতিক প্রক্রিয়ায় অনুবাদ করা হয়, তখন ব্যবহারিক প্রকৌশলগত সাফল্য আনতে পারে।

গবেষণাটি ভিত্তিগত এআই গবেষণায় চীনের ক্রমবর্ধমান প্রভাবকেও তুলে ধরে। যদিও অনেক মনোযোগ বৃহৎ ভাষার মডেলগুলিতে চীনা অর্জনের উপর দৃষ্টি নিবদ্ধ করা হয়েছে, আনলিমিটেড ওসিআর-এর মতো কাজ দেখায় যে চীনা গবেষকরাও তাৎক্ষণিক ব্যবহারিক অ্যাপ্লিকেশন সহ বিশেষায়িত এআই সিস্টেমগুলিতে উল্লেখযোগ্য অবদান রাখছেন।

এআই থেকে এগিয়ে থাকুন

AI গবেষণা, ডকুমেন্ট AI, এবং প্রযুক্তিগত সাফল্যের আরও কভারেজের জন্য, AI Buzz Wire দেখুন।

আরও এআই খবর পড়ুন →