محققان بایدو یک مدل تشخیص کاراکتر نوری (OCR) ایجاد کردهاند که قادر است دهها صفحه سند را در یک استنتاج واحد پردازش کند و در عین حال استفاده از حافظه ثابت و سرعت ثابت را حفظ کند. این سیستم که نامحدود OCR نام دارد، از طریق یک مکانیسم توجه جدید الهام گرفته شده از نحوه کپی کردن متن توسط انسان، که نشان دهنده پیشرفت قابل توجهی در هوش مصنوعی اسناد است، به این مهم دست می یابد. برای آخرین پیشرفتها در تحقیقات و فناوری هوش مصنوعی، به [AI Buzz Wire] (https://aibuzzwire.news) مراجعه کنید.
غلبه بر تنگنای کش KV
سیستمهای OCR سرتاسر کنونی که از مدلهای زبان به عنوان رمزگشای خود استفاده میکنند با یک محدودیت اساسی معماری روبرو هستند. همانطور که یک مدل متن را پردازش می کند، اطلاعات مربوط به توکن های پردازش شده قبلی را در بافری به نام کش KV ذخیره می کند و به آن اجازه می دهد در طول تولید به محتوای قبلی ارجاع دهد. این بافر با هر خط جدید متن افزایش می یابد و مصرف حافظه را به طور پیوسته افزایش می دهد و سرعت تولید را کاهش می دهد.
در عمل، سیستم های موجود با پردازش اسناد صفحه به صفحه در یک حلقه و تنظیم مجدد حافظه پنهان پس از تکمیل هر صفحه، این تنگنا را حل می کنند. این رویکرد کار میکند، اما ناکارآمدیها را معرفی میکند و از حفظ بافت در سراسر مرزهای صفحه جلوگیری میکند. محققان Baidu در گزارش فنی خود خاطرنشان میکنند که هیچ مدل OCR فعلی بیش از ده صفحه را در یک پاس پردازش نمیکند.
OCR نامحدود این محدودیت را به طور کامل حذف می کند. با طراحی مجدد مکانیسم توجه که بر نحوه دسترسی مدل به حافظه پنهان خود نظارت می کند، سیستم استفاده از حافظه را بدون توجه به تعداد صفحاتی که پردازش می کند ثابت نگه می دارد.
توجه پنجره کشویی مرجع چگونه کار می کند
نوآوری کلیدی چیزی است که تیم بایدو آن را توجه پنجره کشویی مرجع (R-SWA) می نامد. این مکانیسم بر اساس یک بینش ساده اما قدرتمند برگرفته از یک قیاس انسانی ساخته شده است: وقتی شخصی متنی را از یک کتاب کپی می کند، به طور مداوم همه چیزهایی را که قبلاً نوشته است بازخوانی نمی کند. در عوض، آنها توجه خود را بر روی منبع، چند کاراکتر آخری که رونویسی کردند و شخصیت بعدی که باید بنویسند متمرکز می کنند. متن های قدیمی تر به طور طبیعی از طریق نوعی فراموشی نرم از حافظه فعال محو می شوند.
R-SWA این اصل را با رفتار متفاوت با انواع مختلف توکن ها اجرا می کند. هر نشانه تولید شده توجه کامل را به تمام نشانه های مرجع حفظ می کند - نشانه های تصویر بصری که سند و درخواست پردازش را رمزگذاری می کنند. اما وقتی نوبت به متن خروجی تولید شده قبلی میرسد، مدل فقط به ۱۲۸ توکن اخیر نگاه میکند.
این طراحی کش KV را در اندازه ثابتی برابر با مجموع طول پیشوند و اندازه پنجره نگه می دارد، صرف نظر از اینکه چقدر متن تولید شده است. حافظه پنهان به عنوان یک صف عمل می کند و هر توکن جدید قدیمی ترین نشانه را بیرون می زند و از رشد نامحدود حافظه که مکانیسم های توجه استاندارد را آزار می دهد، جلوگیری می کند.
حفاظت از اطلاعات بصری
یک انتخاب مهم طراحی در R-SWA نحوه مدیریت توکن های بصری است. توجه استاندارد به پنجره کشویی همه نشانه ها را در معرض تغییرات مداوم وضعیت قرار می دهد، به تدریج ویژگی های تصویر را محو می کند و دقت تشخیص را در طول زمان کاهش می دهد. R-SWA توکن های بصری را از این انتقال ها مستثنی می کند - آنها یک بار کدگذاری می شوند و در کل فرآیند رمزگشایی بدون تغییر باقی می مانند.
این حفظ اطلاعات بصری برای دقت OCR ضروری است. R-SWA با دست نخورده نگه داشتن نمایش تصویر اصلی و در عین حال محدود کردن ظاهر مدل به عقب در خروجی خود، بهترین ها را در هر دو دنیا به دست می آورد: استفاده از حافظه پایدار و تشخیص متن قابل اعتماد.
معماری و آموزش
OCR نامحدود بر روی مدل منبع باز Deepseek OCR ساخته شده است. بایدو DeepEncoder خود را حفظ کرده است که یک تصویر PDF 1024 در 1024 پیکسل را به 256 توکن فشرده می کند و آن را با معماری ترکیبی از متخصصان (MoE) جفت می کند. رمزگشا دارای سه میلیارد پارامتر کل است، اما تنها تقریباً 500 میلیون پارامتر در طول استنتاج فعال هستند و هزینه های محاسباتی را قابل مدیریت نگه می دارند.
این سیستم دو حالت وضوح ارائه می دهد. حالت پایه برای اسناد چند صفحه ای بهینه شده است، در حالی که حالت Gundam از وضوح پویا برای پردازش تک صفحه ای استفاده می کند. هر لایه توجه استاندارد در رمزگشا با R-SWA جایگزین شد.
آموزش بر روی تقریباً دو میلیون نمونه سند انجام شد که نه به یک بین داده های تک صفحه ای و چند صفحه ای تقسیم شد. PaddleOCR حاشیه نویسی را برای صفحات منفرد مدیریت می کرد، در حالی که داده های چند صفحه ای به صورت مصنوعی با دوختن صفحات منفرد به یکدیگر در اسنادی از دو تا پنجاه صفحه ساخته می شدند. تمام دادههای آموزشی در توالیهای 32000 توکن بستهبندی شدند و آموزش برای 4000 مرحله در 8 مجموعه از 16 پردازنده گرافیکی Nvidia A800 اجرا شد. DeepEncoder در طول آموزش ثابت ماند و فقط پارامترهای مدل زبان به روز می شد.
نتایج محک
OCR نامحدود در معیارهای ارزیابی چندگانه به عملکرد قوی دست می یابد. در معیار سند OmniDocBench v1.5، این مدل در مجموع 93 درصد امتیاز کسب می کند که شش درصد بالاتر از خط پایه Deepseek OCR است.
در تست حیاتی افق طولانی - که در آن مدل بسیاری از صفحات را در یک پاس پردازش می کند - میزان خطا حتی بیش از 40 صفحه زیر 0.11 باقی می ماند. محققان خطاهای باقی مانده را نه به زمینه از دست رفته، بلکه به محدودیت وضوح DeepEncoder در حالت Base نسبت می دهند، جایی که تشخیص متن بسیار کوچک دشوار می شود.
پنجره توجه محدود نیز یک مزیت غیرمنتظره دارد. در اسناد تک صفحه ای، محدود کردن پنجره به 128 توکن به دقت لطمه ای وارد نمی کند و در واقع آن را اندکی بهبود می بخشد. محققان فرض میکنند که R-SWA مدل را مجبور میکند تا روی کار متراکم OCR تمرکز کند، در حالی که با افزایش طول خروجی، توجه کامل به سمت واگرایی میرود.
بهبود سرعت نیز به همان اندازه قابل توجه است. در حالت Base، Unlimited OCR به 5580 توکن در ثانیه در مقایسه با 4951 توکن Deepseek OCR دست می یابد که 12.7 درصد بهبود دارد. در مقایسههای نظری کران بالا با موازیسازی ایدهآل، این مدل با 35 درصد در حدود 6000 توکن خروجی، خط پایه را پیشروی میکند.
اهمیت گسترده تر
معماری OCR نامحدود یک اصل را با مفاهیمی فراتر از پردازش سند نشان می دهد. ایده ثابت نگه داشتن حافظه از طریق توجه گزینشی – الهام گرفته از علم شناختی به جای مقیاس بندی خالص – می تواند طراحی سیستم های هوش مصنوعی کارآمدتر را در طیف وسیعی از برنامه ها نشان دهد.
از آنجایی که سازمانها با هزینههای محاسباتی استقرار مدلهای زبانی بزرگ دست و پنجه نرم میکنند، رویکردهایی که مصرف حافظه را بدون به خطر انداختن کیفیت کاهش میدهند، ارزش فزایندهای دارند. کار بایدو نشان میدهد که استعارههای بیولوژیکی، هنگامی که به مکانیسمهای ریاضی ترجمه میشوند، میتوانند پیشرفتهای مهندسی عملی داشته باشند.
این تحقیق همچنین تأثیر رو به رشد چین در تحقیقات اساسی هوش مصنوعی را برجسته می کند. در حالی که توجه زیادی بر دستاوردهای چینی در مدلهای زبان بزرگ متمرکز شده است، کارهایی مانند Unlimited OCR نشان میدهد که محققان چینی نیز مشارکت قابل توجهی در سیستمهای تخصصی هوش مصنوعی با کاربردهای عملی فوری دارند.
از هوش مصنوعی جلوتر بمانید
برای پوشش بیشتر تحقیقات هوش مصنوعی، مستندسازی هوش مصنوعی و پیشرفتهای فناوری، به [AI Buzz Wire] (https://aibuzzwire.news) مراجعه کنید.
بیشتر بخوانید اخبار هوش مصنوعی →
