محققان بایدو یک مدل تشخیص کاراکتر نوری (OCR) ایجاد کرده‌اند که قادر است ده‌ها صفحه سند را در یک استنتاج واحد پردازش کند و در عین حال استفاده از حافظه ثابت و سرعت ثابت را حفظ کند. این سیستم که نامحدود OCR نام دارد، از طریق یک مکانیسم توجه جدید الهام گرفته شده از نحوه کپی کردن متن توسط انسان، که نشان دهنده پیشرفت قابل توجهی در هوش مصنوعی اسناد است، به این مهم دست می یابد. برای آخرین پیشرفت‌ها در تحقیقات و فناوری هوش مصنوعی، به [AI Buzz Wire] (https://aibuzzwire.news) مراجعه کنید.

غلبه بر تنگنای کش KV

سیستم‌های OCR سرتاسر کنونی که از مدل‌های زبان به عنوان رمزگشای خود استفاده می‌کنند با یک محدودیت اساسی معماری روبرو هستند. همانطور که یک مدل متن را پردازش می کند، اطلاعات مربوط به توکن های پردازش شده قبلی را در بافری به نام کش KV ذخیره می کند و به آن اجازه می دهد در طول تولید به محتوای قبلی ارجاع دهد. این بافر با هر خط جدید متن افزایش می یابد و مصرف حافظه را به طور پیوسته افزایش می دهد و سرعت تولید را کاهش می دهد.

در عمل، سیستم های موجود با پردازش اسناد صفحه به صفحه در یک حلقه و تنظیم مجدد حافظه پنهان پس از تکمیل هر صفحه، این تنگنا را حل می کنند. این رویکرد کار می‌کند، اما ناکارآمدی‌ها را معرفی می‌کند و از حفظ بافت در سراسر مرزهای صفحه جلوگیری می‌کند. محققان Baidu در گزارش فنی خود خاطرنشان می‌کنند که هیچ مدل OCR فعلی بیش از ده صفحه را در یک پاس پردازش نمی‌کند.

OCR نامحدود این محدودیت را به طور کامل حذف می کند. با طراحی مجدد مکانیسم توجه که بر نحوه دسترسی مدل به حافظه پنهان خود نظارت می کند، سیستم استفاده از حافظه را بدون توجه به تعداد صفحاتی که پردازش می کند ثابت نگه می دارد.

توجه پنجره کشویی مرجع چگونه کار می کند

نوآوری کلیدی چیزی است که تیم بایدو آن را توجه پنجره کشویی مرجع (R-SWA) می نامد. این مکانیسم بر اساس یک بینش ساده اما قدرتمند برگرفته از یک قیاس انسانی ساخته شده است: وقتی شخصی متنی را از یک کتاب کپی می کند، به طور مداوم همه چیزهایی را که قبلاً نوشته است بازخوانی نمی کند. در عوض، آنها توجه خود را بر روی منبع، چند کاراکتر آخری که رونویسی کردند و شخصیت بعدی که باید بنویسند متمرکز می کنند. متن های قدیمی تر به طور طبیعی از طریق نوعی فراموشی نرم از حافظه فعال محو می شوند.

R-SWA این اصل را با رفتار متفاوت با انواع مختلف توکن ها اجرا می کند. هر نشانه تولید شده توجه کامل را به تمام نشانه های مرجع حفظ می کند - نشانه های تصویر بصری که سند و درخواست پردازش را رمزگذاری می کنند. اما وقتی نوبت به متن خروجی تولید شده قبلی می‌رسد، مدل فقط به ۱۲۸ توکن اخیر نگاه می‌کند.

این طراحی کش KV را در اندازه ثابتی برابر با مجموع طول پیشوند و اندازه پنجره نگه می دارد، صرف نظر از اینکه چقدر متن تولید شده است. حافظه پنهان به عنوان یک صف عمل می کند و هر توکن جدید قدیمی ترین نشانه را بیرون می زند و از رشد نامحدود حافظه که مکانیسم های توجه استاندارد را آزار می دهد، جلوگیری می کند.

حفاظت از اطلاعات بصری

یک انتخاب مهم طراحی در R-SWA نحوه مدیریت توکن های بصری است. توجه استاندارد به پنجره کشویی همه نشانه ها را در معرض تغییرات مداوم وضعیت قرار می دهد، به تدریج ویژگی های تصویر را محو می کند و دقت تشخیص را در طول زمان کاهش می دهد. R-SWA توکن های بصری را از این انتقال ها مستثنی می کند - آنها یک بار کدگذاری می شوند و در کل فرآیند رمزگشایی بدون تغییر باقی می مانند.

این حفظ اطلاعات بصری برای دقت OCR ضروری است. R-SWA با دست نخورده نگه داشتن نمایش تصویر اصلی و در عین حال محدود کردن ظاهر مدل به عقب در خروجی خود، بهترین ها را در هر دو دنیا به دست می آورد: استفاده از حافظه پایدار و تشخیص متن قابل اعتماد.

معماری و آموزش

OCR نامحدود بر روی مدل منبع باز Deepseek OCR ساخته شده است. بایدو DeepEncoder خود را حفظ کرده است که یک تصویر PDF 1024 در 1024 پیکسل را به 256 توکن فشرده می کند و آن را با معماری ترکیبی از متخصصان (MoE) جفت می کند. رمزگشا دارای سه میلیارد پارامتر کل است، اما تنها تقریباً 500 میلیون پارامتر در طول استنتاج فعال هستند و هزینه های محاسباتی را قابل مدیریت نگه می دارند.

این سیستم دو حالت وضوح ارائه می دهد. حالت پایه برای اسناد چند صفحه ای بهینه شده است، در حالی که حالت Gundam از وضوح پویا برای پردازش تک صفحه ای استفاده می کند. هر لایه توجه استاندارد در رمزگشا با R-SWA جایگزین شد.

آموزش بر روی تقریباً دو میلیون نمونه سند انجام شد که نه به یک بین داده های تک صفحه ای و چند صفحه ای تقسیم شد. PaddleOCR حاشیه نویسی را برای صفحات منفرد مدیریت می کرد، در حالی که داده های چند صفحه ای به صورت مصنوعی با دوختن صفحات منفرد به یکدیگر در اسنادی از دو تا پنجاه صفحه ساخته می شدند. تمام داده‌های آموزشی در توالی‌های 32000 توکن بسته‌بندی شدند و آموزش برای 4000 مرحله در 8 مجموعه از 16 پردازنده گرافیکی Nvidia A800 اجرا شد. DeepEncoder در طول آموزش ثابت ماند و فقط پارامترهای مدل زبان به روز می شد.

نتایج محک

OCR نامحدود در معیارهای ارزیابی چندگانه به عملکرد قوی دست می یابد. در معیار سند OmniDocBench v1.5، این مدل در مجموع 93 درصد امتیاز کسب می کند که شش درصد بالاتر از خط پایه Deepseek OCR است.

در تست حیاتی افق طولانی - که در آن مدل بسیاری از صفحات را در یک پاس پردازش می کند - میزان خطا حتی بیش از 40 صفحه زیر 0.11 باقی می ماند. محققان خطاهای باقی مانده را نه به زمینه از دست رفته، بلکه به محدودیت وضوح DeepEncoder در حالت Base نسبت می دهند، جایی که تشخیص متن بسیار کوچک دشوار می شود.

پنجره توجه محدود نیز یک مزیت غیرمنتظره دارد. در اسناد تک صفحه ای، محدود کردن پنجره به 128 توکن به دقت لطمه ای وارد نمی کند و در واقع آن را اندکی بهبود می بخشد. محققان فرض می‌کنند که R-SWA مدل را مجبور می‌کند تا روی کار متراکم OCR تمرکز کند، در حالی که با افزایش طول خروجی، توجه کامل به سمت واگرایی می‌رود.

بهبود سرعت نیز به همان اندازه قابل توجه است. در حالت Base، Unlimited OCR به 5580 توکن در ثانیه در مقایسه با 4951 توکن Deepseek OCR دست می یابد که 12.7 درصد بهبود دارد. در مقایسه‌های نظری کران بالا با موازی‌سازی ایده‌آل، این مدل با 35 درصد در حدود 6000 توکن خروجی، خط پایه را پیشروی می‌کند.

اهمیت گسترده تر

معماری OCR نامحدود یک اصل را با مفاهیمی فراتر از پردازش سند نشان می دهد. ایده ثابت نگه داشتن حافظه از طریق توجه گزینشی – الهام گرفته از علم شناختی به جای مقیاس بندی خالص – می تواند طراحی سیستم های هوش مصنوعی کارآمدتر را در طیف وسیعی از برنامه ها نشان دهد.

از آنجایی که سازمان‌ها با هزینه‌های محاسباتی استقرار مدل‌های زبانی بزرگ دست و پنجه نرم می‌کنند، رویکردهایی که مصرف حافظه را بدون به خطر انداختن کیفیت کاهش می‌دهند، ارزش فزاینده‌ای دارند. کار بایدو نشان می‌دهد که استعاره‌های بیولوژیکی، هنگامی که به مکانیسم‌های ریاضی ترجمه می‌شوند، می‌توانند پیشرفت‌های مهندسی عملی داشته باشند.

این تحقیق همچنین تأثیر رو به رشد چین در تحقیقات اساسی هوش مصنوعی را برجسته می کند. در حالی که توجه زیادی بر دستاوردهای چینی در مدل‌های زبان بزرگ متمرکز شده است، کارهایی مانند Unlimited OCR نشان می‌دهد که محققان چینی نیز مشارکت قابل توجهی در سیستم‌های تخصصی هوش مصنوعی با کاربردهای عملی فوری دارند.

از هوش مصنوعی جلوتر بمانید

برای پوشش بیشتر تحقیقات هوش مصنوعی، مستندسازی هوش مصنوعی و پیشرفت‌های فناوری، به [AI Buzz Wire] (https://aibuzzwire.news) مراجعه کنید.

بیشتر بخوانید اخبار هوش مصنوعی →