طور باحثو بايدو نموذجًا للتعرف البصري على الأحرف (OCR) قادرًا على معالجة العشرات من صفحات المستندات في مسار استدلالي واحد مع الحفاظ على استخدام ثابت للذاكرة وسرعة ثابتة. ويحقق النظام، المسمى Unlimited OCR، ذلك من خلال آلية انتباه جديدة مستوحاة من كيفية قيام البشر بنسخ النص يدويًا، مما يمثل تقدمًا كبيرًا في الذكاء الاصطناعي للمستندات. للحصول على أحدث التطورات في أبحاث وتقنيات الذكاء الاصطناعي، قم بزيارة AI Buzz Wire.

التغلب على اختناق ذاكرة التخزين المؤقت KV

تواجه أنظمة التعرف الضوئي على الحروف الشاملة الحالية التي تستخدم نماذج اللغة كوحدات فك التشفير الخاصة بها، قيودًا معمارية أساسية. عندما يقوم النموذج بمعالجة النص، فإنه يخزن معلومات حول الرموز المميزة التي تمت معالجتها مسبقًا في مخزن مؤقت يسمى ذاكرة التخزين المؤقت KV، مما يسمح له بالرجوع إلى المحتوى السابق أثناء الإنشاء. ينمو هذا المخزن المؤقت مع كل سطر جديد من النص، مما يؤدي إلى زيادة استهلاك الذاكرة بشكل مطرد وإبطاء سرعة الإنشاء.

ومن الناحية العملية، تعمل الأنظمة الحالية على التغلب على هذا الاختناق من خلال معالجة المستندات صفحة تلو الأخرى في حلقة متكررة، وإعادة تعيين ذاكرة التخزين المؤقت بعد اكتمال كل صفحة. يعمل هذا الأسلوب ولكنه يقدم أوجه قصور ويمنع النموذج من الحفاظ على السياق عبر حدود الصفحة. لا يوجد نموذج التعرف الضوئي على الحروف الحالي يتعامل مع أكثر من عشر صفحات تقريبًا في تمريرة واحدة، كما لاحظ باحثو بايدو في تقريرهم الفني.

يزيل OCR غير المحدود هذا القيد تمامًا. من خلال إعادة تصميم آلية الانتباه التي تتحكم في كيفية وصول النموذج إلى ذاكرة التخزين المؤقت الخاصة به، يحافظ النظام على استخدام الذاكرة ثابتًا بغض النظر عن عدد الصفحات التي يعالجها.

كيف يعمل تنبيه النافذة المنزلقة المرجعية

الابتكار الرئيسي هو ما يسميه فريق بايدو الانتباه المرجعي للنافذة المنزلقة (R-SWA). تم بناء الآلية على رؤية بسيطة ولكنها قوية مستمدة من القياس البشري: عندما يقوم شخص ما بنسخ نص من كتاب، فإنه لا يعيد قراءة كل ما كتبه بالفعل بشكل مستمر. وبدلاً من ذلك، يركزون انتباههم على المادة المصدر، والأحرف القليلة الأخيرة التي قاموا بنسخها، والحرف التالي الذي يجب كتابته. تتلاشى المقاطع القديمة بشكل طبيعي من الذاكرة النشطة من خلال نوع من النسيان الناعم.

تطبق R-SWA هذا المبدأ من خلال التعامل مع أنواع مختلفة من الرموز المميزة بشكل مختلف. يحتفظ كل رمز مميز تم إنشاؤه بالاهتمام الكامل بجميع الرموز المميزة - الرموز المميزة للصور المرئية التي تقوم بتشفير المستند ومطالبة المعالجة. ولكن عندما يتعلق الأمر بنص الإخراج الذي تم إنشاؤه مسبقًا، فإن النموذج ينظر فقط إلى أحدث 128 رمزًا.

يحافظ هذا التصميم على حجم ذاكرة التخزين المؤقت KV بحجم ثابت يساوي مجموع طول البادئة وحجم النافذة، بغض النظر عن مقدار النص الذي تم إنشاؤه. تعمل ذاكرة التخزين المؤقت كقائمة انتظار، حيث يقوم كل رمز جديد بدفع الرمز الأقدم إلى الخارج، مما يمنع نمو الذاكرة غير المحدودة الذي يصيب آليات الانتباه القياسية.

حماية المعلومات المرئية

أحد اختيارات التصميم الحاسمة في R-SWA هو كيفية تعاملها مع الرموز المرئية. سيؤدي الانتباه القياسي للنافذة المنزلقة إلى إخضاع جميع الرموز المميزة لتغييرات الحالة المستمرة، مما يؤدي إلى تشويش ميزات الصورة تدريجيًا وتقليل دقة التعرف بمرور الوقت. يعفي R-SWA الرموز المرئية من هذه التحولات - حيث يتم تشفيرها مرة واحدة وتظل دون تغيير طوال عملية فك التشفير بأكملها.

يعد الحفاظ على المعلومات المرئية أمرًا ضروريًا لدقة التعرف الضوئي على الحروف. من خلال الحفاظ على تمثيل الصورة الأصلية سليمًا مع الحد من مدى ظهور النموذج في مخرجاته الخاصة، يحقق R-SWA أفضل ما في كلا العالمين: استخدام مستقر للذاكرة والتعرف الموثوق على النص.

##الهندسة المعمارية والتدريب

تم إنشاء تقنية التعرف الضوئي على الحروف (OCR) غير المحدودة على أساس نموذج Deepseek OCR مفتوح المصدر. تحتفظ بايدو ببرنامج DeepEncoder الخاص بها، والذي يقوم بضغط صورة PDF مقاس 1024 × 1024 بكسل إلى 256 رمزًا مميزًا، ويقرنها ببنية خليط من الخبراء (MoE). يحتوي جهاز فك التشفير على ثلاثة مليارات معلمة إجمالية، ولكن ما يقرب من 500 مليون فقط نشطة أثناء الاستدلال، مما يجعل التكاليف الحسابية قابلة للتحكم.

يقدم النظام وضعين للدقة. تم تحسين الوضع الأساسي للمستندات متعددة الصفحات، بينما يستخدم وضع Gundam الدقة الديناميكية لمعالجة الصفحة الواحدة. تم استبدال كل طبقة انتباه قياسية في وحدة فك التشفير بـ R-SWA.

تم إجراء التدريب على ما يقرب من مليوني عينة من المستندات، مقسمة بنسبة تسعة إلى واحد بين بيانات صفحة واحدة وبيانات متعددة الصفحات. تعامل PaddleOCR مع التعليقات التوضيحية للصفحات الفردية، بينما تم إنشاء البيانات متعددة الصفحات بشكل صناعي عن طريق دمج الصفحات المفردة معًا في مستندات تتراوح من صفحتين إلى خمسين صفحة. تم تجميع جميع بيانات التدريب في تسلسلات مكونة من 32000 رمز، وتم تشغيل التدريب لـ 4000 خطوة على 8 مجموعات من 16 وحدة معالجة رسوميات Nvidia A800. بقي DeepEncoder مجمداً طوال فترة التدريب، مع تحديث معلمات نموذج اللغة فقط.

النتائج المعيارية

يحقق OCR غير المحدود أداءً قويًا عبر مقاييس التقييم المتعددة. في معيار مستند OmniDocBench v1.5، سجل النموذج 93 بالمائة بشكل عام، أي ست نقاط مئوية أعلى من خط الأساس Deepseek OCR.

في اختبار الأفق الطويل الحرج - حيث يعالج النموذج العديد من الصفحات في مسار واحد - يظل معدل الخطأ أقل من 0.11 حتى بعد 40 صفحة. لا يعزو الباحثون الأخطاء المتبقية إلى السياق المفقود، بل إلى حد دقة DeepEncoder في الوضع الأساسي، حيث يصعب التعرف على النص الصغير للغاية.

تؤدي نافذة الانتباه المقيدة أيضًا إلى فائدة غير متوقعة. في المستندات المكونة من صفحة واحدة، لا يضر تحديد النافذة بـ 128 رمزًا بالدقة بل إنه يحسنها قليلاً. يفترض الباحثون أن R-SWA يجبر النموذج على التركيز بشكل أكثر إحكامًا على مهمة التعرف الضوئي على الحروف الكثيفة، بينما يميل الاهتمام الكامل نحو التباعد مع نمو طول المخرجات.

تحسينات السرعة ملحوظة بنفس القدر. في الوضع الأساسي، يحقق برنامج Unlimited OCR 5,580 رمزًا في الثانية مقارنة بـ 4,951 رمزًا لـ Deepseek OCR، وهو تحسن بنسبة 12.7 بالمائة. في المقارنات النظرية ذات الحد الأعلى مع التوازي المثالي، يتقدم النموذج على خط الأساس بنسبة 35 بالمائة عند ما يقرب من 6000 رمز إخراج.

أهمية أوسع

توضح بنية OCR غير المحدودة مبدأً له آثار تتجاوز معالجة المستندات. إن فكرة الحفاظ على ثبات الذاكرة من خلال الاهتمام الانتقائي - المستوحاة من العلوم المعرفية بدلاً من القياس البحت - يمكن أن تفيد تصميم أنظمة الذكاء الاصطناعي الأكثر كفاءة عبر مجموعة من التطبيقات.

بينما تتصارع المؤسسات مع التكاليف الحسابية لنشر نماذج لغوية كبيرة، أصبحت الأساليب التي تقلل من استهلاك الذاكرة دون التضحية بالجودة ذات قيمة متزايدة. ويشير عمل بايدو إلى أن الاستعارات البيولوجية، عند ترجمتها إلى آليات رياضية، يمكن أن تسفر عن اختراقات هندسية عملية.

يسلط البحث أيضًا الضوء على نفوذ الصين المتزايد في أبحاث الذكاء الاصطناعي التأسيسية. في حين تركز الكثير من الاهتمام على الإنجازات الصينية في نماذج اللغات الكبيرة، فإن العمل مثل Unlimited OCR يوضح أن الباحثين الصينيين يقدمون أيضًا مساهمات كبيرة في أنظمة الذكاء الاصطناعي المتخصصة مع تطبيقات عملية فورية.

ابق في صدارة الذكاء الاصطناعي

لمزيد من التغطية لأبحاث الذكاء الاصطناعي وتوثيق الذكاء الاصطناعي والاختراقات التكنولوجية، تفضل بزيارة AI Buzz Wire.

اقرأ المزيد من أخبار الذكاء الاصطناعي →