חוקרי Baidu פיתחו מודל זיהוי תווים אופטי (OCR) המסוגל לעבד עשרות דפי מסמכים במעבר מסקנות בודד תוך שמירה על שימוש קבוע בזיכרון ומהירות עקבית. המערכת, הנקראת Unlimited OCR, משיגה זאת באמצעות מנגנון קשב חדש בהשראת האופן שבו בני אדם מעתיקים טקסט ביד, המייצג התקדמות משמעותית ב-AI של מסמכים. לפיתוחים האחרונים במחקר ובטכנולוגיה של AI, בקר ב-AI Buzz Wire.

התגברות על צוואר הבקבוק של KV Cache

מערכות OCR נוכחיות מקצה לקצה המשתמשות במודלים של שפה כמפענחים שלהן עומדות בפני מגבלה ארכיטקטונית בסיסית. כאשר מודל מעבד טקסט, הוא מאחסן מידע על אסימונים שעובדו בעבר במאגר הנקרא KV cache, ומאפשר לו להתייחס לתוכן מוקדם יותר במהלך היצירה. מאגר זה גדל עם כל שורת טקסט חדשה, מגדיל בהתמדה את צריכת הזיכרון ומאט את מהירות היצירה.

בפועל, מערכות קיימות עוקפות את צוואר הבקבוק הזה על ידי עיבוד מסמכים עמוד אחר עמוד בלולאה, איפוס המטמון לאחר השלמת כל עמוד. גישה זו עובדת אך מציגה חוסר יעילות ומונעת מהמודל לשמור על הקשר מעבר לגבולות העמוד. אף מודל OCR נוכחי לא מטפל ביותר מעשרה עמודים בערך במעבר אחד, מציינים חוקרי Baidu בדוח הטכני שלהם.

OCR בלתי מוגבל מבטל את האילוץ הזה לחלוטין. על ידי עיצוב מחדש של מנגנון הקשב השולט כיצד המודל ניגש למטמון שלו, המערכת שומרת על שימוש קבוע בזיכרון ללא קשר למספר הדפים שהיא מעבדת.

כיצד פועלת תשומת לב בחלון הזזה

החידוש העיקרי הוא מה שצוות Baidu מכנה Reference Sliding Window Attention (R-SWA). המנגנון בנוי על תובנה פשוטה אך רבת עוצמה הנלקחת מאנלוגיה אנושית: כאשר אדם מעתיק טקסט מתוך ספר, הוא אינו קורא שוב ושוב את כל מה שכבר כתב. במקום זאת, הם שומרים על תשומת לבם ממוקדת בחומר המקור, בדמויות האחרונות שהם תמללו, ובדמות הבאה לרשום. קטעים ישנים יותר דוהים באופן טבעי מהזיכרון הפעיל דרך סוג של שכחה רכה.

R-SWA מיישמת עיקרון זה על ידי התייחסות שונה לסוגים שונים של אסימונים. כל אסימון שנוצר שומר על תשומת הלב המלאה לכל אסימוני ההתייחסות - אסימוני התמונה החזותיים המקודדים את המסמך ואת הוראת העיבוד. אבל כשמדובר בטקסט פלט שנוצר בעבר, המודל מסתכל אחורה רק על 128 האסימונים האחרונים.

עיצוב זה שומר על מטמון KV בגודל קבוע השווה לסכום של אורך הקידומת וגודל החלון, ללא קשר לכמות הטקסט שנוצר. המטמון מתפקד כתור, כאשר כל אסימון חדש דוחף את הישן ביותר החוצה, ומונע את צמיחת הזיכרון הבלתי מוגבל הפוגעת במנגנוני הקשב הסטנדרטיים.

הגנה על מידע חזותי

בחירת עיצוב קריטית ב-R-SWA היא האופן שבו הוא מטפל באסימונים חזותיים. תשומת לב רגילה של חלון הזזה יכפוף את כל האסימונים לשינויי מצב מתמשכים, יטשטוש הדרגתי של תכונות תמונה ופוגע ברמת דיוק הזיהוי לאורך זמן. R-SWA פוטר אסימונים חזותיים ממעברים אלה - הם מקודדים פעם אחת ונשארים ללא שינוי לאורך כל תהליך הפענוח.

שמירה זו של מידע חזותי חיונית לדיוק OCR. על ידי שמירה על ייצוג התמונה המקורי ללא פגע תוך הגבלת כמה אחורה נראה הדגם בפלט שלו, R-SWA משיגה את הטוב משני העולמות: שימוש יציב בזיכרון וזיהוי טקסט אמין.

אדריכלות והדרכה

OCR ללא הגבלה בנוי על גבי מודל הקוד הפתוח Deepseek OCR. Baidu שומר על ה-DeepEncoder שלה, שדוחס תמונת PDF בגודל 1024 על 1024 פיקסלים עד ל-256 אסימונים, ומצמיד אותה לארכיטקטורת תערובת של מומחים (MoE). למפענח יש שלושה מיליארד פרמטרים בסך הכל, אך רק כ-500 מיליון פעילים במהלך ההסקה, ושומרים על עלויות חישוב ניתנות לניהול.

המערכת מציעה שני מצבי רזולוציה. מצב הבסיס מותאם למסמכים מרובי עמודים, בעוד שמצב Gundam משתמש ברזולוציה דינמית לעיבוד של עמוד בודד. כל שכבת קשב סטנדרטית במפענח הוחלפה ב-R-SWA.

ההדרכה נערכה על כשני מיליון דגימות מסמכים, מחולקות תשע לאחד בין נתונים של עמוד בודד לנתונים מרובי עמודים. PaddleOCR טיפל בהערות עבור עמודים בודדים, בעוד נתונים מרובי עמודים נבנו באופן סינתטי על ידי תפירת עמודים בודדים יחד למסמכים שנעים בין שניים לחמישים עמודים. כל נתוני האימון נארזו ברצפים של 32,000 אסימונים, והאימון נמשך 4,000 שלבים על 8 סטים של 16 Nvidia A800 GPUs. ה-DeepEncoder נשאר קפוא לאורך האימון, כאשר רק הפרמטרים של מודל השפה עודכנו.

תוצאות בנצ'מרק

OCR ללא הגבלה משיג ביצועים חזקים על פני מדדי הערכה מרובים. במדד המסמכים של OmniDocBench v1.5, המודל מקבל ציונים של 93 אחוזים בסך הכל, שש נקודות אחוז מעל קו הבסיס של Deepseek OCR.

במבחן הקריטי לאופק ארוך - שבו המודל מעבד דפים רבים במעבר אחד - שיעור השגיאות נשאר מתחת ל-0.11 אפילו מעבר ל-40 עמודים. החוקרים מייחסים את השגיאות הנותרות לא לאיבוד הקשר אלא למגבלת הרזולוציה של DeepEncoder במצב Base, שבו טקסט קטן במיוחד מתקשה לזהות.

חלון הקשב המוגבל מניב גם תועלת בלתי צפויה. במסמכים בני עמוד בודד, הגבלת החלון ל-128 אסימונים אינה פוגעת בדיוק ולמעשה משפרת אותו מעט. החוקרים משערים ש-R-SWA מאלץ את המודל להתמקד יותר במשימת ה-OCR הצפופה, בעוד שתשומת הלב המלאה נוטה לסטייה ככל שאורך הפלט גדל.

שיפורי המהירות בולטים באותה מידה. במצב Base, Unlimited OCR משיג 5,580 אסימונים לשנייה לעומת 4,951 עבור Deepseek OCR, שיפור של 12.7 אחוזים. בהשוואות תיאורטיות של הגבול העליון עם מקביליות אידיאלית, המודל מוביל את קו הבסיס ב-35 אחוז בכ-6,000 אסימוני פלט.

משמעות רחבה יותר

ארכיטקטורת ה-OCR הבלתי מוגבל מדגימה עיקרון בעל השלכות מעבר לעיבוד מסמכים. הרעיון של שמירה על זיכרון קבוע באמצעות תשומת לב סלקטיבית - בהשראת מדע קוגניטיבי ולא קנה מידה טהור - יכול להוביל לתכנון של מערכות AI יעילות יותר במגוון יישומים.

כאשר ארגונים מתמודדים עם העלויות החישוביות של פריסת מודלים של שפה גדולים, גישות המפחיתות את צריכת הזיכרון מבלי להקריב את האיכות בעלות ערך רב יותר. עבודתו של באידו מציעה שמטאפורות ביולוגיות, כאשר הן מתורגמות למנגנונים מתמטיים, יכולות להניב פריצות דרך הנדסיות.

המחקר גם מדגיש את ההשפעה הגוברת של סין במחקר AI בסיסי. בעוד שתשומת לב רבה התמקדה בהישגים סיניים במודלים של שפות גדולות, עבודה כמו Unlimited OCR מוכיחה שגם חוקרים סיניים תורמים תרומה משמעותית למערכות AI מיוחדות עם יישומים מעשיים מיידיים.

הישאר לפני AI

לסיקור נוסף של מחקר בינה מלאכותית, מסמכי AI ופריצות דרך טכנולוגיות, בקר ב-AI Buzz Wire.

קרא עוד חדשות AI →