Дослідники Baidu розробили модель оптичного розпізнавання символів (OCR), яка здатна обробляти десятки сторінок документа за один прохід, зберігаючи постійне використання пам’яті та стабільну швидкість. Система під назвою Unlimited OCR досягає цього за допомогою нового механізму уваги, створеного за принципом того, як люди копіюють текст вручну, що представляє значний прогрес у штучному інтелекті документів. Щоб дізнатися про останні розробки та технології ШІ, відвідайте AI Buzz Wire.
Подолання вузького місця KV Cache
Сучасні наскрізні системи OCR, які використовують мовні моделі як свої декодери, стикаються з фундаментальними архітектурними обмеженнями. Коли модель обробляє текст, вона зберігає інформацію про раніше оброблені токени в буфері, який називається кеш KV, що дозволяє їй посилатися на попередній вміст під час генерації. Цей буфер збільшується з кожним новим рядком тексту, постійно збільшуючи споживання пам’яті та сповільнюючи швидкість генерації.
На практиці існуючі системи обходять це вузьке місце, обробляючи документи сторінку за сторінкою в циклі, скидаючи кеш після завершення кожної сторінки. Цей підхід працює, але створює неефективність і не дозволяє моделі підтримувати контекст за межами сторінки. Жодна поточна модель OCR не обробляє більше ніж приблизно десять сторінок за один прохід, відзначають дослідники Baidu у своєму технічному звіті.
Необмежене OCR повністю усуває це обмеження. Завдяки переробці механізму уваги, який керує тим, як модель отримує доступ до кешу, система підтримує постійне використання пам’яті незалежно від кількості сторінок, які вона обробляє.
Як працює довідкове ковзне вікно уваги
Ключовою інновацією є те, що команда Baidu називає Reference Sliding Window Attention (R-SWA). Механізм побудований на простому, але потужному розумінні, отриманому з людської аналогії: коли людина копіює текст із книги, вона не постійно перечитує все, що вже написала. Замість цього вони зосереджують свою увагу на вихідному матеріалі, кількох останніх символах, які вони транскрибували, і наступному символі, який потрібно записати. Старі уривки природним чином зникають з активної пам’яті через своєрідне м’яке забування.
R-SWA реалізує цей принцип, обробляючи різні типи токенів по-різному. Кожен згенерований маркер зберігає повну увагу до всіх довідкових маркерів — маркерів візуального зображення, які кодують документ і підказку обробки. Але коли йдеться про попередньо згенерований вихідний текст, модель переглядає лише останні 128 токенів.
Цей дизайн підтримує фіксований розмір кешу KV, що дорівнює сумі довжини префікса та розміру вікна, незалежно від того, скільки тексту було згенеровано. Кеш функціонує як черга, причому кожен новий маркер виштовхує найстаріший, запобігаючи необмеженому зростанню пам’яті, яке заважає стандартним механізмам уваги.
Захист візуальної інформації
Важливим вибором дизайну в R-SWA є те, як він обробляє візуальні маркери. Стандартне ковзаюче вікно уваги призвело б до постійних змін стану всіх токенів, поступового розмивання функцій зображення та зниження точності розпізнавання з часом. R-SWA звільняє візуальні маркери від цих переходів — вони кодуються один раз і залишаються незмінними протягом усього процесу декодування.
Таке збереження візуальної інформації є важливим для точності OCR. Зберігаючи вихідне представлення зображення незмінним, обмежуючи, наскільки назад модель виглядає на власному виході, R-SWA досягає найкращого з обох світів: стабільне використання пам’яті та надійне розпізнавання тексту.
Архітектура та навчання
Необмежене оптичне розпізнавання символів побудовано на основі моделі Deepseek OCR з відкритим кодом. Baidu зберігає свій DeepEncoder, який стискає PDF-зображення розміром 1024 на 1024 пікселя до 256 токенів і поєднує його з архітектурою суміші експертів (MoE). Декодер має три мільярди параметрів, але лише приблизно 500 мільйонів активні під час логічного висновку, що дозволяє керувати витратами на обчислення.
Система пропонує два режими роздільної здатності. Базовий режим оптимізовано для багатосторінкових документів, а режим Gundam використовує динамічну роздільну здатність для обробки однієї сторінки. Кожен стандартний рівень уваги в декодері було замінено на R-SWA.
Навчання проводилося на приблизно двох мільйонах зразків документів, розділених у співвідношенні дев’ять до одного між односторінковими та багатосторінковими даними. PaddleOCR обробляв анотації для окремих сторінок, тоді як багатосторінкові дані були створені синтетично шляхом зшивання окремих сторінок у документи обсягом від двох до п’ятдесяти сторінок. Усі навчальні дані були упаковані в послідовності з 32 000 токенів, і навчання тривало 4 000 кроків на 8 наборах із 16 графічних процесорів Nvidia A800. DeepEncoder залишався замороженим протягом усього навчання, оновлювалися лише параметри мовної моделі.
Результати тестування
Необмежене OCR забезпечує високу ефективність за кількома показниками оцінки. За результатами тестування документів OmniDocBench v1.5 модель отримала 93 відсотки в цілому, що на шість відсоткових пунктів вище базового рівня Deepseek OCR.
У критичному довгостроковому тесті, коли модель обробляє багато сторінок за один прохід, рівень помилок залишається нижче 0,11 навіть після 40 сторінок. Дослідники пов’язують залишкові помилки не з втратою контексту, а з обмеженням роздільної здатності DeepEncoder у режимі Base, де дуже дрібний текст стає важко розпізнати.
Вікно обмеженої уваги також дає несподівані переваги. На односторінкових документах обмеження вікна до 128 токенів не шкодить точності й фактично трохи покращує її. Дослідники припускають, що R-SWA змушує модель більше зосереджуватися на щільному завданні OCR, тоді як повна увага має тенденцію до розбіжності, оскільки довжина виходу зростає.
Покращення швидкості однаково помітні. У базовому режимі Unlimited OCR досягає 5580 токенів на секунду порівняно з 4951 для Deepseek OCR, що на 12,7 відсотка покращення. У теоретичних порівняннях верхньої межі з ідеальним паралелізмом модель випереджає базову лінію на 35 відсотків із приблизно 6000 вихідними маркерами.
Більш широке значення
Архітектура необмеженого оптичного розпізнавання символів (Unlimited OCR) демонструє принцип, що має наслідки не лише для обробки документів. Ідея підтримувати постійність пам’яті за допомогою вибіркової уваги — натхненна когнітивною наукою, а не чистим масштабуванням — може сприяти розробці більш ефективних систем штучного інтелекту в різних додатках.
Оскільки організації борються з обчислювальними витратами на розгортання великих мовних моделей, підходи, які зменшують споживання пам’яті без шкоди для якості, стають все більш цінними. Робота Baidu свідчить про те, що біологічні метафори, переведені в математичні механізми, можуть призвести до практичних інженерних проривів.
Дослідження також підкреслює зростаючий вплив Китаю на фундаментальні дослідження ШІ. Хоча велика увага приділяється китайським досягненням у великих мовних моделях, така робота, як Unlimited OCR, демонструє, що китайські дослідники також роблять значний внесок у спеціалізовані системи штучного інтелекту з негайним практичним застосуванням.
Будьте попереду ШІ
Щоб дізнатися більше про дослідження штучного інтелекту, документувати штучний інтелект та технологічні прориви, відвідайте AI Buzz Wire.
Читати більше новин AI →
