Исследователи Baidu разработали модель оптического распознавания символов (OCR), способную обрабатывать десятки страниц документа за один проход, сохраняя при этом постоянное использование памяти и постоянную скорость. Система под названием Unlimited OCR достигает этого благодаря новому механизму внимания, вдохновленному тем, как люди копируют текст вручную, что представляет собой значительный прогресс в области искусственного интеллекта документов. Чтобы узнать о последних разработках в области исследований и технологий в области искусственного интеллекта, посетите AI Buzz Wire.

Преодоление узкого места в кэше KV

Современные комплексные системы оптического распознавания символов, использующие языковые модели в качестве декодеров, сталкиваются с фундаментальным архитектурным ограничением. Когда модель обрабатывает текст, она сохраняет информацию о ранее обработанных токенах в буфере, называемом кешем KV, что позволяет ей ссылаться на более ранний контент во время генерации. Этот буфер увеличивается с каждой новой строкой текста, постоянно увеличивая потребление памяти и замедляя скорость генерации.

На практике существующие системы обходят это узкое место, обрабатывая документы постранично в цикле, сбрасывая кэш после завершения каждой страницы. Этот подход работает, но приводит к неэффективности и не позволяет модели поддерживать контекст за пределами страниц. Ни одна из нынешних моделей оптического распознавания символов не обрабатывает более десяти страниц за один проход, отмечают исследователи Baidu в своем техническом отчете.

Unlimited OCR полностью устраняет это ограничение. Переработав механизм внимания, который управляет доступом модели к своему кешу, система поддерживает постоянное использование памяти независимо от того, сколько страниц она обрабатывает.

Как работает внимание к скользящему окну ссылки

Ключевым нововведением является то, что команда Baidu называет «Внимание к скользящему окну ссылки» (R-SWA). Механизм построен на простой, но мощной идее, основанной на человеческой аналогии: когда человек копирует текст из книги, он не перечитывает постоянно все, что уже написал. Вместо этого они концентрируют свое внимание на исходном материале, последних нескольких записанных символах и следующем символе, который нужно записать. Старые отрывки естественным образом исчезают из активной памяти в результате своего рода мягкого забывания.

R-SWA реализует этот принцип, по-разному обрабатывая разные типы токенов. Каждый сгенерированный токен сохраняет полное внимание ко всем ссылочным токенам — токенам визуального изображения, которые кодируют документ и приглашение на обработку. Но когда дело доходит до ранее сгенерированного выходного текста, модель учитывает только самые последние 128 токенов.

Эта конструкция сохраняет фиксированный размер кэша KV, равный сумме длины префикса и размера окна, независимо от того, сколько текста было сгенерировано. Кэш функционирует как очередь: каждый новый токен вытесняет самый старый, предотвращая неограниченный рост памяти, который мешает стандартным механизмам внимания.

Защита визуальной информации

Важнейшим выбором дизайна в R-SWA является то, как он обрабатывает визуальные токены. Стандартное внимание к скользящему окну приведет к постоянным изменениям состояния всех токенов, постепенно размывая характеристики изображения и со временем ухудшая точность распознавания. R-SWA освобождает визуальные токены от этих переходов — они кодируются один раз и остаются неизменными на протяжении всего процесса декодирования.

Такое сохранение визуальной информации важно для точности оптического распознавания символов. Сохраняя исходное представление изображения нетронутым и одновременно ограничивая то, как далеко назад модель выглядит в собственных выходных данных, R-SWA достигает лучшего из обоих миров: стабильного использования памяти и надежного распознавания текста.

Архитектура и обучение

Unlimited OCR построен на основе модели Deepseek OCR с открытым исходным кодом. Baidu сохраняет свой DeepEncoder, который сжимает PDF-изображение размером 1024х1024 пикселей до 256 токенов и сочетает его с архитектурой смешанных экспертов (MoE). Декодер имеет три миллиарда общих параметров, но только около 500 миллионов активны во время вывода, что позволяет контролировать вычислительные затраты.

Система предлагает два режима разрешения. Базовый режим оптимизирован для многостраничных документов, а режим Gundam использует динамическое разрешение для обработки одной страницы. Каждый стандартный уровень внимания в декодере был заменен на R-SWA.

Обучение проводилось примерно на двух миллионах образцов документов, разделенных в соотношении девять к одному на одностраничные и многостраничные данные. PaddleOCR обрабатывал аннотации для отдельных страниц, в то время как многостраничные данные создавались синтетически путем сшивания отдельных страниц в документы размером от двух до пятидесяти страниц. Все данные обучения были упакованы в последовательности по 32 000 токенов, а обучение длилось 4 000 шагов на 8 наборах из 16 графических процессоров Nvidia A800. DeepEncoder оставался зависшим на протяжении всего обучения, обновлялись только параметры языковой модели.

Результаты тестов

Unlimited OCR обеспечивает высокую производительность по множеству показателей оценки. В тесте документов OmniDocBench v1.5 модель в целом набрала 93 процента, что на шесть процентных пунктов выше базового показателя Deepseek OCR.

В критическом долгосрочном тесте, где модель обрабатывает множество страниц за один проход, уровень ошибок остается ниже 0,11 даже после 40 страниц. Исследователи связывают оставшиеся ошибки не с потерей контекста, а с ограничением разрешения DeepEncoder в базовом режиме, когда очень маленький текст становится трудно распознать.

Окно ограниченного внимания также дает неожиданную выгоду. В одностраничных документах ограничение окна до 128 токенов не ухудшает точность и даже слегка ее улучшает. Исследователи предполагают, что R-SWA заставляет модель более пристально сосредоточиться на задаче плотного оптического распознавания символов, в то время как полное внимание имеет тенденцию к расхождению по мере увеличения длины вывода.

Улучшения скорости не менее заметны. В базовом режиме Unlimited OCR достигает 5580 токенов в секунду по сравнению с 4951 токеном в Deepseek OCR, что составляет улучшение на 12,7%. В теоретических сравнениях верхних границ с идеальным параллелизмом модель опережает базовый уровень на 35 процентов при примерно 6000 выходных токенах.

Более широкое значение

Архитектура Unlimited OCR демонстрирует принцип, выходящий за рамки обработки документов. Идея сохранения постоянной памяти за счет избирательного внимания, вдохновленная когнитивной наукой, а не чистым масштабированием, может стать основой для разработки более эффективных систем искусственного интеллекта в ряде приложений.

Поскольку организации сталкиваются с вычислительными затратами на развертывание больших языковых моделей, подходы, позволяющие сократить потребление памяти без ущерба для качества, становятся все более ценными. Работа Байду предполагает, что биологические метафоры, если их перевести в математические механизмы, могут привести к практическим инженерным прорывам.

Исследование также подчеркивает растущее влияние Китая в фундаментальных исследованиях в области искусственного интеллекта. Хотя большое внимание уделяется достижениям Китая в области больших языковых моделей, такая работа, как Unlimited OCR, показывает, что китайские исследователи также вносят значительный вклад в специализированные системы искусственного интеллекта с непосредственным практическим применением.

Будьте впереди ИИ

Чтобы получить более подробную информацию об исследованиях в области ИИ, документировать ИИ и технологические прорывы, посетите [AI Buzz Wire] (https://aibuzzwire.news).

Подробнее новости AI →