Baidu の研究者は、一定のメモリ使用量と一貫した速度を維持しながら、単一の推論パスで数十の文書ページを処理できる光学式文字認識 (OCR) モデルを開発しました。 Unlimited OCR と呼ばれるこのシステムは、人間がテキストを手でコピーする方法にヒントを得た新しいアテンション メカニズムによってこれを実現しており、ドキュメント AI の大幅な進歩を表しています。 AI 研究とテクノロジーの最新の動向については、AI Buzz Wire をご覧ください。

KV キャッシュのボトルネックを克服する

デコーダとして言語モデルを使用する現在のエンドツーエンド OCR システムは、基本的なアーキテクチャ上の制限に直面しています。モデルはテキストを処理する際、以前に処理されたトークンに関する情報を KV キャッシュと呼ばれるバッファーに保存し、生成中に以前のコンテンツを参照できるようにします。このバッファはテキストの新しい行ごとに増加し、メモリ消費量が着実に増加し、生成速度が遅くなります。

実際には、既存のシステムはループ内でドキュメントをページごとに処理し、各ページが完了した後にキャッシュをリセットすることで、このボトルネックを回避しています。このアプローチは機能しますが、非効率が生じ、モデルがページ境界を越えてコンテキストを維持できなくなります。現在の OCR モデルは、1 回のパスで約 10 ページを超えるページを処理できないと、Baidu の研究者らは技術レポートで述べています。

無制限の OCR では、この制約が完全に排除されます。モデルがキャッシュにアクセスする方法を制御するアテンション メカニズムを再設計することにより、システムは処理するページ数に関係なくメモリ使用量を一定に保ちます。

リファレンス スライディング ウィンドウ アテンションの仕組み

重要なイノベーションは、Baidu チームが Reference Sliding Window Attendant (R-SWA) と呼ぶものです。このメカニズムは、人間のアナロジーから引き出されたシンプルだが強力な洞察に基づいて構築されています。つまり、人が本のテキストをコピーするとき、すでに書いたすべてを継続的に再読するわけではありません。代わりに、彼らはソース資料、書き写した最後の数文字、そして次に書き留める文字に注意を集中し続けます。古い文章は、一種のソフトな忘却によって、活動的な記憶から自然に消えていきます。

R-SWA は、さまざまなタイプのトークンを異なる方法で処理することで、この原則を実装します。生成された各トークンは、すべての参照トークン (ドキュメントと処理プロンプトをエンコードする視覚イメージ トークン) に完全に注意を払います。ただし、以前に生成された出力テキストに関しては、モデルは最新の 128 個のトークンのみを振り返ります。

この設計では、生成されたテキストの量に関係なく、KV キャッシュをプレフィックス長とウィンドウ サイズの合計に等しい固定サイズに保ちます。キャッシュはキューとして機能し、新しいトークンごとに最も古いトークンが押し出され、標準のアテンション メカニズムを悩ませる際限のないメモリの増大を防ぎます。

視覚情報の保護

R-SWA における重要な設計上の選択は、ビジュアル トークンをどのように処理するかです。標準的なスライディング ウィンドウ アテンションでは、すべてのトークンが進行中の状態変化にさらされ、時間の経過とともに画像の特徴が徐々にぼやけ、認識精度が低下します。 R-SWA は、これらの遷移からビジュアル トークンを免除します。ビジュアル トークンは一度エンコードされ、デコード プロセス全体を通じて変更されません。

この視覚情報の保存は、OCR の精度にとって不可欠です。 R-SWA は、元の画像表現をそのまま維持しながら、モデルが自身の出力内でどれだけ遡って参照するかを制限することにより、安定したメモリ使用量と信頼性の高いテキスト認識という両方の長所を実現します。

アーキテクチャとトレーニング

Unlimited OCR は、オープンソースの Deepseek OCR モデルに基づいて構築されています。 Baidu は、1024 × 1024 ピクセルの PDF 画像を 256 トークンまで圧縮し、それを専門家混合 (MoE) アーキテクチャと組み合わせた DeepEncoder を保持しています。デコーダーには合計 30 億のパラメーターがありますが、推論中にアクティブになるのは約 5 億のみであるため、計算コストは​​管理可能に保たれます。

システムは 2 つの解像度モードを提供します。ベース モードは複数ページのドキュメントに最適化されていますが、ガンダム モードは単一ページの処理に動的解像度を使用します。デコーダ内のすべての標準アテンション レイヤーが R-SWA に置き換えられました。

トレーニングは、単一ページ データと複数ページ データに 9 対 1 に分割された約 200 万のドキュメント サンプルに対して実施されました。 PaddleOCR は単一ページの注釈を処理しましたが、複数ページのデータは、単一ページを 2 ~ 50 ページの範囲のドキュメントにつなぎ合わせて合成的に構築されました。すべてのトレーニング データは 32,000 トークンのシーケンスにパックされ、トレーニングは 8 セットの 16 Nvidia A800 GPU で 4,000 ステップ実行されました。 DeepEncoder はトレーニング中フリーズしたままで、言語モデルのパラメーターのみが更新されました。

ベンチマーク結果

無制限の OCR は、複数の評価指標にわたって優れたパフォーマンスを実現します。 OmniDocBench v1.5 ドキュメント ベンチマークでは、モデルのスコアは全体で 93% であり、Deepseek OCR ベースラインを 6% ポイント上回っています。

モデルが 1 回のパスで多くのページを処理する重要な長期テストでは、40 ページを超えてもエラー率は 0.11 未満にとどまります。研究者らは、残りのエラーの原因はコンテキストの損失ではなく、Base モードでの DeepEncoder の解像度制限にあると考えており、非常に小さなテキストの認識が困難になります。

注意力のウィンドウが制限されると、予想外の利点も得られます。単一ページのドキュメントでは、ウィンドウを 128 トークンに制限しても精度が損なわれることはなく、実際には精度がわずかに向上します。研究者らは、R-SWA によりモデルが高密度 OCR タスクにさらに集中するように強制される一方、出力の長さが長くなるにつれて完全な注意が発散する傾向にあるのではないかと仮説を立てています。

速度の向上も同様に注目に値します。 Base モードでは、Unlimited OCR は 1 秒あたり 5,580 トークンを達成しますが、Deepseek OCR では 4,951 トークンであり、12.7% 向上しています。理想的な並列処理と理論上の上限を比較すると、モデルは約 6,000 個の出力トークンでベースラインを 35% リードします。

より広範な意義

Unlimited OCR アーキテクチャは、文書処理以外にも影響を与える原則を示しています。選択的注意によって記憶を一定に保つというアイデアは、純粋なスケーリングではなく認知科学にインスピレーションを得たもので、さまざまなアプリケーションにわたってより効率的な AI システムの設計に役立つ可能性があります。

組織が大規模な言語モデルの展開に伴う計算コストに取り組む中、品質を犠牲にすることなくメモリ消費量を削減するアプローチの価値がますます高まっています。 Baidu の研究は、生物学的メタファーが数学的メカニズムに翻訳されると、実用的な工学的ブレークスルーをもたらす可能性があることを示唆しています。

この研究はまた、基礎的なAI研究における中国の影響力の増大も浮き彫りにしている。大規模な言語モデルにおける中国の成果に多くの注目が集まっていますが、Unlimited OCR のような研究は、中国の研究者が即時の実用化に向けた特殊な AI システムにも多大な貢献をしていることを示しています。

AI の先を行く

AI 研究、ドキュメント AI、テクノロジーの進歩に関する詳細については、AI Buzz Wire をご覧ください。

AI ニュースをもっと読む→