Les chercheurs de Baidu ont développé un modèle de reconnaissance optique de caractères (OCR) capable de traiter des dizaines de pages de document en une seule passe d'inférence tout en maintenant une utilisation constante de la mémoire et une vitesse constante. Le système, appelé Unlimited OCR, y parvient grâce à un nouveau mécanisme d'attention inspiré de la façon dont les humains copient le texte à la main, ce qui représente une avancée significative dans l'IA des documents. Pour connaître les derniers développements en matière de recherche et de technologie en matière d'IA, visitez AI Buzz Wire.
Surmonter le goulot d'étranglement du cache KV
Les systèmes OCR de bout en bout actuels qui utilisent des modèles de langage comme décodeurs sont confrontés à une limitation architecturale fondamentale. Lorsqu'un modèle traite du texte, il stocke des informations sur les jetons précédemment traités dans un tampon appelé cache KV, lui permettant de référencer un contenu antérieur lors de la génération. Ce tampon augmente à chaque nouvelle ligne de texte, augmentant régulièrement la consommation de mémoire et ralentissant la vitesse de génération.
En pratique, les systèmes existants contournent ce goulot d'étranglement en traitant les documents page par page en boucle, réinitialisant le cache une fois chaque page terminée. Cette approche fonctionne mais introduit des inefficacités et empêche le modèle de maintenir le contexte au-delà des limites des pages. Aucun modèle OCR actuel ne gère plus d'environ dix pages en un seul passage, notent les chercheurs de Baidu dans leur rapport technique.
L’OCR illimité élimine complètement cette contrainte. En repensant le mécanisme d'attention qui régit la manière dont le modèle accède à son cache, le système maintient l'utilisation de la mémoire constante quel que soit le nombre de pages qu'il traite.
Comment fonctionne l'attention de la fenêtre coulissante de référence
L’innovation clé est ce que l’équipe Baidu appelle Reference Sliding Window Attention (R-SWA). Le mécanisme repose sur une idée simple mais puissante tirée d’une analogie humaine : lorsqu’une personne copie le texte d’un livre, elle ne relit pas continuellement tout ce qu’elle a déjà écrit. Au lieu de cela, ils gardent leur attention concentrée sur le matériel source, les derniers caractères qu’ils ont transcrits et le prochain caractère à écrire. Les passages plus anciens disparaissent naturellement de la mémoire active par une sorte d’oubli doux.
R-SWA met en œuvre ce principe en traitant différemment différents types de jetons. Chaque jeton généré conserve toute l'attention sur tous les jetons de référence : les jetons d'image visuelle qui codent le document et l'invite de traitement. Mais lorsqu’il s’agit du texte de sortie généré précédemment, le modèle ne prend en compte que les 128 jetons les plus récents.
Cette conception maintient le cache KV à une taille fixe égale à la somme de la longueur du préfixe et de la taille de la fenêtre, quelle que soit la quantité de texte générée. Le cache fonctionne comme une file d'attente, chaque nouveau jeton éliminant le plus ancien, empêchant ainsi la croissance illimitée de la mémoire qui affecte les mécanismes d'attention standard.
Protection des informations visuelles
Un choix de conception critique dans R-SWA concerne la façon dont il gère les jetons visuels. L'attention standard par fenêtre coulissante soumettrait tous les jetons à des changements d'état continus, brouillant progressivement les caractéristiques de l'image et dégradant la précision de la reconnaissance au fil du temps. R-SWA exempte les jetons visuels de ces transitions : ils sont codés une seule fois et restent inchangés tout au long du processus de décodage.
Cette préservation des informations visuelles est essentielle pour la précision de l’OCR. En conservant intacte la représentation originale de l'image tout en limitant la distance parcourue par le modèle dans sa propre sortie, R-SWA offre le meilleur des deux mondes : une utilisation stable de la mémoire et une reconnaissance de texte fiable.
Architecture et Formation
L'OCR illimité est construit sur le modèle open source Deepseek OCR. Baidu conserve son DeepEncoder, qui compresse une image PDF de 1 024 x 1 024 pixels jusqu'à 256 jetons, et l'associe à une architecture mixte d'experts (MoE). Le décodeur possède trois milliards de paramètres au total, mais seulement environ 500 millions sont actifs pendant l'inférence, ce qui permet de gérer les coûts de calcul.
Le système propose deux modes de résolution. Le mode de base est optimisé pour les documents de plusieurs pages, tandis que le mode Gundam utilise une résolution dynamique pour le traitement d'une seule page. Chaque couche d'attention standard du décodeur a été remplacée par R-SWA.
La formation a été menée sur environ deux millions d'échantillons de documents, répartis neuf pour un entre des données d'une seule page et des données multipages. PaddleOCR gérait les annotations pour des pages uniques, tandis que les données multipages étaient construites de manière synthétique en assemblant des pages simples ensemble dans des documents allant de deux à cinquante pages. Toutes les données de formation ont été regroupées dans des séquences de 32 000 jetons et la formation s'est déroulée sur 4 000 étapes sur 8 ensembles de 16 GPU Nvidia A800. Le DeepEncoder est resté figé tout au long de la formation, seuls les paramètres du modèle de langage étant mis à jour.
Résultats de référence
L'OCR illimité permet d'obtenir de solides performances sur plusieurs mesures d'évaluation. Sur le benchmark documentaire OmniDocBench v1.5, le modèle obtient un score global de 93 %, soit six points de pourcentage au-dessus de la référence Deepseek OCR.
Dans le test critique à long terme – où le modèle traite de nombreuses pages en un seul passage – le taux d'erreur reste inférieur à 0,11, même au-delà de 40 pages. Les chercheurs attribuent les erreurs restantes non pas à la perte de contexte mais à la limite de résolution du DeepEncoder en mode Base, où un texte extrêmement petit devient difficile à reconnaître.
La fenêtre d’attention restreinte présente également un avantage inattendu. Sur les documents d'une seule page, limiter la fenêtre à 128 jetons ne nuit pas à la précision et l'améliore même légèrement. Les chercheurs émettent l’hypothèse que R-SWA force le modèle à se concentrer davantage sur la tâche OCR dense, tandis que toute l’attention tend vers la divergence à mesure que la longueur de sortie augmente.
Les améliorations de vitesse sont également notables. En mode Base, Unlimited OCR atteint 5 580 jetons par seconde, contre 4 951 pour Deepseek OCR, soit une amélioration de 12,7 %. Dans les comparaisons théoriques de la limite supérieure avec le parallélisme idéal, le modèle est en avance de 35 % sur la ligne de base avec environ 6 000 jetons de sortie.
Importance plus large
L'architecture Unlimited OCR démontre un principe dont les implications vont au-delà du traitement des documents. L’idée de maintenir une mémoire constante grâce à une attention sélective – inspirée par les sciences cognitives plutôt que par une simple mise à l’échelle – pourrait éclairer la conception de systèmes d’IA plus efficaces dans une gamme d’applications.
Alors que les organisations sont aux prises avec les coûts de calcul liés au déploiement de grands modèles de langage, les approches réduisant la consommation de mémoire sans sacrifier la qualité deviennent de plus en plus utiles. Les travaux de Baidu suggèrent que les métaphores biologiques, lorsqu'elles sont traduites en mécanismes mathématiques, peuvent donner lieu à des avancées techniques pratiques.
La recherche met également en évidence l’influence croissante de la Chine dans la recherche fondamentale sur l’IA. Alors qu’une grande attention s’est portée sur les réalisations chinoises dans les grands modèles linguistiques, des travaux comme Unlimited OCR démontrent que les chercheurs chinois apportent également des contributions significatives aux systèmes d’IA spécialisés avec des applications pratiques immédiates.
Gardez une longueur d'avance sur l'IA
Pour plus de couverture sur la recherche sur l'IA, documenter l'IA et les avancées technologiques, visitez AI Buzz Wire.
Lire plus d'actualités sur l'IA →
