Los investigadores de Baidu han desarrollado un modelo de reconocimiento óptico de caracteres (OCR) capaz de procesar docenas de páginas de documentos en una sola pasada de inferencia manteniendo un uso constante de la memoria y una velocidad constante. El sistema, llamado Unlimited OCR, logra esto a través de un novedoso mecanismo de atención inspirado en cómo los humanos copian texto a mano, lo que representa un avance significativo en la IA de documentos. Para conocer los últimos avances en investigación y tecnología de IA, visite AI Buzz Wire.
Superar el cuello de botella de la caché KV
Los sistemas OCR actuales de extremo a extremo que utilizan modelos de lenguaje como decodificadores enfrentan una limitación arquitectónica fundamental. A medida que un modelo procesa texto, almacena información sobre tokens procesados previamente en un búfer llamado caché KV, lo que le permite hacer referencia a contenido anterior durante la generación. Este búfer crece con cada nueva línea de texto, lo que aumenta constantemente el consumo de memoria y ralentiza la velocidad de generación.
En la práctica, los sistemas existentes solucionan este cuello de botella procesando documentos página por página en un bucle, restableciendo el caché después de completar cada página. Este enfoque funciona pero introduce ineficiencias e impide que el modelo mantenga el contexto a través de los límites de la página. Ningún modelo de OCR actual maneja más de aproximadamente diez páginas en una sola pasada, señalan los investigadores de Baidu en su informe técnico.
El OCR ilimitado elimina esta restricción por completo. Al rediseñar el mecanismo de atención que gobierna cómo el modelo accede a su caché, el sistema mantiene constante el uso de la memoria independientemente de cuántas páginas procese.
Cómo funciona la atención de la ventana deslizante de referencia
La innovación clave es lo que el equipo de Baidu llama Atención de ventana deslizante de referencia (R-SWA). El mecanismo se basa en una idea simple pero poderosa extraída de una analogía humana: cuando una persona copia el texto de un libro, no relee continuamente todo lo que ya ha escrito. En cambio, mantienen su atención centrada en el material original, los últimos caracteres que transcribieron y el siguiente carácter a escribir. Los pasajes más antiguos se desvanecen naturalmente de la memoria activa a través de una especie de olvido suave.
R-SWA implementa este principio al tratar diferentes tipos de tokens de manera diferente. Cada token generado mantiene plena atención a todos los tokens de referencia: los tokens de imágenes visuales que codifican el documento y el mensaje de procesamiento. Pero cuando se trata de texto de salida generado previamente, el modelo solo analiza los 128 tokens más recientes.
Este diseño mantiene la caché KV en un tamaño fijo igual a la suma de la longitud del prefijo y el tamaño de la ventana, independientemente de cuánto texto se haya generado. La caché funciona como una cola, y cada token nuevo elimina el más antiguo, lo que evita el crecimiento ilimitado de la memoria que afecta a los mecanismos de atención estándar.
Protección de la información visual
Una elección de diseño fundamental en R-SWA es cómo maneja los tokens visuales. La atención estándar de la ventana deslizante sometería a todos los tokens a cambios de estado continuos, desenfocando gradualmente las características de la imagen y degradando la precisión del reconocimiento con el tiempo. R-SWA exime a los tokens visuales de estas transiciones: se codifican una vez y permanecen sin cambios durante todo el proceso de decodificación.
Esta preservación de la información visual es esencial para la precisión del OCR. Al mantener intacta la representación de la imagen original y al mismo tiempo limitar la retrospectiva del modelo en su propia salida, R-SWA logra lo mejor de ambos mundos: uso de memoria estable y reconocimiento de texto confiable.
Arquitectura y Formación
Unlimited OCR se basa en el modelo de código abierto Deepseek OCR. Baidu conserva su DeepEncoder, que comprime una imagen PDF de 1024 por 1024 píxeles hasta 256 tokens y la combina con una arquitectura de mezcla de expertos (MoE). El decodificador tiene tres mil millones de parámetros totales, pero sólo aproximadamente 500 millones están activos durante la inferencia, lo que mantiene los costos computacionales manejables.
El sistema ofrece dos modos de resolución. El modo base está optimizado para documentos de varias páginas, mientras que el modo Gundam utiliza resolución dinámica para el procesamiento de una sola página. Cada capa de atención estándar en el decodificador fue reemplazada por R-SWA.
La capacitación se llevó a cabo en aproximadamente dos millones de muestras de documentos, divididas nueve a uno entre datos de una sola página y de varias páginas. PaddleOCR manejaba anotaciones para páginas individuales, mientras que los datos de varias páginas se construían sintéticamente uniendo páginas individuales en documentos que iban de dos a cincuenta páginas. Todos los datos de entrenamiento se empaquetaron en secuencias de 32 000 tokens y el entrenamiento se realizó durante 4000 pasos en 8 conjuntos de 16 GPU Nvidia A800. El DeepEncoder permaneció congelado durante todo el entrenamiento y solo se actualizaron los parámetros del modelo de lenguaje.
Resultados de referencia
El OCR ilimitado logra un rendimiento sólido en múltiples métricas de evaluación. En la prueba comparativa de documentos OmniDocBench v1.5, el modelo obtiene una puntuación general del 93 por ciento, seis puntos porcentuales por encima de la línea base de Deepseek OCR.
En la prueba crítica de horizonte largo, donde el modelo procesa muchas páginas en una sola pasada, la tasa de error se mantiene por debajo de 0,11 incluso más allá de las 40 páginas. Los investigadores atribuyen los errores restantes no a la pérdida de contexto sino al límite de resolución del DeepEncoder en el modo Base, donde el texto extremadamente pequeño se vuelve difícil de reconocer.
La ventana de atención restringida también produce un beneficio inesperado. En documentos de una sola página, limitar la ventana a 128 tokens no perjudica la precisión y, de hecho, la mejora ligeramente. Los investigadores plantean la hipótesis de que R-SWA obliga al modelo a centrarse más en la tarea densa de OCR, mientras que la atención total tiende a la divergencia a medida que aumenta la duración de la salida.
Las mejoras en la velocidad son igualmente notables. En el modo Base, Unlimited OCR alcanza 5.580 tokens por segundo en comparación con los 4.951 de Deepseek OCR, una mejora del 12,7 por ciento. En comparaciones teóricas de límite superior con paralelismo ideal, el modelo lidera la línea de base en un 35 por ciento con aproximadamente 6.000 tokens de salida.
Importancia más amplia
La arquitectura Unlimited OCR demuestra un principio con implicaciones más allá del procesamiento de documentos. La idea de mantener la memoria constante mediante la atención selectiva (inspirada en la ciencia cognitiva en lugar de la pura escala) podría informar el diseño de sistemas de inteligencia artificial más eficientes en una variedad de aplicaciones.
A medida que las organizaciones enfrentan los costos computacionales de implementar grandes modelos de lenguaje, los enfoques que reducen el consumo de memoria sin sacrificar la calidad son cada vez más valiosos. El trabajo de Baidu sugiere que las metáforas biológicas, cuando se traducen en mecanismos matemáticos, pueden producir avances prácticos en ingeniería.
La investigación también destaca la creciente influencia de China en la investigación fundamental de la IA. Si bien se ha prestado mucha atención a los logros chinos en grandes modelos lingüísticos, trabajos como Unlimited OCR demuestran que los investigadores chinos también están haciendo contribuciones significativas a los sistemas de inteligencia artificial especializados con aplicaciones prácticas inmediatas.
Manténgase por delante de la IA
Para obtener más cobertura sobre la investigación de la IA, documentar la IA y los avances tecnológicos, visite AI Buzz Wire.
Leer más noticias sobre IA →
