Os pesquisadores do Baidu desenvolveram um modelo de reconhecimento óptico de caracteres (OCR) capaz de processar dezenas de páginas de documentos em uma única passagem de inferência, mantendo o uso constante da memória e uma velocidade consistente. O sistema, chamado Unlimited OCR, consegue isso por meio de um novo mecanismo de atenção inspirado na forma como os humanos copiam texto à mão, representando um avanço significativo na IA de documentos. Para os mais recentes desenvolvimentos em pesquisa e tecnologia de IA, visite AI Buzz Wire.
Superando o gargalo do cache KV
Os atuais sistemas de OCR ponta a ponta que usam modelos de linguagem como decodificadores enfrentam uma limitação arquitetônica fundamental. À medida que um modelo processa texto, ele armazena informações sobre tokens processados anteriormente em um buffer chamado cache KV, permitindo fazer referência a conteúdo anterior durante a geração. Esse buffer cresce a cada nova linha de texto, aumentando constantemente o consumo de memória e diminuindo a velocidade de geração.
Na prática, os sistemas existentes contornam esse gargalo processando documentos página por página em um loop, redefinindo o cache após a conclusão de cada página. Essa abordagem funciona, mas introduz ineficiências e evita que o modelo mantenha o contexto além dos limites da página. Nenhum modelo atual de OCR lida com mais de dez páginas em uma única passagem, observam os pesquisadores do Baidu em seu relatório técnico.
OCR ilimitado elimina totalmente essa restrição. Ao redesenhar o mecanismo de atenção que rege a forma como o modelo acessa seu cache, o sistema mantém o uso da memória constante, independentemente de quantas páginas ele processa.
Como funciona a atenção da janela deslizante de referência
A principal inovação é o que a equipe do Baidu chama de atenção de janela deslizante de referência (R-SWA). O mecanismo é construído sobre uma visão simples, mas poderosa, extraída de uma analogia humana: quando uma pessoa copia um texto de um livro, ela não relê continuamente tudo o que já escreveu. Em vez disso, eles mantêm sua atenção focada no material de origem, nos últimos caracteres que transcreveram e no próximo caractere a ser anotado. Passagens mais antigas desaparecem naturalmente da memória ativa por meio de uma espécie de esquecimento suave.
O R-SWA implementa este princípio tratando diferentes tipos de tokens de maneira diferente. Cada token gerado retém total atenção a todos os tokens de referência – os tokens de imagem visual que codificam o documento e o prompt de processamento. Mas quando se trata de texto de saída gerado anteriormente, o modelo analisa apenas os 128 tokens mais recentes.
Este design mantém o cache KV em um tamanho fixo igual à soma do comprimento do prefixo e do tamanho da janela, independentemente de quanto texto foi gerado. O cache funciona como uma fila, com cada novo token empurrando o mais antigo, evitando o crescimento ilimitado de memória que afeta os mecanismos de atenção padrão.
Protegendo informações visuais
Uma escolha crítica de design no R-SWA é como ele lida com tokens visuais. A atenção padrão da janela deslizante sujeitaria todos os tokens a mudanças contínuas de estado, desfocando gradualmente os recursos da imagem e degradando a precisão do reconhecimento ao longo do tempo. O R-SWA isenta os tokens visuais dessas transições – eles são codificados uma vez e permanecem inalterados durante todo o processo de decodificação.
Esta preservação da informação visual é essencial para a precisão do OCR. Ao manter intacta a representação da imagem original e ao mesmo tempo limitar o quão longe o modelo aparece em sua própria saída, o R-SWA alcança o melhor dos dois mundos: uso estável de memória e reconhecimento de texto confiável.
Arquitetura e Treinamento
OCR ilimitado é baseado no modelo Deepseek OCR de código aberto. O Baidu mantém seu DeepEncoder, que compacta uma imagem PDF de 1.024 por 1.024 pixels para 256 tokens e a combina com uma arquitetura de mistura de especialistas (MoE). O decodificador tem três bilhões de parâmetros totais, mas apenas aproximadamente 500 milhões estão ativos durante a inferência, mantendo os custos computacionais gerenciáveis.
O sistema oferece dois modos de resolução. O modo base é otimizado para documentos de várias páginas, enquanto o modo Gundam usa resolução dinâmica para processamento de uma única página. Cada camada de atenção padrão no decodificador foi substituída por R-SWA.
O treinamento foi realizado em aproximadamente dois milhões de amostras de documentos, divididos de nove para um entre dados de uma única página e de várias páginas. O PaddleOCR lidava com anotações para páginas únicas, enquanto os dados de várias páginas eram construídos sinteticamente, unindo páginas únicas em documentos que variavam de duas a cinquenta páginas. Todos os dados de treinamento foram compactados em sequências de 32.000 tokens, e o treinamento durou 4.000 etapas em 8 conjuntos de 16 GPUs Nvidia A800. O DeepEncoder permaneceu congelado durante todo o treinamento, sendo atualizados apenas os parâmetros do modelo de linguagem.
Resultados de referência
OCR ilimitado alcança forte desempenho em diversas métricas de avaliação. No benchmark de documentos OmniDocBench v1.5, o modelo obteve pontuação geral de 93%, seis pontos percentuais acima da linha de base do Deepseek OCR.
No teste crítico de longo horizonte – onde o modelo processa muitas páginas em uma única passagem – a taxa de erro permanece abaixo de 0,11, mesmo após 40 páginas. Os pesquisadores atribuem os erros restantes não à perda de contexto, mas ao limite de resolução do DeepEncoder no modo Base, onde texto extremamente pequeno se torna difícil de reconhecer.
A janela de atenção restrita também traz um benefício inesperado. Em documentos de página única, limitar a janela a 128 tokens não prejudica a precisão e, na verdade, melhora-a ligeiramente. Os pesquisadores levantam a hipótese de que o R-SWA força o modelo a se concentrar mais na tarefa densa de OCR, enquanto a atenção total tende à divergência à medida que o comprimento da saída aumenta.
As melhorias de velocidade são igualmente notáveis. No modo Base, o Unlimited OCR atinge 5.580 tokens por segundo, em comparação com 4.951 do Deepseek OCR, uma melhoria de 12,7%. Em comparações teóricas de limite superior com paralelismo ideal, o modelo lidera a linha de base em 35%, com aproximadamente 6.000 tokens de saída.
Significância mais ampla
A arquitetura Unlimited OCR demonstra um princípio com implicações que vão além do processamento de documentos. A ideia de manter a memória constante através da atenção seletiva – inspirada na ciência cognitiva em vez de pura escalabilidade – poderia informar o design de sistemas de IA mais eficientes numa série de aplicações.
À medida que as organizações enfrentam os custos computacionais da implantação de grandes modelos de linguagem, as abordagens que reduzem o consumo de memória sem sacrificar a qualidade são cada vez mais valiosas. O trabalho do Baidu sugere que as metáforas biológicas, quando traduzidas em mecanismos matemáticos, podem produzir avanços práticos na engenharia.
A investigação também destaca a crescente influência da China na investigação fundamental da IA. Embora muita atenção tenha se concentrado nas conquistas chinesas em grandes modelos linguísticos, trabalhos como o Unlimited OCR demonstram que os pesquisadores chineses também estão fazendo contribuições significativas para sistemas especializados de IA com aplicações práticas imediatas.
Fique à frente da IA
Para obter mais cobertura sobre pesquisas em IA, documentar IA e avanços tecnológicos, visite AI Buzz Wire.
Leia mais notícias sobre IA →
