I ricercatori di Baidu hanno sviluppato un modello di riconoscimento ottico dei caratteri (OCR) in grado di elaborare dozzine di pagine di documenti in un unico passaggio di inferenza mantenendo un utilizzo costante della memoria e una velocità costante. Il sistema, chiamato Unlimited OCR, raggiunge questo obiettivo attraverso un nuovo meccanismo di attenzione ispirato al modo in cui gli esseri umani copiano il testo a mano, rappresentando un progresso significativo nell’intelligenza artificiale dei documenti. Per gli ultimi sviluppi nella ricerca e nella tecnologia dell'intelligenza artificiale, visitare AI Buzz Wire.
Superare il collo di bottiglia della cache KV
Gli attuali sistemi OCR end-to-end che utilizzano modelli linguistici come decodificatori devono affrontare una limitazione architetturale fondamentale. Quando un modello elabora il testo, memorizza le informazioni sui token precedentemente elaborati in un buffer chiamato cache KV, consentendogli di fare riferimento al contenuto precedente durante la generazione. Questo buffer cresce con ogni nuova riga di testo, aumentando costantemente il consumo di memoria e rallentando la velocità di generazione.
In pratica, i sistemi esistenti aggirano questo collo di bottiglia elaborando i documenti pagina per pagina in un ciclo, reimpostando la cache dopo che ogni pagina è stata completata. Questo approccio funziona ma introduce inefficienze e impedisce al modello di mantenere il contesto oltre i limiti della pagina. Nessun modello OCR attuale gestisce più di dieci pagine in un singolo passaggio, notano i ricercatori di Baidu nel loro rapporto tecnico.
L'OCR illimitato elimina completamente questo vincolo. Riprogettando il meccanismo di attenzione che governa il modo in cui il modello accede alla cache, il sistema mantiene costante l'utilizzo della memoria indipendentemente dal numero di pagine elaborate.
Come funziona l'attenzione della finestra scorrevole di riferimento
L’innovazione chiave è ciò che il team di Baidu chiama Reference Sliding Window Attention (R-SWA). Il meccanismo si basa su un’intuizione semplice ma potente tratta da un’analogia umana: quando una persona copia un testo da un libro, non rilegge continuamente tutto ciò che ha già scritto. Invece, mantengono la loro attenzione focalizzata sul materiale originale, sugli ultimi caratteri che hanno trascritto e sul carattere successivo da scrivere. I passaggi più vecchi svaniscono naturalmente dalla memoria attiva attraverso una sorta di lieve oblio.
R-SWA implementa questo principio trattando i diversi tipi di token in modo diverso. Ogni token generato mantiene la piena attenzione a tutti i token di riferimento: i token dell'immagine visiva che codificano il documento e la richiesta di elaborazione. Ma quando si tratta del testo di output generato in precedenza, il modello guarda solo ai 128 token più recenti.
Questa progettazione mantiene la cache KV a una dimensione fissa pari alla somma della lunghezza del prefisso e della dimensione della finestra, indipendentemente dalla quantità di testo che è stata generata. La cache funziona come una coda, in cui ogni nuovo token elimina quello più vecchio, impedendo la crescita illimitata della memoria che affligge i meccanismi di attenzione standard.
Protezione delle informazioni visive
Una scelta progettuale fondamentale in R-SWA è il modo in cui gestisce i token visivi. L'attenzione standard della finestra scorrevole sottoporrebbe tutti i token a continui cambiamenti di stato, offuscando gradualmente le caratteristiche dell'immagine e riducendo la precisione del riconoscimento nel tempo. R-SWA esonera i token visivi da queste transizioni: vengono codificati una volta e rimangono invariati durante l'intero processo di decodifica.
Questa conservazione delle informazioni visive è essenziale per la precisione dell'OCR. Mantenendo intatta la rappresentazione dell'immagine originale e limitando il tempo in cui il modello appare nel proprio output, R-SWA ottiene il meglio di entrambi i mondi: utilizzo stabile della memoria e riconoscimento affidabile del testo.
Architettura e Formazione
L'OCR illimitato si basa sul modello OCR Deepseek open source. Baidu mantiene il suo DeepEncoder, che comprime un'immagine PDF da 1024 x 1024 pixel fino a 256 token e la accoppia con un'architettura Mix-of-Experts (MoE). Il decodificatore ha tre miliardi di parametri totali, ma solo circa 500 milioni sono attivi durante l'inferenza, mantenendo gestibili i costi computazionali.
Il sistema offre due modalità di risoluzione. La modalità Base è ottimizzata per documenti multipagina, mentre la modalità Gundam utilizza la risoluzione dinamica per l'elaborazione di una sola pagina. Ogni livello di attenzione standard nel decodificatore è stato sostituito con R-SWA.
La formazione è stata condotta su circa due milioni di campioni di documenti, suddivisi nove a uno tra dati a pagina singola e multipagina. PaddleOCR gestiva l'annotazione per singole pagine, mentre i dati multipagina venivano costruiti sinteticamente unendo insieme singole pagine in documenti che andavano da due a cinquanta pagine. Tutti i dati di training sono stati raggruppati in sequenze di 32.000 token e il training è stato eseguito per 4.000 passaggi su 8 set di 16 GPU Nvidia A800. Il DeepEncoder è rimasto congelato durante l'addestramento, aggiornando solo i parametri del modello linguistico.
Risultati del benchmark
L'OCR illimitato raggiunge ottime prestazioni su più parametri di valutazione. Nel benchmark dei documenti OmniDocBench v1.5, il modello ottiene un punteggio complessivo del 93%, sei punti percentuali sopra la linea di base dell'OCR di Deepseek.
Nel test critico a lungo orizzonte, in cui il modello elabora molte pagine in un unico passaggio, il tasso di errore rimane inferiore a 0,11 anche oltre le 40 pagine. I ricercatori attribuiscono gli errori rimanenti non alla perdita di contesto ma al limite di risoluzione del DeepEncoder in modalità Base, dove il testo estremamente piccolo diventa difficile da riconoscere.
La finestra di attenzione limitata produce anche un vantaggio inaspettato. Sui documenti a pagina singola, limitare la finestra a 128 token non compromette la precisione e anzi la migliora leggermente. I ricercatori ipotizzano che R-SWA costringa il modello a concentrarsi maggiormente sul denso compito OCR, mentre la piena attenzione tende verso la divergenza man mano che aumenta la lunghezza dell'output.
I miglioramenti della velocità sono altrettanto notevoli. In modalità Base, Unlimited OCR raggiunge 5.580 token al secondo rispetto ai 4.951 di Deepseek OCR, un miglioramento del 12,7%. Nei confronti teorici con limite superiore con il parallelismo ideale, il modello supera la linea di base del 35% a circa 6.000 token di output.
Significato più ampio
L'architettura Unlimited OCR dimostra un principio con implicazioni che vanno oltre l'elaborazione dei documenti. L’idea di mantenere la memoria costante attraverso l’attenzione selettiva – ispirata alla scienza cognitiva piuttosto che al puro ridimensionamento – potrebbe informare la progettazione di sistemi di intelligenza artificiale più efficienti in una vasta gamma di applicazioni.
Mentre le organizzazioni sono alle prese con i costi computazionali legati all’implementazione di modelli linguistici di grandi dimensioni, gli approcci che riducono il consumo di memoria senza sacrificare la qualità sono sempre più preziosi. Il lavoro di Baidu suggerisce che le metafore biologiche, se tradotte in meccanismi matematici, possono produrre scoperte pratiche di ingegneria.
La ricerca evidenzia anche la crescente influenza della Cina nella ricerca fondamentale sull’intelligenza artificiale. Mentre molta attenzione si è concentrata sui risultati ottenuti dalla Cina nei modelli linguistici di grandi dimensioni, lavori come Unlimited OCR dimostrano che anche i ricercatori cinesi stanno dando contributi significativi a sistemi di intelligenza artificiale specializzati con applicazioni pratiche immediate.
Stai al passo con l'intelligenza artificiale
Per una maggiore copertura della ricerca sull'intelligenza artificiale, dell'intelligenza artificiale dei documenti e delle scoperte tecnologiche, visitare AI Buzz Wire.
Leggi altre notizie sull'AI →
