Baidu-onderzoekers hebben een OCR-model (Optical Character Recognition) ontwikkeld dat tientallen documentpagina's in één enkele gevolggang kan verwerken, terwijl het geheugengebruik en de snelheid constant blijven. Het systeem, genaamd Unlimited OCR, bereikt dit via een nieuw aandachtsmechanisme dat is geïnspireerd op de manier waarop mensen tekst met de hand kopiëren, wat een aanzienlijke vooruitgang betekent in document-AI. Ga voor de nieuwste ontwikkelingen op het gebied van AI-onderzoek en -technologie naar AI Buzz Wire.
Het KV-cache-knelpunt overwinnen
De huidige end-to-end OCR-systemen die taalmodellen als decoders gebruiken, worden geconfronteerd met een fundamentele architecturale beperking. Terwijl een model tekst verwerkt, slaat het informatie over eerder verwerkte tokens op in een buffer die de KV-cache wordt genoemd, waardoor het tijdens het genereren naar eerdere inhoud kan verwijzen. Deze buffer groeit met elke nieuwe regel tekst, waardoor het geheugengebruik gestaag toeneemt en de generatiesnelheid afneemt.
In de praktijk werken bestaande systemen om dit knelpunt heen door documenten pagina voor pagina in een lus te verwerken, waarbij de cache opnieuw wordt ingesteld nadat elke pagina is voltooid. Deze aanpak werkt, maar introduceert inefficiënties en verhindert dat het model de context over de paginagrenzen heen handhaaft. Geen enkel huidig OCR-model verwerkt meer dan ongeveer tien pagina's in één keer, merken de Baidu-onderzoekers op in hun technisch rapport.
Onbeperkte OCR elimineert deze beperking volledig. Door het aandachtsmechanisme dat bepaalt hoe het model toegang krijgt tot de cache opnieuw te ontwerpen, houdt het systeem het geheugengebruik constant, ongeacht het aantal pagina's dat het verwerkt.
Hoe referentie-schuifvenster-aandacht werkt
De belangrijkste innovatie is wat het Baidu-team Reference Sliding Window Attention (R-SWA) noemt. Het mechanisme is gebaseerd op een eenvoudig maar krachtig inzicht dat is ontleend aan een menselijke analogie: wanneer iemand tekst uit een boek kopieert, herleest hij niet voortdurend alles wat hij al heeft geschreven. In plaats daarvan houden ze hun aandacht gericht op het bronmateriaal, de laatste paar karakters die ze hebben getranscribeerd en het volgende karakter dat ze moeten opschrijven. Oudere passages verdwijnen op natuurlijke wijze uit het actieve geheugen door een soort zacht vergeten.
R-SWA implementeert dit principe door verschillende soorten tokens verschillend te behandelen. Elk gegenereerd token behoudt de volledige aandacht voor alle referentietokens: de visuele beeldtokens die het document coderen en de verwerkingsprompt. Maar als het gaat om eerder gegenereerde uitvoertekst, kijkt het model alleen terug naar de meest recente 128 tokens.
Dit ontwerp houdt de KV-cache op een vaste grootte die gelijk is aan de som van de prefixlengte en de venstergrootte, ongeacht hoeveel tekst er is gegenereerd. De cache functioneert als een wachtrij, waarbij elk nieuw token het oudste token naar buiten duwt, waardoor de grenzeloze geheugengroei wordt voorkomen die de standaard aandachtsmechanismen teistert.
Visuele informatie beschermen
Een cruciale ontwerpkeuze in R-SWA is de manier waarop het omgaat met visuele tokens. Standaard aandacht voor een schuifvenster zou alle tokens onderwerpen aan voortdurende statusveranderingen, waardoor de beeldkenmerken geleidelijk vervagen en de herkenningsnauwkeurigheid in de loop van de tijd afneemt. R-SWA stelt visuele tokens vrij van deze overgangen: ze worden één keer gecodeerd en blijven gedurende het hele decoderingsproces ongewijzigd.
Dit behoud van visuele informatie is essentieel voor de nauwkeurigheid van de OCR. Door de oorspronkelijke beeldweergave intact te houden en tegelijkertijd te beperken hoe ver het model terugkijkt in zijn eigen uitvoer, bereikt R-SWA het beste van twee werelden: stabiel geheugengebruik en betrouwbare tekstherkenning.
Architectuur en opleiding
Onbeperkte OCR is gebouwd bovenop het open-source Deepseek OCR-model. Baidu behoudt zijn DeepEncoder, die een PDF-afbeelding van 1024 bij 1024 pixels comprimeert tot 256 tokens, en deze koppelt aan een mix-of-experts (MoE)-architectuur. De decoder heeft in totaal drie miljard parameters, maar slechts ongeveer 500 miljoen zijn actief tijdens de inferentie, waardoor de rekenkosten beheersbaar blijven.
Het systeem biedt twee resolutiemodi. De basismodus is geoptimaliseerd voor documenten met meerdere pagina's, terwijl de Gundam-modus dynamische resolutie gebruikt voor de verwerking van één pagina. Elke standaard attentielaag in de decoder werd vervangen door R-SWA.
Er werd training gegeven op basis van ongeveer twee miljoen documentvoorbeelden, negen op één verdeeld over gegevens van één pagina en gegevens van meerdere pagina's. PaddleOCR verzorgde de annotatie voor afzonderlijke pagina's, terwijl gegevens over meerdere pagina's synthetisch werden geconstrueerd door afzonderlijke pagina's aan elkaar te plakken tot documenten van twee tot vijftig pagina's. Alle trainingsgegevens waren verpakt in reeksen van 32.000 tokens, en de training duurde 4.000 stappen op 8 sets van 16 Nvidia A800 GPU's. De DeepEncoder bleef tijdens de training bevroren, waarbij alleen de taalmodelparameters werden bijgewerkt.
Benchmarkresultaten
Onbeperkte OCR behaalt sterke prestaties op basis van meerdere evaluatiestatistieken. Op de documentenbenchmark OmniDocBench v1.5 scoort het model in totaal 93 procent, zes procentpunten boven de Deepseek OCR-basislijn.
In de kritische lange-horizontest, waarbij het model veel pagina's in één keer verwerkt, blijft het foutenpercentage zelfs boven de 40 pagina's onder de 0,11. De onderzoekers schrijven de resterende fouten niet toe aan verloren context, maar aan de resolutielimiet van de DeepEncoder in de Base-modus, waarbij extreem kleine tekst moeilijk te herkennen is.
Het beperkte aandachtsvenster levert ook een onverwacht voordeel op. Bij documenten van één pagina doet het beperken van het venster tot 128 tokens geen afbreuk aan de nauwkeurigheid, maar verbetert deze zelfs enigszins. De onderzoekers veronderstellen dat R-SWA het model dwingt zich sterker te concentreren op de dichte OCR-taak, terwijl de volledige aandacht neigt naar divergentie naarmate de uitvoerlengte toeneemt.
Snelheidsverbeteringen zijn even opmerkelijk. In de basismodus behaalt onbeperkte OCR 5.580 tokens per seconde, vergeleken met 4.951 voor Deepseek OCR, een verbetering van 12,7 procent. In theoretische bovengrensvergelijkingen met ideaal parallellisme ligt het model 35 procent voor op de basislijn bij ongeveer 6.000 outputtokens.
Bredere betekenis
De Unlimited OCR-architectuur demonstreert een principe met implicaties die verder gaan dan documentverwerking. Het idee om het geheugen constant te houden door middel van selectieve aandacht – geïnspireerd door de cognitieve wetenschap in plaats van pure schaalvergroting – zou het ontwerp van efficiëntere AI-systemen voor een reeks toepassingen kunnen informeren.
Nu organisaties worstelen met de rekenkosten van het inzetten van grote taalmodellen, worden benaderingen die het geheugenverbruik terugdringen zonder dat dit ten koste gaat van de kwaliteit steeds waardevoller. Baidu's werk suggereert dat biologische metaforen, wanneer ze worden vertaald in wiskundige mechanismen, praktische technische doorbraken kunnen opleveren.
Het onderzoek benadrukt ook de groeiende invloed van China op fundamenteel AI-onderzoek. Hoewel er veel aandacht is besteed aan Chinese prestaties op het gebied van grote taalmodellen, toont werk als Unlimited OCR aan dat Chinese onderzoekers ook belangrijke bijdragen leveren aan gespecialiseerde AI-systemen met onmiddellijke praktische toepassingen.
Blijf AI een stap voor
Bezoek AI Buzz Wire voor meer berichtgeving over AI-onderzoek, documenteer AI en technologische doorbraken.
Lees meer AI-nieuws →
