Baidu-forskare har utvecklat en modell för optisk teckenigenkänning (OCR) som kan bearbeta dussintals dokumentsidor i ett enda slutledningspass samtidigt som man bibehåller konstant minnesanvändning och konstant hastighet. Systemet, kallat Unlimited OCR, uppnår detta genom en ny uppmärksamhetsmekanism inspirerad av hur människor kopierar text för hand, vilket representerar ett betydande framsteg inom dokument AI. För den senaste utvecklingen inom AI-forskning och -teknik, besök AI Buzz Wire.

Att övervinna KV Cache-flaskhalsen

Nuvarande end-to-end OCR-system som använder språkmodeller som avkodare står inför en grundläggande arkitektonisk begränsning. När en modell bearbetar text lagrar den information om tidigare bearbetade tokens i en buffert som kallas KV-cache, vilket gör att den kan referera till tidigare innehåll under generering. Denna buffert växer med varje ny rad med text, vilket stadigt ökar minnesförbrukningen och saktar ner genereringshastigheten.

I praktiken löser befintliga system denna flaskhals genom att bearbeta dokument sida för sida i en slinga och återställa cachen efter att varje sida är klar. Detta tillvägagångssätt fungerar men introducerar ineffektivitet och förhindrar modellen från att bibehålla sammanhang över sidgränserna. Ingen aktuell OCR-modell hanterar mer än cirka tio sidor i ett enda pass, noterar Baidu-forskarna i sin tekniska rapport.

Obegränsad OCR eliminerar denna begränsning helt. Genom att omdesigna uppmärksamhetsmekanismen som styr hur modellen kommer åt sin cache, håller systemet minnesanvändningen konstant oavsett hur många sidor det bearbetar.

Hur Referens skjutfönster Attention fungerar

Den viktigaste innovationen är vad Baidu-teamet kallar Reference Sliding Window Attention (R-SWA). Mekanismen bygger på en enkel men kraftfull insikt hämtad från en mänsklig analogi: när en person kopierar text från en bok läser de inte kontinuerligt om allt de redan har skrivit. Istället fokuserar de på källmaterialet, de senaste tecknen de transkriberat och nästa karaktär att skriva ner. Äldre passager bleknar naturligt bort från det aktiva minnet genom ett slags mjukt glömska.

R-SWA implementerar denna princip genom att behandla olika typer av tokens olika. Varje genererad token behåller full uppmärksamhet för alla referenstokens – de visuella bildtoken som kodar dokumentet och bearbetningsuppmaningen. Men när det kommer till tidigare genererad utdatatext, ser modellen bara tillbaka på de senaste 128 tokens.

Denna design håller KV-cachen vid en fast storlek lika med summan av prefixets längd och fönsterstorleken, oavsett hur mycket text som har genererats. Cachen fungerar som en kö, där varje ny token trycker ut den äldsta, vilket förhindrar den obegränsade minnestillväxten som plågar vanliga uppmärksamhetsmekanismer.

Skydda visuell information

Ett avgörande designval i R-SWA är hur det hanterar visuella tokens. Uppmärksamhet med standard skjutfönster skulle utsätta alla tokens för pågående tillståndsändringar, gradvis sudda ut bildegenskaper och försämra igenkänningsnoggrannheten över tiden. R-SWA undantar visuella tokens från dessa övergångar - de kodas en gång och förblir oförändrade under hela avkodningsprocessen.

Detta bevarande av visuell information är avgörande för OCR-noggrannhet. Genom att behålla den ursprungliga bildrepresentationen intakt samtidigt som den begränsar hur långt tillbaka modellen ser ut i sin egen produktion, uppnår R-SWA det bästa av två världar: stabil minnesanvändning och pålitlig textigenkänning.

Arkitektur och utbildning

Obegränsad OCR är byggd ovanpå den öppna källkodsmodellen Deepseek OCR. Baidu behåller sin DeepEncoder, som komprimerar en 1024 x 1024 pixlar PDF-bild ner till 256 tokens, och parar den med en blandning av experter (MoE) arkitektur. Avkodaren har totalt tre miljarder parametrar, men endast cirka 500 miljoner är aktiva under slutledning, vilket håller beräkningskostnaderna hanterbara.

Systemet erbjuder två upplösningslägen. Basläget är optimerat för flersidiga dokument, medan Gundam-läget använder dynamisk upplösning för ensidig bearbetning. Varje standardlager i dekodern ersattes med R-SWA.

Utbildning genomfördes på cirka två miljoner dokumentprover, uppdelade nio till ett mellan ensidig och flersidig data. PaddleOCR hanterade anteckningar för enstaka sidor, medan flersidiga data konstruerades syntetiskt genom att enstaka sidor sammanfogades till dokument från två till femtio sidor. All träningsdata packades in i sekvenser av 32 000 tokens och träningen gick i 4 000 steg på 8 uppsättningar av 16 Nvidia A800 GPU:er. DeepEncoder förblev frusen under träningen, med endast språkmodellens parametrar som uppdaterades.

Benchmark-resultat

Obegränsad OCR uppnår stark prestanda över flera utvärderingsmått. På OmniDocBench v1.5 dokumentriktmärket får modellen totalt 93 procent, sex procentenheter över Deepseek OCR-baslinjen.

I det kritiska testet med lång horisont – där modellen bearbetar många sidor i ett enda pass – stannar felfrekvensen under 0,11 även efter 40 sidor. Forskarna tillskriver återstående fel inte till förlorat sammanhang utan till DeepEncoders upplösningsgräns i Base-läge, där extremt liten text blir svår att känna igen.

Det begränsade uppmärksamhetsfönstret ger också en oväntad fördel. På ensidiga dokument skadar inte precisionen att begränsa fönstret till 128 tokens och förbättrar det faktiskt något. Forskarna antar att R-SWA tvingar modellen att fokusera hårdare på den täta OCR-uppgiften, medan full uppmärksamhet tenderar mot divergens när utdatalängden växer.

Hastighetsförbättringar är lika anmärkningsvärda. I basläget uppnår Unlimited OCR 5 580 tokens per sekund jämfört med 4 951 för Deepseek OCR, en förbättring på 12,7 procent. I teoretiska jämförelser av övre gränser med ideal parallellism leder modellen baslinjen med 35 procent vid cirka 6 000 utdatatokens.

Bredare betydelse

Den obegränsade OCR-arkitekturen visar en princip med implikationer bortom dokumentbehandling. Idén att hålla minnet konstant genom selektiv uppmärksamhet – inspirerad av kognitiv vetenskap snarare än ren skalning – skulle kunna informera utformningen av effektivare AI-system över en rad applikationer.

När organisationer brottas med beräkningskostnaderna för att distribuera stora språkmodeller, blir metoder som minskar minnesförbrukningen utan att offra kvaliteten alltmer värdefulla. Baidus arbete tyder på att biologiska metaforer, när de översätts till matematiska mekanismer, kan ge praktiska tekniska genombrott.

Forskningen belyser också Kinas växande inflytande inom grundläggande AI-forskning. Även om mycket uppmärksamhet har fokuserat på kinesiska prestationer i stora språkmodeller, visar arbete som Unlimited OCR att kinesiska forskare också gör betydande bidrag till specialiserade AI-system med omedelbara praktiska tillämpningar.

Ligg före AI

Besök AI Buzz Wire för mer täckning av AI-forskning, dokumentera AI och tekniska genombrott.

Läs mer AI-nyheter →