Cercetătorii Baidu au dezvoltat un model de recunoaștere optică a caracterelor (OCR) capabil să proceseze zeci de pagini de document într-o singură trecere de inferență, menținând în același timp utilizarea constantă a memoriei și viteza constantă. Sistemul, numit OCR nelimitat, realizează acest lucru printr-un mecanism nou de atenție inspirat de modul în care oamenii copiază textul manual, reprezentând un progres semnificativ în IA pentru documente. Pentru cele mai recente evoluții în cercetarea și tehnologia AI, accesați AI Buzz Wire.

Depășirea blocajului KV Cache

Sistemele actuale de OCR end-to-end care folosesc modele de limbaj ca decodoare se confruntă cu o limitare arhitecturală fundamentală. Pe măsură ce un model procesează text, acesta stochează informații despre token-urile procesate anterior într-un buffer numit cache KV, permițându-i să facă referire la conținutul anterior în timpul generării. Acest buffer crește cu fiecare linie nouă de text, crescând constant consumul de memorie și încetinind viteza de generare.

În practică, sistemele existente rezolvă acest blocaj procesând documentele pagină cu pagină într-o buclă, resetând memoria cache după ce fiecare pagină este finalizată. Această abordare funcționează, dar introduce ineficiențe și împiedică modelul să mențină contextul peste granițele paginii. Niciun model OCR actual nu gestionează mai mult de aproximativ zece pagini într-o singură trecere, notează cercetătorii Baidu în raportul lor tehnic.

OCR nelimitat elimină complet această constrângere. Prin reproiectarea mecanismului de atenție care guvernează modul în care modelul își accesează memoria cache, sistemul menține constantă utilizarea memoriei, indiferent de câte pagini procesează.

Cum funcționează Atenția ferestrei glisante de referință

Inovația cheie este ceea ce echipa Baidu numește Reference Sliding Window Attention (R-SWA). Mecanismul este construit pe o perspectivă simplă, dar puternică, extrasă dintr-o analogie umană: atunci când o persoană copiază text dintr-o carte, nu recitește continuu tot ce a scris deja. În schimb, își păstrează atenția concentrată pe materialul sursă, pe ultimele personaje pe care le-au transcris și pe următorul personaj de notat. Pasajele mai vechi dispar în mod natural din memoria activă printr-un fel de uitare blândă.

R-SWA implementează acest principiu tratând diferite tipuri de jetoane în mod diferit. Fiecare token generat păstrează o atenție deplină asupra tuturor indicatoarelor de referință - token-urile de imagine vizuală care codifică documentul și promptul de procesare. Dar când vine vorba de textul de ieșire generat anterior, modelul se uită înapoi la cele mai recente 128 de jetoane.

Acest design menține memoria cache KV la o dimensiune fixă ​​egală cu suma lungimii prefixului și dimensiunea ferestrei, indiferent de cât de mult text a fost generat. Cache-ul funcționează ca o coadă, fiecare token nou împingând-o pe cel mai vechi, prevenind creșterea nelimitată a memoriei care afectează mecanismele standard de atenție.

Protejarea informațiilor vizuale

O alegere critică de design în R-SWA este modul în care gestionează jetoanele vizuale. Atenția standard a ferestrei glisante ar supune toate jetoanele unor schimbări continue de stare, estompând treptat caracteristicile imaginii și degradând acuratețea recunoașterii în timp. R-SWA scutește jetoanele vizuale de la aceste tranziții - acestea sunt codificate o singură dată și rămân neschimbate pe parcursul întregului proces de decodare.

Această păstrare a informațiilor vizuale este esențială pentru acuratețea OCR. Păstrând intactă reprezentarea originală a imaginii, limitând în același timp cât de îndepărtat arată modelul în propria sa ieșire, R-SWA realizează tot ce este mai bun din ambele lumi: utilizarea stabilă a memoriei și recunoașterea fiabilă a textului.

Arhitectură și formare

OCR nelimitat este construit pe baza modelului open-source Deepseek OCR. Baidu își păstrează DeepEncoder, care comprimă o imagine PDF de 1024 pe 1024 de pixeli până la 256 de jetoane și o împerechează cu o arhitectură mixture-of-experts (MoE). Decodorul are trei miliarde de parametri totali, dar doar aproximativ 500 de milioane sunt activi în timpul inferenței, păstrând costurile de calcul gestionabile.

Sistemul oferă două moduri de rezoluție. Modul de bază este optimizat pentru documente cu mai multe pagini, în timp ce modul Gundam utilizează rezoluția dinamică pentru procesarea unei singure pagini. Fiecare strat de atenție standard din decodor a fost înlocuit cu R-SWA.

Instruirea a fost efectuată pe aproximativ două milioane de eșantioane de documente, împărțite nouă la unu între date de o singură pagină și date de mai multe pagini. PaddleOCR a gestionat adnotări pentru pagini individuale, în timp ce datele cu mai multe pagini au fost construite sintetic prin îmbinarea paginilor individuale în documente cuprinse între două și cincizeci de pagini. Toate datele de antrenament au fost împachetate în secvențe de 32.000 de jetoane, iar antrenamentul a durat 4.000 de pași pe 8 seturi de 16 GPU-uri Nvidia A800. DeepEncoder a rămas blocat pe tot parcursul antrenamentului, fiind actualizați doar parametrii modelului de limbă.

Rezultate benchmark

OCR nelimitat realizează performanțe puternice în mai multe valori de evaluare. În raportul de referință pentru documente OmniDocBench v1.5, modelul obține un punctaj de 93% în general, cu șase puncte procentuale peste valoarea de bază OCR Deepseek.

În testul critic pe orizont lung – în care modelul procesează multe pagini într-o singură trecere – rata de eroare rămâne sub 0,11 chiar și peste 40 de pagini. Cercetătorii atribuie erorile rămase nu pierderii contextului, ci limitei de rezoluție a DeepEncoder în modul de bază, unde textul extrem de mic devine dificil de recunoscut.

Fereastra de atenție restricționată aduce și un beneficiu neașteptat. Pe documentele cu o singură pagină, limitarea ferestrei la 128 de jetoane nu dăunează preciziei și de fapt o îmbunătățește ușor. Cercetătorii presupun ipoteza că R-SWA forțează modelul să se concentreze mai strâns pe sarcina densă OCR, în timp ce atenția deplină tinde spre divergență pe măsură ce lungimea ieșirii crește.

Îmbunătățirile vitezei sunt la fel de notabile. În modul de bază, Unlimited OCR realizează 5.580 de jetoane pe secundă, comparativ cu 4.951 pentru Deepseek OCR, o îmbunătățire cu 12,7%. În comparațiile teoretice ale limitelor superioare cu paralelism ideal, modelul conduce linia de bază cu 35% la aproximativ 6.000 de jetoane de ieșire.

Semnificație mai largă

Arhitectura OCR nelimitată demonstrează un principiu cu implicații dincolo de procesarea documentelor. Ideea de a menține memoria constantă prin atenție selectivă – inspirată mai degrabă de știința cognitivă decât de scalarea pură – ar putea informa proiectarea unor sisteme AI mai eficiente într-o gamă largă de aplicații.

Pe măsură ce organizațiile se confruntă cu costurile de calcul ale implementării modelelor de limbaj mari, abordările care reduc consumul de memorie fără a sacrifica calitatea sunt din ce în ce mai valoroase. Lucrările lui Baidu sugerează că metaforele biologice, atunci când sunt traduse în mecanisme matematice, pot produce descoperiri practice în inginerie.

De asemenea, cercetarea evidențiază influența tot mai mare a Chinei în cercetarea fundamentală în domeniul inteligenței artificiale. În timp ce multă atenție s-a concentrat asupra realizărilor chinezești în modelele mari de limbă, lucrări precum Unlimited OCR demonstrează că cercetătorii chinezi aduc, de asemenea, contribuții semnificative la sistemele AI specializate cu aplicații practice imediate.

Rămâi înaintea AI

Pentru mai multă acoperire a cercetării AI, a documenta AI și a descoperirilor tehnologice, vizitați AI Buzz Wire.

Citește mai multe știri AI →