Výzkumníci z Baidu vyvinuli model optického rozpoznávání znaků (OCR), který je schopen zpracovat desítky stránek dokumentu v jediném inferenčním průchodu při zachování konstantního využití paměti a konzistentní rychlosti. Systém nazvaný Unlimited OCR toho dosahuje prostřednictvím nového mechanismu pozornosti inspirovaného tím, jak lidé ručně kopírují text, což představuje významný pokrok v AI dokumentů. Nejnovější vývoj ve výzkumu a technologii AI najdete na [AI Buzz Wire] (https://aibuzzwire.news).

Překonání úzkého místa mezipaměti KV

Současné komplexní systémy OCR, které jako své dekodéry používají jazykové modely, čelí zásadnímu architektonickému omezení. Jak model zpracovává text, ukládá informace o dříve zpracovaných tokenech do vyrovnávací paměti zvané KV cache, což mu umožňuje odkazovat na dřívější obsah během generování. Tato vyrovnávací paměť roste s každým novým řádkem textu, čímž se neustále zvyšuje spotřeba paměti a zpomaluje se rychlost generování.

V praxi stávající systémy toto úzké hrdlo obcházejí tak, že zpracovávají dokumenty stránku po stránce ve smyčce a po dokončení každé stránky resetují mezipaměť. Tento přístup funguje, ale přináší neefektivitu a brání modelu v udržování kontextu přes hranice stránky. Žádný současný model OCR nezvládne více než přibližně deset stránek v jednom průchodu, poznamenávají výzkumníci Baidu ve své technické zprávě.

Neomezené OCR toto omezení zcela eliminuje. Přepracováním mechanismu pozornosti, který řídí, jak model přistupuje ke své mezipaměti, systém udržuje využití paměti konstantní bez ohledu na to, kolik stránek zpracovává.

Jak funguje upozornění na referenční posuvné okno

Klíčovou inovací je to, co tým Baidu nazývá Reference Sliding Window Attention (R-SWA). Mechanismus je postaven na jednoduchém, ale silném vhledu čerpaném z lidské analogie: když člověk zkopíruje text z knihy, nepřečte si nepřetržitě vše, co již napsal. Místo toho udržují svou pozornost zaměřenou na zdrojový materiál, posledních pár znaků, které přepsali, a další postavu, kterou si zapíší. Starší pasáže se přirozeně vytrácejí z aktivní paměti jakýmsi měkkým zapomínáním.

R-SWA implementuje tento princip tím, že zachází s různými typy tokenů odlišně. Každý vygenerovaný token zachovává plnou pozornost všem referenčním tokenům – vizuálním obrazovým tokenům, které kódují dokument, a výzvě ke zpracování. Ale pokud jde o dříve vygenerovaný výstupní text, model se ohlíží zpět pouze na posledních 128 tokenů.

Tento návrh udržuje mezipaměť KV na pevné velikosti rovnající se součtu délky předpony a velikosti okna bez ohledu na to, kolik textu bylo vygenerováno. Mezipaměť funguje jako fronta, přičemž každý nový token vytlačí ten nejstarší, čímž se zabrání neomezenému růstu paměti, který sužuje standardní mechanismy pozornosti.

Ochrana vizuálních informací

Zásadní volbou designu v R-SWA je způsob, jakým zachází s vizuálními tokeny. Standardní pozornost posuvného okna by vystavila všechny tokeny probíhajícím změnám stavu, postupně by rozmazávaly rysy obrazu a časem by snižovaly přesnost rozpoznávání. R-SWA vyjímá vizuální tokeny z těchto přechodů – jsou zakódovány jednou a zůstávají nezměněny během celého procesu dekódování.

Toto uchování vizuální informace je nezbytné pro přesnost OCR. Zachováním původní reprezentace obrazu nedotčenou a zároveň omezením toho, jak daleko zpět model vypadá ve vlastním výstupu, R-SWA dosahuje toho nejlepšího z obou světů: stabilního využití paměti a spolehlivého rozpoznávání textu.

Architektura a školení

Unlimited OCR je postaven na open source modelu Deepseek OCR. Baidu si zachovává svůj DeepEncoder, který komprimuje obrázek PDF o velikosti 1024 x 1024 pixelů až na 256 tokenů a spáruje jej s architekturou mix-of-experts (MoE). Dekodér má celkem tři miliardy parametrů, ale pouze přibližně 500 milionů je aktivních během inference, takže náklady na výpočty jsou zvládnutelné.

Systém nabízí dva režimy rozlišení. Základní režim je optimalizován pro vícestránkové dokumenty, zatímco režim Gundam využívá dynamické rozlišení pro zpracování jedné stránky. Každá standardní vrstva pozornosti v dekodéru byla nahrazena R-SWA.

Školení bylo provedeno na přibližně dvou milionech vzorků dokumentů, rozdělených devět ku jedné mezi jednostránková a vícestránková data. PaddleOCR zvládal anotaci jednotlivých stránek, zatímco vícestránková data byla vytvořena synteticky spojením jednotlivých stránek do dokumentů v rozsahu od dvou do padesáti stránek. Všechna trénovací data byla zabalena do sekvencí po 32 000 tokenech a trénování probíhalo po 4 000 krocích na 8 sadách 16 GPU Nvidia A800. DeepEncoder zůstal během školení zamrzlý a aktualizovaly se pouze parametry jazykového modelu.

Srovnávací výsledky

Neomezené OCR dosahuje vysokého výkonu napříč mnoha metrikami hodnocení. V benchmarku dokumentů OmniDocBench v1.5 dosahuje model celkově 93 procent, což je šest procentních bodů nad základní hodnotou Deepseek OCR.

V kritickém testu dlouhého horizontu – kde model zpracovává mnoho stránek v jednom průchodu – zůstává chybovost pod 0,11 i za hranicí 40 stránek. Výzkumníci nepřipisují zbývající chyby ztracenému kontextu, ale limitu rozlišení DeepEncoderu v základním režimu, kde je extrémně malý text obtížně rozpoznatelný.

Okno omezené pozornosti také přináší neočekávanou výhodu. U jednostránkových dokumentů omezení okna na 128 tokenů neublíží přesnosti a ve skutečnosti ji mírně zlepší. Výzkumníci předpokládají, že R-SWA nutí model, aby se více zaměřil na hustou úlohu OCR, zatímco plná pozornost má tendenci k divergenci s rostoucí délkou výstupu.

Zlepšení rychlosti je stejně pozoruhodné. V základním režimu Unlimited OCR dosahuje 5 580 tokenů za sekundu ve srovnání s 4 951 u Deepseek OCR, což je zlepšení o 12,7 procenta. V teoretických srovnáních horních hranic s ideálním paralelismem vede model základní linii o 35 procent při přibližně 6 000 výstupních tokenů.

Širší význam

Architektura Unlimited OCR demonstruje princip s důsledky mimo zpracování dokumentů. Myšlenka udržovat paměť konstantní prostřednictvím selektivní pozornosti – inspirovaná spíše kognitivní vědou než čistým škálováním – by mohla být základem pro návrh efektivnějších systémů umělé inteligence v celé řadě aplikací.

Jak se organizace potýkají s výpočetními náklady na nasazení velkých jazykových modelů, jsou stále cennější přístupy, které snižují spotřebu paměti bez obětování kvality. Baiduova práce naznačuje, že biologické metafory, když jsou převedeny do matematických mechanismů, mohou přinést praktické inženýrské průlomy.

Výzkum také zdůrazňuje rostoucí vliv Číny v základním výzkumu AI. Zatímco velká pozornost se soustředila na čínské úspěchy ve velkých jazykových modelech, práce jako Unlimited OCR dokazují, že čínští výzkumníci také významně přispívají ke specializovaným systémům umělé inteligence s okamžitými praktickými aplikacemi.

Udržujte si náskok před AI

Další informace o výzkumu AI, AI dokumentů a technologických průlomech najdete na [AI Buzz Wire] (https://aibuzzwire.news).

Přečtěte si další zprávy o AI →