Badacze z Baidu opracowali model optycznego rozpoznawania znaków (OCR), który jest w stanie przetwarzać dziesiątki stron dokumentów w jednym przebiegu wnioskowania, zachowując przy tym stałe wykorzystanie pamięci i stałą prędkość. System o nazwie Unlimited OCR osiąga ten cel dzięki nowatorskiemu mechanizmowi uwagi inspirowanemu ręcznym kopiowaniem tekstu przez człowieka, co stanowi znaczący postęp w dziedzinie sztucznej inteligencji dokumentów. Najnowsze osiągnięcia w badaniach i technologii nad sztuczną inteligencją można znaleźć na stronie AI Buzz Wire.
Pokonanie wąskiego gardła pamięci podręcznej KV
Obecne kompleksowe systemy OCR, które wykorzystują modele językowe jako dekodery, borykają się z zasadniczymi ograniczeniami architektonicznymi. Gdy model przetwarza tekst, przechowuje informacje o wcześniej przetworzonych tokenach w buforze zwanym pamięcią podręczną KV, umożliwiając odwoływanie się do wcześniejszej treści podczas generowania. Bufor ten rośnie z każdą nową linijką tekstu, stale zwiększając zużycie pamięci i spowalniając prędkość generowania.
W praktyce istniejące systemy obchodzą to wąskie gardło, przetwarzając dokumenty strona po stronie w pętli i resetując pamięć podręczną po ukończeniu każdej strony. To podejście działa, ale powoduje nieefektywność i uniemożliwia modelowi utrzymanie kontekstu ponad granicami stron. Żaden obecny model OCR nie obsługuje więcej niż około dziesięciu stron w jednym przebiegu, zauważają badacze Baidu w swoim raporcie technicznym.
Nieograniczony OCR całkowicie eliminuje to ograniczenie. Dzięki przeprojektowaniu mechanizmu uwagi rządzącego sposobem uzyskiwania przez model dostępu do pamięci podręcznej system utrzymuje stałe wykorzystanie pamięci niezależnie od liczby przetwarzanych stron.
Jak działa uwaga w przesuwanym oknie referencyjnym
Kluczową innowacją jest to, co zespół Baidu nazywa „Referencyjną uwagą na przesuwane okno” (R-SWA). Mechanizm opiera się na prostym, ale potężnym spostrzeżeniu zaczerpniętym z ludzkiej analogii: kiedy ktoś kopiuje tekst z książki, nie czyta w sposób ciągły wszystkiego, co już napisał. Zamiast tego skupiają swoją uwagę na materiale źródłowym, kilku ostatnich znakach, które przepisali, i kolejnym znaku do zapisania. Starsze fragmenty w naturalny sposób znikają z aktywnej pamięci poprzez rodzaj miękkiego zapomnienia.
R-SWA realizuje tę zasadę poprzez odmienne traktowanie różnych typów tokenów. Każdy wygenerowany token zwraca pełną uwagę na wszystkie tokeny referencyjne — tokeny obrazu wizualnego, które kodują dokument i monit o przetwarzanie. Jeśli jednak chodzi o wcześniej wygenerowany tekst wyjściowy, model sprawdza tylko najnowsze 128 tokenów.
Dzięki temu rozwiązaniu pamięć podręczna KV ma stały rozmiar równy sumie długości przedrostka i rozmiaru okna, niezależnie od ilości wygenerowanego tekstu. Pamięć podręczna działa jak kolejka, w której każdy nowy token wypycha najstarszy, zapobiegając nieograniczonemu wzrostowi pamięci, który jest plagą standardowych mechanizmów uwagi.
Ochrona informacji wizualnych
Kluczowym wyborem projektowym w R-SWA jest sposób obsługi tokenów wizualnych. Standardowa uwaga przesuwanego okna narażałaby wszystkie tokeny na ciągłe zmiany stanu, stopniowo zacierając cechy obrazu i pogarszając z czasem dokładność rozpoznawania. R-SWA zwalnia tokeny wizualne z tych przejść — są one kodowane raz i pozostają niezmienione przez cały proces dekodowania.
Zachowanie informacji wizualnych jest niezbędne dla dokładności OCR. Zachowując nienaruszoną reprezentację oryginalnego obrazu, jednocześnie ograniczając odległość, w jakiej znajduje się model w swoich własnych wynikach, R-SWA osiąga to, co najlepsze z obu światów: stabilne wykorzystanie pamięci i niezawodne rozpoznawanie tekstu.
Architektura i szkolenie
Unlimited OCR opiera się na modelu Deepseek OCR o otwartym kodzie źródłowym. Baidu zachowuje swój DeepEncoder, który kompresuje obraz PDF o wymiarach 1024 na 1024 piksele do 256 tokenów i łączy go z architekturą mieszanki ekspertów (MoE). Dekoder ma łącznie trzy miliardy parametrów, ale tylko około 500 milionów jest aktywnych podczas wnioskowania, co pozwala na kontrolowanie kosztów obliczeniowych.
System oferuje dwa tryby rozdzielczości. Tryb podstawowy jest zoptymalizowany pod kątem dokumentów wielostronicowych, natomiast tryb Gundam wykorzystuje dynamiczną rozdzielczość do przetwarzania pojedynczych stron. Każda standardowa warstwa uwagi w dekoderze została zastąpiona R-SWA.
Szkolenie przeprowadzono na około dwóch milionach próbek dokumentów, podzielonych w stosunku dziewięć do jednego na dane jednostronicowe i wielostronicowe. PaddleOCR obsługiwał adnotacje dla pojedynczych stron, podczas gdy dane wielostronicowe konstruowano syntetycznie, łącząc pojedyncze strony w dokumenty o długości od dwóch do pięćdziesięciu stron. Wszystkie dane szkoleniowe zostały spakowane w sekwencje po 32 000 tokenów, a szkolenie obejmowało 4000 kroków na 8 zestawach 16 procesorów graficznych Nvidia A800. Urządzenie DeepEncoder pozostawało zamrożone przez cały czas szkolenia, a aktualizowane były jedynie parametry modelu języka.
Wyniki testów porównawczych
Nieograniczony OCR zapewnia wysoką wydajność w wielu metrykach oceny. W teście porównawczym dokumentów OmniDocBench v1.5 model uzyskał ogólny wynik 93 procent, czyli sześć punktów procentowych powyżej wartości bazowej Deepseek OCR.
W krytycznym teście długohoryzontalnym, w którym model przetwarza wiele stron w jednym przebiegu, poziom błędów utrzymuje się na poziomie poniżej 0,11 nawet po przekroczeniu 40 stron. Badacze przypisują pozostałe błędy nie utracie kontekstu, ale ograniczeniu rozdzielczości DeepEncodera w trybie podstawowym, gdzie bardzo mały tekst staje się trudny do rozpoznania.
Ograniczone okno uwagi przynosi również nieoczekiwane korzyści. W dokumentach jednostronicowych ograniczenie okna do 128 tokenów nie szkodzi dokładności, a wręcz nieznacznie ją poprawia. Badacze wysuwają hipotezę, że R-SWA zmusza model do większego skupienia się na gęstym zadaniu OCR, podczas gdy pełna uwaga zmierza w stronę rozbieżności w miarę wzrostu długości wyjściowej.
Poprawa szybkości jest równie zauważalna. W trybie podstawowym Unlimited OCR osiąga 5580 tokenów na sekundę w porównaniu do 4951 w przypadku Deepseek OCR, co oznacza poprawę o 12,7%. W teoretycznych porównaniach górnych granic z idealną równoległością model wyprzedza linię bazową o 35 procent przy około 6000 tokenów wyjściowych.
Szersze znaczenie
Architektura Unlimited OCR demonstruje zasadę mającą konsekwencje wykraczające poza przetwarzanie dokumentów. Pomysł utrzymywania stałej pamięci poprzez selektywną uwagę – zainspirowany naukami kognitywnymi, a nie czystym skalowaniem – może pomóc w projektowaniu bardziej wydajnych systemów sztucznej inteligencji w szeregu zastosowań.
W miarę jak organizacje zmagają się z kosztami obliczeniowymi wdrażania dużych modeli językowych, coraz bardziej cenne stają się podejścia zmniejszające zużycie pamięci bez utraty jakości. Praca Baidu sugeruje, że metafory biologiczne przełożone na mechanizmy matematyczne mogą przynieść praktyczne przełomy w inżynierii.
Badanie podkreśla również rosnący wpływ Chin na podstawowe badania nad sztuczną inteligencją. Choć wiele uwagi poświęcono chińskim osiągnięciom w zakresie dużych modeli językowych, prace takie jak Unlimited OCR pokazują, że chińscy badacze również wnoszą znaczący wkład w wyspecjalizowane systemy sztucznej inteligencji mające natychmiastowe zastosowania praktyczne.
Wyprzedź sztuczną inteligencję
Aby uzyskać więcej informacji na temat badań nad sztuczną inteligencją, udokumentować sztuczną inteligencję i przełomy technologiczne, odwiedź AI Buzz Wire.
Przeczytaj więcej aktualności o sztucznej inteligencji →
