Peneliti Baidu wis ngembangake model pangenalan karakter optik (OCR) sing bisa ngolah puluhan kaca dokumen ing pass inferensi siji nalika njaga panggunaan memori sing tetep lan kacepetan sing konsisten. Sistem kasebut, sing diarani Unlimited OCR, entuk iki liwat mekanisme perhatian novel sing diilhami dening cara manungsa nyalin teks kanthi tangan, sing nuduhake kemajuan sing signifikan ing dokumen AI. Kanggo perkembangan paling anyar babagan riset lan teknologi AI, bukak AI Buzz Wire.

Ngatasi KV Cache Bottleneck

Sistem OCR end-to-end saiki sing nggunakake model basa minangka dekoder ngadhepi watesan arsitektur dhasar. Minangka model ngolah teks, nyimpen informasi babagan token sing wis diproses sadurunge ing buffer sing diarani cache KV, supaya bisa ngrujuk konten sadurunge sajrone generasi. Buffer iki mundak akeh karo saben baris anyar teks, ajeg nambah konsumsi memori lan kacepetan generasi kalem.

Ing praktik, sistem sing wis ana bisa ngatasi kemacetan iki kanthi ngolah dokumen kaca kanthi kaca kanthi siji, ngreset cache sawise saben kaca rampung. Pendekatan iki bisa digunakake nanging ngenalake inefisiensi lan nyegah model saka njaga konteks ing wates kaca. Ora ana model OCR saiki sing nangani luwih saka sepuluh kaca ing siji pass, peneliti Baidu nyathet ing laporan teknis.

OCR tanpa wates ngilangi kendala iki. Kanthi ngrancang maneh mekanisme manungsa waé sing ngatur cara model ngakses cache, sistem tetep nggunakake memori tanpa preduli saka pirang-pirang halaman sing diproses.

Carane Reference Sliding Window Attention Works

Inovasi utama yaiku apa sing diarani tim Baidu Reference Sliding Window Attention (R-SWA). Mekanisme kasebut dibangun kanthi wawasan sing prasaja nanging kuat sing digambar saka analogi manungsa: nalika wong nyalin teks saka buku, dheweke ora terus maca maneh kabeh sing wis ditulis. Nanging, dheweke tetep fokus ing materi sumber, sawetara karakter pungkasan sing ditranskripsi, lan karakter sabanjure kanggo ditulis. Bagian lawas kanthi alami ilang saka memori aktif liwat jinis lali alus.

R-SWA ngetrapake prinsip iki kanthi nambani macem-macem jinis token kanthi beda. Saben token sing diasilake tetep fokus marang kabeh token referensi - token gambar visual sing ngode dokumen lan pituduh pangolahan. Nanging nalika nerangake teks output sing digawe sadurunge, model mung katon maneh ing paling anyar 128 token.

Desain iki njaga cache KV ing ukuran tetep padha karo jumlah dawa awalan lan ukuran jendhela, preduli saka pinten teks wis kui. Cache fungsi minangka antrian, karo saben token anyar meksa nindakake perkara sing paling tuwa, nyegah wutah memori unbounded sing Wewelak mekanisme manungsa waé standar.

Nglindhungi Informasi Visual

Pilihan desain kritis ing R-SWA yaiku carane nangani token visual. Perhatian jendhela geser standar bakal tundhuk kabeh token menyang owah-owahan negara sing terus-terusan, fitur gambar sing mboko sithik lan ngremehake akurasi pangenalan liwat wektu. R-SWA mbebasake token visual saka transisi kasebut - dienkode sapisan lan tetep ora owah ing kabeh proses dekoding.

Pengawetan informasi visual iki penting kanggo akurasi OCR. Kanthi njaga representasi gambar asli kanthi utuh nalika mbatesi sepira model katon ing output dhewe, R-SWA entuk sing paling apik ing donya: panggunaan memori sing stabil lan pangenalan teks sing dipercaya.

Arsitektur lan Pelatihan

OCR tanpa wates dibangun ing ndhuwur model Deepseek OCR open-source. Baidu nahan DeepEncoder, sing ngompres gambar PDF 1024-by-1024-piksel nganti 256 token, lan dipasangake karo arsitektur campuran ahli (MoE). Dekoder nduweni total telung milyar paramèter, nanging mung udakara 500 yuta sing aktif sajrone inferensi, supaya biaya komputasi bisa diatur.

Sistem kasebut nawakake rong mode resolusi. Mode dhasar dioptimalake kanggo dokumen multi-kaca, nalika mode Gundam nggunakake resolusi dinamis kanggo pangolahan kaca siji. Saben lapisan manungsa waé standar ing decoder diganti karo R-SWA.

Latihan dianakake ing kira-kira rong yuta conto dokumen, pamisah sanga-kanggo-siji antarane data siji-halaman lan multi-halaman. PaddleOCR nangani anotasi kanggo kaca siji, dene data multi-halaman digawe kanthi sintetik kanthi nggabungake kaca siji dadi dokumen saka rong nganti sèket kaca. Kabeh data latihan dikempalken menyang urutan 32.000 token, lan latihan mlaku kanggo 4.000 langkah ing 8 set 16 Nvidia A800 GPUs. DeepEncoder tetep beku sajrone latihan, kanthi mung paramèter model basa sing dianyari.

Asil pathokan

OCR tanpa wates entuk kinerja sing kuat ing pirang-pirang metrik evaluasi. Ing pathokan dokumen OmniDocBench v1.5, model kasebut menehi skor 93 persen sakabèhé, enem poin persentase ing ndhuwur garis dasar Deepseek OCR.

Ing tes long-horizon kritis - ing ngendi model ngolah akeh kaca ing siji pass - tingkat kesalahan tetep ing ngisor 0,11 malah ngluwihi 40 kaca. Para peneliti ngubungake kesalahan sing isih ana ora amarga konteks sing ilang, nanging watesan resolusi DeepEncoder ing mode Base, ing ngendi teks sing cilik banget dadi angel dingerteni.

Jendhela perhatian sing diwatesi uga ngasilake keuntungan sing ora dikarepake. Ing dokumen siji-kaca, mbatesi jendhela nganti 128 token ora nyebabake akurasi lan bener-bener nambah. Peneliti hipotesis yen R-SWA meksa model kanggo fokus luwih tightly ing tugas OCR kandhel, nalika manungsa waé lengkap cenderung menyang divergence minangka dawa output mundak akeh.

dandan kacepetan merata kacathet. Ing mode Base, OCR Unlimited entuk 5,580 token per detik dibandhingake karo 4,951 kanggo Deepseek OCR, paningkatan 12,7 persen. Ing bandingaken ndhuwur-bound teoritis karo paralelisme becik, model ndadékaké baseline dening 35 persen ing kira-kira 6.000 token output.

Wigati sing luwih jembar

Arsitektur OCR Unlimited nduduhake prinsip kanthi implikasi ngluwihi pangolahan dokumen. Gagasan supaya memori tetep tetep liwat perhatian sing selektif - diilhami dening ilmu kognitif tinimbang skala murni - bisa menehi informasi babagan desain sistem AI sing luwih efisien ing macem-macem aplikasi.

Nalika organisasi berjuang karo biaya komputasi kanggo nggunakake model basa gedhe, pendekatan sing nyuda konsumsi memori tanpa ngorbanake kualitas saya tambah akeh. Karya Baidu nyaranake yen metafora biologi, nalika diterjemahake menyang mekanisme matematika, bisa ngasilake terobosan teknik praktis.

Panliten kasebut uga nyoroti pengaruh China sing tuwuh ing riset AI dhasar. Nalika akeh perhatian wis fokus ing prestasi Cina ing model basa gedhe, karya kaya Unlimited OCR nduduhake manawa peneliti Cina uga menehi kontribusi sing signifikan kanggo sistem AI khusus kanthi aplikasi praktis langsung.

Tetep Ahead saka AI

Kanggo liputan liyane babagan riset AI, dokumen AI, lan terobosan teknologi, bukak AI Buzz Wire.

Waca liyane AI warta →