Penyelidik Baidu telah membangunkan model pengecaman aksara optik (OCR) yang mampu memproses berpuluh-puluh halaman dokumen dalam pas inferens tunggal sambil mengekalkan penggunaan memori yang berterusan dan kelajuan yang konsisten. Sistem yang dipanggil Unlimited OCR, mencapai ini melalui mekanisme perhatian baru yang diilhamkan oleh cara manusia menyalin teks dengan tangan, yang mewakili kemajuan ketara dalam AI dokumen. Untuk perkembangan terkini dalam penyelidikan dan teknologi AI, lawati AI Buzz Wire.

Mengatasi Bottleneck Cache KV

Sistem OCR hujung ke hujung semasa yang menggunakan model bahasa sebagai penyahkod mereka menghadapi had asas seni bina. Sebagai model memproses teks, ia menyimpan maklumat tentang token yang diproses sebelum ini dalam penimbal yang dipanggil cache KV, membenarkannya merujuk kandungan awal semasa penjanaan. Penampan ini berkembang dengan setiap baris teks baharu, meningkatkan penggunaan memori secara berterusan dan memperlahankan kelajuan penjanaan.

Dalam amalan, sistem sedia ada mengatasi kesesakan ini dengan memproses dokumen halaman demi halaman dalam satu gelung, menetapkan semula cache selepas setiap halaman selesai. Pendekatan ini berfungsi tetapi memperkenalkan ketidakcekapan dan menghalang model daripada mengekalkan konteks merentas sempadan halaman. Tiada model OCR semasa mengendalikan lebih daripada kira-kira sepuluh halaman dalam satu pas, kata penyelidik Baidu dalam laporan teknikal mereka.

OCR tanpa had menghapuskan kekangan ini sepenuhnya. Dengan mereka bentuk semula mekanisme perhatian yang mengawal cara model mengakses cachenya, sistem memastikan penggunaan memori tetap tidak kira berapa banyak halaman yang diproses.

Cara Perhatian Tetingkap Gelongsor Rujukan Berfungsi

Inovasi utama ialah apa yang pasukan Baidu panggil Reference Sliding Window Attention (R-SWA). Mekanisme ini dibina berdasarkan pandangan yang mudah tetapi berkuasa yang diambil daripada analogi manusia: apabila seseorang menyalin teks daripada buku, mereka tidak terus membaca semula semua yang telah mereka tulis. Sebaliknya, mereka menumpukan perhatian mereka pada bahan sumber, beberapa aksara terakhir yang mereka transkripsikan dan watak seterusnya untuk ditulis. Petikan yang lebih lama secara semula jadi pudar daripada ingatan aktif melalui sejenis melupakan yang lembut.

R-SWA melaksanakan prinsip ini dengan merawat pelbagai jenis token secara berbeza. Setiap token yang dijana mengekalkan perhatian penuh kepada semua token rujukan — token imej visual yang mengekod dokumen dan gesaan pemprosesan. Tetapi apabila ia datang kepada teks output yang dijana sebelum ini, model itu hanya melihat kembali pada 128 token yang paling terkini.

Reka bentuk ini mengekalkan cache KV pada saiz tetap sama dengan jumlah panjang awalan dan saiz tetingkap, tidak kira berapa banyak teks yang telah dihasilkan. Cache berfungsi sebagai baris gilir, dengan setiap token baharu menolak token tertua, menghalang pertumbuhan memori tanpa had yang melanda mekanisme perhatian standard.

Melindungi Maklumat Visual

Pilihan reka bentuk kritikal dalam R-SWA ialah cara ia mengendalikan token visual. Perhatian tetingkap gelongsor standard akan tertakluk kepada perubahan keadaan yang berterusan, ciri imej yang kabur secara beransur-ansur dan ketepatan pengecaman merendahkan dari semasa ke semasa. R-SWA mengecualikan token visual daripada peralihan ini — ia dikodkan sekali dan kekal tidak berubah sepanjang keseluruhan proses penyahkodan.

Pemeliharaan maklumat visual ini penting untuk ketepatan OCR. Dengan mengekalkan perwakilan imej asal secara utuh sambil mengehadkan sejauh mana model kelihatan dalam outputnya sendiri, R-SWA mencapai yang terbaik dari kedua-dua dunia: penggunaan memori yang stabil dan pengecaman teks yang boleh dipercayai.

Seni Bina dan Latihan

OCR tanpa had dibina di atas model OCR Deepseek sumber terbuka. Baidu mengekalkan DeepEncodernya, yang memampatkan imej PDF 1024-kali-1024-piksel kepada 256 token, dan memasangkannya dengan seni bina campuran pakar (MoE). Penyahkod mempunyai tiga bilion jumlah parameter, tetapi hanya kira-kira 500 juta yang aktif semasa inferens, memastikan kos pengiraan terurus.

Sistem ini menawarkan dua mod resolusi. Mod asas dioptimumkan untuk dokumen berbilang halaman, manakala mod Gundam menggunakan resolusi dinamik untuk pemprosesan satu halaman. Setiap lapisan perhatian standard dalam penyahkod telah digantikan dengan R-SWA.

Latihan telah dijalankan ke atas kira-kira dua juta sampel dokumen, membahagikan sembilan kepada satu antara data satu halaman dan berbilang halaman. PaddleOCR mengendalikan anotasi untuk halaman tunggal, manakala data berbilang halaman dibina secara sintetik dengan mencantumkan halaman tunggal menjadi dokumen antara dua hingga lima puluh halaman. Semua data latihan telah dibungkus ke dalam urutan 32,000 token, dan latihan berjalan selama 4,000 langkah pada 8 set 16 GPU Nvidia A800. DeepEncoder kekal beku sepanjang latihan, dengan hanya parameter model bahasa dikemas kini.

Keputusan Penanda Aras

OCR tanpa had mencapai prestasi yang kukuh merentas pelbagai metrik penilaian. Pada penanda aras dokumen OmniDocBench v1.5, model mendapat markah keseluruhan 93 peratus, enam mata peratusan di atas garis dasar Deepseek OCR.

Dalam ujian long-horizon kritikal — di mana model memproses banyak halaman dalam satu laluan — kadar ralat kekal di bawah 0.11 walaupun melebihi 40 halaman. Para penyelidik mengaitkan ralat yang tinggal bukan kepada kehilangan konteks tetapi kepada had resolusi DeepEncoder dalam mod Base, di mana teks yang sangat kecil menjadi sukar untuk dikenali.

Tetingkap perhatian terhad juga menghasilkan faedah yang tidak dijangka. Pada dokumen satu halaman, mengehadkan tetingkap kepada 128 token tidak menjejaskan ketepatan dan sebenarnya meningkatkannya sedikit. Para penyelidik membuat hipotesis bahawa R-SWA memaksa model untuk memfokus lebih ketat pada tugas OCR yang padat, sementara perhatian penuh cenderung ke arah perbezaan apabila panjang output berkembang.

Peningkatan kelajuan adalah sama ketara. Dalam mod Base, OCR Tanpa Had mencapai 5,580 token sesaat berbanding 4,951 untuk Deepseek OCR, peningkatan sebanyak 12.7 peratus. Dalam perbandingan atas atas teori dengan selari ideal, model ini mendahului garis dasar sebanyak 35 peratus pada kira-kira 6,000 token keluaran.

Kepentingan yang Lebih Luas

Seni bina OCR Tanpa Had menunjukkan prinsip dengan implikasi di luar pemprosesan dokumen. Idea untuk mengekalkan ingatan berterusan melalui perhatian terpilih — diilhamkan oleh sains kognitif dan bukannya penskalaan tulen — boleh memaklumkan reka bentuk sistem AI yang lebih cekap merentas pelbagai aplikasi.

Ketika organisasi bergelut dengan kos pengiraan untuk menggunakan model bahasa yang besar, pendekatan yang mengurangkan penggunaan memori tanpa mengorbankan kualiti semakin berharga. Kerja Baidu mencadangkan bahawa metafora biologi, apabila diterjemahkan ke dalam mekanisme matematik, boleh menghasilkan kejayaan kejuruteraan praktikal.

Penyelidikan itu juga menyerlahkan pengaruh China yang semakin meningkat dalam penyelidikan asas AI. Walaupun banyak perhatian telah tertumpu pada pencapaian bahasa Cina dalam model bahasa besar, kerja seperti Unlimited OCR menunjukkan bahawa penyelidik China juga membuat sumbangan penting kepada sistem AI khusus dengan aplikasi praktikal segera.

Kekal Mendahului AI

Untuk liputan lanjut tentang penyelidikan AI, dokumen AI dan penemuan teknologi, lawati AI Buzz Wire.

Baca lebih banyak berita AI →