Baidu araştırmacıları, sabit bellek kullanımını ve tutarlı hızı korurken düzinelerce belge sayfasını tek bir çıkarım geçişinde işleyebilen bir optik karakter tanıma (OCR) modeli geliştirdiler. Sınırsız OCR adı verilen sistem, bunu, insanların metni elle kopyalama biçiminden ilham alan yeni bir dikkat mekanizması yoluyla başarıyor ve bu, belge yapay zekasında önemli bir ilerlemeyi temsil ediyor. Yapay zeka araştırmaları ve teknolojisindeki en son gelişmeler için AI Buzz Wire adresini ziyaret edin.
KV Önbellek Darboğazını Aşmak
Dil modellerini kod çözücü olarak kullanan mevcut uçtan uca OCR sistemleri, temel bir mimari sınırlamayla karşı karşıyadır. Bir model, metni işlerken, önceden işlenmiş belirteçler hakkındaki bilgileri KV önbelleği adı verilen bir arabellekte depolayarak, üretim sırasında daha önceki içeriğe referans verilmesine olanak tanır. Bu arabellek, metnin her yeni satırıyla birlikte büyür, bellek tüketimini sürekli artırır ve oluşturma hızını yavaşlatır.
Pratikte mevcut sistemler, belgeleri bir döngü içinde sayfa sayfa işleyerek ve her sayfa tamamlandıktan sonra önbelleği sıfırlayarak bu darboğazın üstesinden gelir. Bu yaklaşım işe yarar ancak verimsizliklere neden olur ve modelin sayfa sınırları ötesinde bağlamı korumasını engeller. Baidu araştırmacıları teknik raporlarında, mevcut OCR modellerinin hiçbirinin tek geçişte yaklaşık on sayfadan fazlasını işlemediğini belirtiyor.
Sınırsız OCR bu kısıtlamayı tamamen ortadan kaldırır. Sistem, modelin önbelleğine nasıl erişeceğini yöneten dikkat mekanizmasını yeniden tasarlayarak, kaç sayfa işlediğine bakılmaksızın bellek kullanımını sabit tutar.
Referans Kayan Pencere Dikkati Nasıl Çalışır?
En önemli yenilik, Baidu ekibinin Referans Kayar Pencere Dikkati (R-SWA) adını verdiği şeydir. Mekanizma, insan benzetmesinden alınan basit ama güçlü bir içgörü üzerine inşa edilmiştir: Bir kişi bir kitaptan metin kopyaladığında, daha önce yazmış olduğu her şeyi sürekli olarak yeniden okumaz. Bunun yerine dikkatlerini kaynak materyale, yazıya döktükleri son birkaç karaktere ve yazılacak bir sonraki karaktere odaklıyorlar. Daha eski pasajlar bir tür yumuşak unutma yoluyla doğal olarak aktif hafızadan silinir.
R-SWA, bu prensibi farklı token türlerine farklı şekilde davranarak uygular. Oluşturulan her belirteç, tüm referans belirteçlerine (belgeyi ve işlem istemini kodlayan görsel görüntü belirteçlerine) tam dikkat gösterir. Ancak daha önce oluşturulmuş çıktı metnine gelince, model yalnızca en son 128 tokene bakar.
Bu tasarım, ne kadar metin oluşturulduğuna bakılmaksızın KV önbelleğini önek uzunluğu ve pencere boyutunun toplamına eşit sabit bir boyutta tutar. Önbellek, her yeni jetonun en eskisini dışarı ittiği, standart dikkat mekanizmalarını rahatsız eden sınırsız hafıza büyümesini önleyen bir kuyruk işlevi görür.
Görsel Bilginin Korunması
R-SWA'daki kritik tasarım tercihlerinden biri, görsel belirteçleri nasıl işlediğidir. Standart kayan pencere dikkati, tüm belirteçleri devam eden durum değişikliklerine maruz bırakacak, görüntü özelliklerini kademeli olarak bulanıklaştıracak ve zamanla tanıma doğruluğunu düşürecektir. R-SWA, görsel belirteçleri bu geçişlerin dışında tutar; bunlar bir kez kodlanır ve tüm kod çözme süreci boyunca değişmeden kalır.
Görsel bilgilerin bu şekilde korunması OCR doğruluğu için gereklidir. R-SWA, modelin kendi çıktısında ne kadar geriye baktığını sınırlandırırken orijinal görüntü temsilini olduğu gibi koruyarak her iki dünyanın da en iyisini elde eder: istikrarlı bellek kullanımı ve güvenilir metin tanıma.
Mimarlık ve Eğitim
Sınırsız OCR, açık kaynaklı Deepseek OCR modelinin üzerine inşa edilmiştir. Baidu, 1024 x 1024 piksellik bir PDF görüntüsünü 256 jetona kadar sıkıştıran ve bunu bir uzman karışımı (MoE) mimarisiyle eşleştiren DeepEncoder'ı koruyor. Kod çözücünün toplam üç milyar parametresi var, ancak çıkarım sırasında yalnızca yaklaşık 500 milyonu aktif oluyor ve bu da hesaplama maliyetlerini yönetilebilir kılıyor.
Sistem iki çözünürlük modu sunar. Temel mod, çok sayfalı belgeler için optimize edilirken Gundam modu, tek sayfalı işlemler için dinamik çözünürlük kullanır. Kod çözücüdeki her standart dikkat katmanı R-SWA ile değiştirildi.
Eğitim, tek sayfalı ve çok sayfalı veriler arasında dokuza bir bölünmüş yaklaşık iki milyon belge örneği üzerinde gerçekleştirildi. PaddleOCR, tek sayfalar için ek açıklamaları yönetirken, çok sayfalı veriler, tek sayfaların iki ila elli sayfa arasında değişen belgeler halinde bir araya getirilmesiyle sentetik olarak oluşturuldu. Tüm eğitim verileri 32.000 jetonluk diziler halinde paketlendi ve eğitim, 16 adet Nvidia A800 GPU'dan oluşan 8 set üzerinde 4.000 adım boyunca gerçekleştirildi. DeepEncoder, yalnızca dil modeli parametreleri güncellenerek eğitim boyunca donmuş halde kaldı.
Karşılaştırma Sonuçları
Sınırsız OCR, birden fazla değerlendirme ölçümünde güçlü performans sağlar. OmniDocBench v1.5 belge karşılaştırmasında model genel olarak yüzde 93 puan alarak Deepseek OCR temel çizgisinin altı yüzde puan üzerinde puan aldı.
Modelin tek geçişte birçok sayfayı işlediği kritik uzun ufuk testinde hata oranı 40 sayfanın ötesinde bile 0,11'in altında kalıyor. Araştırmacılar geri kalan hataları kayıp içeriğe değil, DeepEncoder'ın Base modundaki çözünürlük sınırına bağlıyor; burada çok küçük metinlerin tanınması zorlaşıyor.
Kısıtlı dikkat aralığı aynı zamanda beklenmedik bir fayda da sağlar. Tek sayfalı belgelerde pencereyi 128 jetonla sınırlamak doğruluğu etkilemez ve aslında biraz iyileştirir. Araştırmacılar, R-SWA'nın modeli yoğun OCR görevine daha sıkı odaklanmaya zorladığını, çıktı uzunluğu arttıkça tüm dikkatin farklılaşmaya yöneldiğini varsayıyorlar.
Hız iyileştirmeleri de aynı derecede dikkate değerdir. Temel modda, Sınırsız OCR saniyede 5.580 token elde ederken, Deepseek OCR için bu sayı yüzde 12,7'lik bir artışla 4.951'dir. İdeal paralellik ile yapılan teorik üst sınır karşılaştırmalarında model, yaklaşık 6.000 çıkış tokenıyla taban çizgisinin yüzde 35 önünde yer alıyor.
Daha Geniş Önem
Sınırsız OCR mimarisi, belge işlemenin ötesinde sonuçları olan bir ilkeyi ortaya koymaktadır. Saf ölçeklendirme yerine bilişsel bilimden ilham alan seçici dikkat yoluyla belleği sabit tutma fikri, çeşitli uygulamalarda daha verimli yapay zeka sistemlerinin tasarımına bilgi sağlayabilir.
Kuruluşlar büyük dil modellerinin dağıtımının hesaplama maliyetleriyle uğraşırken, kaliteden ödün vermeden bellek tüketimini azaltan yaklaşımlar giderek daha değerli hale geliyor. Baidu'nun çalışması, biyolojik metaforların matematiksel mekanizmalara çevrildiğinde pratik mühendislik atılımları sağlayabileceğini öne sürüyor.
Araştırma aynı zamanda Çin'in temel yapay zeka araştırmalarındaki artan etkisini de vurguluyor. Dikkatler büyük dil modellerinde Çince'nin başarılarına odaklanmış olsa da, Sınırsız OCR gibi çalışmalar, Çinli araştırmacıların aynı zamanda acil pratik uygulamalarla özel yapay zeka sistemlerine de önemli katkılar yaptığını gösteriyor.
Yapay Zekanın Önünde Olun
Yapay zeka araştırmaları, yapay zeka belgeleri ve teknolojik gelişmeler hakkında daha fazla bilgi edinmek için AI Buzz Wire adresini ziyaret edin.
Daha fazla AI haberini okuyun →
