Baidu 연구원들은 일정한 메모리 사용량과 일관된 속도를 유지하면서 단일 추론 패스로 수십 개의 문서 페이지를 처리할 수 있는 OCR(광학 문자 인식) 모델을 개발했습니다. Unlimited OCR이라고 불리는 이 시스템은 인간이 텍스트를 손으로 복사하는 방식에서 영감을 받은 새로운 주의 메커니즘을 통해 이를 달성하며 이는 문서 AI의 중요한 발전을 나타냅니다. AI 연구 및 기술의 최신 동향을 알아보려면 AI Buzz Wire를 방문하세요.
Overcoming the KV Cache Bottleneck
언어 모델을 디코더로 사용하는 현재 엔드투엔드 OCR 시스템은 근본적인 아키텍처 제한에 직면해 있습니다. 모델이 텍스트를 처리할 때 이전에 처리된 토큰에 대한 정보를 KV 캐시라는 버퍼에 저장하여 생성 중에 이전 콘텐츠를 참조할 수 있습니다. 이 버퍼는 새로운 텍스트 줄마다 증가하여 메모리 소비가 꾸준히 증가하고 생성 속도가 느려집니다.
실제로 기존 시스템은 문서를 한 페이지씩 루프로 처리하고 각 페이지가 완료된 후 캐시를 재설정하여 이러한 병목 현상을 해결합니다. 이 접근 방식은 효과적이지만 비효율성을 초래하고 모델이 페이지 경계를 넘어 컨텍스트를 유지하지 못하게 합니다. Baidu 연구원들은 기술 보고서에서 단일 패스로 약 10페이지 이상을 처리하는 현재 OCR 모델은 없다고 밝혔습니다.
무제한 OCR은 이러한 제약을 완전히 제거합니다. 모델이 캐시에 액세스하는 방법을 제어하는 주의 메커니즘을 재설계함으로써 시스템은 처리하는 페이지 수에 관계없이 메모리 사용을 일정하게 유지합니다.
참조 슬라이딩 윈도우 어텐션이 작동하는 방식
핵심 혁신은 Baidu 팀이 R-SWA(Reference Sliding Window Attention)라고 부르는 것입니다. 이 메커니즘은 인간의 비유에서 도출된 단순하지만 강력한 통찰력을 바탕으로 구축되었습니다. 즉, 사람이 책에서 텍스트를 복사할 때 이미 작성한 모든 내용을 계속해서 다시 읽지는 않습니다. Instead, they keep their attention focused on the source material, the last few characters they transcribed, and the next character to write down. 오래된 구절은 일종의 부드러운 망각을 통해 활성 기억에서 자연스럽게 사라집니다.
R-SWA는 다양한 유형의 토큰을 다르게 처리하여 이 원칙을 구현합니다. 생성된 각 토큰은 문서와 처리 프롬프트를 인코딩하는 시각적 이미지 토큰인 모든 참조 토큰에 완전한 주의를 기울입니다. 그러나 이전에 생성된 출력 텍스트의 경우 모델은 가장 최근의 128개 토큰만 다시 살펴봅니다.
이 설계는 생성된 텍스트의 양에 관계없이 접두사 길이와 창 크기의 합과 동일한 고정 크기로 KV 캐시를 유지합니다. 캐시는 각각의 새 토큰이 가장 오래된 토큰을 밀어내는 큐 역할을 하여 표준 주의 메커니즘을 괴롭히는 무한한 메모리 증가를 방지합니다.
시각정보 보호
R-SWA에서 중요한 디자인 선택은 시각적 토큰을 처리하는 방법입니다. 표준 슬라이딩 윈도우 주의는 모든 토큰에 지속적인 상태 변경을 적용하여 시간이 지남에 따라 이미지 특징이 점차 흐려지고 인식 정확도가 저하됩니다. R-SWA는 이러한 전환에서 시각적 토큰을 제외합니다. 즉, 시각적 토큰은 한 번 인코딩되고 전체 디코딩 프로세스 전반에 걸쳐 변경되지 않은 상태로 유지됩니다.
이러한 시각적 정보 보존은 OCR 정확성을 위해 필수적입니다. By keeping the original image representation intact while limiting how far back the model looks in its own output, R-SWA achieves the best of both worlds: stable memory usage and reliable text recognition.
아키텍처 및 교육
무제한 OCR은 오픈 소스 Deepseek OCR 모델을 기반으로 구축되었습니다. Baidu는 1024x1024픽셀 PDF 이미지를 256개의 토큰으로 압축하고 이를 MoE(혼합 전문가) 아키텍처와 결합하는 DeepEncoder를 유지합니다. 디코더에는 총 30억 개의 매개변수가 있지만 추론 중에는 약 5억 개만 활성화되므로 계산 비용을 관리할 수 있습니다.
시스템은 두 가지 해상도 모드를 제공합니다. 기본 모드는 여러 페이지 문서에 최적화되어 있는 반면, 건담 모드는 단일 페이지 처리를 위해 동적 해상도를 사용합니다. 디코더의 모든 표준 주의 계층은 R-SWA로 대체되었습니다.
단일 페이지 데이터와 여러 페이지 데이터를 9:1로 분할하여 약 200만 개의 문서 샘플에 대해 교육을 실시했습니다. PaddleOCR은 단일 페이지에 대한 주석을 처리하는 반면, 다중 페이지 데이터는 단일 페이지를 2~50페이지 범위의 문서로 연결하여 종합적으로 구성되었습니다. 모든 훈련 데이터는 32,000개의 토큰 시퀀스로 압축되었으며, 훈련은 16개의 Nvidia A800 GPU로 구성된 8세트에서 4,000단계 동안 실행되었습니다. DeepEncoder는 훈련 내내 동결된 상태로 유지되었으며 언어 모델 매개변수만 업데이트되었습니다.
벤치마크 결과
무제한 OCR은 여러 평가 지표에서 강력한 성능을 달성합니다. OmniDocBench v1.5 문서 벤치마크에서 모델은 전체적으로 93%를 기록했으며 이는 Deepseek OCR 기준보다 6% 포인트 높습니다.
모델이 단일 패스로 많은 페이지를 처리하는 중요한 장거리 테스트에서 오류율은 40페이지를 넘어도 0.11 미만으로 유지됩니다. 연구원들은 남은 오류가 컨텍스트 손실이 아니라 매우 작은 텍스트를 인식하기 어렵게 만드는 기본 모드에서 DeepEncoder의 해상도 제한 때문이라고 생각합니다.
제한된 주의 창은 예상치 못한 이점도 제공합니다. 단일 페이지 문서에서는 창을 128개 토큰으로 제한해도 정확도가 떨어지지 않고 실제로 약간 향상됩니다. 연구자들은 R-SWA가 모델이 밀도가 높은 OCR 작업에 더 집중하도록 강제하는 반면, 완전한 주의는 출력 길이가 증가함에 따라 발산되는 경향이 있다고 가정합니다.
속도 향상도 똑같이 주목할 만합니다. 기본 모드에서 Unlimited OCR은 Deepseek OCR의 4,951개에 비해 초당 5,580개의 토큰을 달성하여 12.7% 향상되었습니다. 이상적인 병렬성과 이론적 상한 비교에서 모델은 약 6,000개의 출력 토큰에서 기준선을 35% 앞선다.
더 넓은 의미
Unlimited OCR 아키텍처는 문서 처리 이상의 의미를 지닌 원칙을 보여줍니다. 순수한 스케일링이 아닌 인지 과학에서 영감을 받은 선택적 주의를 통해 메모리를 일정하게 유지한다는 아이디어는 다양한 애플리케이션에서 보다 효율적인 AI 시스템의 설계를 알릴 수 있습니다.
조직이 대규모 언어 모델을 배포하는 데 드는 계산 비용으로 인해 어려움을 겪으면서 품질을 저하시키지 않고 메모리 소비를 줄이는 접근 방식의 가치가 점점 더 높아지고 있습니다. Baidu의 작업은 생물학적 은유가 수학적 메커니즘으로 변환될 때 실용적인 엔지니어링 혁신을 가져올 수 있음을 시사합니다.
이 연구는 또한 기초 AI 연구에서 중국의 영향력이 커지고 있음을 강조합니다. 대규모 언어 모델에서 중국의 성과에 많은 관심이 집중되었지만 Unlimited OCR과 같은 작업은 중국 연구자들이 즉각적인 실제 적용을 통해 전문 AI 시스템에 상당한 기여를 하고 있음을 보여줍니다.
AI보다 앞서 나가세요
AI 연구, 문서 AI, 기술 혁신에 대한 자세한 내용을 보려면 AI Buzz Wire를 방문하세요.
AI 뉴스 자세히 보기 →
