百度研究人员开发了一种光学字符识别(OCR)模型,能够在一次推理过程中处理数十个文档页面,同时保持恒定的内存使用和一致的速度。该系统名为 Unlimited OCR,通过一种新颖的注意力机制实现了这一目标,该机制的灵感来自人类如何手动复制文本,代表了文档人工智能的重大进步。如需了解人工智能研究和技术的最新进展,请访问 AI Buzz Wire

克服 KV 缓存瓶颈

当前使用语言模型作为解码器的端到端 OCR 系统面临着基本的架构限制。当模型处理文本时,它将有关先前处理的令牌的信息存储在称为 KV 缓存的缓冲区中,从而允许它在生成过程中引用较早的内容。该缓冲区随着每行新文本而增长,从而稳步增加内存消耗并降低生成速度。

实际上,现有系统通过循环逐页处理文档并在每页完成后重置缓存来解决此瓶颈。这种方法有效,但效率低下,并且阻止模型跨页面边界维护上下文。百度研究人员在其技术报告中指出,当前的 OCR 模型单次处理的页面数量不超过大约十页。

无限 OCR 完全消除了这一限制。通过重新设计控制模型如何访问其缓存的注意力机制,系统可以保持内存使用恒定,无论处理多少页。

参考滑动窗口注意力机制的工作原理

关键的创新是百度团队所说的参考滑动窗口注意(R-SWA)。该机制建立在一个简单但强大的人类类比洞察之上:当一个人从书中复制文本时,他们不会不断地重新阅读他们已经写过的所有内容。相反,他们将注意力集中在源材料、他们转录的最后几个字符以及要写下的下一个字符上。较旧的段落会通过一种软遗忘自然地从主动记忆中消失。

R-SWA 通过区别对待不同类型的代币来实现这一原则。每个生成的令牌都会充分关注所有参考令牌 - 对文档和处理提示进行编码的视觉图像令牌。但当涉及到之前生成的输出文本时,该模型仅回顾最近的 128 个标记。

这种设计使 KV 缓存保持固定大小,等于前缀长度和窗口大小之和,无论生成了多少文本。缓存充当队列,每个新令牌都会推出最旧的令牌,从而防止困扰标准注意力机制的无限内存增长。

保护视觉信息

R-SWA 中的一个关键设计选择是它如何处理视觉标记。标准的滑动窗口注意力将使所有标记经历持续的状态变化,随着时间的推移逐渐模糊图像特征并降低识别准确性。 R-SWA 使视觉标记免受这些转换的影响——它们被编码一次,并在整个解码过程中保持不变。

视觉信息的保存对于 OCR 准确性至关重要。通过保持原始图像表示完整,同时限制模型在其自身输出中查看的距离,R-SWA 实现了两全其美:稳定的内存使用和可靠的文本识别。

架构和培训

Unlimited OCR 构建在开源 Deepseek OCR 模型之上。百度保留了其 DeepEncoder,它将 1024 x 1024 像素的 PDF 图像压缩为 256 个标记,并将其与专家混合 (MoE) 架构配对。解码器共有 30 亿个参数,但在推理过程中只有大约 5 亿个参数处于活动状态,从而使计算成本保持在可控范围内。

系统提供两种分辨率模式。基本模式针对多页文档进行了优化,而高达模式则使用动态分辨率进行单页处理。解码器中的每个标准注意力层都被 R-SWA 替换。

对大约 200 万个文档样本进行了训练,单页数据和多页数据按九比一的比例划分。 PaddleOCR 处理单页注释,而多页数据是通过将单页拼接在一起形成两到五十页的文档来综合构建的。所有训练数据都打包成 32,000 个标记的序列,训练在 8 组 16 个 Nvidia A800 GPU 上运行了 4,000 个步骤。 DeepEncoder 在整个训练过程中保持冻结状态,仅更新语言模型参数。

基准测试结果

Unlimited OCR 在多个评估指标上均取得了出色的性能。在 OmniDocBench v1.5 文档基准测试中,该模型的总体得分为 93%,比 Deepseek OCR 基线高出 6 个百分点。

在关键的长期测试中(模型一次处理多个页面),即使超过 40 个页面,错误率也保持在 0.11 以下。研究人员将剩余错误归因于上下文丢失,而是 DeepEncoder 在基本模式下的分辨率限制,在该模式下,极小的文本变得难以识别。

有限的注意力窗口还带来了意想不到的好处。在单页文档中,将窗口限制为 128 个标记不会损害准确性,实际上还可以稍微提高准确性。研究人员假设,R-SWA 迫使模型更紧密地关注密集的 OCR 任务,而随着输出长度的增长,全部注意力会趋于发散。

速度提升同样显着。在基本模式下,Unlimited OCR 每秒可处理 5,580 个令牌,而 Deepseek OCR 每秒可处理 4,951 个令牌,提高了 12.7%。在与理想并行性的理论上限比较中,该模型在大约 6,000 个输出标记处领先于基线 35%。

更广泛的意义

Unlimited OCR 架构展示了一个原则,其影响超出了文档处理范围。通过选择性注意保持记忆恒定的想法——受到认知科学而非纯粹缩放的启发——可以为跨一系列应用的更高效的人工智能系统的设计提供信息。

随着组织努力解决部署大型语言模型的计算成本,在不牺牲质量的情况下减少内存消耗的方法变得越来越有价值。百度的研究表明,当生物隐喻转化为数学机制时,可以带来实际的工程突破。

该研究还凸显了中国在基础人工智能研究方面日益增长的影响力。尽管人们的注意力集中在中国在大型语言模型方面取得的成就,但像 Unlimited OCR 这样的工作表明,中国研究人员也在为具有直接实际应用的专业人工智能系统做出了重大贡献。

保持人工智能领先地位

有关人工智能研究、文档人工智能和技术突破的更多报道,请访问 AI Buzz Wire

阅读更多人工智能新闻 →