Các nhà nghiên cứu của Baidu đã phát triển mô hình nhận dạng ký tự quang học (OCR) có khả năng xử lý hàng chục trang tài liệu trong một lần suy luận duy nhất trong khi vẫn duy trì mức sử dụng bộ nhớ liên tục và tốc độ ổn định. Hệ thống có tên là Unlimited OCR, đạt được điều này thông qua cơ chế chú ý mới lấy cảm hứng từ cách con người sao chép văn bản bằng tay, thể hiện một bước tiến đáng kể trong AI tài liệu. Để biết những phát triển mới nhất về nghiên cứu và công nghệ AI, hãy truy cập AI Buzz Wire.
Vượt qua nút thắt cổ chai KV Cache
Các hệ thống OCR đầu cuối hiện tại sử dụng mô hình ngôn ngữ làm bộ giải mã phải đối mặt với giới hạn kiến trúc cơ bản. Là một mô hình xử lý văn bản, nó lưu trữ thông tin về các mã thông báo đã xử lý trước đó trong bộ đệm gọi là bộ đệm KV, cho phép nó tham chiếu nội dung trước đó trong quá trình tạo. Bộ đệm này tăng lên theo mỗi dòng văn bản mới, làm tăng mức tiêu thụ bộ nhớ một cách đều đặn và làm chậm tốc độ tạo.
Trong thực tế, các hệ thống hiện tại giải quyết nút thắt cổ chai này bằng cách xử lý tài liệu theo từng trang theo vòng lặp, đặt lại bộ đệm sau khi hoàn thành mỗi trang. Cách tiếp cận này hoạt động nhưng gây ra sự thiếu hiệu quả và ngăn mô hình duy trì bối cảnh trên các ranh giới trang. Các nhà nghiên cứu của Baidu lưu ý trong báo cáo kỹ thuật của họ rằng không có mô hình OCR hiện tại nào xử lý hơn khoảng mười trang trong một lần chuyển.
OCR không giới hạn loại bỏ hoàn toàn hạn chế này. Bằng cách thiết kế lại cơ chế chú ý chi phối cách mô hình truy cập vào bộ nhớ đệm, hệ thống sẽ duy trì mức sử dụng bộ nhớ không đổi bất kể nó xử lý bao nhiêu trang.
Cách hoạt động của tính năng chú ý cửa sổ trượt tham chiếu
Sự đổi mới quan trọng là cái mà nhóm Baidu gọi là Chú ý cửa sổ trượt tham chiếu (R-SWA). Cơ chế này được xây dựng dựa trên một hiểu biết sâu sắc đơn giản nhưng mạnh mẽ rút ra từ sự tương tự của con người: khi một người sao chép văn bản từ một cuốn sách, họ không liên tục đọc lại mọi thứ họ đã viết. Thay vào đó, họ tập trung sự chú ý vào tài liệu nguồn, một số ký tự cuối cùng mà họ phiên âm và ký tự tiếp theo sẽ viết ra. Những đoạn văn cũ sẽ mờ dần khỏi trí nhớ đang hoạt động một cách tự nhiên thông qua một kiểu lãng quên nhẹ nhàng.
R-SWA thực hiện nguyên tắc này bằng cách xử lý các loại mã thông báo khác nhau một cách khác nhau. Mỗi mã thông báo được tạo sẽ duy trì sự chú ý đầy đủ đến tất cả các mã thông báo tham chiếu — mã thông báo hình ảnh trực quan mã hóa tài liệu và lời nhắc xử lý. Nhưng khi nói đến văn bản đầu ra được tạo trước đó, mô hình chỉ xem lại 128 mã thông báo gần đây nhất.
Thiết kế này giữ cho bộ đệm KV ở kích thước cố định bằng tổng độ dài tiền tố và kích thước cửa sổ, bất kể số lượng văn bản đã được tạo. Bộ đệm hoạt động như một hàng đợi, với mỗi mã thông báo mới sẽ đẩy mã cũ nhất ra ngoài, ngăn chặn sự tăng trưởng bộ nhớ không giới hạn gây cản trở các cơ chế chú ý tiêu chuẩn.
Bảo vệ thông tin thị giác
Lựa chọn thiết kế quan trọng trong R-SWA là cách nó xử lý các mã thông báo trực quan. Sự chú ý của cửa sổ trượt tiêu chuẩn sẽ khiến tất cả các mã thông báo phải thay đổi trạng thái liên tục, làm mờ dần các đặc điểm của hình ảnh và làm giảm độ chính xác của nhận dạng theo thời gian. R-SWA loại trừ các mã thông báo trực quan khỏi những chuyển đổi này — chúng được mã hóa một lần và không thay đổi trong toàn bộ quá trình giải mã.
Việc bảo tồn thông tin hình ảnh này là điều cần thiết cho độ chính xác của OCR. Bằng cách giữ nguyên hình ảnh gốc trong khi hạn chế khoảng cách của mô hình trong đầu ra của chính nó, R-SWA đạt được lợi ích tốt nhất của cả hai thế giới: sử dụng bộ nhớ ổn định và nhận dạng văn bản đáng tin cậy.
Kiến trúc và Đào tạo
OCR không giới hạn được xây dựng dựa trên mô hình Deepseek OCR mã nguồn mở. Baidu vẫn giữ lại DeepEncode, nén hình ảnh PDF 1024 x 1024 pixel xuống còn 256 mã thông báo và ghép nối nó với kiến trúc hỗn hợp các chuyên gia (MoE). Bộ giải mã có tổng cộng ba tỷ tham số, nhưng chỉ có khoảng 500 triệu tham số hoạt động trong quá trình suy luận, giúp quản lý chi phí tính toán.
Hệ thống cung cấp hai chế độ phân giải. Chế độ cơ bản được tối ưu hóa cho các tài liệu nhiều trang, trong khi chế độ Gundam sử dụng độ phân giải động để xử lý một trang. Mọi lớp chú ý tiêu chuẩn trong bộ giải mã đã được thay thế bằng R-SWA.
Quá trình đào tạo được thực hiện trên khoảng hai triệu mẫu tài liệu, chia thành 9:1 cho dữ liệu một trang và nhiều trang. PaddleOCR xử lý chú thích cho các trang đơn lẻ, trong khi dữ liệu nhiều trang được xây dựng tổng hợp bằng cách ghép các trang đơn lẻ lại với nhau thành các tài liệu từ hai đến năm mươi trang. Tất cả dữ liệu đào tạo được đóng gói thành chuỗi 32.000 mã thông báo và quá trình đào tạo diễn ra trong 4.000 bước trên 8 bộ 16 GPU Nvidia A800. DeepEncode vẫn bị treo trong suốt quá trình đào tạo và chỉ có các tham số mô hình ngôn ngữ được cập nhật.
Kết quả điểm chuẩn
OCR không giới hạn đạt được hiệu suất mạnh mẽ trên nhiều số liệu đánh giá. Trên điểm chuẩn tài liệu OmniDocBench v1.5, mô hình đạt điểm tổng thể là 93%, cao hơn sáu điểm phần trăm so với đường cơ sở Deepseek OCR.
Trong thử nghiệm tầm nhìn dài quan trọng — trong đó mô hình xử lý nhiều trang trong một lần chạy — tỷ lệ lỗi vẫn ở mức dưới 0,11 thậm chí vượt quá 40 trang. Các nhà nghiên cứu cho rằng các lỗi còn lại không phải do mất ngữ cảnh mà là do giới hạn độ phân giải của DeepEncoding ở chế độ Cơ bản, trong đó văn bản cực nhỏ trở nên khó nhận dạng.
Cửa sổ chú ý bị hạn chế cũng mang lại lợi ích không ngờ. Trên các tài liệu một trang, việc giới hạn cửa sổ ở 128 mã thông báo không ảnh hưởng đến độ chính xác và thực sự cải thiện nó một chút. Các nhà nghiên cứu đưa ra giả thuyết rằng R-SWA buộc mô hình phải tập trung chặt chẽ hơn vào nhiệm vụ OCR dày đặc, trong khi sự chú ý hoàn toàn có xu hướng phân kỳ khi độ dài đầu ra tăng lên.
Cải thiện tốc độ cũng đáng chú ý không kém. Ở chế độ Cơ bản, OCR không giới hạn đạt được 5.580 mã thông báo mỗi giây so với 4.951 của Deepseek OCR, cải thiện 12,7%. Trong các so sánh giới hạn trên về mặt lý thuyết với tính song song lý tưởng, mô hình dẫn đầu đường cơ sở 35% với khoảng 6.000 mã thông báo đầu ra.
Ý nghĩa rộng hơn
Kiến trúc OCR không giới hạn thể hiện một nguyên tắc có ý nghĩa vượt ra ngoài việc xử lý tài liệu. Ý tưởng giữ cho bộ nhớ không đổi thông qua sự chú ý có chọn lọc - lấy cảm hứng từ khoa học nhận thức thay vì mở rộng quy mô thuần túy - có thể giúp thiết kế các hệ thống AI hiệu quả hơn trên nhiều ứng dụng.
Khi các tổ chức vật lộn với chi phí tính toán khi triển khai các mô hình ngôn ngữ lớn, các phương pháp giảm mức tiêu thụ bộ nhớ mà không làm giảm chất lượng ngày càng có giá trị. Công trình của Baidu gợi ý rằng các ẩn dụ sinh học, khi được dịch sang các cơ chế toán học, có thể mang lại những đột phá kỹ thuật thực tế.
Nghiên cứu cũng nhấn mạnh tầm ảnh hưởng ngày càng tăng của Trung Quốc trong nghiên cứu nền tảng về AI. Trong khi nhiều sự chú ý tập trung vào thành tựu của Trung Quốc trong các mô hình ngôn ngữ lớn, công việc như Unlimited OCR chứng tỏ rằng các nhà nghiên cứu Trung Quốc cũng đang có những đóng góp đáng kể cho các hệ thống AI chuyên dụng với những ứng dụng thực tế ngay lập tức.
Đi trước AI
Để biết thêm thông tin về nghiên cứu AI, tài liệu AI và những đột phá về công nghệ, hãy truy cập AI Buzz Wire.
Đọc thêm tin tức về AI →
