นักวิจัยของ Baidu ได้พัฒนาโมเดลการรู้จำอักขระด้วยแสง (OCR) ที่สามารถประมวลผลหน้าเอกสารหลายสิบหน้าในการอนุมานเพียงครั้งเดียว ในขณะที่ยังคงใช้หน่วยความจำคงที่และความเร็วที่สม่ำเสมอ ระบบที่เรียกว่า Unlimited OCR บรรลุเป้าหมายนี้ผ่านกลไกความสนใจแบบใหม่ที่ได้รับแรงบันดาลใจจากการที่มนุษย์คัดลอกข้อความด้วยมือ ซึ่งแสดงถึงความก้าวหน้าครั้งสำคัญใน AI ของเอกสาร สำหรับการพัฒนาล่าสุดในการวิจัยและเทคโนโลยี AI โปรดไปที่ AI Buzz Wire

เอาชนะปัญหาคอขวดของแคช KV

ระบบ OCR แบบ end-to-end ปัจจุบันที่ใช้โมเดลภาษาเป็นตัวถอดรหัสเผชิญกับข้อจำกัดทางสถาปัตยกรรมขั้นพื้นฐาน ในขณะที่โมเดลประมวลผลข้อความ โมเดลจะจัดเก็บข้อมูลเกี่ยวกับโทเค็นที่ประมวลผลก่อนหน้านี้ไว้ในบัฟเฟอร์ที่เรียกว่าแคช KV ซึ่งช่วยให้สามารถอ้างอิงเนื้อหาก่อนหน้าระหว่างการสร้างได้ บัฟเฟอร์นี้เพิ่มขึ้นพร้อมกับข้อความใหม่ทุกบรรทัด ทำให้ใช้หน่วยความจำเพิ่มขึ้นอย่างต่อเนื่องและทำให้ความเร็วในการสร้างช้าลง

ในทางปฏิบัติ ระบบที่มีอยู่จะแก้ไขปัญหาคอขวดนี้โดยการประมวลผลเอกสารทีละหน้าแบบวนซ้ำ และรีเซ็ตแคชหลังจากแต่ละหน้าเสร็จสมบูรณ์ แนวทางนี้ใช้งานได้แต่ทำให้เกิดความไร้ประสิทธิภาพและป้องกันไม่ให้โมเดลรักษาบริบทข้ามขอบเขตของหน้า ไม่มีโมเดล OCR ในปัจจุบันที่สามารถจัดการได้มากกว่าประมาณสิบหน้าในการผ่านครั้งเดียว นักวิจัยของ Baidu ระบุไว้ในรายงานทางเทคนิคของพวกเขา

OCR แบบไม่จำกัดจะขจัดข้อจำกัดนี้โดยสิ้นเชิง ด้วยการออกแบบกลไกความสนใจที่ควบคุมวิธีที่โมเดลเข้าถึงแคช ระบบจะรักษาการใช้หน่วยความจำให้คงที่ไม่ว่าจะประมวลผลกี่เพจก็ตาม

วิธีการทำงานของความสนใจหน้าต่างบานเลื่อนอ้างอิง

นวัตกรรมที่สำคัญคือสิ่งที่ทีมงาน Baidu เรียกว่า Reference Slide Window Attention (R-SWA) กลไกนี้สร้างขึ้นจากความเข้าใจที่เรียบง่ายแต่ทรงพลังจากการเปรียบเทียบของมนุษย์: เมื่อบุคคลคัดลอกข้อความจากหนังสือ พวกเขาจะไม่ได้อ่านซ้ำทุกสิ่งที่พวกเขาเขียนไปแล้วอย่างต่อเนื่อง แต่พวกเขามุ่งความสนใจไปที่เนื้อหาต้นฉบับ อักขระสองสามตัวสุดท้ายที่ถอดเสียง และอักขระถัดไปที่จะจดบันทึก ข้อความเก่าๆ จะค่อยๆ จางหายไปจากความทรงจำที่ตื่นตัวผ่านการลืมอย่างนุ่มนวล

R-SWA นำหลักการนี้ไปใช้โดยปฏิบัติต่อโทเค็นประเภทต่างๆ ที่แตกต่างกัน โทเค็นที่สร้างขึ้นแต่ละรายการจะให้ความสนใจอย่างเต็มที่กับโทเค็นอ้างอิงทั้งหมด — โทเค็นรูปภาพที่เข้ารหัสเอกสารและพร้อมท์การประมวลผล แต่เมื่อพูดถึงข้อความเอาต์พุตที่สร้างขึ้นก่อนหน้านี้ โมเดลจะมองย้อนกลับไปที่โทเค็น 128 รายการล่าสุดเท่านั้น

การออกแบบนี้ทำให้แคช KV มีขนาดคงที่เท่ากับผลรวมของความยาวคำนำหน้าและขนาดหน้าต่าง โดยไม่คำนึงถึงจำนวนข้อความที่ถูกสร้างขึ้น แคชทำหน้าที่เป็นคิว โดยแต่ละโทเค็นใหม่จะดันโทเค็นที่เก่าที่สุดออกมา ช่วยป้องกันการเติบโตของหน่วยความจำที่ไม่จำกัดซึ่งรบกวนกลไกความสนใจมาตรฐาน

การปกป้องข้อมูลภาพ

ตัวเลือกการออกแบบที่สำคัญใน R-SWA คือวิธีจัดการกับโทเค็นภาพ ความสนใจของหน้าต่างบานเลื่อนมาตรฐานจะทำให้โทเค็นทั้งหมดมีการเปลี่ยนแปลงสถานะอย่างต่อเนื่อง โดยจะค่อยๆ ทำให้คุณสมบัติของภาพเบลอ และความแม่นยำในการจดจำจะลดลงเมื่อเวลาผ่านไป R-SWA ยกเว้นโทเค็นภาพจากการเปลี่ยนแปลงเหล่านี้ โดยจะมีการเข้ารหัสเพียงครั้งเดียวและยังคงไม่เปลี่ยนแปลงตลอดกระบวนการถอดรหัสทั้งหมด

การเก็บรักษาข้อมูลภาพถือเป็นสิ่งสำคัญสำหรับความแม่นยำของ OCR ด้วยการรักษาการแสดงภาพต้นฉบับให้คงอยู่ ในขณะเดียวกันก็จำกัดระยะการมองย้อนกลับไปของโมเดลในเอาท์พุตของตัวเอง R-SWA บรรลุสิ่งที่ดีที่สุดของทั้งสองโลก: การใช้หน่วยความจำที่เสถียรและการจดจำข้อความที่เชื่อถือได้

สถาปัตยกรรมและการฝึกอบรม

OCR แบบไม่จำกัดสร้างขึ้นจากโมเดล Deepseek OCR แบบโอเพ่นซอร์ส Baidu ยังคงไว้ซึ่ง DeepEncoder ซึ่งบีบอัดรูปภาพ PDF ขนาด 1024 x 1024 พิกเซลเหลือเพียง 256 โทเค็น และจับคู่กับสถาปัตยกรรมแบบผสมของผู้เชี่ยวชาญ (MoE) ตัวถอดรหัสมีพารามิเตอร์ทั้งหมดสามพันล้านพารามิเตอร์ แต่มีเพียงประมาณ 500 ล้านพารามิเตอร์ที่ใช้งานอยู่ในระหว่างการอนุมาน ทำให้ต้นทุนการคำนวณสามารถจัดการได้

ระบบมีโหมดความละเอียดสองโหมด โหมดพื้นฐานได้รับการปรับให้เหมาะสมสำหรับเอกสารหลายหน้า ในขณะที่โหมด Gundam จะใช้ความละเอียดแบบไดนามิกสำหรับการประมวลผลหน้าเดียว ทุกชั้นความสนใจมาตรฐานในตัวถอดรหัสถูกแทนที่ด้วย R-SWA

การฝึกอบรมดำเนินการกับตัวอย่างเอกสารประมาณสองล้านตัวอย่าง โดยแบ่ง 9 ต่อ 1 ระหว่างข้อมูลหน้าเดียวและหลายหน้า PaddleOCR จัดการคำอธิบายประกอบสำหรับหน้าเดียว ในขณะที่ข้อมูลหลายหน้าถูกสร้างขึ้นแบบสังเคราะห์โดยการต่อหน้าเดียวเข้าด้วยกันเป็นเอกสารตั้งแต่สองถึงห้าสิบหน้า ข้อมูลการฝึกทั้งหมดอัดแน่นอยู่ในลำดับโทเค็น 32,000 โทเค็น และการฝึกดำเนินไป 4,000 ขั้นตอนบน Nvidia A800 GPU จำนวน 16 ชุด 8 ชุด DeepEncoder ยังคงค้างตลอดการฝึก โดยจะมีการอัปเดตเฉพาะพารามิเตอร์โมเดลภาษาเท่านั้น

ผลลัพธ์มาตรฐาน

OCR แบบไม่จำกัดทำให้ได้รับประสิทธิภาพที่แข็งแกร่งจากการวัดผลการประเมินหลายรายการ ในเกณฑ์มาตรฐานเอกสาร OmniDocBench v1.5 โมเดลดังกล่าวได้คะแนนโดยรวม 93 เปอร์เซ็นต์ ซึ่งสูงกว่าเกณฑ์พื้นฐาน Deepseek OCR หกเปอร์เซ็นต์

ในการทดสอบขอบข่ายยาวที่สำคัญ ซึ่งโมเดลประมวลผลหลายหน้าในการผ่านครั้งเดียว อัตราข้อผิดพลาดจะต่ำกว่า 0.11 แม้จะเกินกว่า 40 หน้าก็ตาม นักวิจัยถือว่าข้อผิดพลาดที่เหลืออยู่ไม่ได้สูญเสียบริบทไป แต่อยู่ที่ขีดจำกัดความละเอียดของ DeepEncoder ในโหมดฐาน ซึ่งข้อความที่มีขนาดเล็กมากกลายเป็นเรื่องยากที่จะจดจำ

กรอบเวลาความสนใจที่ถูกจำกัดยังให้ประโยชน์ที่ไม่คาดคิดอีกด้วย ในเอกสารหน้าเดียว การจำกัดหน้าต่างไว้ที่ 128 โทเค็นไม่ได้ทำให้ความแม่นยำลดลงแต่อย่างใด และยังปรับปรุงให้ดีขึ้นเล็กน้อยอีกด้วย นักวิจัยตั้งสมมติฐานว่า R-SWA บังคับให้แบบจำลองมุ่งเน้นไปที่งาน OCR ที่หนาแน่นมากขึ้น ในขณะที่ความสนใจอย่างเต็มที่มีแนวโน้มที่จะมีความแตกต่างเมื่อความยาวเอาต์พุตเพิ่มขึ้น

การปรับปรุงความเร็วก็มีความโดดเด่นไม่แพ้กัน ในโหมดพื้นฐาน OCR แบบไม่จำกัดได้รับโทเค็น 5,580 โทเค็นต่อวินาที เทียบกับ 4,951 สำหรับ Deepseek OCR ซึ่งเพิ่มขึ้น 12.7 เปอร์เซ็นต์ ในการเปรียบเทียบขอบเขตบนทางทฤษฎีกับความเท่าเทียมในอุดมคติ โมเดลดังกล่าวนำไปสู่เส้นฐาน 35 เปอร์เซ็นต์ที่โทเค็นเอาท์พุตประมาณ 6,000 รายการ

ความสำคัญที่กว้างขึ้น

สถาปัตยกรรม OCR แบบไม่จำกัดแสดงให้เห็นถึงหลักการที่มีความหมายมากกว่าการประมวลผลเอกสาร แนวคิดในการรักษาหน่วยความจำให้คงที่ด้วยความสนใจแบบเลือกสรร ซึ่งได้รับแรงบันดาลใจจากวิทยาศาสตร์เกี่ยวกับความรู้ความเข้าใจมากกว่าการปรับขนาดเพียงอย่างเดียว สามารถแจ้งการออกแบบระบบ AI ที่มีประสิทธิภาพมากขึ้นในแอปพลิเคชันต่างๆ ได้

ในขณะที่องค์กรต่างๆ ต้องดิ้นรนกับต้นทุนการคำนวณในการปรับใช้โมเดลภาษาขนาดใหญ่ แนวทางที่ลดการใช้หน่วยความจำโดยไม่กระทบต่อคุณภาพจึงมีคุณค่ามากขึ้น งานของไป่ตู้ชี้ให้เห็นว่าคำอุปมาอุปมัยทางชีวภาพเมื่อแปลเป็นกลไกทางคณิตศาสตร์สามารถก่อให้เกิดความก้าวหน้าทางวิศวกรรมเชิงปฏิบัติได้

การวิจัยยังเน้นย้ำถึงอิทธิพลที่เพิ่มขึ้นของจีนในการวิจัย AI ขั้นพื้นฐาน แม้ว่าความสนใจจะมุ่งเน้นไปที่ความสำเร็จของจีนในแบบจำลองภาษาขนาดใหญ่ แต่การทำงานอย่าง Unlimited OCR แสดงให้เห็นว่านักวิจัยชาวจีนยังมีส่วนสำคัญต่อระบบ AI เฉพาะด้านพร้อมการใช้งานจริงได้ทันที

ก้าวนำหน้า AI

หากต้องการความคุ้มครองเพิ่มเติมเกี่ยวกับการวิจัย AI, เอกสาร AI และความก้าวหน้าทางเทคโนโลยี โปรดไปที่ AI Buzz Wire

อ่านข่าว AI เพิ่มเติม →