Οι ερευνητές της Baidu έχουν αναπτύξει ένα μοντέλο οπτικής αναγνώρισης χαρακτήρων (OCR) ικανό να επεξεργάζεται δεκάδες σελίδες εγγράφων σε ένα μόνο πέρασμα συμπερασμάτων διατηρώντας παράλληλα σταθερή χρήση μνήμης και σταθερή ταχύτητα. Το σύστημα, που ονομάζεται Unlimited OCR, το επιτυγχάνει μέσω ενός νέου μηχανισμού προσοχής, εμπνευσμένου από τον τρόπο με τον οποίο οι άνθρωποι αντιγράφουν κείμενο με το χέρι, αντιπροσωπεύοντας μια σημαντική πρόοδο στην τεχνητή νοημοσύνη εγγράφων. Για τις τελευταίες εξελίξεις στην έρευνα και την τεχνολογία AI, επισκεφτείτε το AI Buzz Wire.
Ξεπερνώντας τη συμφόρηση της προσωρινής μνήμης KV
Τα τρέχοντα συστήματα OCR από άκρο σε άκρο που χρησιμοποιούν μοντέλα γλώσσας ως αποκωδικοποιητές τους αντιμετωπίζουν έναν θεμελιώδη αρχιτεκτονικό περιορισμό. Καθώς ένα μοντέλο επεξεργάζεται κείμενο, αποθηκεύει πληροφορίες σχετικά με προηγούμενα επεξεργασμένα διακριτικά σε ένα buffer που ονομάζεται κρυφή μνήμη KV, επιτρέποντάς του να παραπέμπει σε παλαιότερο περιεχόμενο κατά τη διάρκεια της δημιουργίας. Αυτό το buffer μεγαλώνει με κάθε νέα γραμμή κειμένου, αυξάνοντας σταθερά την κατανάλωση μνήμης και επιβραδύνοντας την ταχύτητα παραγωγής.
Στην πράξη, τα υπάρχοντα συστήματα λειτουργούν γύρω από αυτό το σημείο συμφόρησης επεξεργάζοντας έγγραφα σελίδα προς σελίδα σε βρόχο, επαναφέροντας την προσωρινή μνήμη μετά την ολοκλήρωση κάθε σελίδας. Αυτή η προσέγγιση λειτουργεί, αλλά εισάγει αναποτελεσματικότητα και εμποδίζει το μοντέλο να διατηρεί το πλαίσιο πέρα από τα όρια της σελίδας. Κανένα τρέχον μοντέλο OCR δεν χειρίζεται περισσότερες από δέκα σελίδες σε ένα μόνο πέρασμα, σημειώνουν οι ερευνητές της Baidu στην τεχνική τους έκθεση.
Το απεριόριστο OCR εξαλείφει εντελώς αυτόν τον περιορισμό. Με τον επανασχεδιασμό του μηχανισμού προσοχής που διέπει τον τρόπο με τον οποίο το μοντέλο έχει πρόσβαση στην κρυφή μνήμη του, το σύστημα διατηρεί σταθερή τη χρήση της μνήμης ανεξάρτητα από το πόσες σελίδες επεξεργάζεται.
Πώς λειτουργεί το συρόμενο παράθυρο αναφοράς Προσοχή
Η βασική καινοτομία είναι αυτό που η ομάδα της Baidu ονομάζει Reference Sliding Window Attention (R-SWA). Ο μηχανισμός βασίζεται σε μια απλή αλλά ισχυρή εικόνα που αντλείται από μια ανθρώπινη αναλογία: όταν ένα άτομο αντιγράφει κείμενο από ένα βιβλίο, δεν ξαναδιαβάζει συνεχώς όλα όσα έχει ήδη γράψει. Αντίθετα, κρατούν την προσοχή τους εστιασμένη στο υλικό πηγής, στους τελευταίους χαρακτήρες που μετεγγράφησαν και στον επόμενο χαρακτήρα που θα γράψουν. Τα παλαιότερα αποσπάσματα ξεθωριάζουν φυσικά από την ενεργή μνήμη μέσω ενός είδους απαλής λήθης.
Η R-SWA εφαρμόζει αυτήν την αρχή αντιμετωπίζοντας διαφορετικούς τύπους διακριτικών με διαφορετικό τρόπο. Κάθε διακριτικό που δημιουργείται διατηρεί την πλήρη προσοχή σε όλα τα διακριτικά αναφοράς — τα διακριτικά οπτικής εικόνας που κωδικοποιούν το έγγραφο και την προτροπή επεξεργασίας. Αλλά όταν πρόκειται για κείμενο εξόδου που δημιουργήθηκε προηγουμένως, το μοντέλο ανατρέχει μόνο στα πιο πρόσφατα 128 διακριτικά.
Αυτός ο σχεδιασμός διατηρεί την κρυφή μνήμη KV σε σταθερό μέγεθος ίσο με το άθροισμα του μήκους του προθέματος και του μεγέθους του παραθύρου, ανεξάρτητα από το πόσο κείμενο έχει δημιουργηθεί. Η κρυφή μνήμη λειτουργεί ως ουρά, με κάθε νέο διακριτικό να σπρώχνει το παλαιότερο, αποτρέποντας την απεριόριστη ανάπτυξη της μνήμης που μαστίζει τους τυπικούς μηχανισμούς προσοχής.
Προστασία οπτικών πληροφοριών
Μια κρίσιμη επιλογή σχεδιασμού στο R-SWA είναι ο τρόπος με τον οποίο χειρίζεται οπτικά διακριτικά. Η τυπική προσοχή του συρόμενου παραθύρου θα υποβάλει όλα τα διακριτικά σε συνεχείς αλλαγές κατάστασης, θα θολώνουν σταδιακά τα χαρακτηριστικά της εικόνας και θα υποβαθμίζουν την ακρίβεια αναγνώρισης με την πάροδο του χρόνου. Το R-SWA εξαιρεί τα οπτικά διακριτικά από αυτές τις μεταβάσεις — κωδικοποιούνται μία φορά και παραμένουν αμετάβλητα σε όλη τη διαδικασία αποκωδικοποίησης.
Αυτή η διατήρηση των οπτικών πληροφοριών είναι απαραίτητη για την ακρίβεια OCR. Διατηρώντας ανέπαφη την αρχική αναπαράσταση της εικόνας, περιορίζοντας παράλληλα το πόσο πίσω φαίνεται το μοντέλο στη δική του έξοδο, το R-SWA επιτυγχάνει το καλύτερο και των δύο κόσμων: σταθερή χρήση μνήμης και αξιόπιστη αναγνώριση κειμένου.
Αρχιτεκτονική και Εκπαίδευση
Το απεριόριστο OCR είναι χτισμένο πάνω από το μοντέλο ανοιχτού κώδικα Deepseek OCR. Η Baidu διατηρεί τον DeepEncoder της, ο οποίος συμπιέζει μια εικόνα PDF 1024 επί 1024 pixel σε 256 διακριτικά και τη συνδυάζει με μια αρχιτεκτονική μείγματος ειδικών (MoE). Ο αποκωδικοποιητής έχει τρία δισεκατομμύρια συνολικές παραμέτρους, αλλά μόνο περίπου 500 εκατομμύρια είναι ενεργές κατά την εξαγωγή συμπερασμάτων, διατηρώντας το υπολογιστικό κόστος διαχειρίσιμο.
Το σύστημα προσφέρει δύο λειτουργίες ανάλυσης. Η βασική λειτουργία είναι βελτιστοποιημένη για έγγραφα πολλών σελίδων, ενώ η λειτουργία Gundam χρησιμοποιεί δυναμική ανάλυση για επεξεργασία μιας σελίδας. Κάθε τυπικό επίπεδο προσοχής στον αποκωδικοποιητή αντικαταστάθηκε με R-SWA.
Η εκπαίδευση διεξήχθη σε περίπου δύο εκατομμύρια δείγματα εγγράφων, χωρισμένα εννέα προς ένα μεταξύ μονοσελίδων και πολυσέλιδων δεδομένων. Το PaddleOCR χειριζόταν σχολιασμούς για μεμονωμένες σελίδες, ενώ τα δεδομένα πολλών σελίδων κατασκευάστηκαν συνθετικά με τη συρραφή μεμονωμένων σελίδων σε έγγραφα που κυμαίνονται από δύο έως πενήντα σελίδες. Όλα τα δεδομένα εκπαίδευσης συσκευάστηκαν σε ακολουθίες 32.000 μάρκων και η εκπαίδευση διεξήχθη για 4.000 βήματα σε 8 σετ 16 GPU της Nvidia A800. Το DeepEncoder παρέμεινε παγωμένο καθ' όλη τη διάρκεια της εκπαίδευσης, με μόνο τις παραμέτρους του μοντέλου γλώσσας να ενημερώνονται.
Αποτελέσματα συγκριτικής αξιολόγησης
Το απεριόριστο OCR επιτυγχάνει ισχυρή απόδοση σε πολλαπλές μετρήσεις αξιολόγησης. Στο σημείο αναφοράς εγγράφων OmniDocBench v1.5, το μοντέλο κερδίζει συνολικά 93 τοις εκατό, έξι ποσοστιαίες μονάδες πάνω από τη γραμμή βάσης Deepseek OCR.
Στην κρίσιμη δοκιμή μεγάλου ορίζοντα — όπου το μοντέλο επεξεργάζεται πολλές σελίδες με ένα μόνο πέρασμα — το ποσοστό σφάλματος παραμένει κάτω από 0,11 ακόμη και πέρα από τις 40 σελίδες. Οι ερευνητές αποδίδουν τα εναπομείναντα σφάλματα όχι στο χαμένο πλαίσιο αλλά στο όριο ανάλυσης του DeepEncoder στη λειτουργία Βάσης, όπου το εξαιρετικά μικρό κείμενο γίνεται δύσκολο να αναγνωριστεί.
Το παράθυρο περιορισμένης προσοχής αποφέρει επίσης ένα απροσδόκητο όφελος. Σε έγγραφα μιας σελίδας, ο περιορισμός του παραθύρου σε 128 διακριτικά δεν βλάπτει την ακρίβεια και την βελτιώνει ελαφρώς. Οι ερευνητές υποθέτουν ότι το R-SWA αναγκάζει το μοντέλο να εστιάζει πιο σφιχτά στην εργασία πυκνής OCR, ενώ η πλήρης προσοχή τείνει προς την απόκλιση καθώς το μήκος εξόδου αυξάνεται.
Οι βελτιώσεις στην ταχύτητα είναι εξίσου αξιοσημείωτες. Στη λειτουργία Base, το Unlimited OCR επιτυγχάνει 5.580 tokens ανά δευτερόλεπτο σε σύγκριση με 4.951 για το Deepseek OCR, βελτίωση 12,7%. Σε θεωρητικές συγκρίσεις άνω ορίου με ιδανικό παραλληλισμό, το μοντέλο οδηγεί στη γραμμή βάσης κατά 35 τοις εκατό σε περίπου 6.000 διακριτικά εξόδου.
Ευρύτερη σημασία
Η αρχιτεκτονική Unlimited OCR επιδεικνύει μια αρχή με συνέπειες πέρα από την επεξεργασία εγγράφων. Η ιδέα της διατήρησης της μνήμης σταθερή μέσω επιλεκτικής προσοχής - εμπνευσμένη από τη γνωστική επιστήμη και όχι από την καθαρή κλιμάκωση - θα μπορούσε να συμβάλει στη σχεδίαση πιο αποτελεσματικών συστημάτων τεχνητής νοημοσύνης σε μια σειρά εφαρμογών.
Καθώς οι οργανισμοί παλεύουν με το υπολογιστικό κόστος της ανάπτυξης μεγάλων μοντέλων γλώσσας, οι προσεγγίσεις που μειώνουν την κατανάλωση μνήμης χωρίς να θυσιάζουν την ποιότητα είναι όλο και πιο πολύτιμες. Το έργο του Baidu προτείνει ότι οι βιολογικές μεταφορές, όταν μεταφράζονται σε μαθηματικούς μηχανισμούς, μπορούν να αποφέρουν πρακτικές ανακαλύψεις μηχανικής.
Η έρευνα υπογραμμίζει επίσης την αυξανόμενη επιρροή της Κίνας στη θεμελιώδη έρευνα AI. Ενώ μεγάλη προσοχή έχει επικεντρωθεί στα κινεζικά επιτεύγματα σε μεγάλα γλωσσικά μοντέλα, εργασίες όπως το Unlimited OCR καταδεικνύουν ότι οι Κινέζοι ερευνητές συνεισφέρουν επίσης σημαντικά σε εξειδικευμένα συστήματα AI με άμεσες πρακτικές εφαρμογές.
Μείνετε μπροστά από την τεχνητή νοημοσύνη
Για περισσότερη κάλυψη της έρευνας της τεχνητής νοημοσύνης, της τεχνητής νοημοσύνης εγγράφων και των τεχνολογικών ανακαλύψεων, επισκεφτείτε το AI Buzz Wire.
Διαβάστε περισσότερα νέα AI →
