Το DeepSeek κυκλοφόρησε το DSpark, ένα κερδοσκοπικό πλαίσιο αποκωδικοποίησης ανοιχτού κώδικα που η εταιρεία λέει ότι επιταχύνει την εξαγωγή συμπερασμάτων μεγάλων γλωσσικών μοντέλων (LLM) έως και 85% υπό ζωντανή κίνηση, χωρίς καμία απώλεια στην ποιότητα εξόδου. Όπως περιγράφεται σε μια νέα εργασία από το DeepSeek-AI και το Πανεπιστήμιο του Πεκίνου, το σύστημα εκτελείται ήδη εντός της υποδομής εξυπηρέτησης DeepSeek-V4 που χειρίζεται πραγματικά αιτήματα χρηστών.
Η εργασία αντιμετωπίζει ένα από τα πιο επίμονα προβλήματα στην παραγωγή τεχνητής νοημοσύνης: η εξαγωγή συμπερασμάτων είναι αργή επειδή τα μοντέλα δημιουργούν κείμενο ένα διακριτικό τη φορά, καθένα από τα οποία απαιτεί πλήρη διέλευση μέσω του δικτύου. Η κερδοσκοπική αποκωδικοποίηση είναι μια δημοφιλής λύση στην οποία ένα μικρό, γρήγορο μοντέλο "πρόχειρο" προτείνει ένα μπλοκ διακριτικών που το μοντέλο πλήρους μεγέθους επαληθεύει στη συνέχεια σε ένα μόνο πέρασμα, αποδεχόμενο το μεγαλύτερο σωστό πρόθεμα. Επειδή η επαλήθευση είναι παράλληλη και μαθηματικά ακριβής, επιταχύνει τα πράγματα διατηρώντας παράλληλα την κατανομή του αρχικού μοντέλου. Το DSpark, που κυκλοφόρησε παράλληλα με το αποθετήριο εκπαίδευσης DeepSpec στο GitHub, έγινε γρήγορα μια από τις πιο πολυσυζητημένες ιστορίες μηχανικής τεχνητής νοημοσύνης στο Hacker News. For more context on this story, see our ongoing AI news.
Γιατί η υπάρχουσα κερδοσκοπική αποκωδικοποίηση χτυπά σε τοίχο
Η πρόσφατη κερδοσκοπική έρευνα αποκωδικοποίησης έχει κινηθεί προς «παράλληλους συντάκτες» που δημιουργούν ένα ολόκληρο μπλοκ υποψήφιων διακριτικών σε ένα μόνο εμπρός πέρασμα, καθιστώντας τον λανθάνοντα χρόνο πρόχειρου σχεδόν ανεξάρτητο από το μέγεθος του μπλοκ. Το έγγραφο DSpark εντοπίζει δύο σημεία συμφόρησης που εμπόδισαν αυτές τις μεθόδους να εκπληρώσουν την υπόσχεσή τους σε κλίμακα.
Το πρώτο είναι πρόβλημα ποιότητας. Επειδή οι παράλληλοι συντάκτες προβλέπουν κάθε θέση ανεξάρτητα, δεν μπορούν να μοντελοποιήσουν πώς τα διακριτικά μέσα σε ένα μπλοκ εξαρτώνται το ένα από το άλλο. Οι ερευνητές δείχνουν ότι αυτό οδηγεί σε "πολυτροπικές συγκρούσεις" και ταχεία αποσύνθεση αποδοχής σε μεταγενέστερες θέσεις σε ένα μπλοκ βύθισης, ένα φαινόμενο που αποκαλούν αποσύνθεση επιθήματος. Όσο μεγαλύτερο είναι το παράλληλο μπλοκ, τόσο πιο πιθανό είναι η ουρά του να είναι λάθος.
Το δεύτερο είναι πρόβλημα σε επίπεδο συστήματος. Ενώ η δημιουργία μπλοκ μεγάλου βυθίσματος είναι φθηνή, η τυφλή επαλήθευση κάθε προτεινόμενου διακριτικού σπαταλά τη σπάνια χωρητικότητα παρτίδας σε μάρκες που ενδέχεται να απορριφθούν. Κάτω από την υψηλή ταυτόχρονη χρήση ενός πραγματικού συστήματος εξυπηρέτησης, το ιδανικό μήκος επαλήθευσης ποικίλλει κατά μήκος δύο αξόνων: δομημένα αιτήματα όπως ο κώδικας διατηρούν υψηλότερα ποσοστά αποδοχής από τη συνομιλία ανοιχτού τύπου και η επαλήθευση επιπλέον διακριτικών είναι σχεδόν δωρεάν υπό ελαφρύ φορτίο αλλά ακριβή όταν το σύστημα είναι κορεσμένο.
Ένα Ημι-Αυτοπαλινδρομικό Πρόχειρο Μοντέλο
Για να διορθώσει την αποσύνθεση των επιθημάτων, το DSpark υιοθετεί αυτό που οι συγγραφείς αποκαλούν ημι-αυτοπαλινδρομική αρχιτεκτονική. Συνδυάζει μια υπολογιστικά βαριά παράλληλη ραχοκοκαλιά, η οποία μπορεί να προτείνει πολλά διακριτικά ταυτόχρονα, με μια ελαφριά διαδοχική μονάδα που εισάγει μοντελοποίηση εξάρτησης εντός μπλοκ. Ο σχεδιασμός προορίζεται να συνδυάσει την υψηλή χωρητικότητα των παράλληλων μοντέλων σε πρώιμες θέσεις με την κατάληξη συνοχής των παραδοσιακών αυτοπαλινδρομικών συντακτών, τα οποία δημιουργούν διακριτικά το ένα μετά το άλλο και φυσικά σέβονται τις εξαρτήσεις.
Σε ελεγχόμενα σημεία αναφοράς εκτός σύνδεσης που καλύπτουν τη μαθηματική συλλογιστική, τη δημιουργία κώδικα και την καθημερινή συνομιλία, η ομάδα αναφέρει ότι το DSpark βελτιώνει σημαντικά την αποδεκτή διάρκεια ανά κύκλο επαλήθευσης σε ισχυρές γραμμές βάσης. Συγκεκριμένα, η δημοσίευση αναφέρει ότι το DSpark βελτιώνει το αποδεκτό μήκος σε σχέση με το αυτοπαλινδρομικό σχέδιο Eagle3 κατά 30,9%, 26,7% και 30,0% σε τρεις ρυθμίσεις και σε σχέση με το παράλληλο σχέδιο DFlash κατά 16,3%, 18,4% και 18,3%.
Προγραμματισμένη επαλήθευση εμπιστοσύνης, με επίγνωση του φορτίου
Το πιο πρωτότυπο μισό του DSpark είναι η προσέγγισή του στην επαλήθευση. Αντί να επαληθεύει έναν σταθερό αριθμό πρόχειρων διακριτικών για κάθε αίτημα, το DSpark διατυπώνει την επιλογή μήκους επαλήθευσης ως πρόβλημα μεγιστοποίησης συνολικής απόδοσης. Συνδυάζει βαθμονομημένες εκτιμήσεις για το πόσο πιθανό είναι να επιβιώσει το πρόθεμα ενός πρόχειρου, αυτό που η εφημερίδα ονομάζει πιθανότητες επιβίωσης, με έναν προγραμματιστή με επίγνωση υλικού που διαβάζει το φορτίο του κινητήρα σε πραγματικό χρόνο.
Το αποτέλεσμα είναι η προγραμματισμένη επαλήθευση εμπιστοσύνης: το σύστημα προσαρμόζει δυναμικά πόσα διακριτικά επαληθεύει για κάθε αίτημα με βάση τόσο το περιεχόμενο του αιτήματος όσο και την τρέχουσα κατάσταση της μηχανής εξυπηρέτησης. Κάτω από ελαφρά φορτία μπορεί να αντέξει οικονομικά να επαληθεύει γενναιόδωρα, ενώ υπό έντονο συγχρονισμό δρομολογεί τον προϋπολογισμό επαλήθευσης του μοντέλου στόχου μόνο προς μάρκες με την υψηλότερη αναμενόμενη απόδοση, αποφεύγοντας την κατάρρευση της απόδοσης που προέρχεται από τη δαπάνη χωρητικότητας παρτίδας σε διακριτικά χαμηλής πιθανότητας.
Αποτελέσματα κάτω από Ζωντανή επισκεψιμότητα χρηστών
Οι πιο σημαντικοί αριθμοί προέρχονται από την παραγωγή. Η ομάδα ανέπτυξε το DSpark μέσα στο σύστημα εξυπηρέτησης DeepSeek-V4 που εξυπηρετεί ζωντανή κίνηση χρηστών και το συνέκρινε με την προηγούμενη γραμμή παραγωγής της εταιρείας, μια μέθοδο πρόβλεψης πολλαπλών σημείων γνωστή ως MTP-1.
Σύμφωνα με το έγγραφο, το DSpark επιταχύνει σταθερά τις ταχύτητες παραγωγής ανά χρήστη κατά 60% έως 85% για το DeepSeek-V4-Flash και από 57% έως 78% για το DeepSeek-V4-Pro σε αντίστοιχη συνολική απόδοση. Στο πλαίσιο αυστηρών συμφωνιών σε επίπεδο υπηρεσιών όπου η χωρητικότητα της γραμμής βάσης επιδεινώνεται σοβαρά, που ισοδυναμεί με 120 tokens ανά δευτερόλεπτο για το Flash και 50 tokens ανά δευτερόλεπτο για το Pro, το DSpark μειώνει τα έξοδα επαλήθευσης για να διατηρήσει ισχυρή απόδοση. Ξεπερνώντας αυτόν τον γκρεμό απόδοσης, οι συγγραφείς υποστηρίζουν ότι ξεκλειδώνει αυστηρά επίπεδα διαδραστικότητας που ήταν προηγουμένως ανέφικτα, μετατοπίζοντας ουσιαστικά τα σύνορα Pareto του LLM που εξυπηρετούν προς τα έξω.
Αυτή η διάκριση έχει σημασία για τους χειριστές. Μια μεγαλύτερη ταχύτητα ανά χρήστη με την ίδια συνολική απόδοση σημαίνει πιο ανταποκρινόμενους βοηθούς και πρακτικές ροές εργασίας χωρίς να αγοράζετε περισσότερο υλικό, ενώ η επιβίωση των αυστηρών SLA λανθάνοντος χρόνου υπό φόρτωση είναι αυτό που διαχωρίζει μια δοκιμαστική παρουσίαση έρευνας από ένα σύστημα που μπορεί να αντέξει κατά τη διάρκεια αυξήσεων της κυκλοφορίας.
Ανοιχτό κώδικα για την Κοινότητα
Η DeepSeek κυκλοφορεί τα εκπαιδευμένα σημεία ελέγχου DSpark και για τα μοντέλα προεπισκόπησης DeepSeek-V4-Flash και DeepSeek-V4-Pro. Το συνοδευτικό αποθετήριο DeepSpec, το οποίο δημοσιεύεται με την άδεια MIT, περιγράφεται ως μια πλήρης στοίβας, βασισμένη σε αλγόριθμους εκπαίδευσης και βάσης κωδικών αξιολόγησης για κερδοσκοπική αποκωδικοποίηση. Περιλαμβάνει βοηθητικά προγράμματα προετοιμασίας δεδομένων, υλοποιήσεις πρόχειρων μοντέλων, σενάρια εκπαίδευσης και πλεξούδες αξιολόγησης και αποστέλλονται με τρεις αλγόριθμους πρόχειρων μοντέλων: DSpark, DFlash και Eagle3.
Η έκδοση μειώνει το εμπόδιο για άλλα εργαστήρια και ομάδες υποδομής να εκπαιδεύουν και να συγκρίνουν τα δικά τους πρόχειρα μοντέλα έναντι ενός τυποποιημένου αγωγού. Η σουίτα αξιολόγησης της DeepSpec καλύπτει καθιερωμένα σημεία αναφοράς, όπως τα GSM8K, MATH500, AIME 2025, HumanEval, MBPP, LiveCodeBench, MT-Bench, AlpacaEval και Arena-Hard-v2.
Γιατί έχει σημασία
Το κόστος συμπερασμάτων και η καθυστέρηση είναι πλέον μεταξύ των καθοριστικών περιορισμών του κλάδου της τεχνητής νοημοσύνης, διαμορφώνοντας τα πάντα, από το πόσο επιθετικά οι εταιρείες αναπτύσσουν πράκτορες τεχνητής νοημοσύνης έως το αν οι μικρότεροι πάροχοι μπορούν να ανταγωνιστούν τους υπερκλιμάκωτους στα οικονομικά στοιχεία. Η συνεισφορά του DSpark είναι λιγότερο ένας νέος αλγόριθμος παρά μια επίδειξη ότι ο προσεκτικός συν-σχεδιασμός του πρόχειρου μοντέλου και του χρονοπρογραμματιστή επαλήθευσης, και η αντιμετώπιση του μήκους επαλήθευσης ως συνάρτηση της ζωντανής κατάστασης του συστήματος, μπορεί να μετακινήσει ουσιαστικά τη βελόνα σε πραγματικές αναπτύξεις.
Για την DeepSeek, η οποία έχει χτίσει τη φήμη της σε αποτελεσματικά, ανοιχτά κυκλοφορούντα συστήματα, το DSpark είναι ένα άλλο σημείο δεδομένων σε ένα επιχείρημα που το εργαστήριο έχει κάνει για περισσότερο από ένα χρόνο: ότι η απόδοση εξυπηρέτησης οριακής ποιότητας μπορεί να επιτευχθεί μέσω πιο έξυπνης μηχανικής και όχι μόνο μέσω ακατέργαστων υπολογισμών. Το γεγονός ότι τα κέρδη μετρήθηκαν υπό ζωντανή κίνηση, αντί σε συνθετικό σημείο αναφοράς, καθιστά ευκολότερο το αποτέλεσμα για άλλους χειριστές να λάβουν σοβαρά υπόψη τους, καθώς η κοινότητα ανοιχτού κώδικα αφομοιώνει το χαρτί και αρχίζει να αναπαράγει τους αριθμούς.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →

