Ένας ανεξάρτητος προγραμματιστής έχει αποδείξει ότι το μοντέλο V4 Flash της DeepSeek, ένα σύστημα μείγματος ειδικών 304 δισεκατομμυρίων παραμέτρων, μπορεί να τρέξει στην παραγωγή σε μία μόνο GPU AMD MI300X, επιτυγχάνοντας 168,6 tokens ανά δευτερόλεπτο σε αποκωδικοποίηση single-stream χωρίς καμία κβαντοποίηση ή εκφόρτωση βάρους. Η εργασία, που δημοσιεύτηκε στο GitHub και εμφανίστηκε στην κορυφή του Hacker News στις 4 Αυγούστου 2026, προσφέρει την πιο ξεκάθαρη απόδειξη μέχρι τώρα ότι το υλικό της AMD μπορεί να εξυπηρετήσει ένα ανοιχτό μοντέλο συνοριακής κλίμακας χωρίς να βασίζεται στην Nvidia.

Το αποθετήριο, που διατηρεί ο προγραμματιστής Ryan Zhou, περιλαμβάνει μια πλήρη στοίβα Docker Compose, καρφιτσωμένες επικαλύψεις αρχείων και πίνακες συντονισμού για την εκτέλεση του σημείου ελέγχου DeepSeek-V4-Flash-0731 σε ένα MI300X. Για τους αναγνώστες που παρακολουθούν τις ενημερωτικές ειδήσεις AI στον πόλεμο των τσιπ μεταξύ AMD και Nvidia, το αποτέλεσμα είναι σημαντικό επειδή αμφισβητεί την υπόθεση ότι η εξαγωγή συνόρων απαιτεί το πιο πρόσφατο και ακριβότερο υλικό της Nvidia.

Οι αριθμοί

Η συγκριτική απόδοση, που μετράται σε μια καρφιτσωμένη στοίβα λογισμικού χρησιμοποιώντας τη νυχτερινή έκδοση ROCm του vLLM, λέει μια συναρπαστική ιστορία για το τι μπορεί να κάνει ένας μεμονωμένος επιταχυντής AMD:

  • Αποκωδικοποίηση μιας ροής: 168,6 μάρκες ανά δευτερόλεπτο, αρκετά γρήγορα για συνομιλία σε πραγματικό χρόνο και φόρτους εργασίας με πράκτορες.
  • Διακίνηση προπλήρωσης: περίπου 7.900 έως 8.500 μάρκες ανά δευτερόλεπτο με συντονισμένους πυρήνες, που σημαίνει ότι οι μεγάλες προτροπές υποβάλλονται σε επεξεργασία σε πολύ λιγότερο από ένα δευτερόλεπτο.
  • Οκτώ ταυτόχρονες ροές: 542 μάρκες ανά δευτερόλεπτο σύνολο, με 90,3 μάρκες ανά δευτερόλεπτο ανά ροή.
  • 64-stream burst: 830 tokens ανά δευτερόλεπτο σύνολο, χωρίς σφάλματα εκτός μνήμης και χωρίς αστοχίες κινητήρα.
  • Μήκος περιβάλλοντος: 256.000 διακριτικά επικυρωμένα σε δοκιμές, με την αρχιτεκτονική να υποστηρίζει έως και ένα εκατομμύριο.

Ολόκληρο το μοντέλο καταλαμβάνει 156,67 gigabyte μνήμης υψηλού εύρους ζώνης, που χωράει εξ ολοκλήρου στη δεξαμενή HBM3 των 192 gigabyte του MI300X. Δεν χρειάστηκε επιπλέον κβαντισμός ή εκφόρτωση βάρους, γεγονός που διατηρεί την πλήρη ακρίβεια του μοντέλου.

Γιατί λειτουργεί το MI300X

Το AMD MI300X διαθέτει δύο χαρακτηριστικά που καθιστούν δυνατή την ανάπτυξη μιας μονάδας GPU ενός μοντέλου τόσο μεγάλη. Διαθέτει 192 gigabyte μνήμης HBM3, 2,4 φορές τη χωρητικότητα ενός Nvidia H100 SXM5 και 5,3 terabyte ανά δευτερόλεπτο εύρους ζώνης μνήμης. Μια ξεχωριστή εγγραφή από έναν προγραμματιστή που προσδιορίστηκε ως Fergus Finn, η οποία έθεσε τις βάσεις για αυτήν την ανάπτυξη, υπολόγισε ότι το MI300X κοστίζει περίπου το μισό από το συγκρίσιμο υλικό Nvidia στην τιμή καταλόγου.

Για αυτό το συγκεκριμένο σημείο ελέγχου 304 δισεκατομμυρίων παραμέτρων, η χωρητικότητα της μνήμης είναι ο καθοριστικός παράγοντας. Το μοντέλο χωράει εξ ολοκλήρου στη μνήμη του τσιπ, αφήνοντας χώρο για μια ομάδα μνήμης cache κλειδιού-τιμής GPU 20 gigabyte και μια βαθμίδα CPU 96 gigabyte για καταχωρήσεις προσωρινής μνήμης προθέματος που έχουν εξαλειφθεί. Μία κάρτα μπορεί να χειριστεί δύο έως οκτώ τυπικές ταυτόχρονες ροές και εκρήξεις έως και 64 ροών, κάτι που είναι αρκετό για πολλούς φόρτους εργασίας συμπερασμάτων παραγωγής.

Τα εμπόδια της μηχανικής

Η εκτέλεση του DeepSeek V4 Flash στο MI300X δεν ήταν απλή. Η επίσημη συνταγή vLLM καλύπτει το υλικό Nvidia και τις νεότερες GPU της AMD, όπως τα MI325X και MI355X, αλλά όχι μια διαμόρφωση παραγωγής μεμονωμένων MI300X για το σημείο ελέγχου της 31ης Ιουλίου.

Το αποθετήριο καταγράφει αρκετά μηχανολογικά προβλήματα που έπρεπε να επιλυθούν. Το MI300X χρησιμοποιεί μια παραλλαγή της μορφής αριθμών FP8 που διαφέρει από το πρότυπο που χρησιμοποιείται από τα νεότερα τσιπ της AMD και έναν πυρήνα που υποθέτει ότι η λάθος σημασιολογία μπορεί να παράγει αποτελέσματα κατά δύο φορές. Ο προγραμματιστής έπρεπε επίσης να επιδιορθώσει τη δρομολόγηση συνδυασμού ειδικών σε υψηλή ταυτόχρονη επαλήθευση, αιτιολογική κερδοσκοπική επαλήθευση και συγχρονισμό κλειδιού-τιμής CPU, πολλά από τα οποία παραμένουν απροσδιόριστα στο upstream vLLM.

Το αποθετήριο προσθέτει επικαλύψεις ορθότητας, μια επικυρωμένη διαμόρφωση προβολής με κερδοσκοπική σύνταξη, πίνακες συντονισμού AITER GEMM για σχήματα τσιπ που έλειπαν από τους συσκευασμένους πίνακες και μια υβριδική στρατηγική κλειδιού-τιμής που συνδυάζει μια κρυφή μνήμη GPU με την εκφόρτωση CPU.

Τι σημαίνει για το Chip War

Η επίδειξη φτάνει σε μια κομβική στιγμή για τις φιλοδοξίες της AMD στο AI. Η Nvidia ελέγχει τη συντριπτική πλειοψηφία της αγοράς επιταχυντών τεχνητής νοημοσύνης, που υποστηρίζεται από το οικοσύστημα λογισμικού CUDA, το οποίο πολλοί προγραμματιστές βλέπουν ως τάφρο που η AMD δυσκολεύεται να διασχίσει. Η SemiAnalysis εξέτασε αυτό το ερώτημα απευθείας σε μια ανάλυση του Ιουλίου 2026 με τίτλο "Can AMD break the CUDA moat?" και η απάντηση παραμένει αμφισβητούμενη.

Αλλά έργα ανοιχτού κώδικα όπως αυτό το ένα τσιπ μακριά από το χάσμα αντίληψης. Εάν ένα μόνο MI300X μπορεί να εξυπηρετήσει ένα μοντέλο συνοριακής κλίμακας σε ανταγωνιστικές ταχύτητες, το επιχείρημα κόστους για την AMD γίνεται πιο δύσκολο να απορριφθεί. Η AMD έχει επίσης δημιουργήσει το δικό της χαρτοφυλάκιο ανοιχτών μοντέλων, κυκλοφορώντας το Instella-MoE-16B, ένα πλήρως ανοιχτό μοντέλο που έχει εκπαιδευτεί από την αρχή στις δικές της Instinct GPU και συνεργάζεται με τη Zyphra σε μια πλατφόρμα MI355X 15 megawatt.

Εν τω μεταξύ, το ίδιο το DeepSeek μειώνει το κόστος της συνοριακής τεχνητής νοημοσύνης. Το μοντέλο V4 Flash ήταν ήδη το φθηνότερο γνωστό μοντέλο που λειτουργεί σύμφωνα με την ανάλυση της ερευνητικής εταιρείας, ταιριάζοντας με το GPT-5.6 Luna με 60 τοις εκατό χαμηλότερο κόστος. Σε συνδυασμό με φθηνότερο υλικό AMD, τα οικονομικά της εξυπηρέτησης μεγάλων μοντέλων εκτός του οικοσυστήματος της Nvidia βελτιώνονται γρήγορα.

Το πλεονέκτημα ανοιχτού κώδικα

Το αποθετήριο υπογραμμίζει ένα ευρύτερο θέμα στην ανάπτυξη της τεχνητής νοημοσύνης του 2026: τα μοντέλα ανοιχτού βάρους και τα εργαλεία εξαγωγής συμπερασμάτων ανοιχτού κώδικα δίνουν τη δυνατότητα σε ανεξάρτητους μηχανικούς να αναπαράγουν και να βελτιστοποιούν αναπτύξεις που κάποτε ήταν αποκλειστικός τομέας καλά χρηματοδοτούμενων εργαστηρίων. Με τη δημοσίευση της πλήρους διαμόρφωσης, των πινάκων συντονισμού και των συγκεκριμένων σφαλμάτων που διορθώθηκαν στην πορεία, η εργασία μειώνει το εμπόδιο για όποιον σκέφτεται το υλικό AMD για σοβαρούς φόρτους εργασίας AI.

Μείνετε μπροστά από την τεχνητή νοημοσύνη

Η μάχη μεταξύ της AMD και της Nvidia για την εξαγωγή συμπερασμάτων AI εντείνεται και οι συνεισφορές ανοιχτού κώδικα όπως αυτή η ανάπτυξη αλλάζουν αθόρυβα το ανταγωνιστικό τοπίο. Για τις τελευταίες εξελίξεις της τεχνητής νοημοσύνης σε υλικό, ανοιχτά μοντέλα και υποδομές, μείνετε στην κάλυψη μας.

Διαβάστε περισσότερα νέα AI →