Η AMD κυκλοφόρησε το Instella-MoE-16B-A3B, ένα πλήρως ανοιχτό μοντέλο γλώσσας Mixture-of-Experts (MoE) που εκπαιδεύεται από την αρχή στις δικές του Instinct MI300X και MI325X GPU. Η κυκλοφορία είναι μια δήλωση τόσο για το πυρίτιο όσο και για το λογισμικό: δημοσιεύοντας κάθε στάδιο εκπαίδευσης, μείγμα δεδομένων και διαμόρφωσης, η AMD αποδεικνύει ότι οι επιταχυντές κέντρων δεδομένων της μπορούν να δημιουργήσουν ανοιχτά μοντέλα κατηγορίας συνόρων από άκρο σε άκρο — περιοχή που η Nvidia κυριαρχεί εδώ και καιρό. Είναι μια από τις πιο αιχμηρές κινήσεις στον αγώνα ανοιχτού βάρους που παρακολουθούμε στις [έκτακτες ειδήσεις AI] (https://aibuzzwire.news).
Ένας μικρός αλλά ευρύς σχεδιασμός μείγματος ειδικών
Σύμφωνα με μια λεπτομερή ανάλυση στο MarkTechPost, το Instella-MoE-16B-A3B είναι ένα μοντέλο MoE μόνο με αποκωδικοποιητή με 16 δισεκατομμύρια συνολικές παραμέτρους που ενεργοποιεί μόνο 2,8 δισεκατομμύρια ανά διακριτικό. Κάθε ένα από τα 27 επίπεδα χρησιμοποιεί 2 κοινόχρηστους ειδικούς συν 6 δρομολογημένους ειδικούς που επιλέχθηκαν από μια ομάδα 64, με κρυφό μέγεθος 2048, 16 κεφαλές προσοχής και λεξιλόγιο 128.896 τόνων. Ένας στόχος Πρόβλεψη πολλαπλών σημείων χρησιμοποιείται τόσο κατά την προ-προπόνηση όσο και κατά τη διάρκεια της προπόνησης.
Αυτή η αραιή αρχιτεκτονική - όπου ένα μικροσκοπικό κομμάτι του δικτύου "ξυπνάει" για κάθε διακριτικό - είναι η ίδια λογική απόδοσης πίσω από τα φθηνά ανοιχτά μοντέλα που αναμόρφωσαν την αγορά τον περασμένο χρόνο. Η AMD εκπαίδευσε το μοντέλο σε 7,1 τρισεκατομμύρια μάρκες που προέρχονται από ανοιχτά σώματα, συμπεριλαμβανομένων των Nemotron-CC-v2, MegaMath, FineMath, RefineCode και TxT360 και στη συνέχεια διεξήγαγε ένα στάδιο μεσαίας εκπαίδευσης στο Dolma3 Dolmino 100B σε τρεις παραλλαγές βάρους δεδομένων που συγχωνεύτηκαν συνεχώς. Ένα στάδιο μεγάλου πλαισίου επεκτείνει το παράθυρο από 4K σε 64K διακριτικά χρησιμοποιώντας το YaRN.
Δύο καινοτομίες σε επίπεδο συστημάτων
Η έκδοση περιλαμβάνει δύο δομικές επιλογές που η AMD υπογραμμίζει ως σημαντικές νίκες μηχανικής. Το πρώτο είναι το Gated Multi-head Latent Attention (Gated MLA), το οποίο προσθέτει μια ελαφριά πύλη εκμάθησης εξόδου στο Multi-head Latent Attention. Μια αποκλειστική γραμμική προβολή εξάγει μια πύλη ρυθμισμένης εισόδου που εφαρμόζεται πολλαπλασιαστικά πριν από την προβολή εξόδου.
Το δεύτερο, FarSkip-Collective, είναι ένα σχήμα συνδεσιμότητας που μεταβιβάζει ξεπερασμένες και μερικές ενεργοποιήσεις στα επίπεδα MoE και προσοχής, επικαλύπτοντας την παράλληλη επικοινωνία ειδικών με τον υπολογισμό. Η AMD αναφέρει 12,7% επιτάχυνση πριν από την προπόνηση και έως 39,2% μείωση του χρόνου μέχρι το πρώτο διακριτικό όταν σερβίρεται με παραλληλισμό ειδικών. Για μια εταιρεία που προτείνει το υλικό της με βάση την τιμή-απόδοση, αυτοί είναι ακριβώς οι αριθμοί που θέλει να δει ένας αγοραστής.
Ισχυρά σημεία αναφοράς για ένα πλήρως ανοιχτό μοντέλο
Στο βασικό σημείο ελέγχου, το Instella-MoE έχει μέσο όρο 76,7 σε όλες τις αξιολογήσεις, το οποίο η AMD αποκαλεί το ισχυρότερο αποτέλεσμα μεταξύ πλήρως ανοιχτών μοντέλων. Αυτό το τοποθετεί μπροστά από το Moonlight-16B-A3B (76,2), το SmolLM3-3B-Base (70,5), το OLMo-3-7B (70,1) και το OLMoE-1B-7B (61,9), αν και εξακολουθεί να ακολουθεί το Qwen3.5-4B-Base (79,5). Προηγείται στο WinoGrande με βαθμολογία 86,5 και δημοσιεύει 65,7 στο HumanEval+. Για εργασίες μεγάλου πλαισίου, είναι κατά μέσο όρο 41,5 στο HELMET και 79,4 στο RULER.
Η μετά την προπόνηση ακονίζει περαιτέρω το μοντέλο. Οι μέσες βαθμολογίες ανεβαίνουν από το 71,58 μετά από εποπτευόμενη λεπτομέρεια στο 72,67 μετά το DPO και το 73,22 στη διαμόρφωση "Think", κερδίζοντας τα Olmo3-7B-Think (71,97), Gemma-4-E4B Think (70,47) και Qwen 7,7 (6,95). Ακολουθώντας τις οδηγίες, το IFEval αυξάνεται από 77,08 σε 83,70.
Η συνταγή μετά την προπόνηση είναι από μόνη της αξιοσημείωτη. Μετά το SFT σε μείγματα Dolci-Think-SFT-7B και Nemotron, η AMD εκτελεί DPO με ενημερώσεις μεροληψίας δρομολογητή και απενεργοποιημένη τη βοηθητική απώλεια εξισορρόπησης φορτίου για να αποφευχθεί η υποβάθμιση. Στη συνέχεια, η ενισχυτική εκμάθηση προχωρά εντός του πλαισίου Miles της AMD: 1.400 βήματα RLVR ακολουθώντας τις οδηγίες, ακολουθούμενα από Απόσταξη Πολιτικής για πολλούς Δασκάλους που διπλώνει το κέρδος ξανά χωρίς να θυσιάζει την απόδοση μαθηματικών ή κώδικα.
The Licensing Catch
Υπάρχει μια προειδοποίηση που έχει σημασία για τους εμπορικούς χρήστες. Το μοντέλο αποστέλλεται με άδεια ResearchRAIL, η οποία περιορίζει τη χρήση μόνο σε ακαδημαϊκούς και ερευνητικούς σκοπούς, επομένως το Instella-MoE δεν είναι μοντέλο drop-in για αναπτύξεις παραγωγής. Η βάση κωδικών εκπαίδευσης, ωστόσο, διαθέτει άδεια MIT, και αυτό είναι αναμφισβήτητα το πιο επαναχρησιμοποιήσιμο στοιχείο — δίνει σε άλλα εργαστήρια ένα συγκεκριμένο σχέδιο για εκπαίδευση στο πυρίτιο AMD.
Η AMD δημοσίευσε τα πλήρη βάρη από κάθε στάδιο εκπαίδευσης, τα μείγματα δεδομένων, τις διαμορφώσεις εκπαίδευσης και τον κώδικα συμπερασμάτων σε μια συλλογή Hugging Face, ένα αποθετήριο GitHub και το ιστολόγιό της ROCm. Αυτό το επίπεδο διαφάνειας — στάδιο-προπόνηση-στάδιο εκπαίδευσης, όχι απλώς ένα τελικό σημείο ελέγχου — είναι αυτό που διακρίνει μια «πλήρως ανοιχτή» απελευθέρωση από μια τυπική απελευθέρωση ανοιχτού βάρους.
Γιατί αυτό έχει σημασία πέρα από τα σημεία αναφοράς
Το υποκείμενο της έκδοσης είναι ο ανταγωνισμός υλικού. Το οικοσύστημα CUDA της Nvidia και οι GPU κλάσης H100 είναι το προεπιλεγμένο υπόστρωμα για την εκπαίδευση μοντέλων συνόρων και οι αμφισβητίες έχουν περάσει χρόνια προσπαθώντας να αποδείξουν ότι οι επιταχυντές τους μπορούν να χειριστούν την πλήρη στοίβα εκπαίδευσης. Το Instella-MoE είναι ένα αξιόπιστο τεχνούργημα που η σειρά Instinct της AMD — που έχει ήδη αναπτυχθεί σε κλίμακα από υπερκλιμάκωση και εθνικά εργαστήρια — μπορεί να κάνει περισσότερα από φόρτους εργασίας συμπερασμάτων. Εάν η AMD μπορεί να συνεχίσει να παράγει ανταγωνιστικά ανοιχτά μοντέλα που έχουν εκπαιδευτεί στο δικό της υλικό, ενισχύει την υπόθεση για τους αγοραστές που θέλουν να σπάσουν τη δύναμη της Nvidia στην αγορά υπολογιστών AI.
Για τους ερευνητές, η έκκληση είναι η διαφάνεια. Οι πλήρως ανοιχτές εκδόσεις που τεκμηριώνουν το μείγμα δεδομένων, το μείγμα της μέσης εκπαίδευσης, τη στρατηγική απόσταξης και το πρόγραμμα σπουδών RL παραμένουν σπάνιες, και αφήνουν την κοινότητα να ελέγχει και να αναπαράγει ισχυρισμούς αντί να δέχεται τη λέξη του εργαστηρίου. Το Instella-MoE εντάσσεται σε ένα μικρό αλλά αυξανόμενο ρόστερ — συμπεριλαμβανομένων των προηγούμενων μοντέλων Instella της AMD — προωθώντας αυτό το πρότυπο.
Μείνετε μπροστά από την τεχνητή νοημοσύνη
Θέλετε τέτοιου είδους βαθιά τεχνική κάλυψη όπως συμβαίνει; Προσθέστε σελιδοδείκτη στο κέντρο μας για τις πιο πρόσφατες εξελίξεις AI και μην χάσετε ποτέ καμία κυκλοφορία.
Διαβάστε περισσότερα νέα AI →

