Η Reflection AI, η αμερικανική startup που υποστηρίζεται από την Nvidia, παρουσίασε το πρώτο της μοντέλο ανοιχτού βάρους στις 5 Οκτωβρίου, ένα σύστημα αραιού μείγματος ειδικών που ονομάζεται Beam και το οποίο η εταιρεία τοποθετεί ως την ισχυρότερη δυτική πρόκληση μέχρι σήμερα στα ανοιχτά σύνορα που επί του παρόντος κυριαρχούν τα κινεζικά εργαστήρια. Η ανακοίνωση, που δημοσιεύτηκε στο ίδιο το blog του Reflection και λήφθηκε γρήγορα από το Reuters, το TechCrunch, το Fortune και τη Semafor, φτάνει με μια ανατροπή: το μοντέλο δεν μπορεί να κατέβει ακόμη.
Ο Beam υποβάλλεται σε αυτό που η εταιρεία περιγράφει ως τελικό red-teaming και αξιολογήσεις. Η πρώιμη πρόσβαση είναι ανοιχτή μέσω μιας διαδικασίας εγγραφής και η Reflection λέει ότι θα δημοσιεύσει τα βάρη, μια τεχνική αναφορά, μια κάρτα μοντέλου και τεχνουργήματα προγραμματιστή αργότερα αυτόν τον μήνα. Όταν συμβεί αυτό, το Beam θα γίνει μια από τις μεγαλύτερες εκδόσεις ανοιχτού βάρους που έχουν δημοσιευτεί ποτέ από εργαστήριο των ΗΠΑ και η πιο ξεκάθαρη δοκιμή μέχρι στιγμής για το εάν μια αμερικανική εταιρεία μπορεί να ανταποκριθεί στον ρυθμό κυκλοφορίας και το άνοιγμα που έχουν κάνει τα κινεζικά μοντέλα την προεπιλεγμένη επιλογή για μεγάλο μέρος της κοινότητας ανοιχτού κώδικα. Για συνεχή κάλυψη του αγώνα ανοιχτού βάρους και οτιδήποτε άλλο κινεί το γήπεδο, προσθέστε σελιδοδείκτη στην αρχική μας σελίδα ειδήσεων AI.
Οι αριθμοί πίσω από τη δοκό
Το Beam είναι ένα μοντέλο αραιού μείγματος ειδικών με 501 δισεκατομμύρια συνολικές παραμέτρους, από τις οποίες περίπου 23 δισεκατομμύρια είναι ενεργές ανά διακριτικό. Η Reflection λέει ότι προεκπαίδευσε το μοντέλο σε 23,8 τρισεκατομμύρια μάρκες που αντλήθηκαν από τον ιστό και ιδιόκτητα αδειοδοτημένα σύνολα δεδομένων, υποστηρίζοντας ότι το βασικό μοντέλο ταιριάζει ή υπερέχει των μοντέλων ανοιχτής βάσης παρόμοιου μεγέθους.
Ο πιο διακριτικός ισχυρισμός αφορά την ενισχυτική μάθηση. Το Reflection κατασκεύασε τους αλγόριθμους, τα περιβάλλοντα εκπαίδευσης και την υποδομή για τη διατήρηση της υψηλής υπολογιστικής RL σε κλίμακα και η εταιρεία αναφέρει ότι η εκτέλεση RL δημιούργησε περισσότερες από 100 εκατομμύρια εκδόσεις σε 10.500 GPU NVIDIA GB300 σε τέσσερις εβδομάδες εκπαίδευσης. Αυτή είναι μια ασυνήθιστα μεγάλη επένδυση RL για μια κυκλοφορία ανοιχτού βάρους και η Reflection της πιστώνει για την ανταγωνιστική απόδοση της Beam με αυτό που αποκαλεί απόδοση υπολογισμού συνόρων συνόρων.
Σημεία αναφοράς: Ανταγωνιστικό, όχι ακόμη κορυφαίο
Ο δημοσιευμένος πίνακας σημείων αναφοράς του Reflection τοποθετεί το Beam σταθερά στο πακέτο ανοιχτού βάρους, πίσω από τα μεγαλύτερα κινέζικα μοντέλα, αλλά μπροστά ή σε επίπεδο με πολλά καθιερωμένα ονόματα.
Στο SWE-Bench Pro v2-Hard, ο Beam σκοράρει 77,2, πίσω από το GLM 5,3 στο 88,2 και τον Kimi K3 στο 88,2 στην ίδια σειρά, αλλά πολύ πιο μπροστά από τον Inkling στο 56,9. Στο SWE-Bench Pro v1, ο Beam σκοράρει 65,5, μπροστά από τους Inkling (54,3), Nemotron 3 Ultra (46,4) και GLM 5,2 (62,1), ενώ το Qwen 3,8-Max σημειώνει 67,7. Στο σημείο αναφοράς κωδικοποίησης agentic DeepSWE v1.1, το Beam καταγράφει 44,4, επίπεδο με το 44,0 του GLM 5.2 και πίσω από τα GLM 5.3 (61.0), Qwen 3.8-Max (51.0) και DeepSeek V4.1 Flash (74.2).
Το καδράρισμα της εταιρείας είναι ειλικρινές σχετικά με το πού κάθεται ο Beam. Στην ανάρτηση του ιστολογίου, το Reflection γράφει ότι το Beam "προωθεί τα δυτικά σύνορα ανοιχτού βάρους" και είναι "ανταγωνιστικό με μεγαλύτερα ανοιχτά μοντέλα όπως το GLM 5.2 και πλησιάζει το Qwen 3.8-Max σε θέματα κωδικοποίησης και πρακτόρων". Παραδέχεται επίσης ότι τα μοντέλα ανοικτών συνόρων όπως το Kimi K3 «παραμένουν μπροστά σε ακατέργαστες ικανότητες».
Δύο επιφυλάξεις αξίζουν έμφαση. Πρώτον, κάθε αριθμός εδώ αναφέρεται μόνος του από το Reflection πριν από την απελευθέρωση βάρους και η ανεξάρτητη επαλήθευση θα είναι δυνατή μόνο όταν η τεχνική αναφορά και τα σημεία ελέγχου δημοσιοποιηθούν. Δεύτερον, πολλά κελιά στον πίνακα της εταιρείας επισημαίνονται ως μη αναφερόμενα, γεγονός που καθιστά αδύνατες προς το παρόν τις πλήρεις συγκρίσεις μεταξύ μήλων και μήλων.
Το επιχείρημα της αποτελεσματικότητας
Αυτό που το Reflection θέτει ως πραγματικό πλεονέκτημα του Beam δεν είναι η ακατέργαστη θέση του leaderboard αλλά το κόστος σε χρόνο συμπερασμάτων. Επειδή μόνο 23 δισεκατομμύρια από τις 501 δισεκατομμύρια παραμέτρους του ενεργοποιούνται ανά διακριτικό, η εταιρεία υποστηρίζει ότι το Beam μπορεί να προσφέρει σχεδόν σύνορα πρακτορεία και απόδοση κωδικοποίησης σε ένα κλάσμα του υπολογιστικού κόστους μεγαλύτερων πυκνών μοντέλων. Αυτή η τοποθέτηση αντικατοπτρίζει τη στρατηγική που έκανε τις κινεζικές οικογένειες ανοιχτού βάρους τόσο δημοφιλείς στις νεοφυείς επιχειρήσεις: αρκετά ισχυρή ικανότητα σε τιμές που καθιστούν τους αδιάλειπτους πράκτορες οικονομικά βιώσιμους.
Εάν ο ισχυρισμός απόδοσης επιβιώσει της ανεξάρτητης συγκριτικής αξιολόγησης, θα μπορούσε να έχει μεγαλύτερη σημασία από τα δέλτα του leaderboard. Οι ομάδες που εκτελούν χιλιάδες παράλληλους πράκτορες κωδικοποίησης ενδιαφέρονται περισσότερο για το κόστος ανά ολοκληρωμένη εργασία παρά για τα μονοψήφια σημεία αναφοράς.
Ένα γεωπολιτικό υπόγειο ρεύμα
Η κάλυψη της κυκλοφορίας ήταν εντυπωσιακά γεωπολιτική για μια έκδοση μοντέλου ανοιχτού κώδικα. Το Reuters περιέγραψε το Beam ως το «πρώτο μοντέλο τεχνητής νοημοσύνης» από το Reflection που «ανέλαβε κινεζικά ανοιχτά μοντέλα». Η Fortune ρώτησε εάν το Beam θα μπορούσε να είναι «η καλύτερη ευκαιρία της Αμερικής να ανταγωνιστεί την Κίνα» και η Semafor πλαισίωνε την εταιρεία ως «μια δυτική απάντηση ανοιχτού κώδικα στα κινεζικά εργαστήρια».
Αυτό το καδράρισμα αντανακλά την κατάσταση του οικοσυστήματος ανοιχτού βάρους στα τέλη του 2026: τα πιο ικανά μοντέλα με δυνατότητα λήψης έχουν προέλθει σε μεγάλο βαθμό από κινεζικά εργαστήρια, όπως η οικογένεια GLM της Z.ai, η σειρά Kimi της Moonshot, η Qwen της Alibaba και η DeepSeek. Τα αμερικανικά εργαστήρια έχουν κρατήσει σε μεγάλο βαθμό κλειστά τα καλύτερα βάρη τους, ποντάροντας στα έσοδα API. Το Reflection στοιχηματίζει το αντίθετο: ότι ένα ανοιχτό μοντέλο δυτικών συνόρων μπορεί να προσελκύσει το οικοσύστημα προγραμματιστών και ότι η υποστήριξη της Nvidia της δίνει τον υπολογιστικό διάδρομο για να συμβαδίσει.
Τι θα συμβεί στη συνέχεια
Η απελευθέρωση βάρους αργότερα αυτόν τον μήνα θα απαντήσει στις ερωτήσεις που έχουν σημασία: πώς αποδίδει το Beam εκτός των αξιολογήσεων του ίδιου του Reflection, ποια άδεια συνοδεύει τα βάρη και εάν η απόδοση διατηρείται υπό ανεξάρτητο φορτίο. Μέχρι τότε, το Beam παραμένει ένας πολλά υποσχόμενος πίνακας αναφοράς, μια φόρμα εγγραφής και η πιο σημαντική υπόσχεση ανοιχτού βάρους που έχει δώσει ένα αμερικανικό εργαστήριο φέτος.
Για τους προγραμματιστές που αποφασίζουν εάν θα τυποποιηθούν σε GLM, Kimi, Qwen ή να περιμένουν το Beam, η πρακτική συμβουλή είναι να λάβουν τις τελικές αποφάσεις μέχρι να ολοκληρωθεί η τεχνική έκθεση και οι αξιολογήσεις τρίτων. Ο αγώνας ανοιχτού βάρους έχει έναν νέο Αμερικανό συμμετέχοντα και για πρώτη φορά εδώ και λίγο καιρό, δεν ξεκινά από το πίσω μέρος του πακέτου.
Μείνετε μπροστά από την τεχνητή νοημοσύνη
Τα σύνορα ανοιχτού βάρους κινούνται εβδομαδιαία και τα εργαστήρια απελευθερώνονται πιο γρήγορα από ό,τι μπορεί να παρακολουθήσει ο καθένας. Διαβάστε περισσότερα νέα AI στο AI Buzz Wire για λανσαρίσματα μοντέλων, αναλύσεις συγκριτικής αξιολόγησης και τις επιχειρηματικές ιστορίες πίσω από αυτά.
Εξερευνήστε τις τελευταίες εξελίξεις AI εδώ.