Το μυστήριο μοντέλο που πέρασε μια εβδομάδα γοητευτικά προγραμματιστές με το ανώνυμο όνομα Ox Alpha έχει πλέον επίσημη ταυτότητα. Η κινεζική Z.AI κυκλοφόρησε το GLM-5.3-Flash, ένα εγγενώς πολυτροπικό, ανοιχτού βάρους μοντέλο που κυκλοφόρησε με την άδεια MIT — και η εταιρεία λέει ότι ολόκληρη η λειτουργία προεπισκόπησης stealth προβλήθηκε σε τσιπ AI κινεζικής κατασκευής. Το λανσάρισμα κλείνει φέτος ένα από τα παιχνίδια εικασίας με τη μεγαλύτερη παρακολούθηση στη βιομηχανία AI. Για το υπόβαθρο σχετικά με το πώς εξελίχθηκε η ιστορία, δείτε τις πιο πρόσφατες εξελίξεις AI.
Τι πραγματικά έστειλε το Z.ai
Το GLM-5.3-Flash είναι ένα μοντέλο με συνδυασμό ειδικών με 320 δισεκατομμύρια συνολικές παραμέτρους και 18 δισεκατομμύρια ενεργές παραμέτρους — μια αξιοσημείωτη πτώση από τα 32 δισεκατομμύρια ενεργών παραμέτρων του προκατόχου του GLM-4.5. Είναι το πρώτο εγγενώς πολυτροπικό μοντέλο στην οικογένεια GLM-5, που δέχεται εισαγωγή κειμένου και εικόνας και υποστηρίζει ένα παράθυρο περιβάλλοντος που φτάνει το ένα εκατομμύριο διακριτικά, σύμφωνα με την ανακοίνωση της Z.ai.
Το μοντέλο εκπαιδεύτηκε σε ένα πολυτροπικό σώμα 30 τρισεκατομμυρίων και η αρχιτεκτονική του συνδυάζει τη γραμμική προσοχή για τις τοπικές εξαρτήσεις με την αραιή προσοχή για το παγκόσμιο πλαίσιο. Ένα στοιχείο Z.ai καλεί το IndexPool συμπιέζει ομάδες διανυσμάτων κλειδιών ευρετηρίου για να περιορίσει τον λανθάνοντα χρόνο και τη χρήση μνήμης σε μεγάλα μήκη περιβάλλοντος. Η εταιρεία αναφέρει τρεις φορές λιγότερο υπολογισμό προσοχής και 4,4 φορές μείωση στο μέγεθος της κρυφής μνήμης KV σε σύγκριση με το GLM-5.3.
Αξιώσεις αναφοράς και τιμολόγηση
Στον δείκτη τεχνητής ανάλυσης νοημοσύνης v4.1.1, το GLM-5.3-Flash σημείωσε 57 — αριθμός που το τοποθετεί στην κορυφή της τρέχουσας κατάταξης μοντέλων της Artificial Analysis, πολύ πάνω από τη μέση τιμή σύγκρισης του 18. Η Z.ai λέει ότι ξεπερνά το GLM-5.2 σε όλες τις αναφερόμενες τιμές κωδικοποίησης και δοκιμές. Το Claude Opus 4.8 στο εσωτερικό σημείο αναφοράς κωδικοποίησης. Στο DeepSWE v1.1, το μοντέλο σημείωσε 63,4 έναντι 46,2 για το GLM-5.2. στο AutomationBench έφτασε στο 48,8 έναντι 26,2. Όπως σημείωσε το TestingCatalog, οι διαφορετικές πλεξούδες αξιολόγησης, τα όρια περιβάλλοντος και οι ρυθμίσεις παραγωγής σημαίνουν ότι οι συγκρίσεις μεταξύ δοκιμών εξαρτώνται σε μεγάλο βαθμό από κάθε ρύθμιση.
Η τιμολόγηση τοποθετεί το μοντέλο ως επιθετικά φθηνό: 0,15 $ ανά εκατομμύριο διακριτικά εισόδου και 0,50 $ ανά εκατομμύριο μάρκες εξόδου, με έκπτωση 83% στην προσωρινή μνήμη, σύμφωνα με την Artificial Analysis. Ο Z.ai αναφέρει ένα μειωμένο κόστος 0,045 $ ανά εργασία Ευρετηρίου Ευφυΐας.
Η κινεζική γωνία τσιπ
Η πιο σημαντική στρατηγική λεπτομέρεια είναι η υποδομή, όχι η νοημοσύνη. Πριν από την κυκλοφορία, το μοντέλο λειτουργούσε ανώνυμα ως «ox-alpha» στο OpenRouter και το OpenCode από τις 20 Αυγούστου και η Z.ai λέει ότι έγινε το πιο δημοφιλές μοντέλο της εβδομάδας σε αυτές τις υπηρεσίες — με την κυκλοφορία να εξυπηρετείται εξ ολοκλήρου σε εγχώριους κινεζικούς επιταχυντές. Για να το υποστηρίξει αυτό, το Z.ai δημιούργησε μια στοίβα εξυπηρέτησης που βασίζεται σε SGLang που διαχωρίζει την κωδικοποίηση, την προπλήρωση και την αποκωδικοποίηση, αναφέροντας τριπλάσιο κέρδος στην απόδοση εξυπηρέτησης από άκρο σε άκρο σε δεκάδες χιλιάδες κινεζικά τσιπ AI.
Αυτό έχει σημασία πέρα από έναν πωλητή. Είναι μια δημόσια απόδειξη ότι ένα κινεζικό μοντέλο που γειτνιάζει με τα σύνορα μπορεί να εξυπηρετηθεί σε κλίμακα χωρίς υλικό Nvidia, ένα σημείο δεδομένων που δεν θα αγνοήσουν οι δυτικοί υπεύθυνοι χάραξης πολιτικής και οι κατασκευαστές τσιπ. Το New Stack συνόψισε την κυκλοφορία ως φθηνή, καλή και σερβίρεται σε κινεζικές μάρκες — τρεις ιδιότητες που σπάνια ισχυρίζονταν μαζί μέχρι τώρα.
Ανοιχτά βάρη, πραγματική ανάπτυξη
Τα βάρη είναι διαθέσιμα στο Hugging Face με την άδεια MIT, με τοπική ανάπτυξη που υποστηρίζεται μέσω SGLang, vLLM και TokenSpeed. Οι συνδρομητές του Σχεδίου Κωδικοποίησης GLM λαμβάνουν άμεσα το GLM-5.3-Flash ζωντανά με τριπλάσιο όριο χρήσης του GLM-5.3 και οι πολυτροπικές δυνατότητές του εκτίθενται στο ZCode μέσω ενσωματώσεων Χρήσης προγράμματος περιήγησης και χρήσης υπολογιστή.
Ο οπτικός συλλογισμός είναι κεντρικός στην κυκλοφορία: η Z.ai εκπαίδευσε το μοντέλο να επιθεωρεί τις αποδιδόμενες διεπαφές, το παιχνίδι και την έξοδο 3D και, στη συνέχεια, να αξιολογεί και να αναθεωρεί τη δουλειά της από οπτική ανατροφοδότηση. Η ίδια προσέγγιση επεκτείνεται σε έγγραφα, υπολογιστικά φύλλα, παρουσιάσεις και πίνακες εργαλείων - τα τεχνουργήματα της δουλειάς γραφείου, ακριβώς όπου η αντίπαλη κυκλοφορία της Qwen την ίδια μέρα διεκδικεί επίσης τα μεγαλύτερα κέρδη της.
Η απόφαση των ανοιχτών βαρών έχει σημασία για το οικοσύστημα πέρα από τους χομπίστες. Η άδεια χρήσης MIT είναι η πιο επιτρεπτή κοινή άδεια στην τεχνητή νοημοσύνη: η εμπορική χρήση, η τροποποίηση και η αναδιανομή δεν φέρουν υποχρεώσεις copyleft. Οι ανεξάρτητοι οικοδεσπότες μπορούν να εξυπηρετήσουν το GLM-5.3-Flash στο δικό τους υλικό, να το ρυθμίσουν με ακρίβεια για κλάδους από νομικό έλεγχο έως βιομηχανικό αυτοματισμό και να το ενσωματώσουν σε προϊόντα χωρίς όρους διαπραγμάτευσης — μια επιλογή που έχει κλείσει από τα μοντέλα περιορισμού μόνο με API.
Γιατί λειτούργησε η stealth εκτόξευση
Η ανώνυμη κυκλοφορία έδωσε στη Z.ai κάτι που δεν μπορούν να αγοράσουν οι προϋπολογισμοί μάρκετινγκ: αγνωστική επικύρωση επωνυμίας. Οι προγραμματιστές υιοθέτησαν το Ox Alpha με βάση τα πλεονεκτήματά του, χωρίς τη διαμόρφωση ενός κινεζικού εργαστηρίου έναντι των κατεστημένων Αμερικανών. Μέχρι τη στιγμή που το Bloomberg επιβεβαίωσε το Z.AI ως κατασκευαστή και το Business Insider δήλωσε ότι το «μυστήριο λύθηκε», το μοντέλο είχε ήδη φτάσει στην κορυφή των leaderboard της κοινότητας σε ουδέτερο έδαφος.
Η ανταγωνιστική πίεση είναι πλέον σαφής. Ένα πολυτροπικό μοντέλο με πλαίσιο ενός εκατομμυρίου συμβολαίων, βάρη με άδεια MIT και τιμολόγηση παραγωγής κάτω του δολαρίου αναγκάζει κάθε κατεστημένο να δικαιολογήσει τον τιμοκατάλογό του. Τα όρια του Pareto για την τιμή-έναντι απόδοσης – η αντιστάθμιση που νιώθουν οι προγραμματιστές – έχει ξανασχεδιαστεί, όπως το έθεσε ο ευρέως παρακολουθούμενος σχολιαστής τεχνητής νοημοσύνης Andrew Curran στο X.
Το ανοιχτό ερώτημα είναι η ανθεκτικότητα: εάν οι δυνητικοί πελάτες συγκριτικής αξιολόγησης διατηρούνται υπό την αντίπαλη χρήση στον πραγματικό κόσμο και πόσο γρήγορα ανταποκρίνονται τα δυτικά εργαστήρια στην τιμή. Είτε έτσι είτε αλλιώς, η εβδομάδα της ανώνυμης εικασίας τελείωσε με ένα επώνυμο μοντέλο, βάρη με δυνατότητα λήψης και έναν στόλο εξυπηρέτησης που δεν χρησιμοποιεί αμερικανικό πυρίτιο.
---
Μείνετε μπροστά από την τεχνητή νοημοσύνηΛάβετε τα τελευταία νέα, αναλύσεις και ανακαλύψεις AI — όλα σε ένα μέρος.
Διαβάστε περισσότερα νέα AI →