Η Z.ai, η εταιρεία τεχνητής νοημοσύνης που εδρεύει στο Πεκίνο, γνωστή και ως Zhipu, κυκλοφόρησε το GLM-5.3, μια νέα επανάληψη του κορυφαίου μοντέλου που η εταιρεία λέει ότι είναι το πιο ικανό ανοιχτό σύστημά της για μηχανική λογισμικού – και που έχει απροσδόκητα αναπτύξει τρομερές δεξιότητες στον κυβερνοχώρο. Ανακοινώθηκε στις 14 Αυγούστου και περιγράφεται λεπτομερώς σε μια ανάρτηση ιστολογίου της εταιρείας, το GLM-5.3 είναι κατασκευασμένο στο ίδιο βασικό μοντέλο περίπου 700 δισεκατομμυρίων παραμέτρων με τον προκάτοχό του GLM-5.2, που κυκλοφόρησε τον Ιούνιο. Κάθε βελτίωση, λέει η εταιρεία, προέρχεται από μετά την εκπαίδευση και όχι από ένα μεγαλύτερο ίδρυμα. Η κυκλοφορία είναι η πιο πρόσφατη σε ένα κύμα κινεζικών μοντέλων ανοιχτού βάρους που στοχεύουν να ξεπεράσουν τα κλειστά συστήματα των Anthropic και OpenAI. Για τον ανιχνευτή μοντέλων AI Buzz Wire, το GLM-5.3 είναι ένα σαφές μήνυμα ότι τα σύνορα ανοιχτού βάρους κλείνει το κενό κωδικοποίησης πιο γρήγορα από ό,τι περίμεναν πολλοί.

Κέρδη χτισμένα εξ ολοκλήρου μετά την προπόνηση

Η Z.ai είναι ωμή σχετικά με την προσέγγισή της με το GLM-5.3: "Η κλιμάκωση μετά την προπόνηση είναι το μόνο που κάναμε." Η εταιρεία μετέφερε τη στοίβα ενισχυτικής μάθησης που εισήγαγε με το GLM-5.2 — συμπεριλαμβανομένου του IndexShare για αποτελεσματική επεξεργασία μεγάλου πλαισίου, του SAO για ενισχυτική μάθηση σε εργασίες μεγάλου ορίζοντα και ένα πλαίσιο ανοιχτού κώδικα που ονομάζεται slime για μεγάλης κλίμακας ασύγχρονη εκπαίδευση. Τον περασμένο μήνα απλώς έβαλε περισσότερα περιβάλλοντα, πιο διαφορετικές εργασίες και περισσότερους υπολογισμούς σε αυτήν τη στοίβα.

Η ανταμοιβή εμφανίζεται σε όλα τα σημεία αναφοράς κωδικοποίησης. Στο Terminal Bench 3.0, το GLM-5.3 μεταπηδά από τη βαθμολογία του GLM-5.2 4,6 σε 28,3 — μια βελτίωση πάνω από εξαπλάσια. Δημοσιεύει υπερσύγχρονα αποτελέσματα ανοιχτού κώδικα στο Terminal Bench 3.0 και στην Τελευταία Εξέταση Agents, και βελτιώνεται από 23,8 σε 28,5 στη μέτρηση ALE-CLI της ικανότητας πρακτόρων. Η Z.ai αναφέρει βελτίωση 50% σε σχέση με το GLM-5.2 στο εσωτερικό της Z.ai Code Bench, ένα ιδιωτικό σημείο αναφοράς που έχει σχεδιαστεί για την αξιολόγηση των πρακτόρων κωδικοποίησης σε ρεαλιστικά περιβάλλοντα ανάπτυξης και τη μείωση του κινδύνου μόλυνσης από δημόσια σετ δοκιμών.

Κρίσιμης σημασίας, τα κέρδη έρχονται με καλύτερη συμβολική αποτελεσματικότητα, όχι μόνο καλύτερα αποτελέσματα. Στην υψηλή προσπάθεια, το GLM-5.3 φτάνει στο 31,4% της ολοκλήρωσης του εσωτερικού σημείου αναφοράς με περίπου 50.000 διακριτικά εξόδου ανά εργασία, κάτι που ο Z.ai λέει ότι ξεπερνά το Claude Opus 4.8 της Anthropic στο 29,5% με 120.000 μάρκες. Το GLM-5.3 εξακολουθεί να ακολουθεί το πιο προηγμένο Claude Fable 5 της Anthropic, το οποίο φτάνει το 39,5% στη μέγιστη προσπάθεια.

Ένα απροσδόκητο άλμα στην ικανότητα του κυβερνοχώρου

Το πιο εντυπωσιακό αποτέλεσμα από το GLM-5.3 δεν είναι στην κωδικοποίηση αλλά στην ασφάλεια. Καθώς η Z.ai κλιμάκωσε την εκπαίδευση μετά την εκπαίδευση και εισήγαγε δεδομένα και περιβάλλοντα ανακάλυψης ευπάθειας στο μείγμα εκπαίδευσης, ανέμενε ότι το μοντέλο θα βελτιωνόταν στην εύρεση και τη συλλογιστική σχετικά με ελαττώματα. Αυτό που εξέπληξε την ομάδα ήταν το πόσο γρήγορα αναπτύχθηκε αυτή η ικανότητα.

Το GLM-5.3 δεν έγινε απλώς καλύτερο στον εντοπισμό μεμονωμένων ζωυφίων. άρχισε να συλλογίζεται σε πολλαπλά στάδια εκμετάλλευσης, διαμορφώνοντας συνεκτικά σχέδια για πλήρεις αλυσίδες επίθεσης. Στο CyberGym, ένα σημείο αναφοράς που ελέγχει εάν ένα μοντέλο μπορεί να εντοπίσει και να επικυρώσει ευπάθειες από τον πηγαίο κώδικα λευκού κουτιού, το GLM-5.3 βαθμολογείται με 84,5%, από το 77,2% του GLM-5.2. Αυτό είναι το καλύτερο αποτέλεσμα στο σημείο αναφοράς, μπροστά από το Mythos 5 με 83,8% και το GPT-5,6 Sol στο 83,6%. Στο ExploitBench, το οποίο απαιτεί βαθύτερο συλλογισμό σχετικά με τις πραγματικές ευπάθειες και την εκμετάλλευσή τους, το GLM-5.3 υπερδιπλασιάζει τη βαθμολογία του GLM-5.2, φτάνοντας το 54,4% — αν και παραμένει πολύ πίσω από το Mythos 5 στο 78,0% και το GPT-5,6 Sol στο 76,5%.

Ο Z.ai παρατηρεί ένα σταθερό μοτίβο: όσο πιο ψηλά βρίσκεται η αλυσίδα εκμετάλλευσης ένα σημείο αναφοράς, τόσο μεγαλύτερο είναι το κέρδος σε σχέση με το GLM-5.2 — και επίσης τόσο μεγαλύτερο είναι το κενό που απομένει μέχρι τα κλειστά σύνορα. «Η ικανότητα αυξάνεται ταχύτερα ακριβώς εκεί που είμαστε πιο πίσω», σημειώνει η εταιρεία.

Ανακαλύψεις ευπάθειας στον πραγματικό κόσμο

Οι δεξιότητες στον κυβερνοχώρο δεν περιορίζονται σε σημεία αναφοράς. Η Z.ai αναφέρει ότι από το GLM-5.2, συνεργάζεται με πολλές ομάδες ασφαλείας στην Κίνα για να δοκιμάσει τα μοντέλα της σε πραγματικές βάσεις κωδικών. Μετά από ανασκόπηση από εμπειρογνώμονες, έλεγχο και κατάργηση διπλών αντιγράφων, το μοντέλο εντόπισε 2.436 ευπάθειες σε 269 έργα, συμπεριλαμβανομένων 1.097 ζητημάτων μέσης έως υψηλής σοβαρότητας. Τα ευρήματα καλύπτουν πυρήνες συστημάτων, λειτουργικά συστήματα, μηχανές προγράμματος περιήγησης, υποδομές ανοιχτού κώδικα, εφαρμογές Ιστού και πρωτόκολλα δικτύου — πολλά από τα οποία είχαν περάσει απαρατήρητα για χρόνια ή και δεκαετίες, με το παλαιότερο να χρονολογείται πριν από περίπου 40 χρόνια.

Αυτά τα αποτελέσματα απηχούν την εργασία που περιέγραψε η Anthropic στη δική της έρευνα ασφάλειας πολλαπλών πρακτόρων, όπου χρησιμοποιήθηκαν συντονισμένα σμήνη πρακτόρων για να αναζητήσουν ευπάθειες σε λογισμικό ανοιχτού κώδικα σε κλίμακα.

Ανοιχτά βάρη — Με καθυστέρηση

Η Z.ai λέει ότι θα απελευθερώσει τα βάρη GLM-5.3 σε δύο εβδομάδες, μόλις ολοκληρωθεί η αξιολόγηση ασφάλειας και η σκλήρυνση. Αυτή η σκόπιμη καθυστέρηση αντικατοπτρίζει μια ένταση στην ανακοίνωση: ένα μοντέλο που αναπτύσσει ισχυρές επιθετικές δυνατότητες στον κυβερνοχώρο πιο γρήγορα από ό,τι περίμεναν οι δημιουργοί του είναι ακριβώς το είδος του συστήματος που εγείρει ερωτήματα σχετικά με την υπεύθυνη κυκλοφορία. Η εταιρεία τονίζει ότι η συνοχή εκπαίδευσης-προβολής έχει βελτιωθεί σε υψηλό βαθμό αριθμητικής ακρίβειας και ότι μεγάλο μέρος της δυσκολίας στην κλιμάκωση έχει μετατοπιστεί από το ίδιο το μοντέλο στο σχεδιασμό ρεαλιστικών, επαληθεύσιμων περιβαλλόντων εργασιών.

Η αγωνιστική εικόνα είναι ξεκάθαρη. Το GLM-5.3 περιορίζει την απόσταση από τα κλειστά σύνορα στις εργασίες κωδικοποίησης και αντιπροσώπων, ενώ διεκδικεί το απόλυτο προβάδισμα σε τουλάχιστον ένα σημαντικό σημείο αναφοράς ανακάλυψης ευπάθειας. Το κάνει ως μοντέλο ανοιχτού βάρους — που σημαίνει ότι, μόλις κυκλοφορήσει, τα βάρη θα είναι ελεύθερα διαθέσιμα σε οποιονδήποτε να τα κατεβάσει, να τα μελετήσει και να τα αξιοποιήσει. Το αν αυτό το άνοιγμα επιταχύνει την πρόοδο ή εγείρει νέες ανησυχίες για την ασφάλεια είναι μια συζήτηση που το GLM-5.3 είναι εγγυημένο ότι θα αναζωπυρωθεί.

Μείνετε μπροστά από την τεχνητή νοημοσύνη

Για τις πιο πρόσφατες εκδόσεις μοντέλων τεχνητής νοημοσύνης, μάχες συγκριτικής αξιολόγησης και ανάλυση βιομηχανίας, προσθέστε σελιδοδείκτη AI Buzz Wire.

Διαβάστε περισσότερα νέα AI →