Ένα νέο σημείο αναφοράς από την εταιρεία ασφάλειας εφαρμογών Semgrep έφερε ένα απροσδόκητο αποτέλεσμα: ένα μοντέλο ανοιχτού βάρους από την κινεζική Zhipu AI ξεπέρασε τις επιδόσεις του Claude της Anthropic στο να βρει πραγματικά ελαττώματα ασφαλείας στο λογισμικό. Το εύρημα προσθέτει λάδι σε μια συζήτηση σχετικά με το εάν η πιο ικανή τεχνητή νοημοσύνη είναι απαραίτητα η πιο ακριβή ή η πιο περιορισμένη.

Με το ισχυρό μοντέλο Mythos της Anthropic να είναι κλειδωμένο πίσω από μια απαγόρευση εξαγωγών στις ΗΠΑ, οι ομάδες ασφαλείας που αναζητούν μια προσβάσιμη εναλλακτική στρέφονται σε επιλογές ανοιχτού βάρους όπως το GLM 5.2 για την πιο πρόσφατη κάλυψη της βιομηχανίας AI. Η δοκιμή του Semgrep, που δημοσιεύτηκε στις 22 Ιουνίου, υποδηλώνει ότι το κυνήγι μπορεί να αποδώσει νωρίτερα από το αναμενόμενο.

Τι δοκίμασε η Semgrep

Η Semgrep αξιολόγησε μια σειρά μοντέλων ανοιχτού βάρους και συνόρων στο εσωτερικό της σημείο αναφοράς ανίχνευσης IDOR. Τα IDOR — Insecure Direct Object References — είναι σφάλματα ελέγχου πρόσβασης που επιτρέπουν σε έναν χρήστη να φτάσει στα δεδομένα ενός άλλου χρήστη. Είναι γνωστό ότι είναι δύσκολο να πιαστούν με την παραδοσιακή στατική ανάλυση, επειδή το ελάττωμα είναι λογικό και όχι συντακτικό: ο κώδικας είναι τεχνικά έγκυρος, απλά δεν έχει έλεγχο εξουσιοδότησης.

Η εταιρεία έχει βελτιώσει μια ροή εργασιών για τον εντοπισμό αυτών των τρωτών σημείων συνδυάζοντας τη μηχανή της που βασίζεται σε κανόνες με τη λογική της τεχνητής νοημοσύνης. Για να απομονώσουν πόση απόδοση προέρχεται από το ίδιο το μοντέλο σε σχέση με τη σκαλωσιά γύρω του, οι ερευνητές έτρεξαν ένα σύνολο δημοφιλών μοντέλων ανοιχτού βάρους μέσω μιας ελάχιστης ζώνης — μια απλή εγκατάσταση Pydantic που χρησιμοποιεί την ίδια προτροπή IDOR που δίνεται σε κάθε μοντέλο, χωρίς εντοπισμό τελικού σημείου και χωρίς καθοδηγούμενη πλοήγηση. Η προτροπή πρόσφερε μόνο μια βασική στρατηγική αναζήτησης και μερικές υποδείξεις για το πώς μοιάζει ένα IDOR - λίγο περισσότερο από το "εδώ είναι ο κώδικας, βρείτε τα σφάλματα", αλλά πολύ λιγότερο από αυτό που λαμβάνουν οι πράκτορες κωδικοποίησης συνόρων όταν εκτελούνται εντός του πλήρους αγωγού της Semgrep.

Τα IDOR είναι ένας επίμονος πονοκέφαλος για τις ομάδες ασφαλείας εφαρμογών, επειδή πέφτουν μέσα από τις ρωγμές των συμβατικών σαρωτών. Ένα εργαλείο που βασίζεται σε κανόνες μπορεί να επισημάνει έναν έλεγχο εισόδου που λείπει, αλλά η κατανόηση του εάν ένα συγκεκριμένο τελικό σημείο εκθέτει πραγματικά τα δεδομένα άλλου χρήστη απαιτεί συλλογισμό σχετικά με την επιχειρηματική λογική της εφαρμογής — ακριβώς το είδος της κρίσης με βάση τα συμφραζόμενα στην οποία τα μεγάλα γλωσσικά μοντέλα είναι ολοένα και πιο καλά.

Το GLM 5.2 παίρνει το προβάδισμα

Το ξεχωριστό ήταν το GLM 5.2, το ανοιχτού βάρους μοντέλο της Zhipu AI. Έχοντας παρά μόνο μια απλή προτροπή, σημείωσε 39% F1 στον εντοπισμό IDOR — ξεπερνώντας το 32% του Claude Code κατά επτά πλήρεις πόντους. Σύμφωνα με τη Semgrep, το μοντέλο ανοιχτού βάρους ξεπέρασε επίσης το Claude Opus 4.8 στην εργασία, καθιστώντας το την ισχυρότερη μη συνοριακή επιλογή που δοκιμάστηκε.

Τα οικονομικά ήταν εξίσου εντυπωσιακά. Στην τιμολόγηση του GLM 5.2, η εκτέλεση κόστιζε περίπου 0,17 $ ανά ευπάθεια που βρέθηκε. Για οργανισμούς που ενδέχεται να σαρώσουν χιλιάδες τελικά σημεία, η Semgrep σημείωσε ότι το κόστος ανά σφάλμα είναι συχνά ο καθοριστικός παράγοντας για το εάν μια τεχνική ανίχνευσης είναι πρακτική σε κλίμακα.

Άλλοι υποψήφιοι ανοιχτού βάρους έμειναν πιο πίσω. Το MiniMax M3 σημείωσε 23% F1 και το Kimi K2.7 Code έφτασε στο 22%, και τα δύο συγκεντρώθηκαν πολύ κάτω από τον Claude Code. Η Semgrep χαρακτήρισε το GLM 5.2 ως τη σαφή εξαίρεση και όχι ως αντιπροσωπευτικό αποτέλεσμα για την κατηγορία ανοιχτού βάρους.

Το λουρί είναι ακόμα σημαντικό

Παρά τη νίκη ανοιχτού βάρους στην κατηγορία raw-prompt, ο αγωγός της Semgrep παρέμεινε ο γενικός ηγέτης. Η πολυτροπική ρύθμιση της εταιρείας — η οποία συνδυάζει συλλογισμό AI με ανίχνευση βάσει κανόνων και δομημένη απαρίθμηση τελικών σημείων — πέτυχε 53% έως 61% F1, ανάλογα με τη διαμόρφωση. Αυτό το κενό υπογραμμίζει το αρχικό ερώτημα των ερευνητών: πόση απόδοση ανίχνευσης τρωτών σημείων έχει το μοντέλο και πόση είναι η αρχιτεκτονική γύρω από αυτό;

Η απάντηση φαίνεται να είναι "και τα δύο, αλλά περισσότερα από όσα υποθέτουν οι άνθρωποι είναι η ζώνη". Το GLM 5.2 απέδειξε ότι ένα ικανό μοντέλο μπορεί να κάνει ουσιαστική δουλειά με ελάχιστη υποστήριξη, αλλά και πάλι δεν μπορούσε να ταιριάζει με ένα σύστημα που έχει σχεδιαστεί ειδικά για το πρόβλημα.

Η ομάδα του Semgrep - στην οποία περιλαμβάνονταν οι ερευνητές Paxton-Fear, Seth Jaksik, Brenden Noblitt και Erik Buchanan - είπε ότι ήταν «πραγματικά σοκαρισμένοι» που ένα μοντέλο ανοιχτού βάρους που εκτελούσε ένα γυμνό μήνυμα ξεπέρασε έναν πράκτορα κωδικοποίησης συνόρων σε μια βαριά συλλογιστική εργασία ασφαλείας.

Mythos at Home

Το σημείο αναφοράς έχει πρόσθετο βάρος στο τρέχον γεωπολιτικό πλαίσιο. Ο τίτλος της ανάρτησης ιστολογίου — «Έχουμε Mythos στο Σπίτι» — είναι μια έντονη αναφορά στο γεγονός ότι το μοντέλο Mythos της Anthropic που εστιάζει στην ασφάλεια στον κυβερνοχώρο δεν είναι ουσιαστικά διαθέσιμο σε μεγάλο μέρος του κόσμου. Αφού η κυβέρνηση Τραμπ απαγόρευσε σε μη αμερικανούς υπηκόους να χρησιμοποιούν το Mythos και τον περιορισμένο αδερφό του Fable 5, οι παγκόσμιες ομάδες ασφαλείας έχασαν την πρόσβαση σε αυτό που ευρέως θεωρούνταν το πιο ικανό AI για επιθετική και αμυντική εργασία ασφαλείας.

Σε αυτό το κενό, προσβάσιμα μοντέλα ανοιχτού βάρους καλύπτουν το κενό. Το γεγονός ότι το GLM 5.2 — δωρεάν λήψη και ανάπτυξη οπουδήποτε — μπορεί ήδη να ταιριάξει ή να ξεπεράσει τα σύνορα ιδιόκτητα μοντέλα σε συγκεκριμένες εργασίες ασφαλείας υποδηλώνει ότι το ψυχρό αποτέλεσμα της απαγόρευσης εξαγωγών μπορεί να είναι μικρότερο από το προβλεπόμενο. Εάν το καλύτερο «απεριόριστο» μοντέλο συνεχίζει να βελτιώνεται, η στρατηγική αξία των δυνατοτήτων αποθήκευσης συνόρων μειώνεται.

Προς το παρόν, το αποτέλεσμα είναι περιορισμένο: ένα ενιαίο σημείο αναφοράς για μια ενιαία κατηγορία ευπάθειας. Αλλά είναι ένα μήνυμα ότι τα σύνορα ανοιχτού βάρους κλείνει πιο γρήγορα από ό,τι υποθέτουν πολλοί και ότι η προσβασιμότητα - όχι η ακατέργαστη ικανότητα - μπορεί να γίνει η καθοριστική μεταβλητή στο τοπίο ασφάλειας της τεχνητής νοημοσύνης.

Το εύρημα εγείρει επίσης άβολα ερωτήματα για τα συνοριακά εργαστήρια. Εάν ένα ελεύθερα διαθέσιμο μοντέλο μπορεί ήδη να ταιριάξει με ιδιόκτητα συστήματα σε εργασίες συλλογιστικής ασφάλειας, η ανταγωνιστική τάφρος γύρω από τα κλειστά μοντέλα στενεύει — ιδιαίτερα όταν οι έλεγχοι εξαγωγών καθιστούν αυτά τα κλειστά μοντέλα απρόσιτα σε τμήματα της παγκόσμιας αγοράς. Οι προγραμματιστές ανοιχτού βάρους, χωρίς περιορισμούς χρήσης, μπορούν να επαναλάβουν και να αναπτύξουν παντού ταυτόχρονα.

Μείνετε μπροστά από την τεχνητή νοημοσύνη

Το χάσμα μεταξύ συνοριακής και ανοιχτής τεχνητής νοημοσύνης μειώνεται στις [έκτακτες ειδήσεις AI] (https://aibuzzwire.news) και στην έρευνα που αναδιαμορφώνει την ασφάλεια, τις υποδομές και την πολιτική.

Διαβάστε περισσότερα νέα AI →