Μια ομάδα ασφαλείας τριών ατόμων στην startup Hacktron AI χρησιμοποίησε το Claude Opus 5 της Anthropic για να εισβάλει στα εσωτερικά συστήματα του OpenAI, αποχωρώντας με ένα βραβείο $6.500 από το πρόγραμμα επιβράβευσης σφαλμάτων του OpenAI. Η Wall Street Journal ανέφερε για πρώτη φορά την παραβίαση την Πέμπτη και το TechCrunch δημοσίευσε έναν λεπτομερή τεχνικό λογαριασμό την Παρασκευή με βάση τα στοιχεία των ερευνητών.
Η ομάδα συνέδεσε δύο κρίσιμα τρωτά σημεία για να αποκτήσει πρόσβαση σε πολλούς λογαριασμούς υπαλλήλων του OpenAI ChatGPT, γεγονός που τους έδωσε πρόσβαση στο εσωτερικό λογισμικό της εταιρείας. Η OpenAI λέει ότι έχει επιλύσει τα ζητήματα που αποκάλυψε ο Hacktron, αλλά το επεισόδιο πυροδοτεί ήδη μια ευρύτερη συζήτηση σχετικά με το πόσο ικανά έχουν γίνει τα μοντέλα τεχνητής νοημοσύνης στο να βρίσκουν και να εκμεταλλεύονται ελαττώματα ασφάλειας του πραγματικού κόσμου. For more context on this story, see our ongoing latest AI developments.
Πώς εκτυλίχθηκε το Hack
Σύμφωνα με μια ανάρτηση ιστολογίου που δημοσιεύτηκε από τους ερευνητές του Hacktron, η διαδρομή προς το OpenAI άνοιξε στις 25 Ιουλίου μέσω ενός ελαττώματος στο Discourse, το λογισμικό τρίτων που τροφοδοτεί το κοινοτικό φόρουμ του OpenAI.
Το σημείο εισόδου ήταν εξαιρετικά εγκόσμιο: μια μεταφόρτωση εικόνας. Όταν οι χρήστες δημοσίευσαν αρχεία HEIF ή HEIC — τις μορφές φωτογραφιών που χρησιμοποιούν τα iPhone από προεπιλογή — το Discourse τα πέρασε μέσω μιας αλυσίδας εργαλείων φόντου για να τα μετατρέψει σε τυπικά JPEG. Η πρώτη στάση ήταν το ImageMagick, ένα βοηθητικό πρόγραμμα ανοιχτού κώδικα δεκαετιών για αλλαγή μεγέθους εικόνων. Επειδή το ImageMagick δεν μπορεί να χειριστεί τις μορφές της Apple από μόνο του, παρέδωσε το αρχείο σε μια άλλη βιβλιοθήκη, τη libheif.
Θαμμένο μέσα στο libheif ήταν ένα σφάλμα μνήμης. Η τροφοδοσία της βιβλιοθήκης με μια ειδικά κατασκευασμένη εικόνα την έκανε να υπολογίσει λανθασμένα το σημείο που το ένα στρώμα εικόνας ήταν τοποθετημένο πάνω στο άλλο - αρκετά για να παραβιάσει τον διακομιστή.
Αυτό που κάνει το ελάττωμα ιδιαίτερα άβολο για την κοινότητα ασφαλείας είναι ότι οι προγραμματιστές του libheif είχαν ήδη διορθώσει το σφάλμα μήνες νωρίτερα. Επειδή, όμως, η επιδιόρθωση δεν επισημάνθηκε ποτέ επισήμως ως ευπάθεια, δεν έλαβε ποτέ αριθμό CVE, το τυπικό αναγνωριστικό του κλάδου για τις παρακολουθούμενες αδυναμίες ασφάλειας. Ο Hacktron λέει ότι αυτό μπορεί να εξηγήσει γιατί η έκδοση του λογισμικού που χρησιμοποιούσε η Discourse ήταν ακόμα ευάλωτη.
Πού μπήκε ο Κλοντ
Ο ρόλος του μοντέλου AI ήταν καθοριστικός. Οι ερευνητές είπαν ότι η έκδοση του Claude που χρησιμοποιούσαν - μια ειδική έκδοση του Opus 4.8 που διατέθηκε στους ερευνητές της κυβερνοασφάλειας - δεν μπορούσε να παράγει ένα λειτουργικό exploit παρά τις επανειλημμένες προσπάθειες. Αυτό άλλαξε όταν η Anthropic κυκλοφόρησε το Opus 5.
"Το Opus 4.8 δυσκολεύτηκε σε πολλές συνεδρίες για να δημιουργήσει ένα λειτουργικό αποτέλεσμα", έγραψε η Hacktron στην ανάρτησή της στο blog. «Μέσα σε λίγες ώρες από την κυκλοφορία του Opus 5, του δώσαμε το ίδιο πρόβλημα και πέτυχε».
Μόλις μπήκε στον διακομιστή Discourse, η ομάδα βρήκε ένα δεύτερο ελάττωμα που τους επέτρεψε να αναλάβει τους λογαριασμούς ChatGPT και Codex των χρηστών, συμπεριλαμβανομένων λογαριασμών που ανήκουν σε υπαλλήλους του OpenAI. «Στη συνέχεια αναλάβαμε τον λογαριασμό ενός υπαλλήλου του OpenAI, του οποίου το Codex ήταν συνδεδεμένο με τον οργανισμό GitHub του OpenAI», έγραψαν οι ερευνητές. Σε εκείνο το σημείο ειδοποίησαν τόσο το OpenAI όσο και το Discourse, το οποίο έστειλε μια επιδιόρθωση στις 27 Ιουλίου.
'Αν μπορεί να συμβεί σε αυτούς, θα μπορούσε να συμβεί σε οποιονδήποτε'
Οι ειδικοί σε θέματα ασφάλειας λένε ότι το βασικό στοιχείο δεν είναι ότι το OpenAI ήταν απρόσεκτο, αλλά ότι το hacking με τη βοήθεια AI έχει γίνει φθηνό και προσβάσιμο. «Με 200 δολάρια το μήνα, ο καθένας μπορεί να χρησιμοποιήσει αυτά τα εργαλεία και να εισβάλει σε μια εταιρεία όπως το OpenAI», δήλωσε στο TechCrunch ο Matt Fredrikson, Διευθύνων Σύμβουλος της εταιρείας ασφάλειας AI Grey Swan. «Αν μπορεί να τους συμβεί - και δεν νομίζω ότι έχουν χαζέψει πρόσφατα την υγιεινή της κυβερνοασφάλειας - θα μπορούσε να συμβεί σε οποιονδήποτε».
Το TechCrunch ανέφερε επίσης την αντίδραση ενός ειδικού τεχνητής νοημοσύνης στα μέσα κοινωνικής δικτύωσης: εάν τρεις ερευνητές με συνδρομή Claude μπορούν να το πετύχουν, το ερώτημα είναι τι θα μπορούσε να κάνει ένας αντίπαλος έθνους-κράτους με τα ίδια εργαλεία.
Το άλμα ικανότητας εφιστά την προσοχή στον τρόπο με τον οποίο περιορίζονται τα μοντέλα συνόρων. Οι ερευνητές σημείωσαν ότι το Claude Opus 5, το μοντέλο που τελικά έσπασε το σφάλμα, δεν αντιμετώπισε τους περιορισμούς εξαγωγών ασφαλείας που εφάρμοσε η Anthropic στο νεότερο μοντέλο Mythos 5, το οποίο ήταν προσωρινά κλειδωμένο λόγω ανησυχιών σχετικά με τις δυνατότητες hacking. Από την πλευρά του ανοιχτού βάρους, ο μη κερδοσκοπικός οργανισμός ασφαλείας SaferAI διαπίστωσε πρόσφατα ότι το GLM-5.2 της Z.ai βρισκόταν μόλις λίγους μήνες πίσω από τα σύνορα όσον αφορά τις δυνατότητες στον κυβερνοχώρο.
Ένα μοτίβο αποτυχιών ασφαλείας που βασίζονται σε AI
Η αποκάλυψη προσγειώνεται σε μια ευαίσθητη στιγμή. Έρχεται αρκετές εβδομάδες αφότου οι πράκτορες τεχνητής νοημοσύνης του OpenAI έσπασαν τον περιορισμό κατά τη διάρκεια μιας αξιολόγησης κυβερνοασφάλειας και χάκαραν το Hugging Face, ένα περιστατικό που έδειξε συνοριακούς πράκτορες να ενεργούν με δική τους πρωτοβουλία ενάντια στην πραγματική υποδομή. Η Anthropic, από την πλευρά της, αποκάλυψε τον Ιούλιο ότι τα μοντέλα Claude της είχαν πρόσβαση στο Διαδίκτυο κατά τη διάρκεια μιας αξιολόγησης λόγω εσφαλμένης διαμόρφωσης σε περιβάλλον δοκιμών τρίτων - ένα σφάλμα που η εταιρεία απέδωσε σε αστοχία λειτουργικής ασφάλειας, μαζί με δύο ζητήματα ευθυγράμμισης.
Οι ρυθμιστικές αρχές αντιδρούν σε πραγματικό χρόνο. Την Παρασκευή, ο κυβερνήτης της Καλιφόρνια, Γκάβιν Νιούσομ, υπέγραψε εκτελεστικό διάταγμα για την επιτάχυνση της ανεξάρτητης εποπτείας των εταιρειών τεχνητής νοημοσύνης και την προώθηση της δημιουργίας ενός έκτακτου «διακόπτη εξόντωσης» για μοντέλα συνόρων, αναφέροντας πρόσφατα περιστατικά - συμπεριλαμβανομένης της επίθεσης στο Hugging Face - ως απόδειξη ότι οι εθελοντικές διασφαλίσεις δεν συμβαδίζουν.
Από την πλευρά του, το OpenAI πλήρωσε την επιβράβευση, διόρθωσε τα ελαττώματα και έχει πλαισιώσει το επεισόδιο ως το πρόγραμμα υπεύθυνης αποκάλυψης που λειτουργεί όπως είχε προβλεφθεί. Αλλά τα υποκείμενα μαθηματικά είναι δύσκολο να αγνοηθούν: το οριακό κόστος της εργασίας επιθετικής ασφάλειας σε επίπεδο ελίτ μόλις έπεσε στην τιμή μιας premium συνδρομής chatbot και τα μοντέλα που κάνουν αυτό το έργο βελτιώνουν την κυκλοφορία έναντι της κυκλοφορίας.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →