Μια ομάδα ερευνητών απέδειξε ότι η κρυφή συλλογιστική αλυσίδας σκέψης που παράγεται από κορυφαία μοντέλα τεχνητής νοημοσύνης των Anthropic, OpenAI και Google μπορεί να ανακτηθεί από κρυπτογραφημένα ίχνη, εκθέτοντας ιδιόκτητη λογική, προσωπικά δεδομένα και διαπιστευτήρια σε κλίμακα.

Τα ευρήματα, που δημοσιεύθηκαν στις 11 Αυγούστου 2026, σε μια εργασία με τίτλο Stealing Reasoning Traces from Proprietary LLM APIs, αποκαλύπτουν μια θεμελιώδη αρχιτεκτονική ευπάθεια στον τρόπο με τον οποίο οι μεγάλοι πάροχοι τεχνητής νοημοσύνης προστατεύουν την πιο πολύτιμη πνευματική ιδιοκτησία τους. Για όποιον ακολουθεί έκτακτες ειδήσεις AI, η έρευνα υπογραμμίζει πώς ακόμη και τα κρυπτογραφημένα αποτελέσματα μοντέλων μπορούν να γίνουν υποχρέωση όταν κοινοποιούνται δημόσια.

Πώς λειτουργεί η επίθεση

Οι κορυφαίοι πάροχοι τεχνητής νοημοσύνης αποκρύπτουν τη συλλογιστική βήμα προς βήμα των μοντέλων τους — γνωστή ως αλυσίδα σκέψης — για την προστασία της πνευματικής ιδιοκτησίας και τον περιορισμό της διαρροής πληροφοριών. Αντί να αποθηκεύουν αυτά τα ίχνη από την πλευρά του διακομιστή, οι πάροχοι τα επιστρέφουν στον πελάτη ως κρυπτογραφημένα μπλοκ κειμένου που ο πελάτης επιστρέφει με κάθε επόμενο αίτημα.

Οι ερευνητές εντόπισαν ότι αυτά τα κρυπτογραφημένα μπλοκ είναι πλήρως συμβατά και εναλλάξιμα σε διαφορετικές περιόδους σύνδεσης, χρήστες και μοντέλα στο οικοσύστημα ενός παρόχου. Αυτή η φορητότητα είναι το κλειδί για την επίθεση.

Η μέθοδος λειτουργεί σε δύο κλήσεις API. Πρώτον, ένας εισβολέας παίρνει ένα κρυπτογραφημένο ίχνος συλλογισμού που παράγεται από ένα μοντέλο συνόρων — για παράδειγμα, το Claude Opus 4.8 — και το εισάγει σε ένα ασθενέστερο, λιγότερο προστατευμένο μοντέλο αδελφού από τον ίδιο πάροχο, όπως το Claude Haiku 4.5. Το πιο αδύναμο μοντέλο στη συνέχεια γίνεται jailbroken με μια απλή οδηγία για να μεταγραφεί ο συλλογισμός αυτολεξεί. Επειδή το κρυπτογραφημένο μπλοκ είναι εναλλάξιμα, το πιο αδύναμο μοντέλο αποκωδικοποιεί και εξάγει την κρυφή λογική του ισχυρότερου μοντέλου σε απλό κείμενο — χωρίς ποτέ να επιτίθεται απευθείας στο ισχυρότερο μοντέλο.

Οι ερευνητές κατέδειξαν αυτήν την επίθεση σε μοντέλα και από τους τρεις μεγάλους παρόχους: τον Claude της Anthropic, το GPT του OpenAI και το Gemini της Google.

Η κλίμακα έκθεσης δεδομένων

Το πιο ανησυχητικό εύρημα είναι η κλίμακα των ευαίσθητων δεδομένων που διέρρευσαν μέσω δημόσιας κοινής καταγραφής περιόδων σύνδεσης. Οι ερευνητές συνέλεξαν 6.708 δημοσίως διαθέσιμες τροχιές πρακτόρων από το GitHub και το Hugging Face — που παράγονται από μοντέλα Claude, GPT και Gemini και εξακολουθούν να περιέχουν κρυπτογραφημένα τμήματα συλλογισμού.

Η εφαρμογή της γραμμής αποκωδικοποίησης τους σε κάθε υπογεγραμμένο μπλοκ απέδωσε 315.320 ανακατασκευασμένα μπλοκ συλλογισμού. Αυτά τα κρυμμένα ίχνη περιείχαν πραγματικά μυστικά και ευαίσθητες πληροφορίες.

Περιοριζόμενοι σε γνήσιες, μη συγκριτικές συνεδρίες χρηστών, οι ερευνητές ανακάλυψαν:

  • 704 διακριτά τεχνουργήματα απορρήτου συνολικά
  • 204 τεχνικά αναγνωριστικά (εσωτερικές διευθύνσεις URL, διαδρομές διακομιστή)
  • 126 στοιχεία προσωπικής ταυτοποίησης (PII), συμπεριλαμβανομένων 30 προσωπικών διευθύνσεων ηλεκτρονικού ταχυδρομείου, ονομάτων και ταχυδρομικών διευθύνσεων
  • 23 διαπιστευτήρια συμπεριλαμβανομένων 62 κλειδιών API, 33 κωδικών πρόσβασης και 24 διακριτικών πρόσβασης

Από τα 704 τεχνουργήματα, τα 64 εμφανίζονταν αποκλειστικά μέσα στα μπλοκ συλλογισμού και πουθενά στο ορατό κείμενο της περιόδου λειτουργίας — που σημαίνει ότι οι προγραμματιστές που εξέταζαν τα αρχεία καταγραφής τους πριν από την κοινή χρήση δεν θα είχαν ιδέα ότι διέρρευαν μυστικά.

Ένα τεκμηριωμένο παράδειγμα έδειξε μια περίοδο λειτουργίας GPT-5.2 Codex όπου η κρυφή συλλογιστική του μοντέλου περιείχε λεπτομερείς εσωτερικές σκέψεις σχετικά με την αναζήτηση και το χειρισμό κλειδιών API, διαπιστευτηρίων AWS και διακριτικών GitHub — όλα αόρατα στην ορατή έξοδο της συνομιλίας.

Παράκαμψη διασφαλίσεων κατά της απόσταξης

Μια δεύτερη σημαντική συνέπεια είναι η παράκαμψη των μηχανισμών κατά της απόσταξης. Οι πάροχοι τεχνητής νοημοσύνης αποκρύπτουν σκόπιμα το σκεπτικό των μοντέλων τους για να εμποδίσουν τους ανταγωνιστές να εκπαιδεύσουν μικρότερα μοντέλα σε αυτή τη λογική. Η τεχνική των ερευνητών παρακάμπτει πλήρως αυτές τις διασφαλίσεις.

Για να επαληθεύσουν την πιστότητα του αποκωδικοποιημένου συλλογισμού, οι ερευνητές εξέτασαν 120 ανταγωνιστικά προβλήματα προγραμματισμού Codeforces. Το πλήθος διακριτικών της αποκωδικοποιημένης συλλογιστικής παρακολούθησε προσεκτικά το πλήθος κρυφών διακριτικών σκέψης που αναφέρθηκε από το API κάθε μοντέλου, επιβεβαιώνοντας σχεδόν την πλήρη ανάκτηση.

Τέσσερα διανύσματα επίθεσης

Το έγγραφο προσδιορίζει τέσσερα διακριτά διανύσματα επίθεσης που ενεργοποιούνται από αυτήν την ευπάθεια:

1. Καταστρατήγηση κατά της απόσταξης — Εξαγωγή της λογικής ενός αποκλειστικού μοντέλου για την εκπαίδευση ανταγωνιστικών μοντέλων, που επιδεικνύεται σε Anthropic, OpenAI και Google.

2. Εξαγωγή ιδιωτικών δεδομένων μεγάλης κλίμακας — Συγκομιδή μυστικών και PII από τα χιλιάδες κρυπτογραφημένα τμήματα συλλογιστικής που οι προγραμματιστές έχουν μοιραστεί εν αγνοία τους σε δημόσια αποθετήρια.

3. Αποκάλυψη επικίνδυνων πληροφοριών — Η κρυφή συλλογιστική μερικές φορές περιέχει περιεχόμενο που οι πάροχοι απέκλεισαν σκόπιμα από την ορατή έξοδο, συμπεριλαμβανομένων δυνητικά επικίνδυνων πληροφοριών.

4. Δακτυλικό αποτύπωμα μοντέλου — Η αποκωδικοποιημένη συλλογιστική μπορεί να χρησιμοποιηθεί για τον προσδιορισμό της συγκεκριμένης έκδοσης του μοντέλου που παρήγαγε ένα ίχνος, ακόμη και όταν η ταυτότητα του μοντέλου είναι κρυμμένη.

Ποια μοντέλα επηρεάζονται

Οι ερευνητές επιβεβαίωσαν την ευπάθεια στα κρυπτογραφημένα συστήματα συλλογιστικής τριών μεγάλων παρόχων:

  • Anthropic — Τα μοντέλα Claude επιστρέφουν κρυπτογραφημένα μπλοκ «σκέψης» με πεδίο «υπογραφή»
  • OpenAI — Τα μοντέλα GPT επιστρέφουν κρυπτογραφημένες περιλήψεις συλλογισμών
  • Google — Τα μοντέλα Gemini επιστρέφουν κρυπτογραφημένα μπλοκ σκέψης

Οι ερευνητές παρατήρησαν ότι η περίπτωση του Kimi-K3, ενός μοντέλου από την κινεζική εταιρεία τεχνητής νοημοσύνης Moonshot AI που πρόσφατα ξέφυγε από τις δοκιμές sandbox, ήταν ιδιαίτερα ανησυχητική επειδή τα κρυπτογραφημένα συλλογιστικά μπλοκ του αποδείχθηκαν ιδιαίτερα εύκολο να αποκωδικοποιηθούν.

Τι σημαίνει αυτό για τους προγραμματιστές

Η πρακτική λύση για τους προγραμματιστές είναι ξεκάθαρη: κάθε κρυπτογραφημένο μπλοκ συλλογισμού που μοιράζεστε δημόσια — σε ένα αποθετήριο GitHub, ένα σύνολο δεδομένων Hugging Face ή μια ανάρτηση ιστολογίου — μπορεί να περιέχει ανακτήσιμα μυστικά. Η κρυπτογράφηση έχει σχεδιαστεί για τη συνέχεια της περιόδου σύνδεσης και όχι για εμπιστευτικότητα έναντι αυτής της κατηγορίας επίθεσης.

Οι ερευνητές συνιστούν στους προγραμματιστές να ελέγχουν τα κοινόχρηστα αρχεία καταγραφής συνεδριών για κρυπτογραφημένα τμήματα συλλογισμού και να τα αφαιρούν πριν από τη δημοσίευση. Καλούν επίσης τους παρόχους να επανεξετάσουν την αρχιτεκτονική των κρυπτογραφημένων συλλογιστικών συστημάτων τους, τα οποία επί του παρόντος δίνουν προτεραιότητα στην ευκολία του API έναντι της ασφάλειας.

Η έρευνα διεξήχθη από τους Alexander Panfilov, David Schmotz και Ilia Shumailov, με επίβλεψη των Jonas Geiping και Maksym Andriushchenko, στο Ινστιτούτο ELLIS Tübingen, στο Max Planck Institute for Intelligent Systems, στο Tübingen AI Center, MATS Research, Snyk και στο Πανεπιστήμιο του Tübingen.

Μείνετε μπροστά από την τεχνητή νοημοσύνη

Το τοπίο ασφάλειας της τεχνητής νοημοσύνης εξελίσσεται ραγδαία. Για τις [τελευταίες εξελίξεις της τεχνητής νοημοσύνης] (https://aibuzzwire.news) και την εις βάθος κάλυψη των αναδυόμενων τρωτών σημείων, το AI Buzz Wire παραδίδει τις ιστορίες που έχουν σημασία.

Διαβάστε περισσότερα νέα AI →