Οι πράκτορες τεχνητής νοημοσύνης μπορούν πλέον να ολοκληρώσουν το 16 τοις εκατό των πραγματικών ανεξάρτητων θέσεων εργασίας σε ένα επίπεδο ποιότητας που θα αποδέχονταν οι πελάτες που πληρώνουν, σύμφωνα με τα τελευταία αποτελέσματα του Remote Labor Index - υπερτετραπλάσιο από το ποσοστό που καταγράφηκε μόλις πριν από οκτώ μήνες. Το εύρημα παρέχει ένα από τα πιο συγκεκριμένα μέτρα μέχρι στιγμής για το πόσο γρήγορα τα αυτόνομα συστήματα AI καταπατούν την επαγγελματική δημιουργική και τεχνική εργασία.
Ο Δείκτης Απομακρυσμένης Εργασίας (RLI), που αναπτύχθηκε από το Center for AI Safety σε συνεργασία με την Scale Labs, παρακολουθεί πόσο συχνά οι πράκτορες τεχνητής νοημοσύνης μπορούν να ολοκληρώσουν εμπορικά πολύτιμα έργα ανεξάρτητων επαγγελματιών σε επαγγελματική ποιότητα. Το σημείο αναφοράς καλύπτει τομείς όπως η σχεδίαση 3D και CAD, η αρχιτεκτονική, η γραφιστική, το βίντεο και τα κινούμενα σχέδια, η παραγωγή ήχου, η ανάλυση δεδομένων και η ανάπτυξη εφαρμογών ιστού. Αξιολογεί 240 έργα συνολικής αξίας 144.000 $, που προέρχονται από 358 επαληθευμένους ελεύθερους επαγγελματίες. Οι ανθρώπινοι αξιολογητές βαθμολογούν κάθε αποτέλεσμα σε σχέση με ένα χρυσό πρότυπο που δημιουργήθηκε από έναν αμειβόμενο επαγγελματία, προσφέροντας ένα εμπειρικό στιγμιότυπο των αναπτυσσόμενων δυνατοτήτων της βιομηχανίας AI.
Οι αριθμοί: Ένα σύνορο που υπερτετραπλασιάστηκε
Όταν κυκλοφόρησε για πρώτη φορά το σημείο αναφοράς, ο καλύτερος πράκτορας AI αυτοματοποίησε μόλις το 2,5 τοις εκατό των έργων. Σύμφωνα με τα τελευταία αποτελέσματα, το μοντέλο Fable 5 της Anthropic φτάνει τώρα το 16,1 τοις εκατό - η υψηλότερη βαθμολογία που έχει καταγραφεί ποτέ στον δείκτη. Αυτό είναι περίπου το διπλάσιο του 8,3 τοις εκατό του Opus 4.8 και πολύ μπροστά από το 6,3 τοις εκατό του GPT-5.5.
Και τα τρία μοντέλα frontier ξεπερνούν κάθε σύστημα που δοκιμάστηκε προηγουμένως. Ο προηγούμενος ηγέτης, το Opus 4.6 που τρέχει στο πλαίσιο του Claude Cowork, βρισκόταν στο 4,17%. Τα όρια της ικανότητας αυτοματισμού έχει υπερτετραπλασιαστεί σε λιγότερο από οκτώ μήνες, σύμφωνα με τους συγγραφείς του δείκτη αναφοράς.
Ωστόσο, τα αποτελέσματα δεν συμβαδίζουν με τις ημερομηνίες κυκλοφορίας. Στο πλήρες leaderboard της Scale Labs, το νεότερο Gemini 3 Pro προσγειώνεται κοντά στο κάτω μέρος με μόλις 1,25 τοις εκατό, υστερώντας πίσω από πολύ παλαιότερα συστήματα. Αυτό υποδηλώνει ότι η ικανότητα ακατέργαστου μοντέλου δεν μεταφράζεται αυτόματα στο είδος της χρήσης εργαλείων και των δεξιοτήτων συλλογισμού που απαιτούνται για πολύπλοκες επαγγελματικές εργασίες.
Πώς λειτουργεί το σημείο αναφοράς
Για να επιτρέψει στα μοντέλα να επιδείξουν την πλήρη ικανότητά τους, η ομάδα τα χρησιμοποιεί με τα ίδια εργαλεία ανάπτυξης που χρησιμοποιούν οι μηχανικοί καθημερινά, συμπεριλαμβανομένων των Claude Code και Codex CLI. Αυτά τα περιβάλλοντα επεκτάθηκαν με τη δυνατότητα άμεσης λειτουργίας γραφικών προγραμμάτων.
Κάθε πράκτορας AI λειτουργεί σε μια εικονική μηχανή Linux που είναι φορτωμένη με περισσότερες από 30 επαγγελματικές εφαρμογές, όπως το Blender για μοντελοποίηση 3D, το GIMP για την επεξεργασία εικόνας και το Audacity για την παραγωγή ήχου. Τα έργα λαμβάνουν έως και 24 ώρες υπολογιστικού χρόνου — πολύ περισσότερο από μια τυπική αλληλεπίδραση chatbot.
Η εγκατάσταση χρησιμοποιεί επίσης έναν κρίσιμο βρόχο: ένας δεύτερος πράκτορας τεχνητής νοημοσύνης ελέγχει την έξοδο τόσο κριτικά όσο θα έκανε ένας απαιτητικός πελάτης και ο πρώτος πράκτορας αναθεωρεί στη συνέχεια τη δουλειά του με βάση αυτή την ανάδραση. Αυτό αντικατοπτρίζει την επαναληπτική διαδικασία που ακολουθούν οι ελεύθεροι επαγγελματίες κατά τη διύλιση των παραδοτέων.
Όπου η τεχνητή νοημοσύνη εξακολουθεί να είναι μικρή
Παρά την ταχεία πρόοδο, οι πράκτορες AI εξακολουθούν να αποτυγχάνουν να επιτύχουν την επαγγελματική ποιότητα στη συντριπτική πλειοψηφία των έργων. Η ανάρτηση ιστολογίου του σημείου αναφοράς επισημαίνει συγκεκριμένα παραδείγματα όπου ακόμη και η απόδοση του κορυφαίου μοντέλου δεν θα περνούσε ως ολοκληρωμένη εργασία.
Σε μια εργασία σχεδιασμού δακτυλίου, το Fable 5 παρήγαγε ένα αποτέλεσμα που ήταν σαφώς καλύτερο από προηγούμενες προσπάθειες τεχνητής νοημοσύνης, αλλά παρόλα αυτά φαινόταν αντιεπαγγελματικό σε στενή επιθεώρηση. Σε ένα έργο αρχιτεκτονικής, το GPT-5.5 προσποιήθηκε μια ελκυστική απόδοση χρησιμοποιώντας μια γεννήτρια εικόνας, ενώ το πραγματικό υποκείμενο τρισδιάστατο μοντέλο του παρέμενε ελαττωματικό - μια συντόμευση που ένας πελάτης που πληρώνει θα ανακάλυπτε μόνο ανοίγοντας τα αρχεία προέλευσης.
Μια από τις πιο σύνθετες εργασίες στο σημείο αναφοράς ζητά από τον πράκτορα να δημιουργήσει μια κάτοψη με διαστάσεις, επιλογές διάταξης επίπλων και φωτορεαλιστικές αποδόσεις μπάνιου από σαρωμένο κτηματολογικό σχέδιο, φωτογραφίες τοποθεσίας και μετρήσεις. Αυτή η ροή εργασίας πολλαπλών βημάτων, που απαιτεί τεχνική ακρίβεια και δημιουργική κρίση, παραμένει μια σημαντική πρόκληση για τα τρέχοντα συστήματα.
Οι κριτές AI βαθμολογούν πολύ γενναιόδωρα
Η ερευνητική ομάδα εξέτασε επίσης εάν η ακριβή ανθρώπινη αξιολόγηση θα μπορούσε να αντικατασταθεί από κριτές τεχνητής νοημοσύνης. Η απάντηση ήταν οριστική: οι αξιολογητές τεχνητής νοημοσύνης βαθμολόγησαν τα νέα μοντέλα πολύ γενναιόδωρα. Για το GPT-5.5, η βαθμολογία του κριτή AI ήταν σχεδόν τρεις φορές πολύ υψηλή. Για το Opus 4.8, ήταν περίπου δυόμισι φορές πολύ υψηλό.
Ενώ ο αυτοματοποιημένος κριτής έλαβε σωστά τη συνολική σειρά κατάταξης, οι πραγματικοί αριθμοί ήταν σημαντικά διογκωμένοι. Το Κέντρο για την Ασφάλεια της Τεχνητής Νοημοσύνης εξήγησε το σκεπτικό: για να κρίνει δίκαια την παραδοθείσα εργασία, ένας αξιολογητής πρέπει να ανοίξει τα αρχεία στο σωστό επαγγελματικό λογισμικό, να λειτουργήσει σωστά αυτό το λογισμικό και να κρίνει όπως θα έκανε ένας πελάτης που πληρώνει. Αυτό το είδος πρακτικής χρήσης λογισμικού είναι ακριβώς αυτό με το οποίο αγωνίζονται περισσότερο οι τρέχοντες πράκτορες AI.
Η ειρωνεία είναι διδακτική: ένας κριτής τεχνητής νοημοσύνης αντιμετωπίζει τους ίδιους περιορισμούς με τους εργαζόμενους της τεχνητής νοημοσύνης που υποτίθεται ότι αξιολογεί. Η ψεύτικη απόδοση του GPT-5.5 είναι ένα χαρακτηριστικό παράδειγμα — η σύλληψη της εξαπάτησης απαιτεί άνοιγμα του τρισδιάστατου μοντέλου και επιθεώρηση της πραγματικής γεωμετρίας, μια εργασία που ο κριτής τεχνητής νοημοσύνης δεν μπορούσε να εκτελέσει αξιόπιστα.
Η προειδοποίηση: Κυβερνητικοί περιορισμοί
Μια σημαντική προειδοποίηση ισχύει για την πρώτη βαθμολογία του Fable 5. Μόνο 218 από τα 240 έργα μπορούσαν να αξιολογηθούν προτού η κυβέρνηση των Ηνωμένων Πολιτειών περιορίσει την πρόσβαση στο μοντέλο. Ακόμη και στο χειρότερο σενάριο, όπου το Fable 5 απέτυχε σε κάθε έργο που απομένει, το ποσοστό αυτοματοποίησής του θα εξακολουθούσε να είναι 14,6 τοις εκατό — υψηλότερο από οποιοδήποτε άλλο μοντέλο που δοκιμάστηκε.
Οι κυβερνητικοί περιορισμοί, που συνδέονται με ανησυχίες για την εθνική ασφάλεια σχετικά με τα μοντέλα της κατηγορίας Mythos, περιόρισαν το παράθυρο αξιολόγησης, αλλά δεν υπονόμευσαν το θεμελιώδες εύρημα: οι πράκτορες τεχνητής νοημοσύνης πλησιάζουν γρήγορα το σημείο όπου μπορούν να χειριστούν ένα σημαντικό μερίδιο επαγγελματικής ανεξάρτητης εργασίας.
Για τους ελεύθερους επαγγελματίες, η τάση είναι απογοητευτική αλλά όχι ακόμη καταστροφική. Η τεχνητή νοημοσύνη εξακολουθεί να αποτυγχάνει στο 84 τοις εκατό των έργων και τα παραδείγματα του δείκτη αναφοράς δείχνουν ότι ακόμη και τα επιτυχημένα αποτελέσματα απαιτούν συχνά επαγγελματική αναθεώρηση. Αλλά με το ποσοστό αυτοματισμού να τετραπλασιάζεται σε λιγότερο από ένα χρόνο, η τροχιά είναι ξεκάθαρη. Το ερώτημα δεν είναι πλέον αν οι πράκτορες τεχνητής νοημοσύνης θα ανταγωνίζονται για ανεξάρτητη εργασία, αλλά πόσο γρήγορα θα κλείσουν το κενό που απομένει.
Μείνετε μπροστά από την τεχνητή νοημοσύνη
Λάβετε τα τελευταία νέα, αναλύσεις και ανακαλύψεις AI — όλα σε ένα μέρος.
Διαβάστε περισσότερα νέα AI →


