Η Anthropic δημοσίευσε μια πρώτη στο είδος της ματιά στο δικό της αγωγό ανάπτυξης αυτή την εβδομάδα, αποκαλύπτοντας ότι το μοντέλο Claude της «οδηγεί» τώρα το 26% των εργασιών έρευνας και ανάπτυξης τεχνητής νοημοσύνης στην εταιρεία — από λιγότερο από 1% τον Φεβρουάριο του 2026. Τα στοιχεία εμφανίστηκαν σε μια ανάρτηση ιστολογίου της εταιρείας με τίτλο "Measurements for κατανόηση του ρυθμού της τεχνητής νοημοσύνης που δημοσιεύτηκε από το Anthro 7 εντός Σεπτεμβρίου". Reuters, The Washington Post και άλλα μέσα.
Η ανάρτηση είναι εν μέρει άσκηση διαφάνειας και εν μέρει ένα επιχείρημα: Η Anthropic θέλει άλλα συνοριακά εργαστήρια να δημοσιεύουν τα ίδια είδη αριθμών, έτσι ώστε το κοινό και οι κυβερνήσεις να μπορούν να παρακολουθούν πόσο γρήγορα παραδίδονται στην τεχνητή νοημοσύνη τα κλειδιά για την κατασκευή AI. For more context on this story, see our ongoing breaking AI news.
Τρεις αριθμοί για την παρακολούθηση της ανάπτυξης AI
Η εταιρεία πρότεινε τρεις μετρήσεις που, όπως λέει, φωτίζουν τον ρυθμό ανάπτυξης εντός των συνοριακών εργαστηρίων: πόσο μεγάλο μέρος της Ε&Α της τεχνητής νοημοσύνης εκτελείται από την ίδια την τεχνητή νοημοσύνη, πόσο καλά επιβλέπονται οι ενέργειες των πρακτόρων τεχνητής νοημοσύνης και πώς κατανέμεται ο υπολογισμός μεταξύ της εργασίας ικανοτήτων και της εργασίας ασφάλειας.
Ο αριθμός επικεφαλίδας προέρχεται από αυτό που η Anthropic ονομάζει R&D Automation Index. Η εταιρεία καταλόγισε κάθε είδους εργασία Ε&Α τεχνητής νοημοσύνης που έγινε στην εταιρεία, βαθμολόγησε πόσο αυτοματοποιημένη είναι κάθε εργασία αυτή τη στιγμή και συγκέντρωσε τα αποτελέσματα χρησιμοποιώντας μια κλίμακα που αναπτύχθηκε από την ερευνητική ομάδα Epoch AI. Η κλίμακα εκτείνεται από το AL0 (χωρίς εμπλοκή AI) έως το AL5 (το AI λειτουργεί πλήρως αυτόνομα, χωρίς άνθρωπο στο βρόχο), με το AL3 να σημαίνει ότι το AI "συνεργάζεται" σε μεγάλα κομμάτια εργασίας υπό στενή ανθρώπινη διεύθυνση και το AL4 που σημαίνει το AI "οδηγεί", ολοκληρώνοντας το μεγαλύτερο μέρος μιας εργασίας από άκρο σε άκρο από μια ανθρώπινη προτροπή υψηλού επιπέδου.
Από τον Αύγουστο του 2026, ανέφερε η Anthropic, ο Claude ηγείται του 26% των εργασιών Ε&Α τεχνητής νοημοσύνης της εταιρείας. Το μερίδιο της εργασίας σε ή πάνω από το επίπεδο "AI συνεργάζεται" είναι πάνω από 90%. Ο Claude δεν λειτουργεί πλήρως αυτόνομα για οποιοδήποτε μετρημένο υποσύνολο εργασιών Ε&Α AI.
30.000 Agents, One Monitor
Η δεύτερη μέτρηση αφορά την επίβλεψη. Η Anthropic αποκάλυψε ότι από τον Αύγουστο του 2026 υπήρχαν περίπου 30.000 πράκτορες που έκαναν εργασίες έρευνας και μηχανικής στην εταιρεία ανά πάσα στιγμή στην πιο χρησιμοποιούμενη εσωτερική πλατφόρμα της.
Κάθε ενέργεια που κάνουν αυτοί οι πράκτορες περνά από μια ηλεκτρονική οθόνη προτού εκτελεστεί, συνήθως μέσα σε δευτερόλεπτα, σύμφωνα με την ανάρτηση. Η Anthropic λέει ότι ανέλυσε περισσότερες από ένα δισεκατομμύριο αποφάσεις από τους πράκτορες έρευνας και μηχανικής της τον Αύγουστο και διαπίστωσε ότι το μερίδιο των δραστηριοτήτων που μπλοκάρονται ή κλιμακώνονται από τις οθόνες ήταν 0,002%.
Όσον αφορά την υπολογιστική κατανομή, την τρίτη μέτρηση, η εταιρεία είπε ότι κατά τη διάρκεια της εξεταζόμενης εβδομάδας περίπου το 6% του υπολογισμού που πήγε στην Ε&Α τεχνητής νοημοσύνης κατανεμήθηκε στην ασφάλεια.
Χτίζοντας τον δικό της διάδοχο — με τους ανθρώπους να επιβλέπουν
Το καδράρισμα μετράει όσο και οι φιγούρες. Τα μοντέλα της Anthropic συμμετέχουν ολοένα και περισσότερο στην κατασκευή της επόμενης γενιάς αυτών των ίδιων μοντέλων - αυτό που οι ερευνητές αποκαλούν αναδρομική αυτοβελτίωση και αυτό που ο τίτλος της Washington Post περιέγραψε πιο ωμά ως ένα chatbot που «αναλαμβάνει το έργο της οικοδόμησης του δικού του διαδόχου».
Η Anthropic φροντίζει να χαράξει μια γραμμή μεταξύ των "οδηγών AI" και "AI αντικαθιστά". Στο AL4, ένας άνθρωπος εξακολουθεί να επιβλέπει και μπορεί να επέμβει. η εταιρεία ανέφερε ρητά ότι κανένα μετρούμενο υποσύνολο των εργασιών Ε&Α της δεν εκτελείται στο AL5. Αλλά η τροχιά είναι απότομη: η μετάβαση από κάτω από 1% σε 26% σε περίπου επτά μήνες υποδηλώνει ότι το μερίδιο της εργασίας που καθοδηγείται από την τεχνητή νοημοσύνη θα μπορούσε να περάσει κατά το ήμισυ πολύ πριν από το τέλος της δεκαετίας, εάν διατηρηθούν οι τρέχουσες τάσεις.
Η μεθοδολογία έχει πραγματικά όρια και η Anthropic το λέει. Οι βαθμολογίες αυτοματοποίησής του προέκυψαν δειγματοληπτικά τα αρχεία εργασίας της εταιρείας - συμπεριλαμβανομένων των μηνυμάτων Slack και της εσωτερικής τεκμηρίωσης - και με το να αξιολογήσουν τόσο οι άνθρωποι όσο και το μοντέλο κριτής πόσο αυτοματοποιημένη είναι κάθε εργασία. Σε ένα τυφλό τεστ, το προσωπικό βαθμολόγησε τις εργασίες χωρίς να γνωρίζει ποια στοιχεία είχαν συγκεντρώσει τα μοντέλα. Η εταιρεία ανέφερε ότι ο κριτής μοντέλου συμφωνούσε με τους ανθρώπους περίπου όσο συχνά συμφωνούσαν οι άνθρωποι μεταξύ τους: η ακριβής συμφωνία μοντέλου με άνθρωπο ήταν 59%, ενώ η συμφωνία ανθρώπου προς άνθρωπο ήταν μόλις 35% και οι αξιολογήσεις μοντέλου και ανθρώπου προσγειώθηκαν σε ένα επίπεδο μεταξύ τους το 97% των περιπτώσεων.
Η εταιρεία αναγνώρισε επίσης τον αυτοαναφορικό κίνδυνο στη δική της μεθοδολογία: η Anthropic χρησιμοποίησε τα δικά της μοντέλα για να βοηθήσει στην αξιολόγηση των συστημάτων της, πράγμα που θα μπορούσε να σημαίνει ότι το μοντέλο κριτής κάνει τα ίδια είδη σφαλμάτων με το μοντέλο που ελέγχει. Η επαλήθευση από τρίτους, υποστηρίζει, είναι η πραγματική απάντηση.
Έρχονται έξω μάτια
Για το σκοπό αυτό, η Anthropic λέει ότι σχεδιάζει να ενσωματώσει ανεξάρτητους τρίτους αξιολογητές από πολλούς οργανισμούς εντός της εταιρείας, δίνοντάς τους πρόσβαση σε εσωτερικές διαδικασίες, συστήματα και δεδομένα συγκρίσιμα με αυτά που διαθέτουν οι εσωτερικές ομάδες αξιολόγησης κινδύνου. Ο εξωτερικός μη κερδοσκοπικός οργανισμός έρευνας τεχνητής νοημοσύνης METR έχει συνεργαστεί στο παρελθόν με την εκτός σύνδεσης πλατφόρμα παρακολούθησης της Anthropic.
Η αποκάλυψη έρχεται εν μέσω μιας κλιμακούμενης συζήτησης για τον ρυθμό. Ο Διευθύνων Σύμβουλος της Anthropic, Dario Amodei, ζήτησε συντονισμό για την επιβράδυνση των συνόρων και η εταιρεία σημειώνει ότι οι δικοί της αριθμοί αναμένεται να αλλάξουν εάν υπήρχε τέτοιος συντονισμός. Αυτή την εβδομάδα, το Anthropic και το OpenAI αποτέλεσαν επίσης αντικείμενο δημόσιας επιστολής από ειδικούς σε θέματα ασφάλειας που υποστήριζαν ότι τα εργαστήρια χρειάζονται πραγματικά ανεξάρτητους αξιολογητές ασφάλειας.
Το αν οι αντίπαλοι ακολουθούν το παράδειγμα της Anthropic είναι το ανοιχτό ερώτημα. Η εταιρεία υποστηρίζει ότι οποιοσδήποτε μεθοριακός προγραμματιστής θα μπορούσε να δημοσιεύει αυτά τα μέτρα τακτικά χρησιμοποιώντας μια δημόσια μεθοδολογία. Μέχρι να το κάνουν, οι μόνοι δημόσιοι αριθμοί για το πόσο γρήγορα η τεχνητή νοημοσύνη δημιουργεί την τεχνητή νοημοσύνη προέρχονται από τα ίδια τα εργαστήρια.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →