Ένα νέο σημείο αναφοράς που ονομάζεται Real-SWE προκαλεί τον τρόπο με τον οποίο ο κλάδος της τεχνητής νοημοσύνης μετρά την ικανότητα κωδικοποίησης και τα πρώτα αποτελέσματα είναι ταπεινά για τα συνοριακά εργαστήρια. Το Anthropic's Fable 5.1, που τρέχει μέσα στην πλεξούδα Claude Code, οδηγεί τον πίνακα με ποσοστό ανάλυσης 38,8% σε εργασίες που προέρχονται από ιδιωτικές, πραγματικές βάσεις εταιρικών κωδικών. Κανένα μοντέλο που δοκιμάστηκε δεν διαγράφει 40 τοις εκατό.

Το σημείο αναφοράς, το οποίο κυκλοφόρησε αυτόν τον μήνα από την Specific Labs, αξιολογεί μοντέλα τεχνητής νοημοσύνης συνόρων σε ιδιωτικές βάσεις κωδικών παραγωγής που η ομάδα αδειοδοτήθηκε από πραγματικές εταιρείες. Οι δημιουργοί του υποστηρίζουν ότι οι εργασίες που δημιουργούνται από ειδικούς ή συνθετικές εργασίες, όσο καλά σχεδιασμένες κι αν είναι, δεν είναι η αυτολεξεί εργασία που κάνουν στην πραγματικότητα οι μηχανικοί σε πραγματικές εταιρείες. For more context on this story, see our ongoing AI news.

Γιατί οι ιδιωτικές βάσεις κωδικών αλλάζουν την εικόνα

Το Real-SWE διαφέρει από τα καθιερωμένα σημεία αναφοράς όπως το SWE-bench σε δύο άξονες, σύμφωνα με τους συντάκτες του: το υποκείμενο τεχνούργημα κωδικοποίησης και την ιδιαιτερότητα της εντολής. Κάθε εργασία προέρχεται από ένα ιδιόκτητο σύστημα του οποίου ο κώδικας και οι λύσεις δεν είναι διαθέσιμες στο δημόσιο διαδίκτυο, πράγμα που σημαίνει ότι οι πράκτορες δεν μπορούν να βασίζονται σε απομνημονευμένες απαντήσεις που έχουν αντληθεί από δημόσια αποθετήρια.

Τα καθήκοντα έχουν επίσης επιχειρηματικές συνέπειες. Τα παραδείγματα εργασιών του σημείου αναφοράς περιλαμβάνουν τη σωστή χρέωση, τον υπολογισμό των φόρων και τη μετεγκατάσταση πελατών — αλλαγές που επηρεάζουν τον τρόπο λειτουργίας μιας επιχείρησης, συχνά σε πολλές υπηρεσίες. Κάθε εταιρεία έχει τις δικές της συμβάσεις και τρόπους σύνταξης κώδικα, και οι πράκτορες πρέπει να κατανοήσουν αυτούς τους κανόνες και να κάνουν αλλαγές που λειτουργούν με αυτό που υπάρχει ήδη.

"Μπορεί ένας παράγοντας κωδικοποίησης να κάνει πραγματικά τη δουλειά ενός μηχανικού λογισμικού στον πραγματικό κόσμο;" ρωτά η εισαγωγή του σημείου αναφοράς. Ο πίνακας κατάταξης προτείνει η απάντηση, προς το παρόν, είναι: μόνο περίπου το ένα τρίτο του χρόνου στην καλύτερη περίπτωση.

Ο πλήρης πίνακας κατάταξης

Το Specific Labs αξιολόγησε οκτώ συνδυασμούς μοντέλου και πλεξούδας συνόρων, μετρώντας τον ρυθμό ανάλυσης ως pass@1 κατά μέσο όρο σε οκτώ ανεξάρτητες διαδρομές ανά εργασία, με διαστήματα εμπιστοσύνης 95 τοις εκατό:

1. Fable 5.1 (Claude Code) — 38,8%
2. GPT-6 Astra (Codex CLI) — 33,8%
3. Gemini 3.8 Flash (Gemini CLI) — 31,2%
4. GLM 5.3 (Κωδικός Claude) — 28,8%
5. (ισοπαλία) Grok 4,6 (Grok Build) — 23,8%
5. (ισοπαλία) Muse Spark 1.3 (Muse Code) — 23,8%
7. Kimi K3 (Κωδικός Kimi) — 18,8%
8. GPT-5.6 Sol (Codex CLI) — 16,2%

Τα αποτελέσματα συζητήθηκαν εκτενώς στο Hacker News το Σαββατοκύριακο, όπου το σημείο αναφοράς συγκέντρωσε αρκετές εκατοντάδες θετικές ψήφους και μια έντονη συζήτηση σχετικά με το εάν η αξιολόγηση ιδιωτικής βάσης κωδικών είναι το σωστό κριτήριο για την πρόοδο των πρακτόρων.

Μια στενή αλλά με νόημα διάδοση στην κορυφή

Το χάσμα μεταξύ των τεσσάρων κορυφαίων συστημάτων είναι αξιοσημείωτο για όσα λέει για το τρέχον ανταγωνιστικό τοπίο. Το προβάδισμα πέντε πόντων του Fable 5.1 έναντι του GPT-6 Astra του OpenAI έχει νόημα σε ένα σημείο αναφοράς όπου κάθε εργασία είναι πραγματικό πρόβλημα παραγωγής. Το Gemini 3.8 Flash που κατέλαβε την τρίτη θέση είναι εντυπωσιακό, καθώς το μοντέλο τοποθετείται ως ένα γρήγορο, χαμηλού κόστους άλογο εργασίας και όχι ως ένα κορυφαίο σύστημα συλλογισμού. Το GLM 5.3 της Z.ai, που αξιολογήθηκε μέσω του Claude Code, που προσγειώνεται σε απόσταση πέντε σημείων από τον ηγέτη υπογραμμίζει πόσο ανταγωνιστικά έχουν γίνει τα μοντέλα ανοιχτού βάρους σε πρακτικές εργασίες μηχανικής.

Το ίδιο χαρακτηριστικό είναι και το spread στο κάτω μέρος. Το GPT-5.6 Sol, μια παλαιότερη έκδοση OpenAI, επιλύει λιγότερες από τις μισές εργασίες σε σχέση με το Fable 5.1 — μια υπενθύμιση του πόσο γρήγορα έχει μετακινηθεί τα σύνορα και πόσο απότομη μπορεί να είναι η απόρριψη μόλις μια γενιά μοντέλου πίσω.

Οι ζώνες έχουν σημασία όσο και τα μοντέλα

Μία από τις μεθοδολογικές επιλογές του σημείου αναφοράς εφιστά την προσοχή: αντί να αξιολογεί τα μοντέλα μεμονωμένα, η Real-SWE χρησιμοποιεί εγγενείς πλεξούδες — Claude Code, Codex CLI, Gemini CLI, Grok Build — για να αντικατοπτρίζει τον τρόπο με τον οποίο λειτουργούν οι μηχανικοί επιχειρήσεων στην πράξη. Ο πίνακας κατάταξης κατατάσσει ρητά τους συνδυασμούς μοντέλου και πλεξούδας, αναγνωρίζοντας ότι οι βρόχοι σκαλωσιάς, πρόσβασης εργαλείων και επανάληψης είναι πλέον αδιαχώριστα από την ικανότητα του μοντέλου σε πραγματικές αναπτύξεις.

Αυτό το πλαίσιο έχει σημασία για τις επιχειρήσεις που επιλέγουν συστήματα. Το ίδιο μοντέλο μπορεί να αποδώσει πολύ διαφορετικά ανάλογα με την πλεξούδα αντιπροσώπου που είναι τυλιγμένη γύρω του και οι αγοραστές που αξιολογούν τους βοηθούς κωδικοποίησης σε δημόσιους αριθμούς αναφοράς μπορεί να έχουν μια παραμορφωμένη εικόνα του πώς θα συμπεριφέρονται αυτά τα συστήματα στις δικές τους βάσεις κωδικών.

Τι σημαίνει για τη βιομηχανία

Οι δείκτες αναφοράς έχουν κατηγορηθεί επανειλημμένα για κορεσμό, με τα συνοριακά μοντέλα να δημοσιεύουν σχεδόν τέλειες βαθμολογίες σε δημόσιες δοκιμές που διαρρέουν σε δεδομένα εκπαίδευσης. Η σχεδίαση της Real-SWE προσπαθεί να αντιμετωπίσει και τα δύο προβλήματα ταυτόχρονα: ο κώδικας είναι ιδιωτικός και αδειοδοτημένος, οι εργασίες είναι γνήσια προϊόντα εργασίας εργαζομένων ομάδων μηχανικών και οι οδηγίες αντικατοπτρίζουν την ακατάστατη ιδιαιτερότητα των πραγματικών εισιτηρίων και όχι τις απλές δηλώσεις προβλημάτων.

Το αποθαρρυντικό takeaway είναι το απόλυτο επίπεδο. Ακόμη και το καλύτερο σύστημα επιλύει λιγότερες από τέσσερις στις δέκα πραγματικές εταιρικές εργασίες με την πρώτη προσπάθεια, κατά μέσο όρο σε οκτώ εκτελέσεις. Παρά την πρόοδο στην αντιπροσωπευτική κωδικοποίηση, το σημείο αναφοράς υποδηλώνει ότι η αυτόνομη μηχανική λογισμικού σε πραγματικά συστήματα παραγωγής παραμένει μια εποπτευόμενη δραστηριότητα - μια δραστηριότητα όπου οι ανθρώπινοι μηχανικοί εξετάζουν, ανακατευθύνουν και επισκευάζουν πολύ πιο συχνά από ό,τι υπονοούν οι επιδείξεις προμηθευτών.

Για επιχειρήσεις που επιλέγουν μεταξύ των βοηθών κωδικοποίησης, το σημείο αναφοράς προσφέρει μια πρακτική λίστα ελέγχου: προτιμήστε συστήματα που αξιολογούνται σε ιδιωτικό κώδικα, επιμείνετε σε διαστήματα εμπιστοσύνης αντί για αριθμούς επικεφαλίδων μίας εκτέλεσης και ποιότητα δέσμης βάρους τόσο πολύ όσο και η ικανότητα ακατέργαστου μοντέλου. Ο πρώτος πίνακας κατάταξης της Real-SWE δεν θα είναι η τελευταία λέξη — αλλά είναι η πιο άμεση απάντηση μέχρι τώρα στην ερώτηση που θέτει κάθε ηγέτης μηχανικής σχετικά με την ατζέντη κωδικοποίηση.

Για περισσότερα σχετικά με τους πράκτορες κωδικοποίησης, τις εκδόσεις μοντέλων και την έρευνα που τους διαμορφώνει, ακολουθήστε τα τελευταία νέα για την τεχνητή νοημοσύνη καθώς πλησιάζει ο επόμενος γύρος αποτελεσμάτων αναφοράς.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →