Ένα νέο σημείο αναφοράς προκαλεί τον τρόπο με τον οποίο ο κλάδος της τεχνητής νοημοσύνης μετρά τις επιστημονικές ικανότητες και τα πρώτα του αποτελέσματα είναι ταπεινά για τα συνοριακά εργαστήρια. Το Terminal-Bench-Science 0.1, που κυκλοφόρησε αυτήν την εβδομάδα από ερευνητές στο Πανεπιστήμιο του Στάνφορντ και την ομάδα πίσω από το δημοφιλές σημείο αναφοράς κωδικοποίησης Terminal-Bench, αξιολογεί πράκτορες AI σε πραγματικές ροές εργασίας επιστημονικής έρευνας που συνεισφέρουν εργαζόμενοι επιστήμονες — και το ισχυρότερο μοντέλο που δοκιμάστηκε, το Claude Opus 5 που εκτελείται μέσω του Claude Code30, που μόλις ολοκληρώθηκε.

Η σελίδα ανακοινώσεων του σημείου αναφοράς περιγράφει ωμά την κατευθυντήρια αρχή του: οι επιστήμονες, όχι οι προγραμματιστές μοντέλων ή οι προμηθευτές δεδομένων, θα πρέπει να θέτουν τον πήχη για την επιστημονική ικανότητα στην τεχνητή νοημοσύνη. Το έργο δημιουργήθηκε σε συνεργασία με ειδικούς του τομέα από ερευνητικά ιδρύματα σε όλο τον κόσμο και η πρώτη του έκδοση περιλαμβάνει 70 εργασίες που καλύπτουν τις βιοεπιστήμες, τη φυσική, την επιστήμη της γης, τα μαθηματικά και τη μηχανική.

Πώς διαφέρει από τα σημεία αναφοράς σχολικών βιβλίων

Οι περισσότερες επιστημονικές αξιολογήσεις τεχνητής νοημοσύνης ελέγχουν τη γνώση: ερωτήσεις πολλαπλής επιλογής, προβλήματα σχολικών βιβλίων, τυποποιημένες ασκήσεις. Αντίθετα, το Terminal-Bench-Science μετρά εάν οι πράκτορες μπορούν να εκτελέσουν τις τεχνικά απαιτητικές, χρονοβόρες ροές εργασίας που γεμίζουν τις μέρες των πραγματικών ερευνητών — το είδος της εργασίας που δεν εμφανίζεται σε καμία εξέταση. Οι εργασίες εκτελούνται σε ρεαλιστικά περιβάλλοντα και η βαθμολόγηση βασίζεται σε συγκεκριμένα τεχνουργήματα: αναλύσεις, προσομοιώσεις, αποδείξεις, κώδικας και προϊόντα δεδομένων, ελεγμένα με αναπαραγώγιμα τεστ ειδικά για εργασίες αντί να κρίνουν μοντέλα ή βαθμολόγηση πολλαπλών επιλογών.

Αυτός ο σχεδιασμός αντανακλά μια θεωρία για το τι πρέπει τελικά να κάνουν οι βοηθοί τεχνητής νοημοσύνης για την επιστήμη. Αντί να αντικαταστήσουν την επιστημονική κρίση, υποστηρίζουν οι συγγραφείς του σημείου αναφοράς, οι πράκτορες θα πρέπει να αναλάβουν το επίπεδο εκτέλεσης - εκτέλεση των πειραμάτων-in-silico, επεξεργασία των δεδομένων, έλεγχος των αποδείξεων - για να απελευθερώσουν τους επιστήμονες για τα μέρη της έρευνας όπου η ανθρώπινη κρίση έχει μεγαλύτερη σημασία: ορισμός ερωτήσεων, σχηματισμός υποθέσεων, ερμηνεία αποτελεσμάτων.

Το έργο είναι επίσης ρητά κατασκευασμένο ως κινούμενος στόχος. Όπου πολλά σημεία αναφοράς κυκλοφορούν μία φορά και εγκαταλείπονται — η ανακοίνωση το ονομάζει πρόβλημα «έγγραφα προς δημοσίευση» — το Terminal-Bench-Science έχει σχεδιαστεί ως ένα συνεχές σημείο αναφοράς που εξελίσσεται παράλληλα με τα σύνορα, με τακτικές εκδόσεις που αποσκοπούν να κρατήσουν την αξιολόγηση μπροστά από την πρόοδο του μοντέλου και να αποτρέψουν τον πληθωρισμό βαθμολογίας λόγω μόλυνσης.

Το πρώτο Leaderboard: Πολύ μακριά από το αξιόπιστο

Το leaderboard v0.1, το οποίο τράβηξε σημαντική προσοχή όταν έφτασε στο Hacker News αυτή την εβδομάδα, δείχνει μια απότομη πτώση από την κορυφή:

  • Claude Opus 5 (Κωδικός Claude): 30,0%
  • GPT-5,6 Sol (Codex): 22,4%
  • Claude Fable 5 (Claude Code): 21,4%
  • Claude Opus 4.8 (Κωδικός Claude): 10,5%
  • GPT-5,6 Terra (Codex): 8,6%
  • GLM 5.3 (Κωδικός Claude): 8,1%
  • Kimi K3 (Κωδικός Claude): 7,1%
  • Grok 4,6 (Grok Build): 7,1%
  • GPT-5,6 Luna (Κωδικός): 3,3%

Τα αποτελέσματα υποδεικνύουν ότι οι επιστημονικές ροές εργασίας παραμένουν πολύ πιο δύσκολες για τους πράκτορες από τη μηχανική λογισμικού, όπου τα αρχικά Terminal-Bench και τα ανταγωνιστικά σημεία αναφοράς κωδικοποίησης έχουν δει τις βαθμολογίες να ανεβαίνουν γρήγορα. Ένα ποσοστό ανάλυσης 30% για το καλύτερο διαθέσιμο σύστημα σημαίνει ότι σε επτά από τις δέκα πραγματικές ερευνητικές εργασίες, ακόμη και ένας πράκτορας κορυφαίας βαθμίδας σε συνδυασμό με μια ισχυρή ζώνη αποτυγχάνει να παράγει επαληθεύσιμη σωστή εργασία.

Η εξάπλωση εντός των οικογενειών-μοντέλων είναι επίσης διδακτική. Το χάσμα μεταξύ Claude Opus 5 και Claude Opus 4.8 — σχεδόν είκοσι βαθμοί — και μεταξύ των παραλλαγών GPT-5.6 Sol, Terra και Luna δείχνει πόσο η ποιότητα του αποτελέσματος εξαρτάται από την αλληλεπίδραση του μοντέλου και της πλεξούδας πράκτορα, όχι μόνο από την ακατέργαστη ευφυΐα του μοντέλου. Κάθε καταχώριση υψηλής βαθμολογίας χρησιμοποιεί μια πλεξούδα κωδικοποίησης agent (Claude Code, Codex, Grok Build), ενισχύοντας την αναδυόμενη συναίνεση ότι η σκαλωσιά είναι τόσο καθοριστική όσο και τα υποκείμενα βάρη.

Γιατί οι επιστήμονες δημιούργησαν το δικό τους σημείο αναφοράς

Το πλαίσιο του δείκτη αναφοράς φέρει ένα λεπτό θεσμικό επιχείρημα. «Το διακύβευμα στην επιστήμη είναι πολύ υψηλό», αναφέρει η ανακοίνωση, «και τα σημεία αναφοράς της πρέπει να αντικατοπτρίζουν τις προτεραιότητες της επιστημονικής κοινότητας και όχι τα εξωτερικά συμφέροντα». Το έργο δίνει στους εργαζόμενους ερευνητές έναν άμεσο μηχανισμό για να κωδικοποιούν τις εργασίες που πραγματικά χρειάζονται αυτοματοποιημένα - και να συγκρατούν τους ισχυρισμούς των πωλητών για «επιταχυνόμενη επιστημονική ανακάλυψη» σε σχέση με ένα επαληθεύσιμο πρότυπο.

Αυτό έχει σημασία γιατί το χάσμα μεταξύ μάρκετινγκ και πραγματικότητας έχει πραγματικές συνέπειες. Εάν τα συνοριακά εργαστήρια ισχυρίζονται ότι οι αντιπρόσωποί τους μπορούν να επιταχύνουν την έρευνα, ενώ ανεξάρτητες, σχεδιασμένες από ειδικούς αξιολογήσεις δείχνουν ποσοστά επίλυσης μονοψήφια έως 30%, αποφάσεις χρηματοδότησης, σχέδια προσλήψεων και πολιτικές εργαστηρίου που βασίζονται σε αυτούς τους ισχυρισμούς κληρονομούν το σφάλμα. Οι συνεχείς δείκτες αναφοράς που ανήκουν στην κοινότητα είναι ένα διορθωτικό: μετατρέπουν ασαφείς αξιώσεις σε αναπαραγώγιμους αριθμούς.

Ένα σήμα για τα ερευνητικά ιδρύματα

Για τα πανεπιστήμια, τα εθνικά εργαστήρια και τις ομάδες Έρευνας και Ανάπτυξης που σταθμίζουν πότε πρέπει να αναπτύξουν πράκτορες, το σημείο αναφοράς προσφέρει κάτι που οι επιδείξεις προμηθευτών δεν μπορούν: μια μέτρηση που διατηρείται από την κοινότητα για το πού βρίσκεται στην πραγματικότητα η γραμμή αξιοπιστίας. Ένα ποσοστό επίλυσης στην εφηβεία ή στα είκοσι σημαίνει ότι αυτά τα συστήματα αντιμετωπίζονται καλύτερα σήμερα ως βοηθοί που απαιτούν επανεξέταση, όχι ως αυτόνομοι εκτελεστές πειραματικών αγωγών. Οι κατηγορίες εργασιών — που καλύπτουν τη ζωή, τις φυσικές επιστήμες, τις γήινες, μαθηματικές και μηχανικές επιστήμες — παρέχουν επίσης στους ειδικούς τομέα ένα πρότυπο για τη συνεισφορά ροών εργασιών από πεδία που συνήθως παραβλέπουν τα γενικά σημεία αναφοράς.

Το ευρύτερο πλαίσιο του κλάδου ενισχύει γιατί έχει σημασία ο χρόνος. Η επιστήμη έχει γίνει μια από τις πιο προωθημένες περιπτώσεις χρήσης για την τεχνητή νοημοσύνη συνόρων, με τα εργαστήρια να διαφημίζουν συνεισφορές στην ανακάλυψη υλικών, την επιστήμη των πρωτεϊνών και τα μαθηματικά. Αυτοί οι ισχυρισμοί είναι δύσκολο να ελεγχθούν: το επιστημονικό αποτέλεσμα αργεί να επικυρωθεί και ο ενθουσιασμός κινείται πιο γρήγορα από την αναπαραγωγή. Ένα σημείο αναφοράς που βαθμολογεί επαληθεύσιμα τεχνουργήματα σε πραγματικές ροές εργασίας δίνει στα ερευνητικά ιδρύματα έναν τρόπο να διαχωρίζουν τις αποδεδειγμένες ικανότητες από το θέατρο επίδειξης — και να παρακολουθούν, κυκλοφορία με κυκλοφορία, εάν η πρόοδος στην επιστήμη επιδεινώνεται τόσο γρήγορα όσο στη μηχανική λογισμικού, όπου το Terminal-Bench έκανε το όνομά του για πρώτη φορά.

Για τον κλάδο της τεχνητής νοημοσύνης, το μήνυμα του v0.1 είναι διπλό. Τα σύνορα προχωρούν σαφώς — το 30% του Opus 5 υπερβαίνει το 10,5% του παλαιότερου Opus 4.8 — αλλά το ανώτατο όριο παραμένει μακριά από την αξιοπιστία που απαιτούν τα πραγματικά εργαστήρια. Οι σχεδιαστές του σημείου αναφοράς λένε ότι οι τακτικές εκδόσεις θα παρακολουθούν ακριβώς πόσο γρήγορα κλείνει αυτό το κενό. Οι επιστήμονες που παρακολουθούν τις [αναδυόμενες τάσεις της τεχνητής νοημοσύνης] (https://aibuzzwire.news) στα εργαλεία έρευνας πράκτορα έχουν τώρα ένα κριτήριο που κατασκεύασαν οι ίδιοι.

---

Μείνετε μπροστά από την τεχνητή νοημοσύνη

Λάβετε τα τελευταία νέα, αναλύσεις και ανακαλύψεις AI — όλα σε ένα μέρος.

Διαβάστε περισσότερα νέα AI →