Το αποκεντρωμένο εργαστήριο τεχνητής νοημοσύνης Prime Intellect δημοσίευσε τα αποτελέσματα ενός πειράματος μεγάλης κλίμακας που δοκιμάζει πόσο καλά τα σημερινά μοντέλα συνοριακής τεχνητής νοημοσύνης μπορούν να εκτελούν αυτόνομη έρευνα μηχανικής μάθησης — και τα καλύτερα από αυτά πλησίασαν εντυπωσιακά το ανθρώπινο παγκόσμιο ρεκόρ σε ένα διάσημο κοινοτικό σημείο αναφοράς.
Το έργο, που ονομάστηκε NanoGPT Speedrun Frontier και δημοσιεύτηκε στις 22 Αυγούστου, αποτελούνταν από 153 αυτόνομες διαδρομές σε 18 μοντέλα frontier που επιχειρούσαν το nanoGPT optimizer speedrun — έναν διαγωνισμό στον οποίο οι ερευνητές αναζητούν τον πιο αποτελεσματικό τρόπο εκπαίδευσης ενός μοντέλου μικρής γλώσσας σε έναν σταθερό ποιοτικό στόχο. Η ιστορία ανέβηκε γρήγορα στην πρώτη σελίδα του Hacker News, όπου συγκέντρωσε δεκάδες σχόλια που συζητούσαν τι λένε τα αποτελέσματα για την ικανότητα της τεχνητής νοημοσύνης για γνήσια επιστημονική ανακάλυψη. For more context on this story, see our ongoing AI trends.
Τι είναι στην πραγματικότητα το NanoGPT Speedrun
Το σημείο αναφοράς προέρχεται από το αποθετήριο modded-nanogpt που διατηρεί η Keller Jordan και μια μακρά λίστα συνεισφερόντων της κοινότητας. Η πρόκληση είναι απατηλά απλή στην έκφραση: χρησιμοποιώντας 8 GPU NVIDIA H100, εκπαιδεύστε ένα μοντέλο γλώσσας που φτάνει τις 3,28 απώλεια διασταυρούμενης εντροπίας στο σύνολο επικύρωσης FineWeb — το επίπεδο απόδοσης που επιτεύχθηκε η αρχική αναπαραγωγή GPT-2 του Andrej Karpathy μετά από 45 λεπτά — όσο το δυνατόν γρηγορότερα.
Μέσα από εκατοντάδες συνεισφορές της κοινότητας τα τελευταία δύο χρόνια, το ανθρώπινο ρεκόρ μειώθηκε σε λιγότερο από 75 δευτερόλεπτα και κάτω από 400 εκατομμύρια μάρκες εκπαίδευσης, μια βελτίωση πάνω από 30 φορές σε σχέση με την αρχική συνταγή. Οι νικητήριες λύσεις είναι σαν ένας κατάλογος σύγχρονης μηχανικής ML: ο βελτιστοποιητής Muon, περιστροφικές ενσωματώσεις με QK-Norm, ενεργοποιήσεις σε τετράγωνο ReLU, κβαντισμός FP8 στην προσοχή και περάσματα MLP, Flash Attention 3 με μοτίβα συρόμενων παραθύρων και δεκάδες άλλες τεχνικές στοιβαγμένες η μία πάνω στην άλλη.
Η δοκιμή του Prime Intellect χρησιμοποίησε το κομμάτι βελτιστοποίησης του σημείου αναφοράς, το οποίο — σύμφωνα με την τεκμηρίωση του αποθετηρίου — ελαχιστοποιεί τον αριθμό των βημάτων εκπαίδευσης που απαιτούνται για την επίτευξη της απώλειας στόχου, με την επιφύλαξη μιας σταθερής αρχιτεκτονικής, δεδομένων και μεγέθους παρτίδας, με έναν αποτελεσματικά απεριόριστο προϋπολογισμό ρολογιού τοίχου. Αυτό το καθιστά ένα καθαρό τεστ ανακάλυψης αλγορίθμων και όχι ακατέργαστη ταχύτητα υλικού.
Πώς λειτούργησε το πείραμα
Σε καθένα από τα 18 μοντέλα δόθηκε η εργασία αυτόνομα: να προτείνει αλλαγές στη συνταγή εκπαίδευσης, να εκτελέσει πειράματα, να επιθεωρήσει τα αποτελέσματα και να επαναλάβει — με ένα σταθερό σενάριο επαλήθευσης και σταθερούς τυχαίους σπόρους που διασφαλίζουν ότι η βελτίωση που ζητήθηκε είναι πραγματική και όχι τυχερή. Όπως το συνόψισε ένας σχολιαστής του Hacker News, τα μοντέλα κλήθηκαν να ερευνήσουν πώς να βελτιώσουν την εκπαίδευση ενός μικρού μοντέλου, δοκιμάζοντας επανειλημμένα αλλαγές, δοκιμάζοντας τις και χρησιμοποιώντας τα αποτελέσματα για να αποφασίσουν τι θα δοκιμάσουν στη συνέχεια.
Τα μοντέλα εργάστηκαν μέσω μιας ποικιλίας εξαρτημάτων πράκτορα - συμπεριλαμβανομένου του claude-code, του κώδικα του OpenAI, του kimi-code, του grok-cli, του qwen-code και του prime-agent της Prime Intellect - και η ομάδα παρακολουθούσε την κατανάλωση διακριτικών κάθε εκτέλεσης, τον αριθμό πειραμάτων, τις κλήσεις εργαλείων και τον χρόνο που παρήλθε. Συνολικά, το πείραμα κατανάλωσε εκατοντάδες εκατομμύρια μάρκες ανά κορυφαίο μοντέλο και δισεκατομμύρια σε όλο το δίκτυο.
Το Leaderboard: Το Fable 5 οδηγεί το πακέτο
Το αποτέλεσμα της επικεφαλίδας: το μοντέλο που προσδιορίστηκε ως Fable 5, που διέρχεται από την πλεξούδα claude-code, έκλεισε το 81,7 τοις εκατό του χάσματος μεταξύ της βασικής συνταγής και του ανθρώπινου ρεκόρ, με ένα καλύτερο επικυρωμένο αποτέλεσμα 2.726 στη μέτρηση του leaderboard. Για να φτάσετε εκεί χρειάστηκαν 8,7 ημέρες αθροιστικού χρόνου αντιπροσώπου, περίπου 800 εκατομμύρια μάρκες, 811 πειράματα και περίπου 3.000 κλήσεις εργαλείων.
Το κυνήγι ήταν το Opus 5, το οποίο έκλεισε το 53,6 τοις εκατό της διαφοράς, ακολουθούμενο από το Kimi K3 με 52,2 τοις εκατό όταν οδηγείται από την πλεξούδα βασικού πράκτορα της Prime Intellect (και 45,8 τοις εκατό μέσω kimi-code). Το Opus 4.8 διαχειρίστηκε το 39,4 τοις εκατό, αρκετές παραλλαγές GPT-5.6 προσγειώθηκαν μεταξύ περίπου 11 και 36 τοις εκατό, το Sonnet 5 έκλεισε το 26,8 τοις εκατό και το Grok 4,5 και το Qwen3.8 Max έκαστο έφτασε περίπου το 24,6 τοις εκατό.
Πιο κάτω, το DeepSeek V4 Pro έκλεισε το 12,3 τοις εκατό της διαφοράς, το GPT-5,5 έφτασε το 8,1 τοις εκατό και το παλαιότερο Kimi K2.7 τερμάτισε στο 7,2 τοις εκατό. Σημειωτέον, ένα μοντέλο που κυκλοφόρησε πρόσφατα - το GLM 5.3 - εξακολουθούσε να εκτελείται τη στιγμή της δημοσίευσης χωρίς ακόμη επικυρωμένη εγγραφή, μια υπενθύμιση ότι το σημείο αναφοράς τιμωρεί τα μοντέλα που δεν μπορούν να επικυρώσουν αξιόπιστα τις δικές τους βελτιώσεις.
Γιατί έχει σημασία
Τα σημεία αναφοράς όπως αυτό έχουν σημασία επειδή μετρούν κάτι που δεν μπορούν να κωδικοποιήσουν οι βαθμολογικοί πίνακες: τη δυνατότητα εκτέλεσης ενός γνήσιου βρόχου έρευνας - υπόθεση, πείραμα, ανάλυση, αναθεώρηση - σε ημέρες και όχι σε λεπτά. Αυτή η ικανότητα είναι το θεμέλιο του αναδυόμενου πεδίου της αυτόνομης έρευνας τεχνητής νοημοσύνης, στο οποίο οι πράκτορες δεν έχουν την αποστολή να γράφουν κώδικα σε προδιαγραφές, αλλά να ανακαλύπτουν πράγματα που κανείς δεν τους έχει δείξει.
Η εξάπλωση των αποτελεσμάτων είναι από μόνη της ενημερωτική. Σχεδόν κάθε μοντέλο στο πείραμα βρήκε τις ίδιες βασικές νικητήριες ιδέες, σύμφωνα με την εγγραφή του έργου - αυτό που χώριζε τις καλύτερες εκτελέσεις ήταν αυτό που αφήνει πίσω του ένα πείραμα: οι ισχυρότεροι πράκτορες διατήρησαν αδύναμα σήματα σε θορυβώδη αποτελέσματα για αρκετό καιρό για να τα επικυρώσουν και κατανοούσαν καλύτερα τα δικά τους πειραματικά δεδομένα.
Προειδοποιήσεις από την Κοινότητα
Οι σχολιαστές των Hacker News έθεσαν δίκαια μεθοδολογικά σημεία. Οι ρυθμίσεις προσπάθειας και οι πλεξούδες διέφεραν μεταξύ των μοντέλων — το Fable 5 έτρεξε με υψηλή συλλογιστική ρύθμιση ενώ το Opus 5 έτρεξε στο μέγιστο — και η αριθμητική των 153 εκτελέσεων σε 18 μοντέλα υποδηλώνει ότι ορισμένα μοντέλα έλαβαν περισσότερες προσπάθειες από άλλα. Το αν η κατάταξη ενός μοντέλου αντικατοπτρίζει την ακατέργαστη ερευνητική του ικανότητα ή την ποιότητα του λουριού του παραμένει ένα ανοιχτό ερώτημα.
Ωστόσο, η κατεύθυνση του ταξιδιού είναι ξεκάθαρη. Όταν τα πιο γρήγορα ανθρώπινα χέρια χρειάστηκαν χρόνια συλλογικής προσπάθειας για να φτάσουν στο τρέχον ρεκόρ, οι καλύτεροι αυτόνομοι πράκτορες κλείνουν τώρα το μεγαλύτερο μέρος αυτού του κενού σε λίγο περισσότερο από μια εβδομάδα υπολογιστικού χρόνου. Η επόμενη ερώτηση - εάν κάποιο μοντέλο μπορεί να κλείσει το υπόλοιπο 18,3 τοις εκατό - μπορεί να απαντηθεί νωρίτερα από το αναμενόμενο.
Για περισσότερα σχετικά με τα σημεία αναφοράς και την έρευνα που διαμορφώνουν τα σύνορα της τεχνητής νοημοσύνης, ακολουθήστε τη συνεχή κάλυψη του AI Buzz Wire.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →