Laboratorul descentralizat de inteligență artificială Prime Intellect a publicat rezultatele unui experiment pe scară largă care testează cât de bine modelele de IA de frontieră de astăzi pot efectua cercetări autonome în învățarea automată – iar cele mai bune dintre ele s-au apropiat remarcabil de a se potrivi cu recordul mondial uman pe un standard de referință celebrat al comunității.
Proiectul, denumit NanoGPT Speedrun Frontier și publicat pe 22 august, a constat din 153 de rulări autonome pe 18 modele de frontieră care încearcă să încerce optimizarea nanoGPT speedrun - o competiție în care cercetătorii caută cel mai eficient mod de a antrena un model de limbaj mic la o țintă de calitate fixă. Povestea a urcat rapid pe prima pagină a Hacker News, unde a atras zeci de comentarii care dezbat ce spun rezultatele despre capacitatea AI de descoperire științifică autentică. For more context on this story, see our ongoing AI industry coverage.
Ce este de fapt NanoGPT Speedrun
Benchmark-ul provine de la depozitul modded-nanogpt menținut de Keller Jordan și de o listă lungă de colaboratori ai comunității. Provocarea este înșelător de simplu de afirmat: folosind 8 GPU-uri NVIDIA H100, antrenați un model de limbaj care atinge 3,28 pierderi de entropie încrucișată pe setul de validare FineWeb - nivelul de performanță replicare GPT-2 originală a lui Andrej Karpathy atins după 45 de minute - cât mai repede posibil.
Prin sute de contribuții ale comunității în ultimii doi ani, recordul uman a fost redus la mai puțin de 75 de secunde și sub 400 de milioane de jetoane de antrenament, o îmbunătățire de peste 30 de ori față de rețeta originală. Soluțiile câștigătoare citesc ca un catalog de inginerie ML modernă: optimizatorul Muon, înglobări rotative cu QK-Norm, activări ReLU-squared, cuantificare FP8 asupra atenției și treceri MLP, Flash Attention 3 cu modele de ferestre glisante și zeci de alte tehnici stivuite una peste alta.
Testul Prime Intellect a folosit pista de optimizare a benchmark-ului, care – conform documentației depozitului – minimizează numărul de pași de antrenament necesari pentru a atinge pierderea țintă, sub rezerva unei arhitecturi fixe, a unui set de date și a unei dimensiuni a lotului, cu un buget efectiv nelimitat pentru ceas de perete. Asta îl face un test pur de descoperire a algoritmului, mai degrabă decât viteza hardware brută.
Cum a funcționat experimentul
Fiecare dintre cele 18 modele a primit sarcina în mod autonom: propune modificări ale rețetei de antrenament, desfășoară experimente, inspectează rezultatele și repetă - cu un script de verificare fix și semințe aleatorii fixe, asigurându-se că o îmbunătățire pretinsă este reală, mai degrabă decât o rulare norocoasă. După cum a rezumat un comentator al Hacker News, modelele au fost rugate să cerceteze cum să îmbunătățească antrenamentul unui model mic, încercând în mod repetat modificări, testându-le și folosind rezultatele pentru a decide ce să încerce în continuare.
Modelele au funcționat printr-o varietate de hamuri de agenți - inclusiv claude-code, codexul OpenAI, kimi-code, grok-cli, qwen-code și propriul agent principal al Prime Intellect - iar echipa a urmărit consumul de token al fiecărei rulări, numărul de experimente, apelurile de instrumente și timpul scurs de agent. În total, experimentul a consumat sute de milioane de jetoane pentru fiecare model de top și miliarde în întreaga grilă.
Clasamentul: Fable 5 conduce pachetul
Rezultatul principal: modelul identificat ca Fable 5, care trece prin codul claude, a redus 81,7% din decalajul dintre rețeta de bază și înregistrarea umană, cu un rezultat cel mai bine validat de 2.726 pe metrica clasamentului. Ajungerea acolo a durat 8,7 zile de timp cumulat de agent, aproximativ 800 de milioane de jetoane, 811 experimente și aproximativ 3.000 de apeluri la instrumente.
Pachetul de urmărire a fost condus de Opus 5, care a redus 53,6 la sută din diferență, urmat îndeaproape de Kimi K3 la 52,2 la sută atunci când a fost condus de hamurile cu agent principal al Prime Intellect (și 45,8 la sută prin kimi-code). Opus 4.8 a reușit 39,4 la sută, mai multe variante GPT-5.6 au aterizat între aproximativ 11 și 36 la sută, Sonnet 5 a încheiat 26,8 la sută, iar Grok 4.5 și Qwen3.8 Max au ajuns fiecare la aproximativ 24,6 la sută.
Mai jos, DeepSeek V4 Pro a redus 12,3% din decalaj, GPT-5.5 a ajuns la 8,1%, iar mai vechi Kimi K2.7 a terminat la 7,2%. În mod remarcabil, un model lansat recent – GLM 5.3 – încă rula la momentul publicării fără nicio înregistrare validată încă, un memento că benchmarkul pedepsește modelele care nu își pot valida în mod fiabil propriile îmbunătățiri.
De ce contează
Benchmark-uri ca acesta contează pentru că măsoară ceva ce codificarea clasamentelor nu poate: capacitatea de a rula o buclă de cercetare autentică - ipoteză, experiment, analiză, revizuire - în mai degrabă de zile decât de minute. Această capacitate este fundamentul domeniului emergent al cercetării AI autonome, în care agenții nu au sarcina de a scrie cod conform specificațiilor, ci de a descoperi lucruri pe care nimeni nu le-a arătat.
Distribuția rezultatelor este ea însăși informativă. Aproape fiecare model din experiment a găsit aceleași idei de bază câștigătoare, conform scrierii proiectului - ceea ce a separat cele mai bune curse a fost ceea ce un experiment lasă în urmă: agenții mai puternici au păstrat semnalele slabe în rezultate zgomotoase suficient de mult pentru a le valida și și-au înțeles mai bine propriile date experimentale.
Avertismente din partea comunității
Comentatorii Hacker News au ridicat puncte metodologice corecte. Setările de efort și hamurile au variat de la un model la altul - Fable 5 a funcționat pe o setare de raționament ridicat, în timp ce Opus 5 a funcționat la maxim - iar aritmetica de 153 de rulări pe 18 modele implică că unele modele au primit mai multe încercări decât altele. Dacă clasamentul unui model reflectă capacitatea de cercetare brută sau calitatea hamului său rămâne o întrebare deschisă.
Totuși, direcția de mers este clară. Când cele mai rapide mâini umane au avut ani de efort colectiv pentru a atinge recordul actual, cei mai buni agenți autonomi acum închid cea mai mare parte a acestui decalaj în puțin peste o săptămână de timp de calcul. Următoarea întrebare – dacă vreun model poate închide restul de 18,3% – poate primi răspunsul mai devreme decât se aștepta.
Pentru mai multe despre reperele și cercetările care modelează frontiera AI, urmăriți acoperirea continuă a AI Buzz Wire.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →