Decentraliserat AI-labb Prime Intellect har publicerat resultaten av ett storskaligt experiment som testar hur väl dagens frontier AI-modeller kan utföra autonom maskininlärningsforskning – och de bästa av dem kom anmärkningsvärt nära att matcha det mänskliga världsrekordet på ett berömt riktmärke för samhället.
Projektet, kallat NanoGPT Speedrun Frontier och publicerat den 22 augusti, bestod av 153 autonoma körningar över 18 gränsmodeller som försökte nanoGPT optimizer speedrun — en tävling där forskare söker efter det mest effektiva sättet att träna en liten språkmodell till ett fast kvalitetsmål. Berättelsen klättrade snabbt på förstasidan av Hacker News, där den drog dussintals kommentarer som diskuterade vad resultaten säger om AI:s förmåga till genuin vetenskaplig upptäckt. For more context on this story, see our ongoing AI news.
Vad NanoGPT Speedrun faktiskt är
Riktmärket kommer från modded-nanogpt-förvaret som underhålls av Keller Jordan och en lång lista med bidragsgivare från gemenskapen. Utmaningen är bedrägligt enkel att ange: med hjälp av 8 NVIDIA H100 GPU: er, träna en språkmodell som når 3,28 korsentropiförluster på FineWeb-valideringsuppsättningen – prestandanivån som Andrej Karpathys ursprungliga GPT-2-replikering nådde efter 45 minuter – så snabbt som möjligt.
Genom hundratals bidrag från samhället under de senaste två åren har det mänskliga rekordet drivits ner till under 75 sekunder och under 400 miljoner träningstokens, en mer än 30-faldig förbättring jämfört med originalreceptet. De vinnande lösningarna läser som en katalog över modern ML-teknik: Muon-optimeraren, roterande inbäddningar med QK-Norm, ReLU-kvantifierade aktiveringar, FP8-kvantisering på uppmärksamhet och MLP-pass, Flash Attention 3 med skjutfönstermönster och dussintals andra tekniker staplade ovanpå varandra.
Prime Intellects test använde riktmärkets optimeringsspår, som - enligt förvarets dokumentation - minimerar antalet träningssteg som behövs för att nå målförlusten, beroende på en fast arkitektur, datauppsättning och batchstorlek, med en effektivt obegränsad väggklockabudget. Det gör det till ett rent test av algoritmupptäckt snarare än råvaruhastighet.
Hur experimentet fungerade
Var och en av de 18 modellerna fick uppgiften självständigt: föreslå ändringar av träningsreceptet, kör experiment, inspektera resultaten och iterera - med ett fast verifieringsskript och fixerade slumpmässiga frön som säkerställer att en påstådd förbättring är verklig snarare än en lycklig körning. Som en kommentator från Hacker News sammanfattade det, ombads modellerna att undersöka hur man kan förbättra en liten modells träning, upprepade gånger pröva förändringar, testa dem och använda resultaten för att bestämma vad de ska prova härnäst.
Modellerna arbetade genom en mängd olika agenter – inklusive claude-code, OpenAI:s codex, kimi-code, grok-cli, qwen-code och Prime Intellects egen prime-agent – och teamet spårade varje körs tokenförbrukning, experimentantal, verktygsanrop och förfluten agenttid. Totalt förbrukade experimentet hundratals miljoner tokens per toppmodell och miljarder över hela nätet.
Poängtavlan: Fabel 5 leder gruppen
Rubrikresultatet: modellen identifierad som Fable 5, som löpte genom claude-kodselen, stängde 81,7 procent av gapet mellan baslinjereceptet och det mänskliga rekordet, med ett bäst validerat resultat på 2 726 på resultattavlans mätvärde. Att ta sig dit tog 8,7 dagar av kumulativ agenttid, ungefär 800 miljoner tokens, 811 experiment och runt 3 000 verktygsanrop.
Chasing-packet leddes av Opus 5, som stängde 53,6 procent av gapet, tätt följt av Kimi K3 på 52,2 procent när det drivs av Prime Intellects prime-agent-sele (och 45,8 procent via kimi-kod). Opus 4.8 klarade 39,4 procent, flera GPT-5.6-varianter landade mellan ungefär 11 och 36 procent, Sonnet 5 stängde 26,8 procent, och Grok 4,5 och Qwen3,8 Max nådde vardera cirka 24,6 procent.
Längre ner stängde DeepSeek V4 Pro 12,3 procent av gapet, GPT-5,5 nådde 8,1 procent och den äldre Kimi K2.7 slutade på 7,2 procent. Noterbart är att en nyligen släppt modell - GLM 5.3 - fortfarande körde vid publiceringstidpunkten utan några validerade uppgifter ännu, en påminnelse om att riktmärket straffar modeller som inte tillförlitligt kan validera sina egna förbättringar.
Varför det är viktigt
Benchmarks som det här gäller eftersom de mäter något som kodande topplistor inte kan: möjligheten att köra en genuin forskningsloop – hypotes, experiment, analys, revidering – över dagar snarare än minuter. Den förmågan är grunden för det framväxande området för autonom AI-forskning, där agenter inte har till uppgift att skriva kod till specifikation utan att upptäcka saker som ingen har visat dem.
Spridningen i resultat är i sig informativ. Nästan varje modell i experimentet hittade samma vinnande kärnidéer, enligt projektets beskrivning - det som skilde de bästa körningarna var vad ett experiment lämnar efter sig: starkare agenter bevarade svaga signaler i brusiga resultat tillräckligt länge för att validera dem, och förstod sina egna experimentella data bättre.
Varningar från gemenskapen
Hacker News-kommentatorer tog upp rättvisa metodologiska punkter. Ansträngningsinställningarna och selarna varierade mellan modellerna – Fable 5 körde på en hög resonemangsinställning medan Opus 5 körde på max – och aritmetiken på 153 körningar över 18 modeller innebär att vissa modeller fick fler försök än andra. Huruvida en modells rankning återspeglar dess råa forskningsförmåga eller kvaliteten på dess sele är fortfarande en öppen fråga.
Ändå är färdriktningen tydlig. När de snabbaste mänskliga händerna tog åratal av kollektiv ansträngning för att nå det aktuella rekordet, täpper de bästa autonoma agenterna nu till det mesta av det gapet på lite över en veckas beräkningstid. Nästa fråga - om någon modell kan stänga de återstående 18,3 procenten - kan besvaras tidigare än väntat.
För mer om riktmärken och forskning som formar gränsen för AI, följ AI Buzz Wires fortsatta bevakning.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →