Decentralizovaná laboratoř umělé inteligence Prime Intellect zveřejnila výsledky rozsáhlého experimentu, který testoval, jak dobře mohou dnešní modely hraniční umělé inteligence provádět výzkum autonomního strojového učení – a ty nejlepší z nich se pozoruhodně přiblížily světovému rekordu lidí ve slavném benchmarku komunity.
Projekt nazvaný NanoGPT Speedrun Frontier a zveřejněný 22. srpna se skládal ze 153 autonomních běhů napříč 18 hraničními modely, které se pokoušely o speedrun optimalizátoru nanoGPT – soutěž, ve které výzkumníci hledají nejúčinnější způsob, jak trénovat malý jazykový model na pevný cíl kvality. Příběh se rychle vyšplhal na titulní stránku Hacker News, kde vyvolal desítky komentářů debatujících o tom, co výsledky říkají o schopnosti umělé inteligence pro skutečné vědecké objevy. For more context on this story, see our ongoing latest AI developments.
Co NanoGPT Speedrun vlastně je
Benchmark pochází z repozitáře modded-nanogpt spravovaného Keller Jordan a dlouhého seznamu komunitních přispěvatelů. Výzva je zdánlivě jednoduchá: pomocí 8 GPU NVIDIA H100 vytrénujte co nejrychleji jazykový model, který dosáhne ztráty křížové entropie 3,28 na ověřovací sadě FineWeb – úroveň výkonu původní replikace Andreje Karpathyho GPT-2 dosáhla po 45 minutách.
Prostřednictvím stovek příspěvků komunity za poslední dva roky se lidský rekord snížil na méně než 75 sekund a pod 400 milionů tréninkových žetonů, což je více než 30násobné zlepšení oproti původnímu receptu. Vítězná řešení se čtou jako katalog moderního ML inženýrství: optimalizátor Muon, rotační vložení s QK-Norm, aktivace ReLU-kvadrát, kvantizace FP8 na pozornost a průchody MLP, Flash Attention 3 se vzory posuvných oken a desítky dalších technik naskládaných na sebe.
Test Prime Intellectu použil optimalizační stopu benchmarku, která – podle dokumentace úložiště – minimalizuje počet tréninkových kroků potřebných k dosažení cílové ztráty, v závislosti na pevné architektuře, datové sadě a velikosti dávky, s efektivně neomezeným rozpočtem nástěnných hodin. To z něj dělá čistý test objevování algoritmu spíše než hrubou rychlost hardwaru.
Jak experiment fungoval
Každý z 18 modelů dostal za úkol autonomně: navrhnout změny trénovacího receptu, spustit experimenty, zkontrolovat výsledky a iterovat – s pevným ověřovacím skriptem a pevnými náhodnými zárodky, které zajišťují, že deklarované zlepšení je skutečné, spíše než šťastné spuštění. Jak to shrnul jeden komentátor Hacker News, modely byly požádány, aby prozkoumaly, jak zlepšit výcvik malého modelu, opakovaně zkoušely změny, testovaly je a pomocí výsledků se rozhodly, co zkusit dál.
Modely fungovaly prostřednictvím různých svazků agentů – včetně claude-kódu, kodexu OpenAI, kimi-kódu, grok-cli, qwen-code a vlastního hlavního agenta Prime Intellect – a tým sledoval spotřebu tokenů při každém běhu, počet experimentů, volání nástrojů a uplynulý čas agenta. Celkově experiment spotřeboval stovky milionů tokenů na špičkový model a miliardy v celé síti.
Žebříček: Fable 5 vede smečku
Hlavní výsledek: model identifikovaný jako Fable 5, který prošel svazkem klaude-kódu, uzavřel 81,7 procenta mezery mezi základním receptem a lidským rekordem, s nejlepším ověřeným výsledkem 2 726 v metrice žebříčku. Dostat se tam trvalo 8,7 dne kumulativního času agentů, zhruba 800 milionů tokenů, 811 experimentů a přibližně 3 000 volání nástrojů.
Chasing pack vedl Opus 5, který zacelil 53,6 procenta mezery, těsně následovaný Kimi K3 s 52,2 procenty, když řídil primární agent Prime Intellect (a 45,8 procenta přes kimi-kód). Opus 4.8 zvládl 39,4 procenta, několik variant GPT-5.6 dosáhlo zhruba 11 až 36 procent, Sonnet 5 uzavřel 26,8 procenta a Grok 4.5 a Qwen3.8 Max dosáhly každý zhruba 24,6 procenta.
Dále dolů, DeepSeek V4 Pro uzavřel 12,3 procenta mezery, GPT-5.5 dosáhl 8,1 procenta a starší Kimi K2.7 skončil na 7,2 procenta. Je pozoruhodné, že jeden nedávno vydaný model – GLM 5.3 – stále běžel v době zveřejnění bez dosud ověřeného záznamu, což je připomínka, že benchmark trestá modely, které nemohou spolehlivě ověřit svá vlastní vylepšení.
Proč na tom záleží
Na srovnávacích testech, jako jsou tato, záleží, protože měří něco, co kódování žebříčků nedokáže: schopnost spustit skutečnou výzkumnou smyčku – hypotézu, experiment, analýzu, revizi – během dní, nikoli minut. Tato schopnost je základem vznikající oblasti autonomního výzkumu AI, ve kterém agenti nemají za úkol psát kód podle specifikace, ale odhalovat věci, které jim nikdo neukázal.
Rozpětí ve výsledcích je samo o sobě informativní. Téměř každý model v experimentu našel stejné hlavní vítězné nápady, podle popisu projektu – nejlepší pokusy oddělily to, co za sebou experiment zanechá: silnější agenti uchovali slabé signály v hlučných výsledcích dostatečně dlouho, aby je mohli ověřit, a lépe rozuměli svým vlastním experimentálním datům.
Upozornění komunity
Komentátoři Hacker News vznesli spravedlivé metodické body. Nastavení úsilí a svazky se u různých modelů lišily – Fable 5 běžel s vysokým nastavením uvažování, zatímco Opus 5 běžel na maximum – a aritmetika 153 běhů u 18 modelů naznačuje, že některé modely obdržely více pokusů než jiné. Otevřenou otázkou zůstává, zda hodnocení modelu odráží jeho syrové výzkumné schopnosti nebo kvalitu jeho postroje.
Přesto je směr jízdy jasný. Když nejrychlejším lidským rukám trvalo roky kolektivního úsilí, aby dosáhly současného rekordu, nejlepší autonomní agenti nyní většinu této mezery uzavírají za něco málo přes týden výpočetního času. Další otázka – zda nějaký model dokáže uzavřít zbývajících 18,3 procenta – může být zodpovězena dříve, než se očekávalo.
Chcete-li se dozvědět více o srovnávacích testech a výzkumu utvářejících hranici AI, sledujte pokračující pokrytí AI Buzz Wire.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →