Zdecentralizowane laboratorium sztucznej inteligencji Prime Intellect opublikowało wyniki zakrojonego na szeroką skalę eksperymentu sprawdzającego, jak dobrze dzisiejsze pionierskie modele sztucznej inteligencji mogą przeprowadzać autonomiczne badania nad uczeniem maszynowym — a najlepsze z nich były niezwykle bliskie osiągnięcia rekordu świata człowieka w słynnym teście społecznościowym.

Projekt, nazwany NanoGPT Speedrun Frontier i opublikowany 22 sierpnia, składał się ze 153 autonomicznych przebiegów w 18 modelach granicznych, próbujących wykonać speedrun optymalizatora nanoGPT — konkursu, w którym badacze szukają najskuteczniejszego sposobu wyszkolenia modelu małego języka do osiągnięcia ustalonego celu jakościowego. Sprawa szybko trafiła na pierwszą stronę Hacker News, gdzie zebrała dziesiątki komentarzy, w których dyskutowano nad tym, co wyniki mówią o zdolności sztucznej inteligencji do dokonywania prawdziwych odkryć naukowych. Więcej kontekstu na ten temat znajdziesz w naszych wiadomości AI.

Czym właściwie jest NanoGPT Speedrun

Test porównawczy pochodzi z repozytorium modded-nanogpt prowadzonego przez Kellera Jordana i długiej listy współpracowników społeczności. Wyzwanie jest zwodniczo proste: używając 8 procesorów graficznych NVIDIA H100, wytrenuj model językowy, który osiąga stratę entropii krzyżowej na poziomie 3,28 w zestawie walidacyjnym FineWeb — poziom wydajności oryginalnej replikacji GPT-2 Andreja Karpathy'ego osiągnięty po 45 minutach — tak szybko, jak to możliwe.

Dzięki setkom wkładów społeczności w ciągu ostatnich dwóch lat rekord ludzki został skrócony do poniżej 75 sekund i poniżej 400 milionów tokenów szkoleniowych, co stanowi ponad 30-krotną poprawę w stosunku do oryginalnej receptury. Zwycięskie rozwiązania czyta się jak katalog nowoczesnej inżynierii ML: optymalizator Muon, osadzanie obrotowe z QK-Norm, aktywacje ReLU-kwadrat, kwantyzacja FP8 przy uwagach i przejściach MLP, Flash Attention 3 z wzorami przesuwanych okien i dziesiątki innych technik ułożonych jedna na drugiej.

W teście Prime Intellect wykorzystano ścieżkę optymalizującą benchmarku, która – zgodnie z dokumentacją repozytorium – minimalizuje liczbę kroków szkoleniowych potrzebnych do osiągnięcia docelowej straty, przy stałej architekturze, zbiorze danych i rozmiarze partii, przy faktycznie nieograniczonym budżecie zegara ściennego. To sprawia, że ​​jest to czysty test odkrywania algorytmów, a nie surowej szybkości sprzętu.

Jak zadziałał eksperyment

Każdemu z 18 modeli przydzielono autonomiczne zadanie: proponowanie zmian w przepisie szkoleniowym, przeprowadzanie eksperymentów, sprawdzanie wyników i wykonywanie iteracji — przy użyciu stałego skryptu weryfikacyjnego i stałych losowych nasion zapewniających, że deklarowana poprawa jest rzeczywista, a nie szczęśliwym trafem. Jak podsumował to jeden z komentatorów Hacker News, modele poproszono o zbadanie, w jaki sposób ulepszyć szkolenie małego modelu, wielokrotne wypróbowywanie zmian, testowanie ich i wykorzystywanie wyników do podjęcia decyzji, co spróbować dalej.

Modele pracowały z różnymi wiązkami agentów — w tym claude-code, kodeksem OpenAI, kodem kimi, grok-cli, kodem qwen i własnym agentem głównym Prime Intellect — a zespół śledził zużycie tokenów w każdym uruchomieniu, liczbę eksperymentów, wywołania narzędzi i czas, jaki upłynął. W sumie eksperyment pochłonął setki milionów tokenów na topowy model i miliardy na pełnej siatce.

Tabela liderów: Fable 5 na czele stawki

Główny wynik: model zidentyfikowany jako Fable 5, wykorzystujący kod claude, wypełnił 81,7 procent luki między recepturą bazową a rekordem ludzkim, uzyskując najlepszy potwierdzony wynik 2726 w metryce tabeli liderów. Dotarcie tam zajęło agentowi łącznie 8,7 dnia, około 800 milionów tokenów, 811 eksperymentów i około 3000 wywołań narzędzi.

Grupę pościgową prowadził Opus 5, który zmniejszył stratę z 53,6%, a tuż za nim plasował się Kimi K3 z wynikiem 52,2%, gdy prowadzony był za pomocą uprzęży głównego agenta Prime Intellect (i 45,8% poprzez kod kimi). Opus 4.8 uzyskał 39,4%, kilka wariantów GPT-5.6 osiągnęło wynik od około 11 do 36%, Sonnet 5 zamknął się na poziomie 26,8%, a Grok 4.5 i Qwen3.8 Max osiągnęły około 24,6%.

Dalej DeepSeek V4 Pro zamknął 12,3 procent luki, GPT-5.5 osiągnął 8,1 procent, a starszy Kimi K2.7 osiągnął wynik 7,2 procent. Warto zauważyć, że jeden niedawno wydany model – GLM 5.3 – nadal działał w momencie publikacji i nie miał jeszcze zatwierdzonego rekordu, co przypomina, że ​​test porównawczy karze modele, które nie są w stanie wiarygodnie zweryfikować własnych ulepszeń.

Dlaczego to ma znaczenie

Takie testy porównawcze mają znaczenie, ponieważ mierzą coś, czego nie potrafią rankingi kodowania: możliwość przeprowadzenia prawdziwej pętli badawczej — hipotezy, eksperymentu, analizy, rewizji — w ciągu dni, a nie minut. Zdolność ta stanowi podstawę wyłaniającej się dziedziny autonomicznych badań nad sztuczną inteligencją, w której zadaniem agentów nie jest pisanie kodu zgodnie ze specyfikacjami, ale odkrywanie rzeczy, których nikt im nie pokazał.

Rozrzut wyników sam w sobie ma charakter informacyjny. Jak wynika z opisu projektu, niemal każdy model biorący udział w eksperymencie znalazł te same, zwycięskie pomysły — najlepsze przebiegi oddzielił to, co pozostawił po sobie eksperyment: silniejsze czynniki zachowywały słabe sygnały w zaszumionych wynikach wystarczająco długo, aby je zweryfikować, i lepiej rozumiały własne dane eksperymentalne.

Ostrzeżenia społeczności

Komentatorzy Hacker News podnieśli słuszne kwestie metodologiczne. Ustawienia wysiłku i uprzęże różniły się w zależności od modelu — Fable 5 działał przy wysokim ustawieniu rozumowania, podczas gdy Opus 5 działał na maksymalnym poziomie — a arytmetyka 153 przebiegów w 18 modelach oznacza, że ​​niektóre modele otrzymały więcej prób niż inne. Kwestią otwartą pozostaje, czy ranking modelu odzwierciedla jego surowe możliwości badawcze, czy też jakość uprzęży.

Mimo to kierunek podróży jest jasny. Podczas gdy najszybsze ludzkie ręce wymagały lat wspólnego wysiłku, aby osiągnąć obecny rekord, najlepsi autonomiczni agenci wypełniają obecnie większość tej luki w nieco ponad tydzień czasu obliczeniowego. Na kolejne pytanie – czy któremuś modelowi uda się zamknąć pozostałe 18,3 proc. – odpowiedź może pojawić się szybciej, niż oczekiwano.

Aby uzyskać więcej informacji na temat testów porównawczych i badań kształtujących granice sztucznej inteligencji, śledź ciągłe relacje AI Buzz Wire.

---

Bądź na Bieżąco z AI

Najnowsze wiadomości, analizy i przełomy w dziedzinie AI — wszystko w jednym miejscu.

Czytaj więcej wiadomości AI →