Laboratorium AI terdesentralisasi Prime Intellect wis nerbitake asil uji coba skala gedhe babagan carane model AI perbatasan saiki bisa nindakake riset pembelajaran mesin otonom - lan sing paling apik banget cedhak karo rekor donya manungsa ing pathokan komunitas sing dirayakake.

Proyèk kasebut, dijuluki NanoGPT Speedrun Frontier lan diterbitake tanggal 22 Agustus, kalebu 153 larian otonom ing 18 model perbatasan sing nyoba speedrun pangoptimal nanoGPT - kompetisi ing ngendi peneliti nggoleki cara sing paling efisien kanggo nglatih model basa cilik menyang target kualitas tetep. Crita kasebut kanthi cepet munggah ing kaca ngarep Hacker News, ing ngendi dheweke narik puluhan komentar sing debat babagan asile babagan kapasitas AI kanggo panemuan ilmiah sing asli. For more context on this story, see our ongoing AI industry coverage.

Apa Sejatine NanoGPT Speedrun

Patokan kasebut asale saka repositori modded-nanogpt sing dikelola dening Keller Jordan lan dhaptar kontributor komunitas sing dawa. Tantangan punika deceptively prasaja kanggo negara: nggunakake 8 NVIDIA H100 GPUs, olahraga model basa sing tekan 3,28 mundhut salib entropi ing FineWeb validasi pesawat - tingkat kinerja Andrej Karpathy asli GPT-2 replikasi tekan sawise 45 menit - minangka cepet sabisa.

Liwat atusan kontribusi komunitas sajrone rong taun kepungkur, rekor manungsa wis mudhun nganti kurang saka 75 detik lan kurang saka 400 yuta token latihan, paningkatan luwih saka 30 kali lipat saka resep asli. Solusi sing menang maca kaya katalog teknik ML modern: Muon optimizer, embeddings rotary karo QK-Norm, aktivasi ReLU-kuadrat, kuantisasi FP8 ing perhatian lan MLP pass, Flash Attention 3 kanthi pola sliding-window, lan puluhan teknik liyane sing ditumpuk ing ndhuwur saben liyane.

Tes Perdana Intellect nggunakake trek pangoptimal pathokan, sing - miturut dokumentasi gudang - nyilikake jumlah langkah latihan sing dibutuhake kanggo nggayuh target target, miturut arsitektur tetep, dataset, lan ukuran batch, kanthi anggaran jam tembok sing ora ana watesan. Sing ndadekake tes murni panemuan algoritma tinimbang kacepetan hardware mentah.

Carane Eksperimen Bisa

Saben model 18 diwenehi tugas kanthi otonom: ngusulake owah-owahan ing resep latihan, nglakokake eksperimen, mriksa asil, lan ngulang - kanthi skrip verifikasi tetep lan wiji acak tetep kanggo mesthekake yen perbaikan sing diklaim nyata tinimbang mlaku kanthi untung. Minangka komentator Hacker News ngringkes, model kasebut dijaluk riset babagan carane nambah latihan model cilik, bola-bali nyoba owah-owahan, nyoba, lan nggunakake asil kanggo mutusake apa sing bakal dicoba sabanjure.

Model makarya liwat macem-macem harnesses agen - kalebu claude-kode, OpenAI kang codex, kimi-kode, grok-cli, qwen-kode, lan Perdana Intellect kang prima-agen - lan tim dilacak saben konsumsi token, count eksperimen, telpon alat, lan wektu agen liwati. Secara total, eksperimen kasebut nggunakake atusan yuta token saben model paling dhuwur lan milyaran ing kothak lengkap.

Papan Pimpinan: Fable 5 Nuntun Pack

Asil judhul: model sing diidentifikasi minangka Fable 5, mlaku liwat claude-code harness, nutup 81,7 persen celah antarane resep garis dasar lan rekaman manungsa, kanthi asil validasi paling apik 2,726 ing metrik leaderboard. Tekan kana butuh 8,7 dina wektu agen kumulatif, kira-kira 800 yuta token, 811 eksperimen, lan sekitar 3,000 panggilan alat.

Pack nguber dipimpin dening Opus 5, sing nutup 53,6 persen saka longkangan, ngiring rapet dening Kimi K3 ing 52,2 persen nalika mimpin dening Prime Intellect kang prime-agen harness (lan 45,8 persen liwat kimi-code). Opus 4.8 ngatur 39.4 persen, sawetara varian GPT-5.6 ndharat antarane kira-kira 11 lan 36 persen, Sonnet 5 ditutup 26.8 persen, lan Grok 4.5 lan Qwen3.8 Max saben tekan 24.6 persen.

Luwih mudhun, DeepSeek V4 Pro ditutup 12,3 persen saka longkangan, GPT-5,5 tekan 8,1 persen, lan lawas Kimi K2.7 rampung ing 7,2 persen. Utamane, siji model sing bubar dirilis - GLM 5.3 - isih mlaku ing wektu publikasi tanpa cathetan sing wis divalidasi, minangka pangeling yen pathokan ngukum model sing ora bisa dipercaya kanggo ngesyahke dandan dhewe.

Apa Iku Penting

Benchmarks kaya prakara iki amarga padha ngukur soko leaderboards coding ora bisa: kemampuan kanggo mbukak loop riset asli - hipotesis, eksperimen, analisis, revisi - liwat dina tinimbang menit. Kapabilitas kasebut minangka pondasi lapangan riset AI otonom sing berkembang, ing ngendi agen ditugasake ora nulis kode kanggo spek nanging nemokake perkara sing ora ana sing nuduhake.

Panyebaran ing asil dhewe informatif. Meh saben model ing eksperimen nemokake gagasan sing menang inti sing padha, miturut panulisan proyek kasebut - sing misahake sing paling apik yaiku apa sing ditinggalake dening eksperimen: agen sing luwih kuat njaga sinyal sing ringkih ing asil rame sing cukup suwe kanggo validasi, lan luwih ngerti data eksperimen dhewe.

Peringatan Saka Komunitas

Komentator News Hacker ngunggahake poin metodologis sing adil. Setelan gaweyan lan harnesses mawarni-warni antarane model - Fable 5 mlaku ing setelan nalar dhuwur nalika Opus 5 mlaku ing max - lan aritmetika saka 153 mlaku ing 18 model nggadahi sawetara model nampa luwih nyoba saka liyane. Apa peringkat model nuduhake kemampuan riset mentah utawa kualitas sabuk tetep dadi pitakonan sing mbukak.

Nanging, arah lelungan wis jelas. Nalika tangan manungsa paling cepet njupuk taun gaweyan bebarengan kanggo nggayuh rekor saiki, agen otonom paling apik saiki nutup paling longkangan sing ing sethitik liwat minggu wektu ngitung. Pitakonan sabanjure - apa model apa wae bisa nutup sisa 18,3 persen - bisa dijawab luwih cepet tinimbang sing dikarepake.

Kanggo luwih lengkap babagan pathokan lan riset sing mbentuk wates AI, tindakake jangkoan terus AI Buzz Wire.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →