Makmal AI terdesentralisasi Prime Intellect telah menerbitkan hasil percubaan berskala besar yang menguji sejauh mana model AI sempadan hari ini boleh melaksanakan penyelidikan pembelajaran mesin autonomi — dan yang terbaik daripada mereka hampir menyamai rekod dunia manusia pada penanda aras komuniti yang terkenal.
Projek itu, yang digelar NanoGPT Speedrun Frontier dan diterbitkan pada 22 Ogos, terdiri daripada 153 larian autonomi merentasi 18 model sempadan yang mencuba speedrun pengoptimuman nanoGPT — pertandingan di mana penyelidik mencari cara paling cekap untuk melatih model bahasa kecil kepada sasaran kualiti tetap. Kisah itu dengan cepat memanjat muka depan Berita Hacker, di mana ia menarik berpuluh-puluh komen yang membahaskan apa yang dikatakan keputusan tentang kapasiti AI untuk penemuan saintifik yang tulen. For more context on this story, see our ongoing artificial intelligence updates.
Apakah Sebenarnya NanoGPT Speedrun
Penanda aras datang daripada repositori modded-nanogpt yang diselenggara oleh Keller Jordan dan senarai panjang penyumbang komuniti. Cabarannya adalah mudah untuk dinyatakan: menggunakan 8 GPU NVIDIA H100, latih model bahasa yang mencapai 3.28 kehilangan entropi silang pada set pengesahan FineWeb — tahap prestasi replikasi GPT-2 asal Andrej Karpathy dicapai selepas 45 minit — secepat mungkin.
Melalui ratusan sumbangan komuniti dalam tempoh dua tahun yang lalu, rekod manusia telah diturunkan kepada di bawah 75 saat dan di bawah 400 juta token latihan, peningkatan lebih 30 kali ganda berbanding resipi asal. Penyelesaian yang menang dibaca seperti katalog kejuruteraan ML moden: pengoptimum Muon, benam berputar dengan QK-Norm, pengaktifan kuasa dua ReLU, kuantisasi FP8 pada perhatian dan pas MLP, Flash Attention 3 dengan corak tetingkap gelongsor dan berpuluh-puluh teknik lain disusun di atas satu sama lain.
Ujian Prime Intellect menggunakan runut pengoptimuman penanda aras, yang — mengikut dokumentasi repositori — meminimumkan bilangan langkah latihan yang diperlukan untuk mencapai kehilangan sasaran, tertakluk kepada seni bina tetap, set data dan saiz kelompok, dengan belanjawan jam dinding tanpa had yang berkesan. Itu menjadikannya ujian tulen penemuan algoritma dan bukannya kelajuan perkakasan mentah.
Cara Eksperimen Berfungsi
Setiap daripada 18 model diberi tugas secara autonomi: cadangkan perubahan pada resipi latihan, jalankan eksperimen, periksa keputusan dan lelaran — dengan skrip pengesahan tetap dan benih rawak tetap memastikan bahawa peningkatan yang didakwa adalah nyata dan bukannya larian bertuah. Sebagai seorang pengulas Berita Hacker meringkaskannya, model tersebut diminta untuk menyelidik cara meningkatkan latihan model kecil, mencuba perubahan berulang kali, mengujinya dan menggunakan keputusan untuk memutuskan perkara yang perlu dicuba seterusnya.
Model-model tersebut bekerja melalui pelbagai abah-abah ejen — termasuk kod klaude, kod OpenAI, kod kimi, grok-cli, kod qwen dan ejen utama Prime Intellect sendiri — dan pasukan menjejaki penggunaan token setiap larian, kiraan percubaan, panggilan alat dan masa ejen yang telah berlalu. Secara keseluruhan, percubaan itu menggunakan ratusan juta token setiap model teratas dan berbilion-bilion merentasi grid penuh.
Papan Pendahulu: Fable 5 Mendahului Pek
Hasil tajuk utama: model yang dikenal pasti sebagai Fable 5, berjalan melalui abah-abah kod klaude, menutup 81.7 peratus jurang antara resipi garis dasar dan rekod manusia, dengan keputusan disahkan terbaik sebanyak 2,726 pada metrik papan pendahulu. Untuk ke sana mengambil masa 8.7 hari terkumpul masa ejen, kira-kira 800 juta token, 811 percubaan dan sekitar 3,000 panggilan alat.
Pek mengejar diketuai oleh Opus 5, yang menutup 53.6 peratus daripada jurang, diikuti rapat oleh Kimi K3 pada 52.2 peratus apabila didorong oleh abah-abah ejen utama Prime Intellect (dan 45.8 peratus melalui kimi-kod). Opus 4.8 berjaya 39.4 peratus, beberapa varian GPT-5.6 mendarat antara kira-kira 11 dan 36 peratus, Sonnet 5 ditutup 26.8 peratus, dan Grok 4.5 dan Qwen3.8 Max masing-masing mencapai kira-kira 24.6 peratus.
Lebih jauh ke bawah, DeepSeek V4 Pro menutup 12.3 peratus daripada jurang, GPT-5.5 mencapai 8.1 peratus, dan Kimi K2.7 yang lebih tua selesai pada 7.2 peratus. Terutama, satu model yang dikeluarkan baru-baru ini — GLM 5.3 — masih berjalan pada masa penerbitan tanpa rekod yang disahkan lagi, peringatan bahawa penanda aras menghukum model yang tidak boleh mengesahkan penambahbaikan mereka sendiri dengan pasti.
Mengapa Ia Penting
Penanda aras seperti perkara ini kerana mereka mengukur sesuatu pengekodan papan pendahulu tidak boleh: keupayaan untuk menjalankan gelung penyelidikan yang tulen — hipotesis, percubaan, analisis, semakan — sepanjang hari dan bukannya minit. Keupayaan itu adalah asas kepada bidang penyelidikan AI autonomi yang baru muncul, di mana ejen ditugaskan bukan untuk menulis kod mengikut spesifikasi tetapi untuk menemui perkara yang tidak ditunjukkan oleh sesiapa kepada mereka.
Penyebaran dalam keputusan itu sendiri adalah bermaklumat. Hampir setiap model dalam percubaan menemui idea pemenang teras yang sama, mengikut penulisan projek — perkara yang memisahkan larian terbaik ialah perkara yang ditinggalkan oleh percubaan: ejen yang lebih kuat mengekalkan isyarat lemah dalam hasil bising yang cukup lama untuk mengesahkannya dan memahami data percubaan mereka sendiri dengan lebih baik.
Kaveat Daripada Komuniti
Pengulas Berita Hacker membangkitkan perkara metodologi yang adil. Tetapan usaha dan abah-abah berbeza-beza merentas model — Fable 5 dijalankan pada tetapan penaakulan yang tinggi manakala Opus 5 dijalankan secara maksimum — dan aritmetik 153 larian merentasi 18 model membayangkan beberapa model menerima lebih banyak percubaan daripada yang lain. Sama ada kedudukan model mencerminkan keupayaan penyelidikan mentahnya atau kualiti abah-abahnya masih menjadi persoalan terbuka.
Namun, hala tuju perjalanan adalah jelas. Apabila tangan manusia terpantas mengambil masa bertahun-tahun usaha kolektif untuk mencapai rekod semasa, ejen autonomi terbaik kini menutup sebahagian besar jurang itu dalam masa lebih seminggu pengiraan. Soalan seterusnya - sama ada mana-mana model boleh menutup baki 18.3 peratus - mungkin dijawab lebih awal daripada jangkaan.
Untuk mengetahui lebih lanjut tentang penanda aras dan penyelidikan yang membentuk sempadan AI, ikuti liputan berterusan AI Buzz Wire.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →