Merkezi olmayan yapay zeka laboratuvarı Prime Intellect, günümüzün öncü yapay zeka modellerinin otonom makine öğrenimi araştırmalarını ne kadar iyi gerçekleştirebildiğini test eden büyük ölçekli bir deneyin sonuçlarını yayınladı ve bunların en iyileri, ünlü bir topluluk karşılaştırmasında insan dünya rekorunu yakalamaya oldukça yaklaştı.
NanoGPT Speedrun Frontier olarak adlandırılan ve 22 Ağustos'ta yayınlanan proje, araştırmacıların küçük bir dil modelini sabit bir kalite hedefine göre eğitmenin en etkili yolunu aradığı bir yarışma olan nanoGPT optimize edici speedrun'u deneyen 18 sınır modeli boyunca 153 otonom çalışmadan oluşuyordu. Hikaye hızla Hacker News'in ön sayfasına tırmandı ve burada sonuçların yapay zekanın gerçek bilimsel keşif kapasitesi hakkında ne söylediğini tartışan düzinelerce yorum yapıldı. For more context on this story, see our ongoing more AI stories.
NanoGPT Speedrun Aslında Nedir?
Kriter, Keller Jordan tarafından sağlanan modded-nanogpt deposundan ve topluluğa katkıda bulunanların uzun bir listesinden geliyor. Sorunu açıklamak aldatıcı derecede basit: 8 NVIDIA H100 GPU kullanarak, FineWeb doğrulama setinde 3,28 çapraz entropi kaybına (Andrej Karpathy'nin orijinal GPT-2 çoğaltmasının 45 dakika sonra ulaştığı performans düzeyi) mümkün olan en hızlı şekilde ulaşan bir dil modeli eğitin.
Geçtiğimiz iki yılda yüzlerce topluluk katkısıyla insan rekoru 75 saniyenin altına ve 400 milyon eğitim jetonunun altına indi; bu, orijinal tarife göre 30 kattan fazla bir gelişme. Kazanan çözümler, modern makine öğrenimi mühendisliğinin bir kataloğu gibi okunuyor: Muon optimize edici, QK-Norm'lu döner yerleştirmeler, ReLU-kare aktivasyonları, dikkat üzerine FP8 nicemleme ve MLP geçişleri, kayan pencere desenleriyle Flash Attention 3 ve üst üste yığılmış düzinelerce başka teknik.
Prime Intellect'in testi, veri havuzunun belgelerine göre, sabit bir mimariye, veri kümesine ve toplu iş boyutuna bağlı olarak, etkili bir şekilde sınırsız duvar saati bütçesiyle hedef kaybına ulaşmak için gereken eğitim adımlarının sayısını en aza indiren kıyaslama optimizasyon yolunu kullandı. Bu, onu ham donanım hızından ziyade saf bir algoritma keşfi testi haline getirir.
Deney Nasıl Çalıştı?
18 modelin her birine görev bağımsız olarak verildi: eğitim tarifinde değişiklikler önermek, deneyler yapmak, sonuçları incelemek ve yinelemek - sabit bir doğrulama komut dosyası ve sabit rastgele tohumlarla, iddia edilen iyileştirmenin şanslı bir çalışma yerine gerçek olmasını sağlamak. Bir Hacker News yorumcusunun özetlediği gibi, modellerden küçük bir modelin eğitimini nasıl geliştireceklerini araştırmaları, değişiklikleri tekrar tekrar denemeleri, bunları test etmeleri ve bir sonraki adımda ne deneyeceklerine karar vermek için sonuçları kullanmaları istendi.
Modeller, Claude-code, OpenAI'nin kodeksi, kimi-code, grok-cli, qwen-code ve Prime Intellect'in kendi prime-agent'ı da dahil olmak üzere çeşitli ajan donanımları üzerinden çalıştı ve ekip, her çalıştırmanın jeton tüketimini, deney sayısını, araç çağrılarını ve geçen ajan süresini takip etti. Toplamda, deney üst model başına yüz milyonlarca jeton ve tüm şebekede milyarlarca jeton tüketti.
Liderlik Sıralaması: Fable 5 Pakette Liderlik Ediyor
Başlık sonucu: Fable 5 olarak tanımlanan model, klaud kodu donanımından geçerek, temel tarif ile insan kaydı arasındaki boşluğun yüzde 81,7'sini kapattı ve lider tablosunun metriğinde 2.726'lık en iyi doğrulanmış sonuçla. Oraya ulaşmak 8,7 günlük kümülatif temsilci süresi, yaklaşık 800 milyon jeton, 811 deney ve yaklaşık 3.000 araç çağrısı gerektirdi.
Takip eden gruba, aradaki farkı yüzde 53,6 kapatan Opus 5 liderlik ederken, onu Prime Intellect'in ana ajan koşumuyla (ve kimi koduyla yüzde 45,8) kullanıldığında yüzde 52,2 ile Kimi K3 takip etti. Opus 4.8 yüzde 39,4'ü yönetti, birkaç GPT-5.6 çeşidi kabaca yüzde 11 ila 36 arasında yer aldı, Sonnet 5 yüzde 26,8'i kapattı ve Grok 4,5 ve Qwen3.8 Max'in her biri yaklaşık yüzde 24,6'ya ulaştı.
Daha aşağıda DeepSeek V4 Pro aradaki farkı yüzde 12,3 oranında kapattı, GPT-5.5 yüzde 8,1'e ulaştı ve eski Kimi K2.7 yüzde 7,2 ile tamamladı. Özellikle, yakın zamanda piyasaya sürülen bir model - GLM 5.3 - henüz doğrulanmış bir kayıt olmadan yayınlandığı sırada hala çalışıyordu; bu, karşılaştırmalı değerlendirmenin kendi iyileştirmelerini güvenilir bir şekilde doğrulayamayan modelleri cezalandırdığını hatırlatıyor.
Neden Önemlidir
Bunun gibi kıyaslamalar önemlidir çünkü kodlama lider tablolarının ölçemediği bir şeyi ölçerler: gerçek bir araştırma döngüsünü (hipotez, deney, analiz, revizyon) dakikalar yerine günler içinde yürütme becerisi. Bu yetenek, ajanların spesifikasyona göre kod yazmakla değil, kimsenin onlara göstermediği şeyleri keşfetmekle görevlendirildiği, yeni ortaya çıkan otonom yapay zeka araştırma alanının temelini oluşturuyor.
Sonuçların dağılımı başlı başına bilgilendiricidir. Projenin yazımına göre, deneydeki hemen hemen her model aynı kazanan fikirleri buldu; en iyi çalıştırmaları ayıran şey, deneyin geride bıraktığı şeylerdi: Daha güçlü ajanlar, gürültülü sonuçlardaki zayıf sinyalleri, onları doğrulayacak kadar uzun süre korudu ve kendi deneysel verilerini daha iyi anladı.
Topluluktan Uyarılar
Hacker News yorumcuları adil metodolojik noktalara değindiler. Çaba ayarları ve donanımlar modeller arasında farklılık gösteriyordu - Fable 5 yüksek bir mantık ayarında çalışırken Opus 5 maksimumda çalışıyordu - ve 18 modeldeki 153 çalıştırmanın aritmetiği, bazı modellerin diğerlerinden daha fazla deneme aldığını gösteriyor. Bir modelin sıralamasının onun ham araştırma yeteneğini mi yoksa koşum takımının kalitesini mi yansıttığı açık bir soru olmaya devam ediyor.
Yine de gidişatın yönü belli. En hızlı insan elinin mevcut rekora ulaşmak için yıllarca kolektif çaba harcadığı zamanlarda, en iyi otonom ajanlar artık bu açığın çoğunu bir haftadan biraz daha uzun bir sürede kapatıyor. Bir sonraki soru (herhangi bir modelin kalan yüzde 18,3'ü kapatıp kapatamayacağı) beklenenden daha erken yanıtlanabilir.
Yapay zekanın sınırlarını şekillendiren kıyaslamalar ve araştırmalar hakkında daha fazla bilgi için AI Buzz Wire'ın devam eden kapsamını takip edin.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →