Real-SWE adı verilen yeni bir kıyaslama, yapay zeka endüstrisinin kodlama yeteneğini nasıl ölçtüğünü zorluyor ve ilk sonuçlar öncü laboratuvarlar için utanç verici. Anthropic'in Claude Code donanımı içinde çalışan Fable 5.1'i, özel, gerçek dünyadaki kurumsal kod tabanlarından alınan görevlerde %38,8'lik bir çözünürlük oranıyla yönetim kuruluna liderlik ediyor. Test edilen hiçbir model yüzde 40'ı temizleyemiyor.

Specific Labs tarafından bu ay yayınlanan kıyaslama, ekibin gerçek şirketlerden lisansladığı özel üretim kod tabanlarındaki öncü yapay zeka modellerini değerlendiriyor. Yaratıcıları, ne kadar iyi tasarlanmış olursa olsun, uzmanlar tarafından oluşturulan veya sentetik görevlerin, gerçek şirketlerdeki mühendislerin gerçekte yaptığı birebir işler olmadığını savunuyor. For more context on this story, see our ongoing artificial intelligence updates.

Özel Kod Tabanları Neden Resmi Değiştiriyor?

Real-SWE, yazarlarına göre SWE-bench gibi yerleşik kıyaslamalardan iki eksende farklılık göstermektedir: temeldeki kodlama yapısı ve talimatın özgüllüğü. Her görev, kodu ve çözümleri halka açık internette bulunmayan özel bir sistemden gelir; bu, temsilcilerin genel depolardan alınan ezberlenmiş yanıtlara güvenemeyeceği anlamına gelir.

Görevler aynı zamanda ticari sonuçlar da taşır. Karşılaştırmanın örnek görevleri arasında faturalandırmanın doğru yapılması, vergilerin hesaplanması ve müşterilerin taşınması yer alır; bunlar genellikle birden fazla hizmette bir işletmenin işleyişini etkileyen değişikliklerdir. Her şirketin kendi kuralları ve kod yazma yöntemleri vardır ve temsilcilerin bu normları anlamaları ve halihazırda var olanlarla işe yarayacak değişiklikler yapmaları gerekir.

"Bir kodlama aracısı gerçek dünyada bir yazılım mühendisinin işini gerçekten yapabilir mi?" Benchmark'ın tanıtımı şunu soruyor: Liderlik tablosu şimdilik cevabın şu olduğunu gösteriyor: en iyi ihtimalle yalnızca üçte biri kadar.

Tam Skor Tablosu

Spesifik Laboratuarlar sekiz sınır model ve donanım kombinasyonunu değerlendirdi ve çözünürlük oranını yüzde 95 güven aralıklarıyla görev başına sekiz bağımsız çalıştırmanın ortalaması olan pass@1 olarak ölçtü:

1. Fable 5.1 (Claude Kodu) — %38,8
2. GPT-6 Astra (Codex CLI) — %33,8
3. Gemini 3.8 Flash (Gemini CLI) — %31,2
4. GLM 5.3 (Claude Kodu) — %28,8
5. (berabere) Grok 4,6 (Grok Build) — %23,8
5. (berabere) Muse Spark 1.3 (Muse Code) — %23,8
7. Kimi K3 (Kimi Kodu) — %18,8
8. GPT-5.6 Sol (Codex CLI) — %16,2

Sonuçlar hafta sonu Hacker News'te kapsamlı bir şekilde tartışıldı; burada kıyaslama birkaç yüz olumlu oy aldı ve özel kod tabanı değerlendirmesinin temsilci ilerlemesi için doğru ölçüt olup olmadığı konusunda canlı bir tartışma yaşandı.

Zirvede Dar Ama Anlamlı Bir Dağılım

İlk dört sistem arasındaki fark, mevcut rekabet ortamı hakkında söyledikleri açısından dikkate değer. Fable 5.1'in OpenAI'nin GPT-6 Astra'sına göre beş puanlık üstünlüğü, her görevin gerçek bir üretim sorunu olduğu bir kıyaslamada anlamlıdır. Gemini 3.8 Flash'ın üçüncü olması dikkat çekicidir çünkü model, amiral gemisi bir akıl yürütme sisteminden ziyade hızlı, düşük maliyetli bir iş makinesi olarak konumlandırılmıştır. Claude Code aracılığıyla değerlendirilen Z.ai'nin GLM 5.3'ü, liderin beş puanına iniyor, açık ağırlık modellerinin pratik mühendislik çalışmalarında ne kadar rekabetçi hale geldiğinin altını çiziyor.

Alt kısımdaki yayılma da aynı derecede anlamlıdır. Daha eski bir OpenAI sürümü olan GPT-5.6 Sol, Fable 5.1'in yarısından daha azını çözüyor; bu, sınırın ne kadar hızlı ilerlediğini ve düşüşün yalnızca bir model neslinde ne kadar dik olabileceğini hatırlatıyor.

Modeller Kadar Emniyet Kemerleri de Önemlidir

Karşılaştırmalı değerlendirmenin metodolojik tercihlerinden biri dikkat çekmektir: Real-SWE, modelleri tek başına değerlendirmek yerine, kurumsal mühendislerin pratikte gerçekte nasıl çalıştığını yansıtmak için yerel donanımları (Claude Code, Codex CLI, Gemini CLI, Grok Build) kullanır. Liderlik sıralaması, iskele, araç erişimi ve yineleme döngülerinin artık gerçek dağıtımlardaki model kapasitesinden ayrılamaz olduğunu kabul ederek model ve donanım kombinasyonlarını açıkça sıralıyor.

Bu çerçeveleme, sistem seçen işletmeler için önemlidir. Aynı model, etrafına sarılmış aracı donanımına bağlı olarak çok farklı performans gösterebilir ve kodlama asistanlarını genel kıyaslama sayılarına göre değerlendiren alıcılar, bu sistemlerin kendi kod tabanlarında nasıl davranacağına dair çarpık bir resim elde ediyor olabilir.

Endüstri İçin Ne İfade Ediyor?

Sınır modellerinin halka açık testlerde eğitim verilerine sızan mükemmele yakın puanlar yayınlamasıyla kıyaslamalar defalarca doygunlukla suçlandı. Real-SWE'nin tasarımı her iki sorunu da aynı anda çözmeye çalışır: Kod özel ve lisanslıdır, görevler çalışan mühendislik ekiplerinin orijinal çalışma ürünleridir ve talimatlar gösterişli sorun açıklamaları yerine gerçek biletlerin karmaşık özelliklerini yansıtır.

Ayılma paketi mutlak seviyedir. En iyi sistem bile ilk denemede on gerçek kurumsal görevden dördünden daha azını çözer; ortalama sekiz çalıştırmanın üzerindedir. Acentesel kodlamadaki tüm ilerlemelere rağmen, kıyaslama, gerçek üretim sistemleri üzerindeki otonom yazılım mühendisliğinin denetlenen bir faaliyet olarak kaldığını, insan mühendislerin satıcı demolarının ima ettiğinden çok daha sık inceleme, yönlendirme ve onarım yaptığını öne sürüyor.

Karşılaştırma, kodlama asistanları arasından seçim yapan kuruluşlar için pratik bir kontrol listesi sunar: özel kod üzerinden değerlendirilen sistemleri tercih edin, tek seferlik başlık numaraları yerine güven aralıklarında ısrar edin ve ham model kapasitesi kadar ağırlık donanımı kalitesine de önem verin. Real-SWE'nin ilk skor tablosu son söz olmayacak; ancak bu, her mühendislik liderinin ajansal kodlama hakkında sorduğu soruya verilen en doğrudan cevaptır.

Kodlama aracıları, model yayınları ve bunları şekillendiren araştırmalar hakkında daha fazla bilgi için, bir sonraki kıyaslama sonuçları geldiğinde en son yapay zeka haberlerini takip edin.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →