Tandha pathokan anyar sing diarani Real-SWE nantang kepiye industri AI ngukur kemampuan coding, lan asil pisanan ngremehake laboratorium perbatasan. Anthropic's Fable 5.1, mlaku ing sabuk Claude Code, ndadékaké papan kanthi tingkat résolusi 38,8% kanggo tugas sing digambar saka basis kode perusahaan pribadi ing donya nyata. Ora ana model sing diuji kanthi 40 persen.

Patokan kasebut, dirilis ing wulan iki dening Lab Spesifik, ngevaluasi model AI perbatasan ing basis kode produksi pribadi sing dilisensi tim saka perusahaan nyata. Pencipta mbantah manawa tugas sing digawe pakar utawa sintetik, sanajan dirancang kanthi apik, dudu karya verbatim sing ditindakake dening insinyur ing perusahaan nyata. For more context on this story, see our ongoing artificial intelligence updates.

Napa Kode Basis Pribadi Ngganti Gambar

Nyata-SWE bedo saka benchmarks diadegaké kaya SWE-bench ing loro sumbu, miturut sawijining penulis: artefak coding ndasari lan specificity saka instruksi. Saben tugas asale saka sistem kepemilikan sing kode lan solusi ora kasedhiya ing internet umum, tegese agen ora bisa gumantung ing jawaban sing wis diapalake sing ditarik saka repositori umum.

Tugas kasebut uga nggawa konsekuensi bisnis. Tugas conto pathokan kalebu njupuk tagihan sing bener, ngitung pajak, lan migrasi pelanggan - owah-owahan sing mengaruhi cara bisnis mlaku, asring ing macem-macem layanan. Saben perusahaan duwe konvensi lan cara nulis kode dhewe, lan agen kudu ngerti norma kasebut lan nggawe owah-owahan sing cocog karo apa sing wis ana.

"Apa agen coding bisa nindakake pakaryan insinyur piranti lunak ing donya nyata?" pambuka pathokan takon. Papan pimpinan nyaranake jawaban, saiki, yaiku: mung kira-kira sapratelune paling apik.

Papan Pimpinan Lengkap

Lab Spesifik ngevaluasi wolung kombinasi model-lan-sabuk wates, ngukur tingkat resolusi minangka pass@1 rata-rata liwat wolung mlaku mandiri saben tugas, kanthi interval kapercayan 95 persen:

1. Fable 5.1 (Kode Claude) — 38,8%
2. GPT-6 Astra (Codex CLI) — 33,8%
3. Gemini 3.8 Flash (Gemini CLI) — 31.2%
4. GLM 5.3 (Kode Claude) — 28.8%
5. (ikat) Grok 4.6 (Grok Mbangun) — 23.8%
5. (dasi) Muse Spark 1.3 (Kode Muse) — 23.8%
7. Kimi K3 (Kode Kimi) — 18,8%
8. GPT-5.6 Sol (Codex CLI) — 16.2%

Asil kasebut dibahas sacara ekstensif ing Hacker News ing akhir minggu, ing ngendi pathokan kasebut narik sawetara atus upvotes lan debat sing nyenengake babagan apa evaluasi basis kode pribadi minangka ukuran sing tepat kanggo kemajuan agen.

Panyebaran Ciyut nanging Makna ing Ndhuwur

Longkangan antarane papat sistem ndhuwur kacathet kanggo apa ngandika bab lanskap competitive saiki. Fable 5.1 unggul limang poin liwat OpenAI GPT-6 Astra migunani ing pathokan ing ngendi saben tugas minangka masalah produksi nyata. Gemini 3.8 Flash njupuk katelu iku striking, wiwit model dipanggonke minangka cepet, kurang-biaya workhorse tinimbang sistem penalaran kapal penggedhe. Z.ai's GLM 5.3, dievaluasi liwat Claude Code, kebangkrutan ing limang TCTerms pimpinan nandheske carane competitive model mbukak-bobot wis dadi ing karya engineering praktis.

Sing padha karo nyebarake ing ngisor. GPT-5.6 Sol, release OpenAI sadurungé, mutusaké kurang saka setengah minangka akeh tugas minangka Fable 5.1 - pangeling carane cepet tapel wates wis dipindhah, lan carane tajem gulung-mati bisa mung siji model generasi bali.

Nganggo Matter minangka Kathah Model

Salah sawijining pilihan metodologis pathokan yaiku narik kawigaten: tinimbang ngevaluasi model kanthi kapisah, Real-SWE nggunakake sabuk asli - Kode Claude, Codex CLI, Gemini CLI, Grok Build - kanggo nggambarake carane insinyur perusahaan bener-bener kerja ing praktik. Papan pimpinan kasebut kanthi jelas menehi rangking kombinasi model-lan-sabuk, ngakoni yen perancah, akses alat lan loop iterasi saiki ora bisa dipisahake saka kemampuan model ing panyebaran nyata.

Framing kasebut penting kanggo perusahaan sing milih sistem. Model sing padha bisa beda banget gumantung saka sabuk agen sing dibungkus, lan para panuku sing ngevaluasi asisten coding ing nomer pathokan umum bisa uga entuk gambaran sing kleru babagan cara sistem kasebut bakal tumindak ing basis kode dhewe.

Apa Tegese kanggo Industri

Tolok ukur wis bola-bali dituduh jenuh, kanthi model perbatasan ngirim skor sing meh sampurna ing tes umum sing bocor menyang data latihan. Desain Real-SWE nyoba ngatasi masalah kasebut bebarengan: kode kasebut pribadi lan dilisensi, tugas kasebut minangka produk kerja asli tim teknik kerja, lan instruksi kasebut nggambarake kekhasan tiket nyata tinimbang pernyataan masalah sing dipoles.

Takeaway sobering punika tingkat mutlak. Malah sistem paling apik mutusake kurang saka papat saka sepuluh tugas perusahaan nyata ing nyoba pisanan, rata-rata liwat wolung roto. Kanggo kabeh kemajuan ing coding agen, pathokan kasebut nyaranake manawa rekayasa piranti lunak otonom ing sistem produksi nyata tetep dadi kegiatan sing diawasi - ing ngendi insinyur manungsa mriksa, ngarahake lan ndandani luwih asring tinimbang demo vendor.

Kanggo perusahaan sing milih ing antarane asisten coding, pathokan kasebut nawakake dhaptar priksa praktis: luwih milih sistem sing dievaluasi ing kode pribadi, ngeyel interval kapercayan tinimbang nomer judhul siji-roto, lan kualitas sabuk bobote kaya kemampuan model mentah. Papan pimpinan pisanan Real-SWE ora bakal dadi tembung pungkasan - nanging iki minangka jawaban sing paling langsung kanggo pitakonan sing ditakoni saben pimpinan teknik babagan kode agen.

Kanggo luwih akeh babagan agen coding, rilis model lan riset sing nggawe, tindakake warta AI paling anyar nalika asil benchmark babak sabanjure teka.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →