Penanda aras baharu yang dipanggil Real-SWE mencabar cara industri AI mengukur keupayaan pengekodan, dan keputusan pertama adalah merendah diri untuk makmal sempadan. Anthropic's Fable 5.1, berjalan di dalam abah-abah Claude Code, mengetuai lembaga dengan kadar resolusi 38.8% pada tugasan yang diambil daripada pangkalan kod perusahaan dunia nyata persendirian. Tiada model yang diuji melepasi 40 peratus.
Penanda aras yang dikeluarkan bulan ini oleh Specific Labs, menilai model AI sempadan pada pangkalan kod pengeluaran swasta yang dilesenkan oleh pasukan daripada syarikat sebenar. Penciptanya berpendapat bahawa tugas yang dijana pakar atau sintetik, walau bagaimanapun direka bentuk dengan baik, bukanlah kerja verbatim yang sebenarnya dilakukan oleh jurutera di syarikat sebenar. For more context on this story, see our ongoing latest AI developments.
Mengapa Pangkalan Kod Peribadi Mengubah Gambar
Real-SWE berbeza daripada penanda aras yang ditetapkan seperti SWE-bench pada dua paksi, menurut pengarangnya: artifak pengekodan asas dan kekhususan arahan. Setiap tugas datang daripada sistem proprietari yang kod dan penyelesaiannya tidak tersedia di internet awam, yang bermaksud ejen tidak boleh bergantung pada jawapan yang dihafal yang diambil dari repositori awam.
Tugas itu juga membawa akibat perniagaan. Contoh tugas penanda aras termasuk mendapatkan pengebilan yang betul, mengira cukai dan memindahkan pelanggan — perubahan yang mempengaruhi cara perniagaan berjalan, selalunya merentas berbilang perkhidmatan. Setiap syarikat mempunyai konvensyen dan cara menulis kodnya sendiri, dan ejen mesti memahami norma tersebut dan membuat perubahan yang sesuai dengan apa yang sedia ada.
"Bolehkah ejen pengekodan benar-benar melakukan kerja jurutera perisian di dunia nyata?" pengenalan penanda aras bertanya. Papan pendahulu mencadangkan jawapannya, buat masa ini, ialah: hanya kira-kira satu pertiga daripada masa terbaik.
Papan Pendahulu Penuh
Makmal Khusus menilai lapan kombinasi model dan abah-abah sempadan, mengukur kadar resolusi sebagai lulus@1 dipuratakan dalam lapan larian bebas bagi setiap tugas, dengan selang keyakinan 95 peratus:
1. Fable 5.1 (Kod Claude) — 38.8%
2. GPT-6 Astra (Codex CLI) — 33.8%
3. Gemini 3.8 Flash (Gemini CLI) — 31.2%
4. GLM 5.3 (Kod Claude) — 28.8%
5. (tali seri) Grok 4.6 (Grok Build) — 23.8%
5. (tali seri) Muse Spark 1.3 (Muse Code) — 23.8%
7. Kimi K3 (Kod Kimi) — 18.8%
8. GPT-5.6 Sol (Codex CLI) — 16.2%
Hasilnya telah dibincangkan secara meluas di Berita Hacker pada hujung minggu, di mana penanda aras itu menarik beberapa ratus undian positif dan perdebatan yang meriah tentang sama ada penilaian pangkalan kod persendirian adalah kayu pengukur yang tepat untuk kemajuan ejen.
Sebaran Sempit tetapi Bermakna di Puncak
Jurang antara empat sistem teratas adalah ketara kerana apa yang dikatakan tentang landskap persaingan semasa. Pendahuluan lima mata Fable 5.1 mengatasi GPT-6 Astra OpenAI adalah bermakna pada penanda aras di mana setiap tugas adalah masalah pengeluaran sebenar. Gemini 3.8 Flash mengambil tempat ketiga adalah menarik, kerana model ini diletakkan sebagai kuda kerja yang pantas dan kos rendah dan bukannya sistem penaakulan utama. GLM 5.3 Z.ai, yang dinilai melalui Kod Claude, mendarat dalam jarak lima mata dari peneraju menggariskan bagaimana model berwajaran terbuka berdaya saing dalam kerja kejuruteraan praktikal.
Perkara yang sama adalah penyebaran di bahagian bawah. GPT-5.6 Sol, keluaran OpenAI yang lebih awal, menyelesaikan kurang daripada separuh tugasan seperti Fable 5.1 — peringatan tentang seberapa cepat sempadan telah bergerak dan betapa curamnya penurunan boleh menjadi satu generasi model ke belakang.
Memanfaatkan Penting Sama Seperti Model
Salah satu pilihan metodologi penanda aras ialah menarik perhatian: daripada menilai model secara berasingan, Real-SWE menggunakan abah-abah asli — Kod Claude, Codex CLI, Gemini CLI, Grok Build — untuk mencerminkan cara jurutera perusahaan sebenarnya bekerja dalam amalan. Papan pendahulu secara eksplisit menyenaraikan kombinasi model-dan-abah-abah, mengakui bahawa perancah, akses alat dan gelung lelaran kini tidak dapat dipisahkan daripada keupayaan model dalam penggunaan sebenar.
Pembingkaian itu penting bagi perusahaan yang memilih sistem. Model yang sama boleh berprestasi sangat berbeza bergantung pada abah-abah ejen yang dililitkan di sekelilingnya, dan pembeli yang menilai pembantu pengekodan pada nombor penanda aras awam mungkin mendapat gambaran yang herot tentang cara sistem tersebut akan berkelakuan pada pangkalan kod mereka sendiri.
Maksudnya untuk Industri
Penanda aras telah berulang kali dituduh tepu, dengan model sempadan menyiarkan skor hampir sempurna pada ujian awam yang bocor ke dalam data latihan. Reka bentuk Real-SWE cuba mengatasi kedua-dua masalah sekaligus: kod tersebut adalah peribadi dan berlesen, tugasan adalah produk kerja tulen pasukan kejuruteraan yang bekerja, dan arahan mencerminkan kekhususan tiket sebenar yang tidak kemas dan bukannya kenyataan masalah yang digilap.
Pengambilalihan yang menenangkan adalah tahap mutlak. Malah sistem terbaik menyelesaikan kurang daripada empat daripada sepuluh tugasan perusahaan sebenar pada percubaan pertama, secara purata dalam lapan larian. Untuk semua kemajuan dalam pengekodan agen, penanda aras mencadangkan bahawa kejuruteraan perisian autonomi pada sistem pengeluaran sebenar kekal sebagai aktiviti yang diawasi — aktiviti di mana jurutera manusia menyemak, mengubah hala dan membaiki jauh lebih kerap daripada yang ditunjukkan oleh demo vendor.
Untuk perusahaan yang memilih dalam kalangan pembantu pengekodan, penanda aras menawarkan senarai semak praktikal: lebih suka sistem yang dinilai pada kod peribadi, menegaskan selang keyakinan berbanding nombor tajuk satu larian dan kualiti memanfaatkan berat seberat keupayaan model mentah. Papan pendahulu pertama Real-SWE bukanlah kata terakhir — tetapi ia adalah jawapan paling langsung kepada soalan yang ditanya oleh setiap pemimpin kejuruteraan tentang pengekodan agen.
Untuk maklumat lanjut tentang ejen pengekodan, keluaran model dan penyelidikan yang membentuknya, ikuti berita AI terkini apabila pusingan seterusnya keputusan penanda aras tiba.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →