Un nou punct de referință numit Real-SWE provoacă modul în care industria AI măsoară capacitatea de codare, iar primele rezultate sunt umilitoare pentru laboratoarele de frontieră. Anthropic's Fable 5.1, care rulează în interiorul hamului Claude Code, conduce placa cu o rată de rezoluție de 38,8% pentru sarcinile extrase din baze de cod private, din lumea reală. Niciun model testat nu elimină 40%.
Benchmark-ul, lansat luna aceasta de Specific Labs, evaluează modelele AI de frontieră pe baze de coduri de producție private pe care echipa le-a licențiat de la companii reale. Creatorii săi susțin că sarcinile generate de experți sau sintetice, oricât de bine concepute, nu sunt munca textuală pe care o fac de fapt inginerii de la companii reale. For more context on this story, see our ongoing AI news.
De ce bazele de cod private schimbă imaginea
Real-SWE diferă de standardele stabilite, cum ar fi SWE-bench, pe două axe, potrivit autorilor săi: artefactul de codificare de bază și specificul instrucțiunii. Fiecare sarcină provine dintr-un sistem proprietar al cărui cod și soluții nu sunt disponibile pe internetul public, ceea ce înseamnă că agenții nu se pot baza pe răspunsurile memorate extrase din depozitele publice.
Sarcinile au și consecințe de afaceri. Exemplele de sarcini ale benchmark-ului includ facturarea corectă, calcularea taxelor și migrarea clienților - modificări care afectează modul în care funcționează o afacere, adesea prin mai multe servicii. Fiecare companie are propriile convenții și moduri de scriere a codului, iar agenții trebuie să înțeleagă acele norme și să facă modificări care funcționează cu ceea ce există deja.
„Poate un agent de codare să facă de fapt munca unui inginer de software în lumea reală?” introducerea benchmark-ului întreabă. Clasamentul sugerează că răspunsul, deocamdată, este: doar aproximativ o treime din timp, în cel mai bun caz.
Clasamentul complet
Laboratoarele specifice au evaluat opt combinații de model și cablaj de frontieră, măsurând rata de rezoluție ca medie de trecere@1 pe opt rulări independente per sarcină, cu intervale de încredere de 95%:
1. Fable 5.1 (Claude Code) — 38,8%
2. GPT-6 Astra (Codex CLI) — 33,8%
3. Gemini 3.8 Flash (Gemini CLI) — 31,2%
4. GLM 5.3 (Claude Code) — 28,8%
5. (egalitate) Grok 4.6 (Grok Build) — 23,8%
5. (egalitate) Muse Spark 1.3 (Cod Muze) — 23,8%
7. Kimi K3 (Codul Kimi) — 18,8%
8. GPT-5,6 Sol (Codex CLI) — 16,2%
Rezultatele au fost discutate pe larg pe Hacker News în weekend, unde benchmark-ul a atras câteva sute de voturi pozitive și o dezbatere aprinsă despre dacă evaluarea bazei de cod private este criteriul potrivit pentru progresul agentului.
O răspândire îngustă, dar semnificativă în partea de sus
Diferența dintre primele patru sisteme este notabilă pentru ceea ce spune despre peisajul competitiv actual. Avantajul de cinci puncte a lui Fable 5.1 față de GPT-6 Astra de la OpenAI este semnificativ într-un punct de referință în care fiecare sarcină este o problemă reală de producție. Gemini 3.8 Flash ocupa locul al treilea este izbitor, deoarece modelul este poziționat mai degrabă ca un cal de bătaie rapid, cu costuri reduse, decât ca un sistem de raționament emblematic. GLM 5.3 de la Z.ai, evaluat prin Claude Code, aterizarea la cinci puncte de lider subliniază cât de competitive au devenit modelele open-weight în munca de inginerie practică.
La fel de grăitoare este răspândirea din partea de jos. GPT-5.6 Sol, o lansare anterioară a OpenAI, rezolvă mai puțin de jumătate din câte sarcini decât Fable 5.1 – un reamintire a cât de repede s-a mutat frontiera și cât de abruptă poate fi renunțarea la doar o generație de model în urmă.
Hamurile contează la fel de mult ca și modelele
Una dintre alegerile metodologice ale benchmark-ului este atragerea atenției: în loc să evalueze modelele izolat, Real-SWE folosește hamuri native — Claude Code, Codex CLI, Gemini CLI, Grok Build — pentru a reflecta modul în care inginerii întreprinderii lucrează efectiv în practică. Clasamentul clasifică în mod explicit combinațiile de model și cablaj, recunoscând că schelele, accesul la instrumente și buclele de iterație sunt acum inseparabile de capacitatea modelului în implementările reale.
Această încadrare contează pentru întreprinderile care aleg sisteme. Același model poate funcționa foarte diferit în funcție de cablajul agentului înconjurat în jurul acestuia, iar cumpărătorii care evaluează asistenții de codare pe numerele de referință publice pot obține o imagine distorsionată a modului în care acele sisteme se vor comporta pe propriile baze de cod.
Ce înseamnă pentru industrie
Benchmark-urile au fost acuzate în mod repetat de saturație, modelele de frontieră postând scoruri aproape perfecte la testele publice care se scurg în datele de antrenament. Designul Real-SWE încearcă să contracareze ambele probleme în același timp: codul este privat și licențiat, sarcinile sunt produse de lucru autentice ale echipelor de ingineri care lucrează, iar instrucțiunile reflectă specificul dezordonat al biletelor reale, mai degrabă decât declarațiile de problemă șlefuite.
Reducerea la îndemână este nivelul absolut. Chiar și cel mai bun sistem rezolvă mai puțin de patru din zece sarcini reale de întreprindere la prima încercare, în medie pe opt rulări. Cu toate progresele înregistrate în codificarea agentică, benchmark-ul sugerează că ingineria software autonomă pe sistemele de producție reale rămâne o activitate supravegheată - una în care inginerii umani revizuiesc, redirecționează și repară mult mai des decât implică demonstrațiile furnizorilor.
Pentru întreprinderile care aleg dintre asistenți de codare, benchmark-ul oferă o listă de verificare practică: preferați sistemele evaluate pe cod privat, insistați pe intervale de încredere mai degrabă decât numerele de titlu cu o singură rundă și calitatea hamului de greutate la fel de puternică ca și capacitatea modelului brut. Primul clasament al Real-SWE nu va fi ultimul cuvânt – dar este răspunsul cel mai direct de până acum la întrebarea pe care fiecare lider de inginerie și-o pune despre codificarea agentică.
Pentru mai multe despre agenții de codificare, lansările de modele și cercetările care le modelează, urmăriți cele mai recente știri despre AI pe măsură ce urmează următoarea rundă de rezultate de referință.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →