Ett nytt riktmärke som heter Real-SWE utmanar hur AI-industrin mäter kodningsförmåga, och de första resultaten är ödmjuka för frontierlabben. Anthropics Fable 5.1, som körs inuti Claude Code-selen, leder styrelsen med en upplösningsgrad på 38,8 % för uppgifter som hämtas från privata, verkliga företagskodbaser. Ingen testad modell klarar 40 procent.

Riktmärket, som släpptes denna månad av Specific Labs, utvärderar frontier AI-modeller på privata produktionskodbaser som teamet licensierat från riktiga företag. Dess skapare hävdar att expertgenererade eller syntetiska uppgifter, hur väl utformade än är, inte är det ordagranta arbetet som ingenjörer på riktiga företag faktiskt gör. For more context on this story, see our ongoing artificial intelligence updates.

Varför privata kodbaser ändrar bilden

Real-SWE skiljer sig från etablerade benchmarks som SWE-bench på två axlar, enligt dess författare: den underliggande kodningsartefakten och instruktionens specificitet. Varje uppgift kommer från ett proprietärt system vars kod och lösningar inte är tillgängliga på det offentliga internet, vilket innebär att agenter inte kan luta sig mot memorerade svar hämtade från offentliga arkiv.

Arbetsuppgifterna har även affärsmässiga konsekvenser. Benchmarks exempeluppgifter inkluderar att få rätt fakturering, beräkna skatter och migrera kunder – förändringar som påverkar hur ett företag fungerar, ofta över flera tjänster. Varje företag har sina egna konventioner och sätt att skriva kod, och agenter måste förstå dessa normer och göra förändringar som fungerar med det som redan finns där.

"Kan en kodningsagent verkligen göra jobbet som en mjukvaruingenjör i den verkliga världen?" frågar riktmärkets inledning. Ledartavlan föreslår att svaret för tillfället är: bara ungefär en tredjedel av tiden i bästa fall.

Hela topplistan

Specifika laboratorier utvärderade åtta gränsmodell-och-selekombinationer, och mätte upplösningshastigheten som pass@1 i genomsnitt över åtta oberoende körningar per uppgift, med 95 procents konfidensintervall:

1. Fabel 5.1 (Claude Code) — 38,8 %
2. GPT-6 Astra (Codex CLI) — 33,8 %
3. Gemini 3.8 Flash (Gemini CLI) — 31,2 %
4. GLM 5.3 (Claude Code) — 28,8 %
5. (oavgjort) Grok 4,6 (Grok Build) — 23,8 %
5. (slips) Muse Spark 1.3 (Muse Code) — 23,8 %
7. Kimi K3 (Kimi-kod) — 18,8 %
8. GPT-5.6 Sol (Codex CLI) — 16,2 %

Resultaten diskuterades flitigt på Hacker News under helgen, där riktmärket fick flera hundra uppröstningar och en livlig debatt om huruvida utvärdering av privat kodbas är rätt måttstock för agentframsteg.

Ett smalt men meningsfullt uppslag på toppen

Gapet mellan de fyra bästa systemen är anmärkningsvärt för vad det säger om det nuvarande konkurrensutsatta landskapet. Fable 5.1:s fem poängs försprång över OpenAI:s GPT-6 Astra är meningsfullt på ett benchmark där varje uppgift är ett verkligt produktionsproblem. Gemini 3.8 Flash tar tredje plats är slående, eftersom modellen är placerad som en snabb, billig arbetshäst snarare än ett flaggskeppsresonemangssystem. Z.ai:s GLM 5.3, utvärderad genom Claude Code, som landar inom fem punkter från ledaren understryker hur konkurrenskraftiga modeller med öppen vikt har blivit på praktiskt ingenjörsarbete.

Lika talande är spridningen i botten. GPT-5.6 Sol, en tidigare OpenAI-utgåva, löser färre än hälften så många uppgifter som Fable 5.1 – en påminnelse om hur snabbt gränsen har flyttats och hur brant nedgången kan vara bara en modellgeneration tillbaka.

Selar betyder lika mycket som modeller

Ett av riktmärkets metodiska val är att uppmärksamma: snarare än att utvärdera modeller isolerat, använder Real-SWE inhemska selar – Claude Code, Codex CLI, Gemini CLI, Grok Build – för att spegla hur företagsingenjörer faktiskt arbetar i praktiken. Leaderboarden rankar uttryckligen kombinationer av modell och sele, och erkänner att ställningar, verktygsåtkomst och iterationsslingor nu är oskiljaktiga från modellkapacitet i verkliga implementeringar.

Den inramningen är viktig för företag som väljer system. Samma modell kan prestera väldigt olika beroende på agentselen som är lindad runt den, och köpare som utvärderar kodningsassistenter på offentliga benchmark-nummer kan få en förvrängd bild av hur dessa system kommer att bete sig på sina egna kodbaser.

Vad det betyder för branschen

Benchmarks har upprepade gånger anklagats för mättnad, med gränsmodeller som publicerar nästan perfekta poäng på offentliga tester som läcker in i träningsdata. Real-SWE:s design försöker motverka båda problemen på en gång: koden är privat och licensierad, uppgifterna är verkliga arbetsprodukter från arbetande ingenjörsteam, och instruktionerna återspeglar den röriga specificiteten hos riktiga biljetter snarare än polerade problemformuleringar.

Den nyktra takeawayen är den absoluta nivån. Även det bästa systemet löser färre än fyra av tio verkliga företagsuppgifter vid första försöket, i genomsnitt över åtta körningar. Trots alla framsteg inom agentkodning antyder riktmärket att autonom mjukvaruutveckling på verkliga produktionssystem förblir en övervakad aktivitet - en där mänskliga ingenjörer granskar, omdirigerar och reparerar mycket oftare än vad leverantörsdemoner antyder.

För företag som väljer bland kodningsassistenter erbjuder riktmärket en praktisk checklista: föredrar system utvärderade på privat kod, insistera på konfidensintervall snarare än engångsrubriknummer, och viktselens kvalitet lika tungt som råmodellens förmåga. Real-SWE:s första topplista kommer inte att vara sista ordet – men det är det mest direkta svaret hittills på frågan varje ingenjörsledare ställer om agentkodning.

För mer om kodningsagenter, modellsläpp och forskningen som formar dem, följ de senaste AI-nyheterna när nästa omgång av benchmarkresultat landar.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →