Nový benchmark nazvaný Real-SWE je výzvou, jak průmysl AI měří schopnost kódování, a první výsledky jsou pro hraniční laboratoře ponižující. Anthropic's Fable 5.1, běžící uvnitř svazku Claude Code, vede představenstvo s 38,8% mírou rozlišení u úloh čerpaných ze soukromých podnikových kódových základen v reálném světě. Žádný testovaný model nevyčistí 40 procent.

Benchmark, který tento měsíc vydala společnost Specific Labs, hodnotí hraniční modely umělé inteligence na soukromých produkčních kódových základnách, které tým licencoval od skutečných společností. Jeho tvůrci tvrdí, že expertně generované nebo syntetické úkoly, jakkoli dobře navržené, nejsou doslovnou prací, kterou inženýři ve skutečných společnostech skutečně dělají. For more context on this story, see our ongoing breaking AI news.

Proč soukromé kódové báze mění obrázek

Real-SWE se podle svých autorů liší od zavedených benchmarků, jako je SWE-bench, ve dvou osách: základní kódovací artefakt a specifičnost instrukce. Každý úkol pochází z proprietárního systému, jehož kód a řešení nejsou k dispozici na veřejném internetu, což znamená, že se agenti nemohou spolehnout na zapamatované odpovědi vytažené z veřejných úložišť.

Úkoly mají také obchodní důsledky. Mezi příklady úkolů benchmarku patří správné účtování, výpočet daní a migrace zákazníků – změny, které ovlivňují chod firmy, často napříč různými službami. Každá společnost má své vlastní konvence a způsoby psaní kódu a agenti musí těmto normám rozumět a provádět změny, které pracují s tím, co již existuje.

"Může kódovací agent skutečně vykonávat práci softwarového inženýra v reálném světě?" ptá se úvod benchmarku. Žebříček naznačuje, že odpověď prozatím zní: v nejlepším případě jen asi ve třetině času.

Úplný žebříček

Specific Labs vyhodnotila osm kombinací hraničního modelu a svazku, přičemž měřila míru rozlišení jako pass@1 zprůměrovanou během osmi nezávislých běhů na úlohu s 95procentním intervalem spolehlivosti:

1. Fable 5.1 (Claude Code) – 38,8 %
2. GPT-6 Astra (Codex CLI) – 33,8 %
3. Gemini 3.8 Flash (Gemini CLI) – 31,2 %
4. GLM 5.3 (Claude Code) – 28,8 %
5. (remíza) Grok 4,6 (Grok Build) – 23,8 %
5. (remíza) Muse Spark 1.3 (Muse Code) – 23,8 %
7. Kimi K3 (Kimi Code) – 18,8 %
8. GPT-5.6 Sol (Codex CLI) – 16,2 %

Výsledky byly o víkendu rozsáhle diskutovány na Hacker News, kde benchmark získal několik stovek kladných hlasů a živou debatu o tom, zda je hodnocení soukromé kódové základny tím správným měřítkem pro pokrok agentů.

Úzké, ale smysluplné rozpětí na vrcholu

Rozdíl mezi prvními čtyřmi systémy je pozoruhodný tím, co říká o současném konkurenčním prostředí. Pětibodový náskok Fable 5.1 před GPT-6 Astra OpenAI je smysluplný v benchmarku, kde je každý úkol skutečným produkčním problémem. Gemini 3.8 Flash, který se umístil na třetím místě, je zarážející, protože model je umístěn spíše jako rychlý a levný pracant než jako vlajková loď systému uvažování. Z.ai's GLM 5.3, hodnocený pomocí Claude Code, přistání v rozmezí pěti bodů od lídra, podtrhuje, jak se v praktické inženýrské práci staly konkurenceschopné modely s otevřenou váhou.

Stejně vypovídající je rozpětí ve spodní části. GPT-5.6 Sol, dřívější vydání OpenAI, řeší méně než polovinu úloh než Fable 5.1 – připomíná, jak rychle se hranice posunula a jak strmý pokles může být jen o jednu generaci modelu zpět.

Na postrojích záleží stejně jako na modelech

Jednou z metodologických voleb benchmarku je upoutat pozornost: Real-SWE namísto hodnocení modelů v izolaci používá nativní kabely – Claude Code, Codex CLI, Gemini CLI, Grok Build – k vyjádření toho, jak podnikoví inženýři skutečně pracují v praxi. Žebříček explicitně řadí kombinace modelu a svazku, což potvrzuje, že lešení, přístup k nástrojům a iterační smyčky jsou nyní neoddělitelné od schopností modelu v reálném nasazení.

Na tomto uspořádání záleží pro podniky, které si vybírají systémy. Stejný model může fungovat velmi odlišně v závislosti na svazku agentů, který je kolem něj navinutý, a kupující hodnotící kódovací asistenty na veřejných číslech benchmarků mohou získat zkreslený obrázek o tom, jak se tyto systémy budou chovat na svých vlastních kódových základnách.

Co to znamená pro průmysl

Benchmarky byly opakovaně obviňovány ze saturace, přičemž hraniční modely vykazují téměř dokonalé výsledky ve veřejných testech, které unikají do tréninkových dat. Návrh Real-SWE se snaží čelit oběma problémům najednou: kód je soukromý a licencovaný, úkoly jsou skutečnými pracovními produkty pracovních inženýrských týmů a pokyny odrážejí spíše chaotický specifičnost skutečných tiketů než vyleštěná prohlášení o problémech.

Vystřízlivění je absolutní úroveň. I ten nejlepší systém vyřeší na první pokus méně než čtyři z deseti skutečných podnikových úloh, v průměru za osm spuštění. Přes veškerý pokrok v agentním kódování benchmark naznačuje, že autonomní softwarové inženýrství na skutečných produkčních systémech zůstává činností pod dohledem – činností, kde lidští inženýři kontrolují, přesměrovávají a opravují mnohem častěji, než naznačují ukázky prodejců.

Pro podniky, které si vybírají mezi asistenty kódování, nabízí benchmark praktický kontrolní seznam: preferujte systémy vyhodnocované na soukromém kódu, trvejte na intervalech spolehlivosti spíše než na jednorázových počtech titulků a vážíte kvalitu postroje stejně vysokou jako schopnosti surového modelu. První žebříček Real-SWE nebude posledním slovem – ale je to zatím nejpřímější odpověď na otázku, kterou si klade každý technický vedoucí ohledně agentního kódování.

Chcete-li se dozvědět více o kódovacích agentech, modelových verzích a výzkumu, který je utváří, sledujte nejnovější zprávy o AI, když přistane další kolo srovnávacích výsledků.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →