Cognition, společnost stojící za softwarovým inženýrem Devin AI, spustila ve čtvrtek SWE-2 a označila jej za svůj dosud nejpokročilejší model kódování. V blogovém příspěvku zveřejněném 10. září společnost uvedla, že nový model posouvá to, co nazývá Paretovou hranicí schopností a nákladů, dosáhl 50,0 % v benchmarku FrontierCode 1.1 Main, zatímco stojí o 64 % méně než Fable 5.1, model Anthropic, který je jen o jeden bod před ním s 50,9 %.

Uvedení na trh přichází sotva den poté, co společnost Cognition potvrdila kolo financování ve výši 2 miliard dolarů při ocenění 48 miliard dolarů, a signalizuje, jak agresivně startup s agentním kódováním investuje do vývoje vlastního modelu, spíše než aby se spoléhal pouze na hraniční modely třetích stran. Pro nepřetržité zpravodajství o závodě v kódování AI a všem dalším, co hýbe průmyslem, si uložte AI Buzz Wire, svůj denní zdroj nejnovějších zpráv o AI.

Kde SWE-2 přistane na benchmarkech

Podle zveřejněných výsledků Cognition má SWE-2 50,0 % na FrontierCode 1.1 Main, před Grokem 4.6 s 48,0 % a GPT-5.6 Sol s 47,5 % a v dosahu GPT-6 Astra, který vede pole s 53,3 %. V benchmarku DeepSWE 1.1 dosahuje SWE-2 73,0 %, na druhém místě za Astra 74,1 % mezi modely na seznamech Cognition.

Nejsilnější ukázka přichází na Terminal-Bench 2.1, kde SWE-2 dosahuje skóre 92,8 %, což je nejvyšší hodnota ve srovnávací tabulce Cognition a před Fable 5.1 s 91,4 % a GPT-6 Astra s 89,9 %. Obrázek se mění na tvrdší Terminal-Bench 4, kde SWE-2 zvládá 27,3 % oproti 57,9 % u GPT-6 Astra a 55,8 % u Fable 5.1, což je připomínkou, že design modelu, který je na prvním místě v efektivitě, ponechává prostor na samém vrcholu obtížnosti úkolu.

Cognition stručně shrnuje umístění: na FrontierCode 1.1 Main a DeepSWE 1.1 SWE-2 překonává svůj předchozí model SWE-1.7 a Grok 4.6 jak ve skóre, tak v ceně, odpovídá GPT-5.6 Sol a Fable 5/5.1 za zlomek jejich ceny a je v rozmezí několika bodů za čtvrtinu GPT-6.

Po proškolení od Kimi K3 v multibilionovém měřítku

SWE-2 není postaven od nuly. Cognition dotrénoval model z Kimi K3, základní model s 2,8 biliony parametrů od Moonshot AI, který již prošel rozsáhlým učením se posílením pro agentní kódování. Kromě tohoto základu Cognition říká, že jeho proces RL přidal pět až šest bodů v mnoha benchmarkech a posunul celou hranici nákladů a výkonu K3.

Společnost říká, že SWE-2 je poprvé, kdy škálovala učení posilování na režim mnoha bilionů parametrů, přičemž staví na školicí infrastruktuře a receptu vyvinutém pro SWE-1.7. Klíčovým doplňkem je RL algoritmus, který trénuje všechny úrovně uvažování-úsilí v jediném běhu, spíše než zachází s nízkou, střední a vysokou námahou jako s oddělenými tréninkovými cíli.

Cenové sankce utvářejí celou hranici

Ústřední myšlenkou tréninku SWE-2 je lineární penalizace nákladů aplikovaná na úroveň úsilí v rámci jednoho běhu RL, přičemž každá penalizace je vyladěna podle místního sklonu Paretovy hranice základního modelu. Cognition říká, že tento přístup, odvozený z prvních principů, posouvá celou hranici nákladů a výkonu modelu, přičemž zachovává jeho tvar a odráží skutečné uživatelské náklady co nejpříměji při školení.

Společnost také podrobně popsala délkově váženou základní linii odměn, kterou používá od SWE-1.6, a kterou připisuje významné stabilizaci školení, spolu s vylepšeními poskytování RL zavádění, které zahrnuje online návrh modelu pro zvýšení propustnosti dekódování. Díky jádrům NVFP4 a FP8 a trénování s ohledem na kvantizaci společnost Cognition říká, že snížila celkové využití paměti navzdory tomu, že základní model má téměř trojnásobek parametrů než jeho předchůdce.

Tréninkový datový kanál se také rozšířil: Cognition ztrojnásobil počet RL prostředí, přidal překryvy podle instrukcí a postavil setrvačník poháněný předchozími kontrolními body SWE-2, který iterativně posiluje verifikátory používané k hodnocení modelu.

Efektivita stejně jako inteligence

Poznání rámuje zisky SWE-2 jako úzce spojené s efektivitou. Silnější inženýrský úsudek, říká společnost, umožňuje agentovi psát úplnější řešení s menším počtem oklik a nadbytečných čtení. Na FrontierCode 1.1 Main má středně náročná konfigurace SWE-2 vyšší skóre než SWE-1.7, přičemž zabírá o 58 % méně otáček a stojí o 81 % méně.

Toto zarámování je pro Cognition důležité. Devin je prodáván jako autonomní softwarový inženýr a odvozené náklady jsou přímým vstupem do cen a marží. Model, který si zachovává kvalitu sousedící s hranicemi a zároveň omezuje otáčky a žetony na úkol, mění ekonomiku každé devinské relace, kterou společnost obsluhuje.

Dostupnost

SWE-2 je k dispozici počínaje dneškem v Devin Desktop a Devin CLI, přičemž podle společnosti probíhá zavádění na Devin Web a Fusion. Cognition říká, že uživatelé by měli vidět, že se model objeví na různých površích v nadcházejících dnech.

Co to znamená pro trh kódovacích modelů

Vydání utahuje již tak přeplněný balík za GPT-6 Astra. Společnost Cognition nyní vlastní model, který vyměňuje rány s nabídkami od Anthropic, OpenAI a xAI za výrazně nižší cenu, a řídí celý balík od modelu k produktu agenta. Soupeři budou čelit tlaku, aby reagovali jak na cenu, tak na schopnosti, zejména u velkoobjemových a středně obtížných úkolů, kde je nákladový profil SWE-2 nejsilnější.

Pro kupující nástrojů pro kódování AI je praktickým poznatkem, že pomoc s hraničním kódováním již nevyžaduje stanovení cen na hraniční úrovni. Pro zbytek odvětví je SWE-2 důkazem toho, že rozhodující konkurenční pákou se staly post-školení a efektivita infrastruktury, nejen měřítko základního modelu.

---

Stay Ahead of AI

Získejte nejnovější zprávy, analýzy a průlomové informace o umělé inteligenci – vše na jednom místě.

Přečtěte si další zprávy o AI →