Cognition, compania din spatele inginerului software Devin AI, a lansat joi SWE-2, descriindu-l ca fiind cel mai avansat model de codare de până acum. Într-o postare pe blog publicată pe 10 septembrie, compania a spus că noul model împinge ceea ce numește frontiera Pareto a capacității și costurilor, obținând un punctaj de 50,0% la benchmark-ul principal FrontierCode 1.1, în timp ce costă cu 64% mai puțin decât Fable 5.1, modelul antropic care se află cu doar un punct înaintea acestuia, la 50,9%.
Lansarea aterizează la abia o zi după ce Cognition a confirmat o rundă de finanțare de 2 miliarde de dolari la o evaluare de 48 de miliarde de dolari și semnalează cât de agresiv investește startup-ul de codare agentică în dezvoltarea propriului model, în loc să se bazeze doar pe modele de frontieră terță parte. Pentru o acoperire continuă a cursei de codare AI și a tot ceea ce mișcă industria, marcați AI Buzz Wire, sursa dvs. zilnică pentru știri de ultimă oră AI.
Unde SWE-2 aterizează pe punctele de referință
Conform rezultatelor publicate de Cognition, SWE-2 afișează 50,0% pe FrontierCode 1.1 Main, înaintea Grok 4.6 la 48,0% și GPT-5.6 Sol la 47,5% și la distanță de GPT-6 Astra, care conduce pe teren cu 53,3%. Pe benchmark-ul DeepSWE 1.1, SWE-2 ajunge la 73,0%, pe locul doi după 74,1% a Astrei în topul modelelor Cognition.
Cea mai puternică apariție vine pe Terminal-Bench 2.1, unde SWE-2 are 92,8%, cea mai mare cifră din tabelul de comparație al Cognition și înaintea Fable 5.1 cu 91,4% și GPT-6 Astra cu 89,9%. Imaginea se schimbă pe Terminal-Bench 4, mai greu, unde SWE-2 reușește cu 27,3% față de 57,9% pentru GPT-6 Astra și 55,8% pentru Fable 5.1, un reamintire că designul modelului care pune în primul rând eficiența lasă spațiu liber la extremitatea superioară a greutății sarcinii.
Cognition rezumă clar poziționarea: pe FrontierCode 1.1 Main și DeepSWE 1.1, SWE-2 depășește modelul său anterior SWE-1.7 și Grok 4.6 atât la scor și cost, se potrivește cu GPT-5.6 Sol și Fable 5/5/5.1 la o fracțiune din prețul lor și vine la câteva puncte din costul GPT-6.
Post-antrenament de la Kimi K3 la scară de mai multe trilioane
SWE-2 nu este construit de la zero. Cognition a post-antrenat modelul de la Kimi K3, un model de bază de 2,8 trilioane de parametri de la Moonshot AI care a suferit deja o învățare extinsă de consolidare pentru codificarea agentică. Pe lângă această bază, Cognition spune că procesul său RL a adăugat cinci până la șase puncte la multe puncte de referință și a schimbat întreaga frontieră cost-performanță a K3.
Compania spune că SWE-2 este prima dată când a scalat învățarea prin consolidare la regimul cu parametri multi-trilioane, bazându-se pe infrastructura de antrenament și rețeta dezvoltată pentru SWE-1.7. Adăugarea cheie este un algoritm RL care antrenează toate nivelurile de raționament-efort într-o singură cursă, mai degrabă decât să trateze efortul scăzut, mediu și mare ca ținte separate de antrenament.
Penalitățile costurilor modelează întreaga frontieră
O idee centrală în antrenamentul SWE-2 este o penalizare de cost liniară aplicată pe nivel de efort într-o singură cursă RL, fiecare penalizare ajustată la panta locală a frontierei Pareto a modelului de bază. Cognition spune că această abordare, derivată din primele principii, avansează întreaga frontieră cost-performanță a modelului, păstrând în același timp forma și reflectând costurile reale ale utilizatorului cât mai direct posibil în formare.
Compania a detaliat, de asemenea, o linie de bază a recompensei ponderate pe lungime pe care a folosit-o de la SWE-1.6, pe care o creditează pentru stabilizarea semnificativă a pregătirii, alături de îmbunătățiri aduse difuzării RL, care includ un model de schiță online pentru a crește randamentul de decodare. Cu nucleele NVFP4 și FP8 și formarea cuantificare, Cognition spune că a redus utilizarea totală a memoriei, în ciuda faptului că modelul de bază are aproape trei ori mai mult decât parametrii predecesorului său.
Conducta de date de antrenament s-a extins de asemenea: Cognition a triplat numărul de medii RL, a adăugat suprapuneri de urmărire a instrucțiunilor și a construit un volant alimentat de punctele de control SWE-2 anterioare care întărește în mod iterativ verificatorii utilizați pentru a nota modelul.
Eficiență la fel de mult ca și inteligență
Cogniția încadrează câștigurile SWE-2 ca fiind strâns legate de eficiență. Raționamentul ingineresc mai puternic, spune compania, permite agentului să scrie soluții mai complete, cu mai puține ocoliri și citiri redundante. Pe FrontierCode 1.1 Main, configurația cu efort mediu a SWE-2 are scoruri mai mari decât SWE-1.7, în timp ce ia cu 58% mai puține ture și costă cu 81% mai puțin.
Această încadrare contează pentru afacerea Cognition. Devin este vândut ca inginer software autonom, iar costul de inferență este o intrare directă în stabilirea prețurilor și a marjelor. Un model care păstrează o calitate adiacentă frontierei în timp ce reduce viraje și jetoane pe sarcină schimbă economia fiecărei sesiuni Devin pe care compania o deservește.
Disponibilitate
SWE-2 este disponibil începând de astăzi în Devin Desktop și Devin CLI, cu o lansare pe Devin Web și Fusion în curs, potrivit companiei. Cognition spune că utilizatorii ar trebui să vadă modelul apărând pe suprafețe în zilele următoare.
Ce înseamnă pentru piața modelelor de codare
Lansarea strânge un pachet deja aglomerat în spatele GPT-6 Astra. Cognition deține acum un model care schimbă lovituri cu oferte de la Anthropic, OpenAI și xAI la un cost semnificativ mai mic și controlează întregul pachet de la model la produs agent. Rivalii se vor confrunta cu presiuni să răspundă atât în ceea ce privește prețul, cât și capacitatea, în special pentru sarcinile de volum mare, cu dificultate medie, unde profilul de cost al SWE-2 este cel mai puternic.
Pentru cumpărătorii de instrumente de codare AI, concluzia practică este că ajutorul pentru codificare la nivel de frontieră nu mai necesită prețuri la nivel de frontieră. Pentru restul industriei, SWE-2 este dovada că eficiența post-formare și a infrastructurii, nu doar scara modelului de bază, au devenit o pârghie competitivă decisivă.
---
Rămâneți înaintea AIObțineți cele mai recente știri, analize și descoperiri AI - toate într-un singur loc.
Citește mai multe știri AI →