Cognition, firma stojąca za inżynierem oprogramowania Devin AI, wypuściła w czwartek SWE-2, opisując go jako najbardziej zaawansowany model kodowania w historii. W poście na blogu opublikowanym 10 września firma stwierdziła, że nowy model przesuwa granicę Pareto pod względem możliwości i kosztów, uzyskując 50,0% w głównym benchmarku FrontierCode 1.1, a jednocześnie kosztując o 64% mniej niż Fable 5.1, model Anthropic, który wyprzedza go o zaledwie jeden punkt z wynikiem 50,9%.
Premiera następuje zaledwie dzień po tym, jak Cognition potwierdziło rundę finansowania w wysokości 2 miliardów dolarów przy wycenie na 48 miliardów dolarów, co sygnalizuje, jak agresywnie startup zajmujący się kodowaniem agentycznym inwestuje w rozwój własnego modelu, zamiast polegać wyłącznie na granicznych modelach stron trzecich. Aby stale relacjonować wyścig w kodowaniu AI i wszystko inne, co napędza branżę, dodaj zakładkę AI Buzz Wire, Twoje codzienne źródło najświeższych wiadomości o sztucznej inteligencji.
Gdzie SWE-2 ląduje w benchmarkach
Według opublikowanych wyników Cognition, SWE-2 osiąga 50,0% w FrontierCode 1.1 Main, wyprzedzając Grok 4.6 z 48,0% i GPT-5.6 Sol z 47,5% i znajdując się w odległości uderzenia od GPT-6 Astra, która prowadzi w grupie z 53,3%. W teście DeepSWE 1.1 SWE-2 osiąga 73,0%, ustępując jedynie Astrze 74,1% wśród modeli znajdujących się na listach Cognition.
Najlepszy wynik odnotowano w Terminal-Bench 2.1, gdzie SWE-2 uzyskał 92,8%, co stanowi najwyższy wynik w tabeli porównawczej Cognition i wyprzedził Fable 5.1 z wynikiem 91,4% i GPT-6 Astra z wynikiem 89,9%. Obraz zmienia się na trudniejszym Terminal-Bench 4, gdzie SWE-2 radzi sobie z 27,3% w porównaniu z 57,9% w przypadku GPT-6 Astra i 55,8% w przypadku Fable 5.1, co przypomina, że konstrukcja modelu nastawiona przede wszystkim na wydajność pozostawia rezerwę na samym najwyższym poziomie trudności zadania.
Cognition podsumowuje tę pozycję bez ogródek: na FrontierCode 1.1 Main i DeepSWE 1.1 SWE-2 pokonuje swoje poprzednie modele SWE-1.7 i Grok 4.6 zarówno pod względem wyniku, jak i kosztu, dorównuje GPT-5.6 Sol i Fable 5/5.1 za ułamek ich ceny i jest o kilka punktów gorszy od GPT-6 Astra za jedną czwartą ceny.
Trening po Kimi K3 w skali wielu bilionów
SWE-2 nie jest budowany od zera. Firma Cognition przeszkoliła model z Kimi K3, modelu podstawowego o 2,8 biliona parametrów opracowanego przez Moonshot AI, który przeszedł już szeroko zakrojone uczenie się wzmacniające na potrzeby kodowania agentycznego. Oprócz tego Cognition twierdzi, że jego proces RL dodał od pięciu do sześciu punktów w wielu testach porównawczych i przesunął całą granicę kosztu i wydajności K3.
Firma twierdzi, że w SWE-2 po raz pierwszy skalowano uczenie się przez wzmacnianie do systemu obejmującego wiele bilionów parametrów, opierając się na infrastrukturze szkoleniowej i przepisie opracowanym dla SWE-1.7. Kluczowym dodatkiem jest algorytm RL, który ćwiczy wszystkie poziomy wysiłku związanego z rozumowaniem w jednym przebiegu, zamiast traktować niski, średni i wysoki wysiłek jako osobne cele treningowe.
Kary kosztowe kształtują całą granicę
Główną ideą szkolenia SWE-2 jest liniowa kara kosztowa stosowana na poziom wysiłku w pojedynczym biegu RL, przy czym każda kara jest dostosowana do lokalnego nachylenia granicy Pareto modelu podstawowego. Cognition twierdzi, że to podejście, wywodzące się z podstawowych zasad, przesuwa całą granicę kosztów i wydajności modelu, zachowując jednocześnie jego kształt i możliwie bezpośrednio odzwierciedlając rzeczywiste koszty użytkownika podczas szkolenia.
Firma szczegółowo opisała również bazowy poziom wynagrodzeń ważony długością, stosowany od wersji SWE 1.6, któremu przypisuje znacząco stabilizujące szkolenie, a także ulepszenia obsługi wdrażania RL, które obejmują wersję roboczą modelu online w celu zwiększenia przepustowości dekodowania. Dzięki jądrom NVFP4 i FP8 oraz szkoleniu uwzględniającemu kwantyzację firma Cognition twierdzi, że zmniejszyła ogólne zużycie pamięci, mimo że model podstawowy ma prawie trzykrotnie większe parametry niż jego poprzednik.
Potok danych szkoleniowych również się rozwinął: firma Cognition potroiła liczbę środowisk RL, dodała nakładki wykonujące instrukcje i zbudowała koło zamachowe oparte na poprzednich punktach kontrolnych SWE-2, które iteracyjnie wzmacnia weryfikatory używane do oceny modelu.
Wydajność na równi z inteligencją
Proces poznawczy postrzega korzyści SWE-2 jako ściśle powiązane z wydajnością. Firma twierdzi, że lepsza ocena inżynieryjna pozwala agentowi pisać bardziej kompletne rozwiązania przy mniejszej liczbie objazdów i zbędnych odczytów. W FrontierCode 1.1 Main konfiguracja SWE-2 o średnim wysiłku osiąga lepsze wyniki niż SWE-1.7, wykonując o 58% mniej zakrętów i kosztując 81% mniej.
To ramy mają znaczenie dla działalności Cognition. Devin jest sprzedawany jako niezależny inżynier oprogramowania, a wnioskowane koszty stanowią bezpośredni wkład w ceny i marże. Model, który utrzymuje jakość graniczną, jednocześnie wycinając tury i tokeny na zadanie, zmienia ekonomikę każdej sesji Devin obsługiwanej przez firmę.
Dostępność
Według firmy SWE-2 jest już dostępne w Devin Desktop i Devin CLI, a jego wdrażanie w Devin Web i Fusion jest w toku. Cognition twierdzi, że w nadchodzących dniach użytkownicy powinni zobaczyć model na różnych powierzchniach.
Co to oznacza dla rynku modeli kodowania
Wydanie zacieśnia i tak już zatłoczoną grupę stojącą za GPT-6 Astra. Cognition posiada teraz model, który łączy oferty Anthropic, OpenAI i xAI po znacznie niższych kosztach i kontroluje pełny stos od modelu do produktu agenta. Rywale staną przed presją, aby w równym stopniu kierować się ceną, jak i możliwościami, szczególnie w przypadku zadań wymagających dużej objętości i średniej trudności, w przypadku których profil kosztów SWE-2 jest najsilniejszy.
Dla nabywców narzędzi do kodowania AI praktycznym wnioskiem jest to, że pomoc w kodowaniu na poziomie pionierskim nie wymaga już ustalania cen na poziomie pionierskim. Dla reszty branży SWE-2 jest dowodem na to, że wydajność poszkoleniowa i infrastruktura, a nie tylko skala modelu podstawowego, stały się decydującą dźwignią konkurencyjności.
---
Wyprzedź sztuczną inteligencjęOtrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.
Przeczytaj więcej aktualności o sztucznej inteligencji →