Cognition, компанія, що стоїть за розробником програмного забезпечення Devin AI, запустила SWE-2 у четвер, описавши її як свою найдосконалішу модель кодування. У дописі в блозі, опублікованому 10 вересня, компанія заявила, що нова модель розширює те, що вона називає кордоном Парето щодо можливостей і вартості, набравши 50,0% у тесті FrontierCode 1.1 Main, в той час як коштує на 64% менше, ніж Fable 5.1, модель Anthropic, яка випереджає її лише на один пункт із 50,9%.
Запуск відбувся лише через день після того, як Cognition підтвердила раунд фінансування в розмірі 2 мільярдів доларів США при оцінці в 48 мільярдів доларів, і це сигналізує про те, наскільки агресивно стартап із агентного програмування інвестує у розробку власної моделі, а не покладається виключно на передові моделі сторонніх розробників. Для безперервного висвітлення перегонів кодування штучного інтелекту та всього іншого, що рухає галузь, додайте в закладки AI Buzz Wire, ваше щоденне джерело свіжих новин штучного інтелекту.
Де SWE-2 приземляється на тестах
Згідно з опублікованими результатами Cognition, SWE-2 показує 50,0% на FrontierCode 1.1 Main, випереджаючи Grok 4.6 з 48,0% і GPT-5.6 Sol з 47,5%, і наближається до GPT-6 Astra, який лідирує в області з 53,3%. За тестом DeepSWE 1.1 SWE-2 досягає 73,0%, поступаючись лише Astra 74,1% у списках Cognition моделей.
Найсильніший результат демонструє Terminal-Bench 2.1, де SWE-2 набирає 92,8%, що є найвищим показником у порівняльній таблиці Cognition і випереджає Fable 5.1 з 91,4% і GPT-6 Astra з 89,9%. Картина змінюється на складнішому Terminal-Bench 4, де SWE-2 справляється з 27,3% проти 57,9% для GPT-6 Astra і 55,8% для Fable 5.1, нагадуючи, що дизайн моделі, який орієнтований на ефективність, залишає запас на самому верхньому рівні складності завдань.
Cognition чітко підсумовує позиціонування: на FrontierCode 1.1 Main і DeepSWE 1.1 SWE-2 перевершує свою попередню модель SWE-1.7 і Grok 4.6 як за результатами, так і за вартістю, збігається з GPT-5.6 Sol і Fable 5/5.1 за невелику частку їхньої ціни та на кілька пунктів поступається GPT-6 Astra за чверть вартості.
Після навчання від Kimi K3 у багатотрильйонному масштабі
SWE-2 не будується з нуля. Cognition пройшов постнавчання моделі з Kimi K3, базової моделі з 2,8 трильйонами параметрів від Moonshot AI, яка вже пройшла значне навчання підкріплення для агентного кодування. На додаток до цієї основи, Cognition каже, що її процес RL додав п’ять-шість балів за багатьма тестами та змістив усі межі ефективності K3.
Компанія каже, що SWE-2 — це перший випадок, коли вона масштабує навчання з підкріпленням до режиму з кількома трильйонами параметрів, спираючись на навчальну інфраструктуру та рецепт, розроблений для SWE-1.7. Ключовим доповненням є алгоритм RL, який тренує всі рівні міркування-зусиль за один прогін, а не розглядає низькі, середні та високі зусилля як окремі цілі навчання.
Штрафи за витрати формують весь кордон
Головною ідеєю в навчанні SWE-2 є лінійне покарання за вартість, що застосовується до рівня зусиль протягом одного прогону RL, з кожним покаранням, налаштованим на локальний нахил межі Парето базової моделі. Cognition стверджує, що цей підхід, заснований на початкових принципах, просуває всю модель між ціною та ефективністю, зберігаючи її форму та максимально безпосередньо відображаючи реальні витрати користувачів у навчанні.
Компанія також детально описала базовий рівень винагороди, зважений за довжиною, який вона використовувала, починаючи з SWE-1.6, якому вона приписує значну стабілізацію навчання, а також удосконалення обслуговування розгортання RL, що включає онлайн-чорнову модель для підвищення пропускної здатності декодування. Завдяки ядрам NVFP4 і FP8 і навчанню з урахуванням квантування Cognition каже, що це зменшило загальне використання пам’яті, незважаючи на те, що параметри базової моделі майже втричі перевищували параметри її попередника.
Також було розширено конвеєр навчальних даних: Cognition потроїло кількість середовищ RL, додало накладення з інструкціями та створило маховик на основі попередніх контрольних точок SWE-2, який ітеративно посилює верифікатори, що використовуються для оцінки моделі.
Ефективність так само, як і інтелект
Когнітивність визначає переваги SWE-2 як тісно пов’язані з ефективністю. За словами компанії, більш сильні інженерні рішення дозволяють агенту писати повніші рішення з меншою кількістю обхідних шляхів і зайвих читань. На FrontierCode 1.1 Main конфігурація SWE-2 із середнім зусиллям має вищу оцінку, ніж SWE-1.7, але виконує на 58% менше ходів і коштує на 81% менше.
Цей фреймінг має значення для бізнесу Cognition. Девін продається як автономний розробник програмного забезпечення, а вартість висновків є прямим внеском у ціноутворення та маржу. Модель, яка підтримує передову якість, скорочуючи черги та жетони за завдання, змінює економіку кожного сеансу Devin, який обслуговує компанія.
Наявність
SWE-2 доступний сьогодні в Devin Desktop і Devin CLI, а розгортання на Devin Web і Fusion триває, за даними компанії. Cognition каже, що протягом найближчих днів користувачі повинні побачити модель на різних поверхнях.
Що це означає для ринку моделей кодування
Реліз підтягує і без того переповнену колоду за GPT-6 Astra. Cognition тепер володіє моделлю, яка обмінюється ударами з пропозиціями від Anthropic, OpenAI та xAI за помітно нижчою ціною, і контролює весь пакет від моделі до продукту агента. Конкуренти будуть змушені відповідати як на ціну, так і на можливості, особливо для великих обсягів завдань середньої складності, де вартість SWE-2 є найсильнішою.
Для покупців інструментів кодування штучного інтелекту практичний висновок полягає в тому, що допомога з кодування на граничному рівні більше не потребує ціноутворення на граничному рівні. Для решти індустрії SWE-2 є доказом того, що післянавчання та ефективність інфраструктури, а не лише масштаб базової моделі, стали вирішальним конкурентним важелем.
---
Будьте попереду ШІОтримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.
Читати більше новин AI →