Cognition, компания, создавшая программное обеспечение Devin AI, в четверг запустила SWE-2, назвав ее самой продвинутой моделью кодирования. В сообщении в блоге, опубликованном 10 сентября, компания заявила, что новая модель расширяет то, что она называет границей Парето в возможностях и стоимости, набрав 50,0% в основном тесте FrontierCode 1.1 и стоя на 64% меньше, чем Fable 5.1, антропная модель, которая опережает ее всего на один пункт с показателем 50,9%.

Запуск состоялся всего через день после того, как Cognition подтвердила раунд финансирования в 2 миллиарда долларов при оценке в 48 миллиардов долларов, и это свидетельствует о том, насколько агрессивно стартап по агентному кодированию инвестирует в разработку собственной модели, а не полагается исключительно на сторонние передовые модели. Чтобы постоянно освещать гонку кодирования ИИ и все остальное, что двигает отрасль, добавьте в закладки AI Buzz Wire, ваш ежедневный источник последних новостей об ИИ.

Где SWE-2 достигает эталонов

Согласно опубликованным результатам Cognition, SWE-2 занимает 50,0% на FrontierCode 1.1 Main, опережая Grok 4.6 с 48,0% и GPT-5.6 Sol с 47,5% и в пределах досягаемости GPT-6 Astra, которая лидирует с 53,3%. В тесте DeepSWE 1.1 SWE-2 достигает 73,0%, уступая только Astra 74,1% среди моделей в списках Cognition.

Самый сильный результат наблюдается на Terminal-Bench 2.1, где SWE-2 набирает 92,8%, что является самым высоким показателем в сравнительной таблице Cognition и опережает Fable 5.1 с 91,4% и GPT-6 Astra с 89,9%. Картина меняется на более сложном Terminal-Bench 4, где SWE-2 набирает 27,3% против 57,9% у GPT-6 Astra и 55,8% у Fable 5.1, что является напоминанием о том, что конструкция модели, ориентированная на эффективность, оставляет запас на самом верхнем уровне сложности задач.

Cognition подводит итог позиционирования прямо: на FrontierCode 1.1 Main и DeepSWE 1.1 SWE-2 превосходит свою предыдущую модель SWE-1.7 и Grok 4.6 как по баллам, так и по стоимости, соответствует GPT-5.6 Sol и Fable 5/5.1 за небольшую часть их цены и находится в пределах нескольких баллов от GPT-6 Astra за четверть стоимости.

Пост-тренинг у Кими К3 в многотриллионном масштабе

SWE-2 создается не с нуля. Cognition постобучила модель Kimi K3, базовую модель с 2,8 триллионами параметров от Moonshot AI, которая уже прошла обширное обучение с подкреплением для агентного кодирования. Вдобавок к этому, Cognition заявляет, что ее процесс RL добавил пять-шесть баллов по многим тестам и сдвинул всю границу затрат и производительности K3.

Компания заявляет, что SWE-2 — это первый раз, когда она масштабировала обучение с подкреплением до режима с несколькими триллионами параметров, опираясь на инфраструктуру обучения и рецепт, разработанный для SWE-1.7. Ключевым дополнением является алгоритм RL, который тренирует все уровни рассуждений за один подход, вместо того, чтобы рассматривать низкие, средние и высокие усилия как отдельные цели обучения.

Штрафные санкции формируют всю границу

Центральной идеей обучения SWE-2 является линейный штраф за затраты, применяемый к каждому уровню усилий в рамках одного прогона RL, при этом каждый штраф настраивается на локальный наклон границы Парето базовой модели. Cognition утверждает, что этот подход, основанный на основных принципах, расширяет весь диапазон затрат и производительности модели, сохраняя при этом ее форму и максимально непосредственно отражая реальные затраты пользователей при обучении.

Компания также подробно описала базовый план вознаграждения с учетом длины, который она использовала начиная с SWE-1.6, что, по ее мнению, привело к значительной стабилизации обучения, а также к улучшениям в развертывании обслуживания RL, которые включают онлайн-проект модели для повышения пропускной способности декодирования. Cognition заявляет, что благодаря ядрам NVFP4 и FP8 и обучению с учетом квантования удалось сократить общее использование памяти, несмотря на то, что базовая модель имела параметры почти в три раза больше, чем у ее предшественницы.

Конвейер обучающих данных также расширился: компания Cognition утроила количество сред RL, добавила наложения, выполняющие инструкции, и создала маховик, работающий на основе предыдущих контрольных точек SWE-2, который итеративно ужесточает верификаторы, используемые для оценки модели.

Эффективность и интеллект

По мнению Cognitive, достижения SWE-2 тесно связаны с эффективностью. По словам компании, более строгие инженерные решения позволяют агенту писать более полные решения с меньшим количеством обходных путей и избыточных операций чтения. В FrontierCode 1.1 Main конфигурация SWE-2 средней сложности получила более высокие оценки, чем SWE-1.7, при этом она требует на 58 % меньше оборотов и стоит на 81 % меньше.

Такое оформление имеет значение для бизнеса Cognition. Девин продается как автономный инженер-программист, а стоимость вывода напрямую влияет на ценообразование и прибыль. Модель, обеспечивающая высочайшее качество при сокращении количества операций и жетонов за задачу, меняет экономику каждого сеанса Devin, который обслуживает компания.

Доступность

По данным компании, SWE-2 доступен с сегодняшнего дня в Devin Desktop и Devin CLI, а также в настоящее время развертывается в Devin Web и Fusion. Cognition утверждает, что пользователи должны увидеть, как модель появится на разных поверхностях в ближайшие дни.

Что это значит для рынка моделей кодирования

Релиз дополняет и без того переполненную группу GPT-6 Astra. Cognition теперь владеет моделью, которая конкурирует с предложениями Anthropic, OpenAI и xAI по значительно более низкой цене, и контролирует весь стек от модели до продукта-агента. Конкуренты столкнутся с необходимостью реагировать как на цену, так и на возможности, особенно при выполнении больших объемов задач средней сложности, где профиль затрат SWE-2 самый сильный.

Для покупателей инструментов ИИ-кодирования практический вывод заключается в том, что помощь в кодировании на передовом уровне больше не требует высоких цен. Для остальной части отрасли SWE-2 является свидетельством того, что эффективность обучения и инфраструктуры, а не только масштаб базовой модели, стала решающим конкурентным рычагом.

---

Будьте впереди ИИ

Получайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.

Подробнее новости AI →