Cognition, a empresa por trás do engenheiro de software Devin AI, lançou o SWE-2 na quinta-feira, descrevendo-o como seu modelo de codificação mais avançado até agora. Em uma postagem no blog publicada em 10 de setembro, a empresa disse que o novo modelo ultrapassa o que chama de fronteira de capacidade e custo de Pareto, marcando 50,0% no benchmark FrontierCode 1.1 Main, enquanto custa 64% menos que o Fable 5.1, o modelo Antrópico que está apenas um ponto à frente dele, com 50,9%.

O lançamento chega apenas um dia depois que a Cognition confirmou uma rodada de financiamento de US$ 2 bilhões com uma avaliação de US$ 48 bilhões, e sinaliza o quão agressivamente a startup de codificação de agentes está investindo no desenvolvimento de seu próprio modelo, em vez de depender apenas de modelos de fronteira de terceiros. Para cobertura contínua da corrida de codificação de IA e de tudo o mais que move a indústria, marque AI Buzz Wire, sua fonte diária de notícias de última hora sobre IA.

Onde o SWE-2 chega aos benchmarks

De acordo com os resultados publicados pela Cognition, o SWE-2 registra 50,0% no FrontierCode 1.1 Main, à frente do Grok 4.6 com 48,0% e do GPT-5.6 Sol com 47,5%, e a uma curta distância do GPT-6 Astra, que lidera o campo com 53,3%. No benchmark DeepSWE 1.1, o SWE-2 atinge 73,0%, perdendo apenas para os 74,1% do Astra entre os modelos da lista Cognition.

A exibição mais forte vem no Terminal-Bench 2.1, onde SWE-2 pontua 92,8%, o valor mais alto na tabela de comparação do Cognition e à frente do Fable 5.1 com 91,4% e do GPT-6 Astra com 89,9%. A imagem muda no Terminal-Bench 4 mais difícil, onde SWE-2 consegue 27,3% contra 57,9% para GPT-6 Astra e 55,8% para Fable 5.1, um lembrete de que o design de eficiência do modelo deixa margem de manobra no topo da dificuldade da tarefa.

A cognição resume o posicionamento sem rodeios: no FrontierCode 1.1 Main e DeepSWE 1.1, o SWE-2 supera seu modelo anterior SWE-1.7 e Grok 4.6 em pontuação e custo, iguala GPT-5.6 Sol e Fable 5/5.1 por uma fração de seu preço, e chega a alguns pontos do GPT-6 Astra por um quarto do custo.

Pós-treinado com Kimi K3 em escala multitrilhão

O SWE-2 não foi construído do zero. A Cognition pós-treinou o modelo do Kimi K3, um modelo básico de 2,8 trilhões de parâmetros da Moonshot AI que já havia passado por extenso aprendizado de reforço para codificação de agente. Além dessa base, a Cognition afirma que seu processo de RL adicionou de cinco a seis pontos em muitos benchmarks e mudou toda a fronteira de custo-desempenho do K3.

A empresa afirma que o SWE-2 é a primeira vez que escala o aprendizado por reforço para o regime de vários trilhões de parâmetros, com base na infraestrutura de treinamento e na receita desenvolvida para o SWE-1.7. A principal adição é um algoritmo RL que treina todos os níveis de esforço de raciocínio em uma única execução, em vez de tratar o esforço baixo, médio e alto como alvos de treinamento separados.

Penalidades de custo moldam toda a fronteira

Uma ideia central no treinamento do SWE-2 é uma penalidade de custo linear aplicada por nível de esforço dentro de uma única execução de RL, com cada penalidade ajustada à inclinação local da fronteira de Pareto do modelo base. A Cognition afirma que esta abordagem, derivada dos primeiros princípios, avança toda a fronteira custo-desempenho do modelo, preservando ao mesmo tempo a sua forma e reflectindo os custos reais do utilizador tão directamente quanto possível na formação.

A empresa também detalhou uma linha de base de recompensa ponderada por comprimento que tem usado desde SWE-1.6, que credita por estabilizar significativamente o treinamento, juntamente com melhorias no serviço de implementação de RL que incluem um modelo de rascunho online para aumentar o rendimento de decodificação. Com kernels NVFP4 e FP8 e treinamento com reconhecimento de quantização, a Cognition diz que reduziu o uso geral de memória, apesar do modelo básico ter quase três vezes os parâmetros de seu antecessor.

O pipeline de dados de treinamento também se expandiu: a Cognition triplicou o número de ambientes RL, adicionou sobreposições de seguimento de instruções e construiu um volante alimentado por pontos de verificação SWE-2 anteriores que fortalece iterativamente os verificadores usados ​​para pontuar o modelo.

Eficiência tanto quanto inteligência

A cognição enquadra os ganhos do SWE-2 como intimamente ligados à eficiência. Um julgamento de engenharia mais forte, diz a empresa, permite que o agente escreva soluções mais completas com menos desvios e leituras redundantes. No FrontierCode 1.1 Main, a configuração de esforço médio do SWE-2 tem pontuação superior à do SWE-1.7, ao mesmo tempo que realiza 58% menos voltas e custa 81% menos.

Esse enquadramento é importante para os negócios da Cognition. Devin é vendido como engenheiro de software autônomo, e o custo de inferência é uma contribuição direta para preços e margens. Um modelo que mantém qualidade adjacente à fronteira enquanto reduz turnos e tokens por tarefa muda a economia de cada sessão Devin que a empresa atende.

Disponibilidade

SWE-2 está disponível a partir de hoje no Devin Desktop e Devin CLI, com lançamento no Devin Web e Fusion em andamento, de acordo com a empresa. A Cognition diz que os usuários deverão ver o modelo aparecer nas superfícies nos próximos dias.

O que isso significa para o mercado de modelos de codificação

O lançamento aperta um grupo já lotado atrás do GPT-6 Astra. A Cognition agora possui um modelo que negocia golpes com ofertas da Anthropic, OpenAI e xAI a um custo significativamente mais baixo e controla toda a pilha, do modelo ao produto do agente. Os rivais enfrentarão pressão para responder tanto no preço como na capacidade, especialmente para as tarefas de alto volume e dificuldade média, onde o perfil de custos do SWE-2 é mais forte.

Para os compradores de ferramentas de codificação de IA, a conclusão prática é que a ajuda de codificação em nível de fronteira não requer mais preços em nível de fronteira. Para o resto da indústria, o SWE-2 é uma prova de que a eficiência pós-formação e da infra-estrutura, e não apenas a escala do modelo básico, se tornaram uma alavanca competitiva decisiva.

---

Fique à frente da IA

Receba as últimas notícias, análises e avanços sobre IA — tudo em um só lugar.

Leia mais notícias sobre IA →