Cognition, la società dietro l'ingegnere del software Devin AI, ha lanciato giovedì SWE-2, descrivendolo come il suo modello di codifica più avanzato finora. In un post sul blog pubblicato il 10 settembre, la società ha affermato che il nuovo modello spinge quella che chiama la frontiera paretiana di capacità e costo, ottenendo un punteggio del 50,0% sul benchmark FrontierCode 1.1 Main e costando il 64% in meno rispetto a Fable 5.1, il modello Anthropic che si trova solo un punto avanti a lui con il 50,9%.

Il lancio avviene appena un giorno dopo che Cognition ha confermato un round di finanziamento da 2 miliardi di dollari con una valutazione di 48 miliardi di dollari, e segnala con quanta aggressività la startup di codifica ad agenti sta investendo nello sviluppo del proprio modello piuttosto che affidarsi esclusivamente a modelli di frontiera di terze parti. Per una copertura continua della corsa alla codifica dell'IA e di tutto ciò che muove il settore, aggiungi AI Buzz Wire, la tua fonte quotidiana di ultime notizie sull'IA.

Dove SWE-2 raggiunge i benchmark

Secondo i risultati pubblicati da Cognition, SWE-2 registra il 50,0% su FrontierCode 1.1 Main, davanti a Grok 4.6 al 48,0% e GPT-5.6 Sol al 47,5%, e a breve distanza da GPT-6 Astra, che guida la classifica con il 53,3%. Nel benchmark DeepSWE 1.1, SWE-2 raggiunge il 73,0%, secondo solo al 74,1% di Astra tra i modelli Cognition.

Il risultato più forte arriva su Terminal-Bench 2.1, dove SWE-2 ottiene il 92,8%, la cifra più alta nella tabella comparativa di Cognition e davanti a Fable 5.1 al 91,4% e GPT-6 Astra all'89,9%. Il quadro cambia sul più difficile Terminal-Bench 4, dove SWE-2 arriva al 27,3% contro il 57,9% di GPT-6 Astra e il 55,8% di Fable 5.1, a ricordare che il design incentrato sull'efficienza del modello lascia margine ai livelli più alti di difficoltà del compito.

Cognition riassume senza mezzi termini il posizionamento: su FrontierCode 1.1 Main e DeepSWE 1.1, SWE-2 batte il suo modello precedente SWE-1.7 e Grok 4.6 sia in termini di punteggio che di costo, corrisponde a GPT-5.6 Sol e Fable 5/5.1 a una frazione del loro prezzo e arriva a pochi punti da GPT-6 Astra a un quarto del costo.

Post-addestrato da Kimi K3 su scala multi-trilione

SWE-2 non è stato creato da zero. Cognition ha post-addestrato il modello di Kimi K3, un modello base da 2,8 trilioni di parametri di Moonshot AI che era già stato sottoposto a un ampio apprendimento di rinforzo per la codifica degli agenti. Oltre a queste fondamenta, Cognition afferma che il suo processo RL ha aggiunto da cinque a sei punti su molti benchmark e ha spostato l'intera frontiera costi-prestazioni di K3.

L’azienda afferma che SWE-2 è la prima volta che adatta l’apprendimento per rinforzo al regime di molti trilioni di parametri, basandosi sull’infrastruttura di formazione e sulla ricetta sviluppata per SWE-1.7. L’aggiunta chiave è un algoritmo RL che allena tutti i livelli di sforzo di ragionamento in un’unica esecuzione, invece di trattare lo sforzo basso, medio e alto come obiettivi di allenamento separati.

Le penalità sui costi plasmano l'intera frontiera

Un'idea centrale nell'addestramento di SWE-2 è una penalità di costo lineare applicata per livello di sforzo all'interno di una singola corsa RL, con ciascuna penalità calibrata sulla pendenza locale della frontiera di Pareto del modello base. Cognition afferma che questo approccio, derivato dai principi primi, fa avanzare l'intera frontiera costi-prestazioni del modello preservandone la forma e riflettendo i costi reali degli utenti nel modo più diretto possibile nella formazione.

L'azienda ha inoltre dettagliato una linea di base di ricompensa ponderata in base alla lunghezza che ha utilizzato a partire da SWE-1.6, a cui attribuisce una formazione significativamente stabilizzante, insieme a miglioramenti al servizio di implementazione RL che include un modello di bozza online per aumentare il throughput di decodifica. Con i kernel NVFP4 e FP8 e l'addestramento basato sulla quantizzazione, Cognition afferma di aver ridotto l'utilizzo complessivo della memoria nonostante il modello base avesse quasi tre volte i parametri del suo predecessore.

Anche la pipeline dei dati di addestramento si è ampliata: Cognition ha triplicato il numero di ambienti RL, ha aggiunto sovrapposizioni che seguono le istruzioni e ha costruito un volano alimentato dai precedenti checkpoint SWE-2 che rafforza in modo iterativo i verificatori utilizzati per valutare il modello.

Efficienza tanto quanto intelligenza

La cognizione inquadra i guadagni di SWE-2 come strettamente legati all'efficienza. Un giudizio ingegneristico più forte, afferma l'azienda, consente all'agente di scrivere soluzioni più complete con meno deviazioni e letture ridondanti. Su FrontierCode 1.1 Main, la configurazione a sforzo medio di SWE-2 ottiene un punteggio superiore a SWE-1.7, richiedendo il 58% di giri in meno e costando l'81% in meno.

Tale inquadramento è importante per l'attività di Cognition. Devin viene venduto come ingegnere informatico autonomo e il costo di inferenza è un input diretto per i prezzi e i margini. Un modello che mantiene una qualità adiacente alla frontiera riducendo allo stesso tempo turni e gettoni per attività cambia l'economia di ogni sessione Devin offerta dall'azienda.

Disponibilità

SWE-2 è disponibile a partire da oggi in Devin Desktop e Devin CLI, con un lancio su Devin Web e Fusion in corso, secondo l'azienda. Cognition afferma che gli utenti dovrebbero vedere il modello apparire sulle superfici nei prossimi giorni.

Cosa significa per il mercato dei modelli di codifica

Il comunicato stringe un gruppo già affollato dietro GPT-6 Astra. Cognition ora possiede un modello che scambia colpi con le offerte di Anthropic, OpenAI e xAI a costi nettamente inferiori e controlla l’intero stack, dal modello al prodotto agente. I rivali dovranno affrontare la pressione di rispondere tanto sul prezzo quanto sulla capacità, in particolare per i compiti ad alto volume e di media difficoltà dove il profilo di costo di SWE-2 è più forte.

Per gli acquirenti di strumenti di codifica AI, il punto pratico è che l’aiuto alla codifica a livello di frontiera non richiede più prezzi a livello di frontiera. Per il resto del settore, SWE-2 è la prova che l’efficienza post-formazione e delle infrastrutture, non solo la scala del modello base, sono diventate una leva competitiva decisiva.

---

Stai al passo con l'intelligenza artificiale

Ricevi le ultime notizie, analisi e scoperte sull'intelligenza artificiale, tutto in un unico posto.

Leggi altre notizie sull'AI →