Cognition, la société derrière l'ingénieur logiciel Devin AI, a lancé SWE-2 jeudi, le décrivant comme son modèle de codage le plus avancé à ce jour. Dans un article de blog publié le 10 septembre, la société a déclaré que le nouveau modèle repoussait ce qu'elle appelle la frontière de Pareto en matière de capacité et de coût, obtenant un score de 50,0 % sur le benchmark FrontierCode 1.1 Main tout en coûtant 64 % de moins que Fable 5.1, le modèle Anthropic qui ne le devance qu'un point à 50,9 %.
Le lancement arrive à peine un jour après que Cognition a confirmé un cycle de financement de 2 milliards de dollars pour une valorisation de 48 milliards de dollars, et cela montre à quel point la startup de codage agent investit de manière agressive dans son propre développement de modèles plutôt que de s'appuyer uniquement sur des modèles frontières tiers. Pour une couverture continue de la course au codage de l'IA et de tout ce qui fait bouger l'industrie, ajoutez AI Buzz Wire, votre source quotidienne d'actualités sur l'IA.
Où SWE-2 atterrit sur les benchmarks
Selon les résultats publiés par Cognition, SWE-2 affiche 50,0 % sur FrontierCode 1.1 Main, devant Grok 4.6 à 48,0 % et GPT-5.6 Sol à 47,5 %, et à portée de main de GPT-6 Astra, qui mène le peloton à 53,3 %. Sur le benchmark DeepSWE 1.1, SWE-2 atteint 73,0 %, juste derrière les 74,1 % d'Astra parmi les modèles répertoriés par Cognition.
La meilleure performance vient de Terminal-Bench 2.1, où SWE-2 obtient un score de 92,8 %, le chiffre le plus élevé du tableau comparatif de Cognition et devant Fable 5.1 à 91,4 % et GPT-6 Astra à 89,9 %. La situation change sur le plus dur Terminal-Bench 4, où SWE-2 gère 27,3 % contre 57,9 % pour GPT-6 Astra et 55,8 % pour Fable 5.1, rappelant que la conception axée sur l'efficacité du modèle laisse une marge tout en haut de la difficulté de la tâche.
Cognition résume le positionnement sans détour : sur FrontierCode 1.1 Main et DeepSWE 1.1, SWE-2 bat ses modèles précédents SWE-1.7 et Grok 4.6 en termes de score et de coût, correspond à GPT-5.6 Sol et Fable 5/5.1 à une fraction de leur prix, et se situe à quelques points de GPT-6 Astra à un quart du coût.
Post-formation de Kimi K3 à une échelle de plusieurs milliards
SWE-2 n’est pas construit à partir de zéro. Cognition a post-entraîné le modèle de Kimi K3, un modèle de base de 2,8 billions de paramètres de Moonshot AI qui avait déjà fait l'objet d'un apprentissage approfondi par renforcement pour le codage agent. En plus de cette base, Cognition affirme que son processus RL a ajouté cinq à six points sur de nombreux points de référence et a déplacé toute la frontière coût-performance de K3.
La société affirme que SWE-2 est la première fois qu'elle étend l'apprentissage par renforcement au régime de plusieurs milliards de paramètres, en s'appuyant sur l'infrastructure de formation et la recette développées pour SWE-1.7. L'ajout clé est un algorithme RL qui entraîne tous les niveaux d'effort de raisonnement en une seule fois, plutôt que de traiter les efforts faibles, moyens et élevés comme des objectifs d'entraînement distincts.
Les pénalités de coûts façonnent toute la frontière
Une idée centrale de la formation de SWE-2 est une pénalité de coût linéaire appliquée par niveau d'effort au sein d'une seule exécution RL, chaque pénalité étant adaptée à la pente locale de la frontière de Pareto du modèle de base. Cognition affirme que cette approche, dérivée des premiers principes, fait progresser toute la frontière coût-performance du modèle tout en préservant sa forme et en reflétant les coûts réels des utilisateurs aussi directement que possible dans la formation.
La société a également détaillé une base de récompense pondérée en fonction de la longueur qu'elle utilise depuis SWE-1.6, qu'elle attribue à une formation considérablement stabilisante, ainsi qu'à des améliorations du service de déploiement RL qui incluent un modèle de projet en ligne pour augmenter le débit de décodage. Avec les noyaux NVFP4 et FP8 et une formation prenant en compte la quantification, Cognition affirme avoir réduit l'utilisation globale de la mémoire malgré le modèle de base ayant presque trois fois les paramètres de son prédécesseur.
Le pipeline de données de formation s'est également élargi : Cognition a triplé le nombre d'environnements RL, ajouté des superpositions de suivi des instructions et construit un volant d'inertie alimenté par les précédents points de contrôle SWE-2 qui renforce de manière itérative les vérificateurs utilisés pour évaluer le modèle.
L'efficacité autant que l'intelligence
La cognition considère les gains de SWE-2 comme étant étroitement liés à l'efficacité. Selon la société, un jugement technique plus solide permet à l'agent d'écrire des solutions plus complètes avec moins de détours et de lectures redondantes. Sur FrontierCode 1.1 Main, la configuration à effort moyen du SWE-2 obtient des résultats supérieurs à ceux du SWE-1.7 tout en prenant 58 % de tours en moins et en coûtant 81 % de moins.
Ce cadre est important pour les activités de Cognition. Devin est présenté comme un ingénieur logiciel autonome, et le coût d'inférence est un apport direct aux prix et aux marges. Un modèle qui maintient une qualité frontalière tout en réduisant les tours et les jetons par tâche modifie l'économie de chaque session Devin desservie par l'entreprise.
Disponibilité
SWE-2 est disponible dès aujourd'hui dans Devin Desktop et Devin CLI, avec un déploiement sur Devin Web et Fusion en cours, selon la société. Cognition indique que les utilisateurs devraient voir le modèle apparaître sur les surfaces au cours des prochains jours.
Ce que cela signifie pour le marché des modèles de codage
La version resserre un peloton déjà nombreux derrière le GPT-6 Astra. Cognition possède désormais un modèle qui négocie les coups avec les offres d'Anthropic, OpenAI et xAI à un coût nettement inférieur, et contrôle la pile complète, du modèle au produit agent. Les concurrents seront confrontés à des pressions pour réagir autant sur le prix que sur la capacité, en particulier pour les tâches à volume élevé et de difficulté moyenne pour lesquelles le profil de coûts de SWE-2 est le plus fort.
Pour les acheteurs d’outils de codage d’IA, le point pratique est que l’aide au codage au niveau frontière ne nécessite plus une tarification au niveau frontière. Pour le reste de l’industrie, SWE-2 est la preuve que l’efficacité post-formation et des infrastructures, et pas seulement l’échelle du modèle de base, est devenue un levier concurrentiel décisif.
---
Gardez une longueur d'avance sur l'IARecevez les dernières actualités, analyses et avancées en matière d'IA, le tout en un seul endroit.
Lire plus d'actualités sur l'IA →