Cognition, la compañía detrás del ingeniero de software Devin AI, lanzó SWE-2 el jueves y lo describió como su modelo de codificación más avanzado hasta el momento. En una publicación de blog publicada el 10 de septiembre, la compañía dijo que el nuevo modelo empuja lo que llama la frontera de capacidad y costo de Pareto, con una puntuación del 50,0 % en el punto de referencia principal FrontierCode 1.1 y un coste un 64 % menor que Fable 5.1, el modelo Anthropic que se sitúa sólo un punto por delante con un 50,9 %.
El lanzamiento se produce apenas un día después de que Cognition confirmara una ronda de financiación de 2.000 millones de dólares con una valoración de 48.000 millones de dólares, y señala cuán agresivamente está invirtiendo la startup de codificación agente en el desarrollo de su propio modelo en lugar de depender únicamente de modelos fronterizos de terceros. Para obtener una cobertura continua de la carrera de codificación de IA y todo lo que mueve la industria, agregue AI Buzz Wire, su fuente diaria de noticias de última hora sobre IA.
Dónde aterriza SWE-2 en los puntos de referencia
Según los resultados publicados de Cognition, SWE-2 registra un 50,0 % en FrontierCode 1.1 Main, por delante de Grok 4.6 con un 48,0 % y GPT-5.6 Sol con un 47,5 %, y a poca distancia de GPT-6 Astra, que lidera el campo con un 53,3 %. En el benchmark DeepSWE 1.1, SWE-2 alcanza el 73,0%, sólo superado por el 74,1% de Astra entre los modelos de la lista Cognition.
El resultado más fuerte se produce en Terminal-Bench 2.1, donde SWE-2 obtiene una puntuación del 92,8%, la cifra más alta en la tabla comparativa de Cognition y por delante de Fable 5.1 con un 91,4% y GPT-6 Astra con un 89,9%. El panorama cambia en el Terminal-Bench 4, más duro, donde SWE-2 logra un 27,3% frente a un 57,9% para GPT-6 Astra y un 55,8% para Fable 5.1, un recordatorio de que el diseño del modelo que prioriza la eficiencia deja margen de maniobra en el extremo superior de la dificultad de la tarea.
Cognition resume el posicionamiento sin rodeos: en FrontierCode 1.1 Main y DeepSWE 1.1, SWE-2 supera a su modelo anterior SWE-1.7 y Grok 4.6 tanto en puntaje como en costo, iguala a GPT-5.6 Sol y Fable 5/5.1 a una fracción de su precio, y se acerca a unos pocos puntos de GPT-6 Astra a una cuarta parte del costo.
Post-entrenado de Kimi K3 a escala multimillonaria
SWE-2 no se construye desde cero. Cognition entrenó posteriormente el modelo de Kimi K3, un modelo base de 2,8 billones de parámetros de Moonshot AI que ya se había sometido a un amplio aprendizaje por refuerzo para la codificación agente. Además de esa base, Cognition dice que su proceso RL agregó de cinco a seis puntos en muchos puntos de referencia y cambió toda la frontera costo-rendimiento de K3.
La compañía dice que SWE-2 es la primera vez que escala el aprendizaje por refuerzo al régimen de multimillonarios de parámetros, basándose en la infraestructura de capacitación y la receta desarrollada para SWE-1.7. La incorporación clave es un algoritmo RL que entrena todos los niveles de esfuerzo de razonamiento en una sola ejecución, en lugar de tratar el esfuerzo bajo, medio y alto como objetivos de entrenamiento separados.
Las sanciones por costos dan forma a toda la frontera
Una idea central en el entrenamiento de SWE-2 es una penalización de costo lineal aplicada por nivel de esfuerzo dentro de una sola ejecución de RL, con cada penalización ajustada a la pendiente local de la frontera de Pareto del modelo base. Cognition dice que este enfoque, derivado de los primeros principios, avanza toda la frontera costo-rendimiento del modelo al tiempo que preserva su forma y refleja los costos reales del usuario de la manera más directa posible en la capacitación.
La compañía también detalló una línea base de recompensa ponderada por longitud que ha utilizado desde SWE-1.6, a la que atribuye una capacitación significativamente estabilizadora, junto con mejoras en el servicio de implementación de RL que incluyen un modelo preliminar en línea para aumentar el rendimiento de decodificación. Con los núcleos NVFP4 y FP8 y el entrenamiento con reconocimiento de cuantificación, Cognition dice que redujo el uso general de memoria a pesar de que el modelo base tenía casi tres veces los parámetros de su predecesor.
La canalización de datos de entrenamiento también se expandió: Cognition triplicó la cantidad de entornos RL, agregó superposiciones de seguimiento de instrucciones y construyó un volante impulsado por puntos de control SWE-2 anteriores que refuerza de forma iterativa los verificadores utilizados para calificar el modelo.
Eficiencia tanto como inteligencia
La cognición enmarca las ganancias de SWE-2 como estrechamente vinculadas a la eficiencia. Según la compañía, un criterio de ingeniería más sólido permite al agente escribir soluciones más completas con menos desvíos y lecturas redundantes. En FrontierCode 1.1 Main, la configuración de esfuerzo medio de SWE-2 obtiene una puntuación más alta que SWE-1.7, mientras toma un 58 % menos de turnos y cuesta un 81 % menos.
Ese marco es importante para el negocio de Cognition. Devin se vende como un ingeniero de software autónomo y el costo de inferencia es un insumo directo para los precios y los márgenes. Un modelo que mantiene una calidad adyacente a la frontera y al mismo tiempo reduce los turnos y los tokens por tarea cambia la economía de cada sesión de Devin a la que atiende la empresa.
Disponibilidad
SWE-2 está disponible a partir de hoy en Devin Desktop y Devin CLI, y se está implementando en Devin Web y Fusion, según la compañía. Cognition dice que los usuarios deberían ver el modelo aparecer en las superficies en los próximos días.
Qué significa para el mercado de modelos de codificación
El lanzamiento refuerza un grupo ya abarrotado detrás del GPT-6 Astra. Cognition ahora posee un modelo que intercambia golpes con ofertas de Anthropic, OpenAI y xAI a un costo notablemente menor, y controla la pila completa desde el modelo hasta el producto agente. Los rivales enfrentarán presión para responder tanto en precio como en capacidad, particularmente para las tareas de alto volumen y dificultad media donde el perfil de costos de SWE-2 es más fuerte.
Para los compradores de herramientas de codificación de IA, la conclusión práctica es que la ayuda de codificación a nivel de frontera ya no requiere precios a nivel de frontera. Para el resto de la industria, SWE-2 es una prueba de que la eficiencia posterior a la capacitación y la infraestructura, no solo la escala del modelo base, se han convertido en una palanca competitiva decisiva.
---
Manténgase a la vanguardia de la IAObtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.
Leer más noticias sobre IA →