El equipo de Ornith ha lanzado Ornith-1.5, una familia de modelos de lenguaje abierto construidos en torno a una idea inusual: el modelo genera sus propias tareas de entrenamiento, diseña sus propios andamios y aprende de sus propios intentos de solución en un bucle que se ejecuta continuamente. Según las propias evaluaciones del equipo, el buque insignia Ornith-1.5-397B obtiene una puntuación de 86,1 en Terminal-Bench 2.1 (Terminus-2), lo que lo sitúa a la par con Claude Opus 4.8 de Anthropic con 85,0 y por delante de cualquier otro modelo de código abierto de tamaño comparable.

El lanzamiento, publicado esta semana en el blog de Ornith y en Hugging Face bajo una licencia del MIT, es la última salva en la carrera de la IA de código abierto que regularmente ha producido resultados que alguna vez se consideraron imposibles sin el presupuesto de un laboratorio de vanguardia. Para los desarrolladores y empresas que siguen las últimas noticias sobre modelos de IA, la importancia es doble: la paridad de referencia con un modelo cerrado líder y una receta de capacitación que señala hacia dónde se dirige el desarrollo de modelos abiertos.

Tres tamaños, una receta

Ornith-1.5 se envía en tres configuraciones: un buque insignia con una mezcla de expertos de 397B de parámetros, un MoE de 35B que activa solo 3B de parámetros por token y un modelo compacto denso de 9B con una variante "móvil" cuantificada diseñada para ejecutarse directamente en dispositivos iPhone y Android. Los tres están disponibles en Hugging Face junto con las versiones GGUF, MLX y NVFP4, y las tarjetas modelo indican que la familia está construida sobre la arquitectura Qwen3.5 MoE.

El linaje importa aquí. Ornith-1.0, lanzado a principios de este año, popularizó el enfoque de "auto-andamio" para la codificación agente y se convirtió en un éxito silencioso: su versión 9B GGUF ha registrado más de cinco millones de descargas en Hugging Face. Ornith-1.5 amplía ese marco desde la optimización de andamios e implementaciones hasta un proceso de mejora personal completo.

El ciclo de superación personal, explicado

En un proceso convencional posterior a la capacitación, el aprendizaje por refuerzo se ejecuta en contra de un conjunto fijo de tareas seleccionadas por humanos. En cambio, Ornith-1.5 hace que el modelo en sí proponga nuevas tareas, genere un andamio específico para la tarea (las instrucciones, herramientas y estrategia de descomposición utilizadas para atacar el problema) y luego produzca implementaciones de soluciones que se califican según el andamio que acaba de construir. La recompensa se propaga a través de las tres etapas utilizando GRPO, por lo que el sistema aprende simultáneamente a escribir mejores tareas, mejores andamios y mejores soluciones.

La recompensa por la generación de tareas es el corazón del diseño. Cada tarea propuesta se califica según tres señales multiplicativas: validez (¿el andamio se ejecuta y evalúa correctamente?), dificultad de frontera (¿la tasa de éxito empírico del modelo está cerca de un objetivo de aproximadamente el 20 por ciento, manteniendo las tareas desafiantes pero fáciles de aprender?) y novedad (¿es lo suficientemente diferente de todo lo que hay en un buffer de tareas generadas previamente?). Debido a que la dificultad se mide en comparación con la tasa de éxito actual del modelo, el plan de estudios aumenta automáticamente a medida que el modelo mejora.

El equipo también informa medidas explícitas contra la piratería durante la evaluación: el historial de git se elimina de las imágenes del repositorio para que los modelos no puedan recuperar soluciones anteriores y el acceso a la red se desactiva para evitar que los modelos obtengan respuestas externas. Todos los resultados se promedian en cinco ejecuciones independientes.

Los números

En cuanto a la codificación agente, los resultados autoinformados del buque insignia se agrupan en la parte superior del campo de código abierto. En Terminal-Bench 2.1 ejecutado a través del arnés Terminus-2, el 86.1 de Ornith-1.5-397B supera a Claude Opus 4.8 (85.0), DeepSeek-V4-Flash-0731 (82.7) y GLM-5.2 (81). En el mismo punto de referencia ejecutado a través del arnés Claude Code, Ornith-1.5 registra 85.2 contra 78.9 de Opus 4.8. En SWE-bench Verified, los dos están efectivamente empatados con 86,0 y 85,8, con Kimi K3 ligeramente por delante con 86,2.

Las brechas se amplían en las suites agentes más duras. En DeepSWE, Ornith-1.5-397B obtiene una puntuación de 56,0, por delante del 46,2 de GLM-5.2, aunque detrás de Opus 4.8 (59,0) y Kimi K3 (67,5). El salto más sorprendente es generacional: Ornith-1.0 obtuvo solo 8,0 en DeepSWE, lo que significa que la nueva iteración ofrece una mejora siete veces mayor que la misma familia de referencia.

Los modelos más pequeños cuentan su propia historia. Ornith-1.5-35B-A3B, que activa solo 3B de parámetros por token, obtiene una puntuación de 68,5 en Terminal-Bench 2.1 (Claude Code) frente a 43,4 para Gemma 4-31B de Google y 51,7 para Muse Glimmer-30B de Meta, y publica 79,0 en SWE-bench Verified. El modelo 9B alcanza 47,0 en Terminal-Bench 2.1, 70,6 en SWE-bench Verified y 86,4 en GPQA Diamond, cifras que sitúan a un modelo de clase telefónica a una distancia sorprendente de sus rivales de clase de escritorio.

Advertencias y contexto

Estos son puntos de referencia realizados por desarrolladores, no resultados auditados de forma independiente, y los modelos de comparación fueron evaluados por el equipo de Ornith bajo su propia configuración de arnés. Los laboratorios rivales también buscan diferentes compensaciones; El liderazgo de Kimi K3 en DeepSWE sugiere que la frontera del trabajo de software agente todavía está en disputa. Pero la transparencia completa de la tabla del comunicado (promedios de cinco corridas, configuraciones de arnés publicadas, salvaguardas reveladas) hace que la reproducción independiente sea inusualmente sencilla.

La respuesta de la comunidad ha sido sustancial. El anuncio del lanzamiento generó más de cien puntos en Hacker News en cuestión de horas, y la discusión se centró menos en las afirmaciones de los puntos de referencia que en la metodología de superación personal, que varios comentaristas describieron como una de las implementaciones abiertas más creíbles de generación de tareas de estilo recursivo.

Para el ecosistema de código abierto, Ornith-1.5 aterriza en un momento en el que los modelos abiertos de los laboratorios de China y los equipos independientes occidentales han estado cerrando la brecha con fronteras cerradas en codificación y tareas de agencia. Una familia con licencia del MIT que coincide con un modelo cerrado líder en Terminal-Bench (y envía una variante 9B lista para teléfono) reduce aún más esa brecha y lo hace con un método de capacitación que cualquiera puede inspeccionar, reproducir y ampliar.

---

Manténgase a la vanguardia de la IA

Obtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.

Leer más noticias sobre IA →