La firma de evaluación comparativa Artificial Analysis lanzó la versión 4.2 de su Índice de Inteligencia el 4 de septiembre de 2026, una actualización provisional que reelabora cómo se miden los modelos de IA de frontera y, según la nueva tabla de clasificación, Claude Fable 5.1 de Anthropic ocupa el primer lugar, con GPT-6 Astra de OpenAI en segundo lugar después de una ganancia de cuatro puntos sobre GPT-5.6 Sol.

La actualización llega apenas ocho meses después del lanzamiento de Index v4 en enero, un cambio inusualmente rápido que la empresa atribuye al ritmo de los recientes lanzamientos fronterizos. "Con la frontera moviéndose tan rápidamente en las últimas semanas, creemos que es importante ofrecer una actualización provisional inmediata para garantizar que nuestro índice siga siendo tan relevante y útil como siempre", escribió la compañía en su anuncio.

Las clasificaciones de titulares

Según los resultados publicados, Claude Fable 5.1 de Anthropic lidera el índice, seguido por GPT-6 Astra de OpenAI, que mejoró cuatro puntos sobre GPT-5.6 Sol. Meta ocupa el tercer lugar en la clasificación, seguido de SpaceXAI, Moonshot/Kimi, Z.AI y Google.

Anthropic y OpenAI también comparten la imagen actualizada de rentabilidad: las dos empresas, junto con Meta y Z.AI, ocupan la frontera de Pareto de "coste por tarea" del índice, lo que significa que ningún otro laboratorio ofrece actualmente una inteligencia estrictamente mejor por el mismo precio por tarea completada.

En cuanto a la eficiencia de los tokens, Artificial Analysis encontró que GPT-6 Astra es "más eficiente que casi todos los demás modelos cerca de la frontera de la inteligencia", con Claude Fable 5.1, Grok 4.5 y Gemini 3.5 Flash-Lite en cada extremo de la curva. Sin embargo, la firma señaló en un análisis complementario que el menor uso de tokens de Astra se ve compensado por sus precios más altos, un recordatorio de que la eficiencia bruta y el costo total no siempre van juntos.

¿Qué cambió en v4.2?

El cambio estructural más significativo es un impulso deliberado contra los juegos de referencia. El cuarenta por ciento de la ponderación del Índice ahora proviene de conjuntos de pruebas privados y reservados (el doble que en la versión 4.1), incluidos AA-Briefcase, AA-Omniscience y soluciones para CritPt. La firma dijo que esa cifra aumentará aún más en el Índice v5.

Dos nuevas evaluaciones anclan la actualización:

  • AA-Briefcase, un punto de referencia de trabajo de conocimiento agente interno con un conjunto de pruebas privado. Los modelos se evalúan en proyectos profesionales de varias semanas, cada uno con muchas tareas vinculadas y miles de archivos fuente de entrada, y se califican mediante una combinación de puntuación de rúbricas y comparación por pares que cubre el éxito verificable de las tareas, la calidad analítica y la calidad de la presentación.
  • GDP.pdf, creado por Surge AI, que prueba el razonamiento de un solo turno en documentos profesionales: 100 archivos PDF que abarcan diez dominios, con evidencia distribuida en 4592 páginas de texto, tablas, gráficos y notas a pie de página. Las respuestas se califican según 1275 criterios atómicos escritos por expertos, y el título Tasa de aprobación total acredita una tarea solo cuando se cumplen todos los criterios.

Un punto de referencia de larga data está a punto de desaparecer: GPQA Diamond, la prueba de razonamiento científico a nivel de posgrado, ha sido eliminada porque ha sido efectivamente saturada por modelos de frontera.

La empresa también actualizó su infraestructura de calificación, lanzando AA-LCR v1.1 con un nuevo sistema de calificación y claves de respuestas corregidas, reanclando la escala Elo para GDPval-AA v2 y AA-Briefcase para que las calificaciones se mantengan estables a medida que llegan nuevos modelos, y fortaleciendo las zonas de pruebas de calificación de SciCode para que el código lento pero correcto ya no cuente como una falla.

Lo que revelan las nuevas pruebas

Los resultados de las nuevas evaluaciones ofrecen una imagen más granular de dónde se encuentran realmente los laboratorios de frontera.

En AA-Briefcase, Claude Fable 5.1 y Opus 5 de Anthropic lideran, seguidos por GPT-6 Astra de OpenAI y Muse Spark 1.3 de Meta. GPT-6 Astra obtiene aproximadamente 85 puntos Elo por encima de GPT-5.6 Sol en la misma evaluación, un salto sustancial entre generaciones sucesivas de OpenAI.

En GDP.pdf, la imagen cambia: OpenAI lidera con GPT-6 Astra con una tasa de aprobación total del 33,2 %, seguido por GPT-5.6 Sol con un 28,2 % y Claude Fable 5.1 con un 26,2 %. La divergencia sugiere que la síntesis de documentos largos en contextos muy grandes sigue siendo una fortaleza relativa para el modelo más nuevo de OpenAI, incluso cuando los modelos de Anthropic lideran el índice general y las tareas de trabajo de agencia.

Por qué son importantes los conjuntos de pruebas privados

El cambio hacia una evaluación postergada refleja un problema de credibilidad más amplio en la evaluación comparativa de la IA. A medida que los modelos han absorbido más datos de pruebas públicas, los laboratorios y los observadores independientes se han preocupado cada vez más de que las puntuaciones principales en puntos de referencia bien conocidos reflejen memorización o capacitación específica en lugar de una capacidad genuina. Al mantener privada una proporción cada vez mayor de sus conjuntos de pruebas y darles mayor peso, Artificial Analysis intenta preservar la señal de que las tablas de clasificación públicas han estado perdiendo.

La firma dijo que ha estado construyendo elementos del Índice v5 "durante meses" y deliberadamente retuvo las actualizaciones para mantener el Índice estable durante la reciente ola de lanzamientos de modelos importantes. Más allá de la versión provisional v4.2, planea más actualizaciones incrementales en el futuro cercano a medida que complete la transición a la v5.

Para los compradores que eligen entre modelos de vanguardia, la conclusión práctica de la v4.2 es que la cima del mercado sigue siendo una carrera de dos caballos entre Anthropic y OpenAI, con Meta cerrando la brecha, y que las evaluaciones diseñadas para ser resistentes a los juegos ahora están haciendo más trabajo de clasificación. Los usuarios que siguen las decisiones de selección de modelos pueden seguir los últimos desarrollos de IA a medida que se acerca el lanzamiento de la versión 5.

Manténgase por delante de la IA

Las actualizaciones de puntos de referencia como ésta remodelan la forma en que la industria juzga el progreso. Lea más noticias sobre IA y manténgase a la vanguardia de cada lanzamiento de modelo.

Leer más noticias sobre IA →