OpenAI está retrocediendo después de que Claude Opus 5 de Anthropic dominara el punto de referencia ARC-AGI-3, publicando resultados que muestran que su propio modelo GPT-5.6 Sol alcanza el 38,3 por ciento, siempre que utilice la configuración preferida de OpenAI en lugar del arnés de prueba oficial.

La disputa, que se desarrolló el 30 de julio de 2026, llega al corazón de un problema creciente en la evaluación de la IA: los puntos de referencia ya no miden solo un modelo, sino todo el andamiaje técnico que lo rodea. Para un análisis más profundo de los últimos desarrollos de IA y los lanzamientos de modelos, AI Buzz Wire está siguiendo la historia.

Los números y la trampa

OpenAI informó que GPT-5.6 Sol alcanza el 38,3 por ciento en ARC-AGI-3, superando a Claude Opus 5 de Anthropic, que obtuvo un 30,2 por ciento después de haber cuadriplicado previamente el récord del punto de referencia. La advertencia es importante: esa cifra del 38,3 por ciento depende de dos características específicas de la API Responses de OpenAI.

El primero es Razonamiento retenido, que preserva la cadena de pensamiento del modelo entre pasos en lugar de descartarla después de cada acción. El segundo es Compactación, que resume el contexto anterior en lugar de truncarlo, lo que permite que el modelo siga trabajando en problemas largos sin perder el razonamiento anterior.

Ejecutado a través del arnés estandarizado oficial de ARC Prize, que evita intencionalmente configuraciones específicas del proveedor para garantizar comparaciones de manzanas con manzanas, GPT-5.6 Sol logró solo el 7,8 por ciento. La razón, sostiene OpenAI, es que la configuración oficial descarta el razonamiento del modelo después de cada paso, destruyendo el rendimiento en tareas que requieren un pensamiento sostenido de varios pasos.

Un punto de referencia creado para la pureza

ARC-AGI-3 fue diseñado por François Chollet y el equipo del Premio ARC para probar la capacidad de un modelo para resolver acertijos de razonamiento novedosos que nunca antes había visto: una prueba de inteligencia general en lugar de conocimiento memorizado. Para mantener las comparaciones justas, el arnés oficial elimina deliberadamente las características específicas del proveedor, midiendo la capacidad del modelo en bruto en un entorno neutral.

El contraargumento de OpenAI es que esta neutralidad puede convertirse en una desventaja. La compañía sostiene que el arnés oficial se basaba en una "API de terminaciones estilo OpenAI" más antigua que carecía de capacidades que la API de Claude ya ofrecía, lo que efectivamente colocaba a OpenAI en una desventaja estructural en relación con Anthropic en la comparación original.

En esencia, OpenAI dice: midiste nuestro modelo con una mano atada a la espalda.

Respuesta de Chollet

El cofundador del Premio ARC, François Chollet, respondió trazando una línea clara entre dos tipos de configuraciones de prueba. Los arneses "hechos a la medida para resolver el benchmark o que contengan conocimiento sobre el formato del benchmark" están prohibidos, dijo. Pero las configuraciones de API de propósito general "que no fueron desarrolladas para ARC-AGI-3 y que están disponibles para todos los usuarios de API" son un juego limpio.

De hecho, Chollet admitió que la puntuación GPT-5.6 Sol del propio ARC Prize puso a OpenAI en desventaja. Señaló que la organización ha tenido "muchos intercambios con OpenAI sobre cómo probar mejor sus modelos, especialmente con respecto a la compactación", y dio la bienvenida a que la empresa "comenzara a descubrir la respuesta".

Chollet señaló una preocupación restante. Diferentes proveedores que utilizan diferentes entornos crean lo que él llamó "un posible problema de paridad", pero lo considera aceptable "siempre que los entornos y el costo se informen claramente".

Por qué esto es importante más allá de la clasificación

El episodio subraya una tensión que está cambiando la forma en que la industria de la IA evalúa el progreso. A medida que los modelos se implementan cada vez más a través de API ricas en funciones en lugar de sistemas independientes, la línea entre la capacidad inherente de un modelo y la ingeniería que lo rodea se vuelve cada vez más borrosa. Un punto de referencia que ignore el andamiaje puede subestimar el desempeño en el mundo real; uno que lo adopte puede recompensar a las empresas por superar la prueba.

Es poco probable que el debate ARC-AGI-3 sea el último. A medida que los modelos de frontera se agrupen cerca de la cima de los puntos de referencia establecidos, los desacuerdos sobre lo que se considera una medición justa y quién establece el estándar no harán más que intensificarse.

Manténgase por delante de la IA

¿Quiere seguir las últimas noticias sobre IA sobre modelos, pruebas comparativas y los laboratorios que los crean? AI Buzz Wire lo tiene cubierto.

Leer más noticias sobre IA