El GPT-6 Astra de OpenAI ha publicado resultados de última generación en ARC-AGI-3, el punto de referencia de razonamiento abstracto diseñado para medir la inteligencia agente, según los resultados publicados el miércoles por la Fundación Premio ARC. El modelo obtuvo una puntuación del 62,7 % en el conjunto semiprivado del punto de referencia bajo el arnés estándar de la fundación y del 99,9 % cuando se evaluó con un arnés del adaptador de proveedor que preserva el estado de razonamiento interno del modelo entre solicitudes.

Los resultados llegaron un día después de que OpenAI comenzara el lanzamiento por etapas de Astra, el modelo insignia que la compañía ha enmarcado como el comienzo de una nueva era. Para los lectores que intentan llevar la cuenta a medida que los laboratorios fronterizos superan los puntos de referencia comerciales, la página últimos desarrollos de IA rastrea cada lanzamiento importante a medida que ocurre.

Dos arneses, dos puntajes muy diferentes

La diferencia entre las dos cifras principales de Astra es el detalle más importante del informe. El Premio ARC evalúa a los agentes bajo diferentes arneses, y cada uno cambia lo que el modelo puede hacer con su propio contexto.

Bajo el arnés Estándar, un modelo puede llevar notas que elija conservar mientras trabaja en un entorno. Con esa configuración, Astra con el máximo esfuerzo de razonamiento obtuvo una puntuación del 62,7%, con un coste total de 26.098 dólares para la ejecución de la evaluación. En el extremo opuesto, ejecutar el mismo método con el razonamiento desactivado produjo solo un 35,2% y costó más (49.791 dólares) porque el modelo necesitaba muchas más acciones para progresar.

El arnés Provider Adapter es más generoso: preserva el estado de razonamiento opaco del modelo entre solicitudes y utiliza la compactación para conversaciones más largas, lo que permite a Astra reutilizar el trabajo anterior. Bajo ese control, Astra obtuvo una puntuación del 99,9% en esfuerzo de razonamiento alto por 18.817 dólares, y del 98,6% en esfuerzo máximo por 17.332 dólares. Incluso el nivel de razonamiento más bajo alcanzó el 96,7%.

En otras palabras, la diferencia entre una puntuación parcial y una casi perfecta no es solo la capacidad bruta: es la cantidad del estado de funcionamiento del modelo que sobrevive entre los pasos.

Venciendo a los humanos en eficiencia de acción

ARC-AGI-3 se basa en entornos de juego novedosos, abstractos y por turnos. Los agentes deben explorar sin instrucciones, inferir cómo funciona el mundo, identificar objetivos a partir de escasas recompensas y planificar acciones de varios pasos. Los entornos están calibrados para que los humanos puedan resolver el 100% de ellos, lo que hace que el desempeño humano sea la base con la que se miden los puntos de referencia.

Astra no sólo resolvió la mayoría de los niveles, sino que los resolvió de manera eficiente. Según el Premio ARC, el modelo utilizó menos acciones que el humano promedio probado en el 96% de los niveles, superando la línea base humana en eficiencia de acción en todo el conjunto.

Los aspectos económicos de la comparación son crudos. A los participantes de la prueba humana se les pagó $115 por sesión de 90 minutos más $5 por juego completado, lo que equivale aproximadamente a $12,78 por intento de juego. Una evaluación completa del Astra cuesta cinco cifras, dependiendo de la configuración. Pero ARC Prize notó un problema contrario a la intuición: un mayor esfuerzo de razonamiento generalmente cuesta menos, porque Astra resolvió juegos en menos acciones, reduciendo el número total de llamadas de modelo y tokens quemados por ejecución.

Un modelo que construye su propio lenguaje

Más allá de las puntuaciones, el Premio ARC destacó un comportamiento cualitativo que observó el equipo. Astra convirtió constantemente entornos desconocidos en modelos mundiales simbólicos compactos, representando la mecánica del juego como reglas lógicas y desarrollando su propia taquigrafía específica de dominio para rastrear el estado y planificar acciones.

Esa es precisamente la habilidad para la que se diseñó ARC-AGI-3. Mientras que las generaciones anteriores del punto de referencia probaron el razonamiento fluido sobre patrones novedosos, la tercera generación prueba si un agente puede explorar, modelar, establecer objetivos y ejecutar planes en entornos que nunca ha visto: los componentes que ARC Prize enumera como exploración, modelado, establecimiento de objetivos y planificación y ejecución.

El telón de fondo de la era AGI

Los resultados del benchmark llegaron en medio de una retórica máxima por parte del propio OpenAI. En una conferencia de prensa antes del lanzamiento del jueves, el presidente de la compañía, Greg Brockman, dijo que "no era descabellado sentir que ahora estamos en la era AGI", aunque no llegó a hacer una declaración formal, según la cobertura del lanzamiento de The New Stack. Describió a AGI como un "concepto de misión o concepto espiritual" en lugar de un desencadenante contractual.

El investigador de OpenAI, Aidan Clark, dijo que Astra fue la ejecución de capacitación más grande de la compañía hasta la fecha (la primera capacitación previa en más de 100,000 GPU en el sitio Stargate en Texas) y la primera versión de OpenAI en la que los modelos anteriores desempeñaron un papel importante en la supervisión del proceso de capacitación. El acceso sigue por etapas: el lanzamiento comienza con los clientes empresariales del programa Daybreak, con disponibilidad Plus, Pro, Business y Enterprise, además de acceso a API y AWS prometido en los próximos días.

El asterisco en la partitura

Es necesario actuar con cautela en varios frentes. El rendimiento del ARC-AGI-3 de Astra depende en gran medida de la configuración del arnés, como lo muestran los dos números principales, y los arneses personalizados que preservan el estado del modelo han sido un punto recurrente de discordia en las disputas sobre los puntos de referencia. El análisis del lanzamiento de New Stack señaló que Astra "publica grandes ganancias en tareas especializadas, pero tiene un costo elevado y no lidera claramente el paquete de codificación", un recordatorio de que los puntos de referencia de rompecabezas agentes y las cargas de trabajo comerciales cotidianas miden cosas diferentes.

El propio Premio ARC enmarca el ejercicio como una medición de la "brecha residual" entre la IA actual y el AGI, definiendo el AGI como la capacidad de adquirir cualquier habilidad que un ser humano pueda, tan eficientemente como un ser humano. Una puntuación casi perfecta en condiciones favorables no cierra esa brecha por sí sola. Y a un precio de entre 17.000 y 50.000 dólares por ejecución de evaluación, sólo los laboratorios con buenos recursos pueden permitirse ejecutar el punto de referencia a esta escala, aunque los datos de costos del Premio ARC muestran que un razonamiento más inteligente en realidad puede reducir la factura.

Por qué es importante

La eficiencia de la acción es un eje de comparación realmente nuevo. Un modelo que resuelve todos los niveles pero desperdicia miles de llamadas es menos útil (y más costoso) que uno que actúa como lo hizo Astra aquí: explorando deliberadamente, comprimiendo lo que aprende y actuando en consecuencia. Cualquiera que sea la conclusión que se concluya sobre el debate sobre los AGI, los datos del Premio ARC muestran que los agentes fronterizos ahora están igualando a los humanos no sólo en cuanto a si pueden resolver problemas novedosos, sino también en qué tan económicamente los resuelven.

Manténgase por delante de la IA

Cada resultado de referencia, lanzamiento de modelo y debate sobre seguridad, seguido a medida que sucede - leer más noticias sobre IA →