Los investigadores de Nvidia han creado un sistema de agente que llevó a Claude Opus 5 de Anthropic a una puntuación perfecta del 100% en ARC-AGI-3, uno de los puntos de referencia de razonamiento interactivo más exigentes en IA, utilizando el mismo modelo que obtiene una puntuación del 30% cuando se ejecuta por sí solo. El resultado, publicado el viernes en el Blog Técnico de Nvidia, es la evidencia más sólida hasta el momento de que el software incluido en un modelo de frontera importa tanto como el modelo en sí. Para cualquiera que siga los últimos desarrollos de IA, esto marca un cambio en el lugar donde realmente reside la ventaja competitiva en la IA agente.

El sistema se llama AVO, abreviatura de Agentic Variation Operadores, y es la versión de Nvidia de una arquitectura de propósito general para agentes autónomos de largo plazo: IA que puede permanecer en una tarea durante horas o días en lugar de responder a un solo mensaje. En el conjunto público ARC-AGI-3, AVO registró una puntuación RHAE de 100,00 en los 25 entornos de juego, completando los 183 niveles en 6.624 acciones ambientales utilizando Claude Opus 5 como modelo de backend.

Lo que realmente prueba ARC-AGI-3

ARC-AGI-3 es un punto de referencia de razonamiento interactivo creado por la fundación ARC Prize. Un agente es arrojado a entornos desconocidos, parecidos a juegos, sin instrucciones, reglas establecidas ni objetivo establecido. Tiene que explorar mediante prueba y error, inferir cómo funciona el entorno, descubrir qué significa "ganar" y luego actuar con la suficiente eficacia para progresar a través de niveles progresivamente más difíciles.

La métrica de puntuación del punto de referencia, Eficiencia relativa de la acción humana (RHAE), combina la finalización de la tarea con la cantidad de acciones que el agente desperdicia en comparación con los jugadores humanos primerizos. Eso lo convierte en una prueba brutal de autonomía sostenida: el agente debe recordar lo que aprendió, recuperarse de los errores y presupuestar cuidadosamente sus acciones a lo largo de toda una carrera.

El número principal de Nvidia gana contexto a partir de una comparación. VISTA, un arnés de interacción directa anterior que también usaba Claude Opus 5, completó los mismos 183 niveles públicos en 7,542 acciones ambientales. AVO necesitó aproximadamente un 12% menos de acciones para terminar el trabajo, según la publicación del blog de Nvidia.

De los núcleos de GPU a los juegos desconocidos

AVO no fue creado para rompecabezas. Nvidia demostró por primera vez la arquitectura de optimización del kernel de GPU, un dominio donde pequeños cambios de código pueden alterar la corrección, el comportamiento de la memoria y el rendimiento de maneras impredecibles. En un estudio de atención del núcleo, AVO se ejecutó continuamente durante siete días, exploró más de 500 direcciones de optimización y comprometió 40 versiones del núcleo. En los sistemas NVIDIA DGX B200, los núcleos de atención multicabezal resultantes superaron a cuDNN hasta en un 3,5 % y a FlashAttention-4 hasta en un 10,5 %. Luego, el agente adaptó su núcleo evolucionado a la atención de consultas agrupadas en aproximadamente 30 minutos de trabajo autónomo adicional.

Luego, el mismo bucle central (inspeccionar, planificar, implementar, probar, evaluar) se apuntó a ARC-AGI-3 y solo se cambió la interfaz de tareas. Dos mecanismos transferidos. La primera es la memoria persistente, que almacena implementaciones anteriores, resultados de evaluación, resultados del compilador y perfilador, y razonamiento acumulado, de modo que el agente pueda reanudar desde su estado actual en lugar de reconstruir el contexto desde cero. El segundo es un supervisor, un segundo agente que vigila la trayectoria general e interviene cuando el progreso se estanca.

El supervisor es el gran avance

TechCrunch, que entrevistó a Adel El Hallak de Nvidia, vicepresidente de producto en la unidad de IA de la empresa, destacó al supervisor como el ingrediente más importante. "Casi actúa como un director ejecutivo al empujar al agente cuando se desvía o comienza a explorar un camino que podría conducir a un callejón sin salida, o reexplorar un camino que ya había recorrido anteriormente", dijo El Hallak a la publicación.

La brecha de desempeño es marcada. Las pruebas de Nvidia encontraron que Claude Opus 5 sin un arnés sofisticado logró una puntuación del 30% en ARC-AGI-3, el mejor resultado entre los modelos probados, pero ni mucho menos una ejecución completa. Los modelos de OpenAI obtuvieron una puntuación inferior al 10% en el punto de referencia, y la compañía publicó su propia investigación el mes pasado que muestra que ajustar solo dos configuraciones del arnés triplicó sus puntuaciones. Ninguna configuración exclusiva de modelo se ha acercado al 100% que logró AVO.

En particular, la configuración AVO se ejecutó en una modalidad de solo texto: cada observación se proporcionó como una cuadrícula de texto exacta de 64x64, sin imágenes ni tokens de imágenes enviados al modelo. El poder de razonamiento provino del circuito alrededor del modelo, no de la percepción multimodal.

Por qué la industria apuesta por los arneses

El hallazgo se produce en medio de una ola de evidencia de que la infraestructura de los agentes, y no la capacidad bruta del modelo, es el cuello de botella actual para la IA autónoma. Databricks publicó una investigación comparativa en julio que muestra que el arnés tiene un impacto dramático tanto en el rendimiento como en el costo. "Puede elegir el mismo modelo pero diferentes arneses, y obtendrá un costo significativamente mayor si usa el arnés incorrecto", dijo a TechCrunch el director ejecutivo de Databricks, Ali Ghodsi. "Eso en sí mismo puede duplicar su costo".

El Hallak formuló el argumento más amplio de Nvidia en términos de apertura. "Creemos que tener una pila de agentes abierta, donde se tiene control sobre todo el arnés, sobre la infraestructura, sobre el tiempo de ejecución, es lo que necesitamos para impulsar el ecosistema hacia adelante y de forma segura", afirmó. Nvidia tiene piezas de tecnología de arnés de tamaño abierto bajo su marca NeMo, y la investigación de AVO está documentada en un artículo sobre arXiv.

Un punto de referencia con historia

ARC-AGI-3 se ha convertido en un punto álgido en la rivalidad entre laboratorios fronterizos. OpenAI anteriormente obtuvo buenos resultados para su modelo GPT-5.6 Sol en el punto de referencia, lo que generó un escrutinio sobre la configuración de evaluación utilizada. El resultado de Nvidia elude ese debate en un sentido: no pretende ser un modelo más inteligente, sólo un agente mejor diseñado en torno a uno existente.

El mensaje para los desarrolladores y las empresas que crean productos agentes es directo: la selección del modelo sigue siendo importante, pero el diseño del sistema ahora decide si un modelo de frontera ofrece resultados de vanguardia. Como dice Nvidia, evaluar un modelo no es lo mismo que evaluar un agente, y las tablas de referencia de 2026 recompensan cada vez más a los ingenieros que construyen el andamiaje.

Manténgase por delante de la IA

Las arquitecturas de los agentes se están moviendo más rápido que nunca y la brecha entre un buen aprovechamiento y uno malo ahora se mide en puntos de referencia y en dólares reales. Siga AI Buzz Wire para obtener cobertura diaria, verificada en fuente, de investigaciones, evaluaciones comparativas y lanzamientos de productos de IA.

Leer más noticias sobre investigación de IA →