El laboratorio descentralizado de IA Prime Intellect ha publicado los resultados de un experimento a gran escala que prueba qué tan bien los modelos de IA de vanguardia de hoy pueden realizar investigaciones de aprendizaje automático autónomo, y los mejores de ellos estuvieron notablemente cerca de igualar el récord mundial humano en un célebre punto de referencia comunitario.

El proyecto, denominado NanoGPT Speedrun Frontier y publicado el 22 de agosto, consistió en 153 ejecuciones autónomas en 18 modelos de frontera que intentaban el speedrun del optimizador nanoGPT, una competencia en la que los investigadores buscan la forma más eficiente de entrenar un modelo de lenguaje pequeño con un objetivo de calidad fijo. La historia rápidamente subió a la portada de Hacker News, donde generó docenas de comentarios que debatían lo que dicen los resultados sobre la capacidad de la IA para realizar descubrimientos científicos genuinos. Para más contexto sobre esta historia, consulta nuestra actualidad de inteligencia artificial.

¿Qué es realmente el NanoGPT Speedrun?

El punto de referencia proviene del repositorio modded-nanogpt mantenido por Keller Jordan y una larga lista de contribuyentes de la comunidad. El desafío es engañosamente simple de plantear: utilizando 8 GPU NVIDIA H100, entrenar un modelo de lenguaje que alcance una pérdida de entropía cruzada de 3,28 en el conjunto de validación FineWeb (el nivel de rendimiento que alcanzó la replicación GPT-2 original de Andrej Karpathy después de 45 minutos) lo más rápido posible.

Gracias a cientos de contribuciones de la comunidad durante los últimos dos años, el récord humano se ha reducido a menos de 75 segundos y menos de 400 millones de tokens de entrenamiento, una mejora de más de 30 veces con respecto a la receta original. Las soluciones ganadoras se leen como un catálogo de ingeniería de aprendizaje automático moderna: el optimizador Muon, incrustaciones rotativas con QK-Norm, activaciones ReLU-cuadrado, cuantificación de atención FP8 y pases MLP, Flash Attention 3 con patrones de ventana deslizante y docenas de otras técnicas apiladas una encima de otra.

La prueba de Prime Intellect utilizó la pista optimizadora del punto de referencia, que, según la documentación del repositorio, minimiza la cantidad de pasos de entrenamiento necesarios para alcanzar la pérdida objetivo, sujeto a una arquitectura, un conjunto de datos y un tamaño de lote fijos, con un presupuesto de reloj de pared efectivamente ilimitado. Eso lo convierte en una prueba pura de descubrimiento de algoritmos en lugar de velocidad bruta del hardware.

Cómo funcionó el experimento

A cada uno de los 18 modelos se le asignó la tarea de forma autónoma: proponer cambios en la receta de entrenamiento, ejecutar experimentos, inspeccionar los resultados e iterar, con un script de verificación fijo y semillas aleatorias fijas que garantizan que una mejora supuesta sea real y no una ejecución afortunada. Como lo resumió un comentarista de Hacker News, se pidió a los modelos que investigaran cómo mejorar el entrenamiento de un modelo pequeño, probando cambios repetidamente, probándolos y usando los resultados para decidir qué probar a continuación.

Los modelos funcionaron a través de una variedad de arneses de agentes, incluidos claude-code, códice de OpenAI, kimi-code, grok-cli, qwen-code y el propio agente principal de Prime Intellect, y el equipo realizó un seguimiento del consumo de tokens de cada ejecución, el recuento de experimentos, las llamadas a herramientas y el tiempo transcurrido del agente. En total, el experimento consumió cientos de millones de tokens por modelo superior y miles de millones en toda la red.

La clasificación: Fable 5 lidera el grupo

El resultado principal: el modelo identificado como Fable 5, ejecutado a través del arnés del código Claude, cerró el 81,7 por ciento de la brecha entre la receta básica y el registro humano, con un mejor resultado validado de 2.726 en la métrica de la tabla de clasificación. Llegar allí requirió 8,7 días de tiempo acumulado del agente, aproximadamente 800 millones de tokens, 811 experimentos y alrededor de 3000 llamadas a herramientas.

El grupo perseguidor fue liderado por Opus 5, que cerró el 53,6 por ciento de la brecha, seguido de cerca por Kimi K3 con un 52,2 por ciento cuando fue impulsado por el arnés de agente principal de Prime Intellect (y un 45,8 por ciento a través del código kimi). Opus 4.8 logró el 39,4 por ciento, varias variantes de GPT-5.6 obtuvieron entre aproximadamente el 11 y el 36 por ciento, Sonnet 5 cerró el 26,8 por ciento y Grok 4.5 y Qwen3.8 Max alcanzaron cada uno alrededor del 24,6 por ciento.

Más abajo, DeepSeek V4 Pro cerró el 12,3 por ciento de la brecha, GPT-5.5 alcanzó el 8,1 por ciento y el antiguo Kimi K2.7 terminó con el 7,2 por ciento. En particular, un modelo lanzado recientemente, GLM 5.3, todavía estaba ejecutándose en el momento de la publicación sin ningún registro validado aún, un recordatorio de que el punto de referencia castiga a los modelos que no pueden validar de manera confiable sus propias mejoras.

Por qué es importante

Los puntos de referencia como este son importantes porque miden algo que las tablas de clasificación de codificación no pueden: la capacidad de ejecutar un ciclo de investigación genuino (hipótesis, experimento, análisis, revisión) durante días en lugar de minutos. Esa capacidad es la base del campo emergente de la investigación de la IA autónoma, en el que los agentes no tienen la tarea de escribir código según las especificaciones, sino de descubrir cosas que nadie les ha mostrado.

La dispersión de los resultados es en sí misma informativa. Casi todos los modelos del experimento encontraron las mismas ideas centrales ganadoras, según el informe del proyecto: lo que separó las mejores ejecuciones fue lo que deja un experimento: agentes más fuertes conservaron señales débiles en resultados ruidosos el tiempo suficiente para validarlos y comprendieron mejor sus propios datos experimentales.

Advertencias de la comunidad

Los comentaristas de Hacker News plantearon puntos metodológicos justos. Las configuraciones de esfuerzo y los arneses variaron según los modelos (Fable 5 se ejecutó con una configuración de razonamiento alta mientras que Opus 5 se ejecutó al máximo) y la aritmética de 153 ejecuciones en 18 modelos implica que algunos modelos recibieron más intentos que otros. Sigue siendo una cuestión abierta si la clasificación de un modelo refleja su capacidad de investigación en bruto o la calidad de su arnés.

Aún así, la dirección del viaje es clara. Mientras que las manos humanas más rápidas necesitaron años de esfuerzo colectivo para alcanzar el récord actual, los mejores agentes autónomos ahora están cerrando la mayor parte de esa brecha en poco más de una semana de tiempo de cómputo. La siguiente pregunta (si algún modelo puede cerrar el 18,3 por ciento restante) puede responderse antes de lo esperado.

Para obtener más información sobre los puntos de referencia y las investigaciones que dan forma a la frontera de la IA, siga la cobertura continua de AI Buzz Wire.

---

Mantente al Día con la IA

Las últimas noticias, análisis y avances de inteligencia artificial, en un solo lugar.

Leer más noticias de IA →