Le laboratoire d'IA décentralisé Prime Intellect a publié les résultats d'une expérience à grande échelle testant dans quelle mesure les modèles d'IA de pointe actuels peuvent effectuer des recherches autonomes sur l'apprentissage automatique - et les meilleurs d'entre eux se sont remarquablement rapprochés du record mondial humain sur un célèbre benchmark communautaire.
Le projet, baptisé NanoGPT Speedrun Frontier et publié le 22 août, consistait en 153 exécutions autonomes sur 18 modèles frontières tentant le speedrun de l'optimiseur nanoGPT – un concours dans lequel les chercheurs recherchent le moyen le plus efficace de former un petit modèle de langage à un objectif de qualité fixe. L'histoire a rapidement fait la une de Hacker News, où elle a suscité des dizaines de commentaires débattant de ce que disent les résultats sur la capacité de l'IA à de véritables découvertes scientifiques. Pour plus de contexte sur cette histoire, consultez notre actualités IA.
Qu'est-ce que le NanoGPT Speedrun ?
Le benchmark provient du référentiel modded-nanogpt maintenu par Keller Jordan et d'une longue liste de contributeurs de la communauté. Le défi est d'une simplicité trompeuse à énoncer : à l'aide de 8 GPU NVIDIA H100, entraînez un modèle de langage qui atteint une perte d'entropie croisée de 3,28 sur l'ensemble de validation FineWeb - le niveau de performance atteint par la réplication GPT-2 originale d'Andrej Karpathy après 45 minutes - le plus rapidement possible.
Grâce à des centaines de contributions communautaires au cours des deux dernières années, le record humain a été réduit à moins de 75 secondes et à moins de 400 millions de jetons d'entraînement, soit une amélioration de plus de 30 fois supérieure à la recette originale. Les solutions gagnantes se lisent comme un catalogue d'ingénierie ML moderne : l'optimiseur Muon, les intégrations rotatives avec QK-Norm, les activations ReLU-squared, la quantification FP8 sur l'attention et les passes MLP, Flash Attention 3 avec des modèles de fenêtres coulissantes et des dizaines d'autres techniques empilées les unes sur les autres.
Le test de Prime Intellect a utilisé la piste d'optimisation du benchmark qui, selon la documentation du référentiel, minimise le nombre d'étapes de formation nécessaires pour atteindre la perte cible, sous réserve d'une architecture, d'un ensemble de données et d'une taille de lot fixes, avec un budget d'horloge murale effectivement illimité. Cela en fait un pur test de découverte d’algorithmes plutôt que de vitesse brute du matériel.
Comment l'expérience a fonctionné
Chacun des 18 modèles s'est vu confier la tâche de manière autonome : proposer des modifications à la recette de formation, exécuter des expériences, inspecter les résultats et itérer - avec un script de vérification fixe et des graines aléatoires fixes garantissant qu'une amélioration revendiquée est réelle plutôt qu'une chance. Comme l'a résumé un commentateur de Hacker News, les modèles ont été invités à rechercher comment améliorer la formation d'un petit modèle, en essayant à plusieurs reprises des modifications, en les testant et en utilisant les résultats pour décider quoi essayer ensuite.
Les modèles ont fonctionné via une variété de harnais d'agents - y compris Claude-code, le codex d'OpenAI, kimi-code, grok-cli, qwen-code et le propre agent principal de Prime Intellect - et l'équipe a suivi la consommation de jetons de chaque exécution, le nombre d'expériences, les appels d'outils et le temps écoulé de l'agent. Au total, l’expérience a consommé des centaines de millions de jetons par modèle haut de gamme et des milliards sur l’ensemble du réseau.
Le classement : Fable 5 en tête du peloton
Le résultat principal : le modèle identifié comme Fable 5, exécuté via le harnais du code Claude, a comblé 81,7 % de l'écart entre la recette de base et le record humain, avec un meilleur résultat validé de 2 726 sur la métrique du classement. Pour y parvenir, il a fallu 8,7 jours de temps cumulé aux agents, environ 800 millions de jetons, 811 expériences et environ 3 000 appels d’outils.
Le peloton de chasse était mené par Opus 5, qui a réduit l'écart à 53,6 pour cent, suivi de près par Kimi K3 à 52,2 pour cent lorsqu'il était piloté par le harnais d'agent principal de Prime Intellect (et 45,8 pour cent via kimi-code). Opus 4.8 a réussi 39,4 pour cent, plusieurs variantes GPT-5.6 ont atterri entre environ 11 et 36 pour cent, Sonnet 5 a clôturé 26,8 pour cent et Grok 4.5 et Qwen3.8 Max ont chacun atteint environ 24,6 pour cent.
Plus bas, DeepSeek V4 Pro a réduit l'écart de 12,3 pour cent, GPT-5.5 a atteint 8,1 pour cent et l'ancien Kimi K2.7 a terminé à 7,2 pour cent. Notamment, un modèle récemment publié – GLM 5.3 – était toujours en cours d'exécution au moment de la publication sans aucun enregistrement validé, rappelant que le benchmark punit les modèles qui ne peuvent pas valider de manière fiable leurs propres améliorations.
Pourquoi c'est important
Les benchmarks sont importants car ils mesurent quelque chose que les classements de codage ne peuvent pas mesurer : la capacité à exécuter une véritable boucle de recherche - hypothèse, expérience, analyse, révision - sur plusieurs jours plutôt que quelques minutes. Cette capacité constitue le fondement du domaine émergent de la recherche sur l’IA autonome, dans laquelle les agents ne sont pas chargés d’écrire du code conforme aux spécifications, mais de découvrir des choses que personne ne leur a montrées.
La répartition des résultats est elle-même informative. Selon le texte du projet, presque tous les modèles de l'expérience ont trouvé les mêmes idées principales gagnantes : ce qui séparait les meilleures expériences était ce qu'une expérience laissait derrière elle : des agents plus puissants préservaient les signaux faibles dans les résultats bruyants suffisamment longtemps pour les valider et comprenaient mieux leurs propres données expérimentales.
Mises en garde de la communauté
Les commentateurs de Hacker News ont soulevé des points méthodologiques justes. Les paramètres d'effort et les harnais variaient selon les modèles – Fable 5 fonctionnait avec un paramètre de raisonnement élevé tandis qu'Opus 5 fonctionnait au maximum – et l'arithmétique de 153 exécutions sur 18 modèles implique que certains modèles ont reçu plus de tentatives que d'autres. La question de savoir si le classement d'un modèle reflète sa capacité de recherche brute ou la qualité de son harnais reste ouverte.
Pourtant, la direction du voyage est claire. Alors que les mains humaines les plus rapides ont mis des années d'efforts collectifs pour atteindre le record actuel, les meilleurs agents autonomes comblent désormais la majeure partie de cet écart en un peu plus d'une semaine de temps de calcul. La question suivante – savoir si un modèle peut clôturer les 18,3 pour cent restants – pourrait recevoir une réponse plus tôt que prévu.
Pour en savoir plus sur les références et les recherches qui façonnent les frontières de l'IA, suivez la couverture continue d'AI Buzz Wire.
---
Restez à la Pointe de l'IALes dernières actualités, analyses et percées en IA — au même endroit.
Lire plus d'actualités IA →