La société d'analyse comparative Artificial Analysis a publié la version 4.2 de son Intelligence Index le 4 septembre 2026, une mise à jour intermédiaire qui retravaille la façon dont les modèles d'IA frontières sont mesurés - et, selon le nouveau classement, Claude Fable 5.1 d'Anthropic occupe la première place, avec GPT-6 Astra d'OpenAI en deuxième place après un gain de quatre points sur GPT-5.6 Sol.

La mise à jour intervient huit mois seulement après le lancement d'Index v4 en janvier, un délai d'exécution inhabituellement rapide que l'entreprise attribue au rythme des récentes versions frontalières. "La frontière ayant évolué si rapidement ces dernières semaines, nous pensons qu'il est important de fournir une mise à jour intermédiaire immédiate pour garantir que notre indice reste aussi pertinent et utile que jamais", a écrit la société dans son communiqué.

Le classement des titres

Selon les résultats publiés, Claude Fable 5.1 d'Anthropic est en tête de l'indice, suivi de GPT-6 Astra d'OpenAI, qui a amélioré de quatre points par rapport à GPT-5.6 Sol. Meta se classe au troisième rang des laboratoires les plus performants du classement, suivi de SpaceXAI, Moonshot/Kimi, Z.AI et Google.

Anthropic et OpenAI partagent également le tableau actualisé de la rentabilité : les deux sociétés, avec Meta et Z.AI, occupent la frontière de Pareto du « coût par tâche » de l'indice, ce qui signifie qu'aucun autre laboratoire n'offre actuellement une intelligence strictement meilleure pour le même prix par tâche terminée.

En ce qui concerne l'efficacité des jetons, Artificial Analysis a trouvé GPT-6 Astra "plus efficace que presque tous les autres modèles proches de la frontière de l'intelligence", avec Claude Fable 5.1, Grok 4.5 et Gemini 3.5 Flash-Lite à chaque extrémité de la courbe. La société a toutefois noté dans une analyse complémentaire que l'utilisation moindre des jetons d'Astra est compensée par ses prix plus élevés – un rappel que l'efficacité brute et le coût total n'évoluent pas toujours de pair.

Ce qui a changé dans la v4.2

Le changement structurel le plus important est une poussée délibérée contre les jeux de référence. Quarante pour cent de la pondération de l'indice provient désormais d'ensembles de tests privés, soit le double de la part de la version 4.1, notamment AA-Briefcase, AA-Omniscience et des solutions pour CritPt. La société a déclaré que ce chiffre augmenterait encore dans l’indice v5.

Deux nouvelles évaluations ancrent la mise à jour :

  • AA-Briefcase, un benchmark interne de travail de connaissances agentiques avec un ensemble de tests privés. Les modèles sont évalués sur des projets professionnels de plusieurs semaines, chacun comportant de nombreuses tâches liées et des milliers de fichiers sources d'entrée, et notés grâce à une combinaison de notation par rubriques et de comparaison par paires couvrant la réussite vérifiable des tâches, la qualité analytique et la qualité de la présentation.
  • GDP.pdf, créé par Surge AI, qui teste le raisonnement en un seul tour sur des documents professionnels : 100 PDF couvrant dix domaines, avec des preuves réparties sur 4 592 pages de texte, tableaux, graphiques et notes de bas de page. Les réponses sont évaluées en fonction de 1 275 critères atomiques rédigés par des experts, et le titre All-pass Rate ne crédite une tâche que lorsque chaque critère est satisfait.

Une référence de longue date est en voie de disparition : le GPQA Diamond, le test de raisonnement scientifique de niveau universitaire, a été supprimé car il a été effectivement saturé par des modèles frontières.

La société a également mis à niveau son infrastructure de notation, en publiant AA-LCR v1.1 avec une nouvelle invite de système de notation et des corrigés corrigés, en réancrant l'échelle Elo pour GDPval-AA v2 et AA-Briefcase afin que les notations restent stables à mesure que de nouveaux modèles arrivent, et en renforçant les bacs à sable de notation de SciCode afin qu'un code lent mais correct ne compte plus comme un échec.

Ce que révèlent les nouveaux tests

Les résultats des nouvelles évaluations offrent une image plus précise de la situation réelle des laboratoires frontières.

Sur AA-Briefcase, Claude Fable 5.1 et Opus 5 d'Anthropic sont en tête, suivis par GPT-6 Astra d'OpenAI et Muse Spark 1.3 de Meta. GPT-6 Astra obtient environ 85 points Elo au-dessus de GPT-5.6 Sol sur la même évaluation – un saut substantiel entre les générations OpenAI successives.

Sur GDP.pdf, le tableau s'inverse : OpenAI est en tête avec GPT-6 Astra à 33,2 % de taux de réussite, suivi de GPT-5.6 Sol à 28,2 % et Claude Fable 5.1 à 26,2 %. La divergence suggère que la synthèse de documents longs sur de très grands contextes reste une force relative pour le nouveau modèle d'OpenAI, même si les modèles d'Anthropic dirigent l'ensemble des tâches d'indexation et de travail agent.

Pourquoi les ensembles de tests privés sont importants

L’évolution vers une évaluation retenue reflète un problème de crédibilité plus large dans l’analyse comparative de l’IA. À mesure que les modèles absorbent davantage de données de tests publics, les laboratoires et les observateurs indépendants s’inquiètent de plus en plus du fait que les scores globaux sur des critères de référence bien connus reflètent la mémorisation ou une formation ciblée plutôt que de véritables capacités. En gardant une part croissante de ses ensembles de tests privés et en leur accordant une pondération plus importante, Artificial Analysis tente de préserver le signal que les classements publics ont perdu.

La société a déclaré qu'elle construisait des éléments de l'Index v5 "depuis des mois" et qu'elle avait délibérément retenu les mises à jour pour maintenir la stabilité de l'Indice lors de la récente vague de lancements de modèles majeurs. Au-delà de la version intermédiaire v4.2, il prévoit d'autres mises à jour incrémentielles dans un avenir proche à mesure qu'il achève la transition vers la v5.

Pour les acheteurs qui choisissent entre des modèles frontières, le point pratique de la v4.2 est que le sommet du marché reste une course à deux chevaux entre Anthropic et OpenAI, Meta comblant l'écart – et que les évaluations conçues pour résister aux jeux font désormais davantage le travail de classement. Les utilisateurs qui suivent les décisions de sélection de modèles peuvent suivre les derniers développements de l'IA à l'approche du déploiement de la v5.

Gardez une longueur d'avance sur l'IA

Les mises à jour de référence comme celle-ci remodèlent la façon dont l’industrie juge les progrès. Lire plus d'actualités sur l'IA et gardez une longueur d'avance sur chaque sortie de modèle.

Lire plus d'actualités sur l'IA →