OpenAI recule après que Claude Opus 5 d'Anthropic ait dominé le benchmark ARC-AGI-3, publiant des résultats qui montrent que son propre modèle GPT-5.6 Sol atteint 38,3 % – à condition que vous utilisiez les paramètres préférés d'OpenAI plutôt que le harnais de test officiel.

Le différend, qui a eu lieu le 30 juillet 2026, touche au cœur d’un problème croissant dans l’évaluation de l’IA : les benchmarks ne mesurent plus seulement un modèle, mais l’ensemble de l’échafaudage technique qui l’entoure. Pour une analyse plus approfondie des derniers développements de l'IA et des versions de modèles, AI Buzz Wire suit l'histoire.

Les chiffres et le piège

OpenAI a rapporté que GPT-5.6 Sol atteint 38,3 % sur ARC-AGI-3, dépassant Claude Opus 5 d'Anthropic, qui a obtenu 30,2 % après avoir quadruplé le record de référence. La mise en garde est importante : ce chiffre de 38,3 % dépend de deux fonctionnalités spécifiques de l'API Responses d'OpenAI.

Le premier est le Retained Reasoning, qui préserve la chaîne de pensée du modèle entre les étapes plutôt que de la supprimer après chaque action. Le second est Compaction, qui résume le contexte plus ancien au lieu de le tronquer, permettant au modèle de continuer à travailler sur de longs problèmes sans perdre le raisonnement antérieur.

En parcourant le harnais standardisé officiel d'ARC Prize – qui évite intentionnellement les paramètres spécifiques au fournisseur pour garantir des comparaisons de pommes à pommes – GPT-5.6 Sol n'a réussi que 7,8 pour cent. La raison, selon OpenAI, est que la configuration officielle rejette le raisonnement du modèle après chaque étape, réduisant ainsi les performances sur les tâches qui nécessitent une réflexion soutenue en plusieurs étapes.

Une référence conçue pour la pureté

ARC-AGI-3 a été conçu par François Chollet et l'équipe du Prix ARC pour sonder la capacité d'un modèle à résoudre de nouvelles énigmes de raisonnement qu'il n'a jamais vues auparavant – un test d'intelligence générale plutôt que de connaissances mémorisées. Pour que les comparaisons soient équitables, le harnais officiel supprime délibérément les fonctionnalités spécifiques au fournisseur, mesurant la capacité brute du modèle dans un environnement neutre.

Le contre-argument d’OpenAI est que cette neutralité peut devenir un handicap. La société affirme que l'exploit officiel reposait sur une ancienne "API de complétion de style OpenAI" qui manquait des capacités que l'API Claude offrait déjà, ce qui mettait effectivement OpenAI dans une situation désavantageuse structurelle par rapport à Anthropic dans la comparaison originale.

En substance, OpenAI dit : vous avez mesuré notre modèle avec une main attachée dans le dos.

Réponse de Cholet

François Chollet, co-fondateur du Prix ARC, a répondu en traçant une ligne claire entre deux types de configurations de test. Les harnais « faits sur mesure pour résoudre le benchmark ou contenant des connaissances sur le format du benchmark » sont interdits, a-t-il déclaré. Mais les paramètres d'API à usage général « qui n'ont pas été développés pour ARC-AGI-3 et qui sont disponibles pour tous les utilisateurs d'API » sont un jeu équitable.

En effet, Chollet a admis que le score GPT-5.6 Sol du Prix ARC désavantageait OpenAI. Il a noté que l'organisation avait eu « de nombreux échanges avec OpenAI sur la meilleure façon de tester leurs modèles, notamment en ce qui concerne le compactage », et s'est félicité que l'entreprise « commence à trouver la réponse ».

Chollet a signalé une préoccupation restante. Différents fournisseurs utilisant des paramètres différents créent ce qu'il appelle « un problème potentiel de parité » – mais il considère que cela est acceptable « à condition que les paramètres et le coût soient clairement indiqués ».

Pourquoi c'est important au-delà du classement

L’épisode souligne une tension qui remodèle la façon dont l’industrie de l’IA évalue les progrès. Alors que les modèles sont de plus en plus déployés via des API riches en fonctionnalités plutôt que sous forme de systèmes autonomes, la frontière entre la capacité inhérente d'un modèle et l'ingénierie qui l'entoure continue de s'estomper. Un benchmark qui ignore les échafaudages peut sous-estimer les performances réelles ; celui qui l’accepte peut récompenser les entreprises qui ont réussi le test.

Il est peu probable que le débat ARC-AGI-3 soit le dernier. À mesure que les modèles frontières se regroupent au sommet des références établies, les désaccords sur ce qui compte comme une mesure équitable – et sur la manière dont l’instrument doit établir la norme – ne feront que s’intensifier.

Gardez une longueur d'avance sur l'IA

Vous souhaitez suivre les dernières actualités de l'IA sur les modèles, les benchmarks et les laboratoires qui les construisent ? AI Buzz Wire a ce qu'il vous faut.

Lire plus d'actualités sur l'IA