GPT-6 Astra d'OpenAI a publié des résultats de pointe sur ARC-AGI-3, la référence de raisonnement abstrait conçue pour mesurer l'intelligence agentique, selon les résultats publiés mercredi par la Fondation ARC Prize. Le modèle a obtenu un score de 62,7 % sur l'ensemble semi-privé du benchmark sous le harnais standard de la fondation, et de 99,9 % lorsqu'il est évalué avec un harnais d'adaptateur de fournisseur qui préserve l'état de raisonnement interne du modèle entre les requêtes.

Les résultats sont arrivés un jour après qu'OpenAI a commencé le déploiement par étapes d'Astra, le modèle phare que la société a présenté comme le début d'une nouvelle ère. Pour les lecteurs qui tentent de garder leurs scores alors que le benchmark commercial des laboratoires frontaliers explose, la page derniers développements de l'IA suit chaque version majeure au fur et à mesure qu'elle se produit.

Deux harnais, deux partitions très différentes

L'écart entre les deux chiffres principaux d'Astra est le détail le plus important du rapport. Le Prix ARC évalue les agents sous différents harnais, et chacun modifie ce que le modèle est autorisé à faire avec son propre contexte.

Sous le harnais Standard, un modèle peut reporter les notes qu'il choisit de conserver lorsqu'il travaille dans un environnement. Avec cette configuration, Astra, avec un effort de raisonnement maximal, a obtenu un score de 62,7 %, pour un coût total de 26 098 $ pour l'évaluation. À l’opposé, l’utilisation du même harnais avec le raisonnement désactivé n’a produit que 35,2 % tout en coûtant plus – 49 791 $ – car le modèle avait besoin de beaucoup plus d’actions pour progresser.

Le harnais Provider Adapter est plus généreux : il préserve l'état de raisonnement opaque du modèle entre les requêtes et utilise le compactage pour les conversations plus longues, permettant à Astra de réutiliser le travail antérieur. Sous cet exploit, Astra a obtenu un score de 99,9 % à un effort de raisonnement élevé pour 18 817 $ et 98,6 % à un effort maximum pour 17 332 $. Même le paramètre de raisonnement le plus bas atteint 96,7 %.

En d’autres termes, la différence entre un score partiel et un score presque parfait ne réside pas uniquement dans la capacité brute : il s’agit également de la quantité d’état de fonctionnement du modèle qui survit entre les étapes.

Battre les humains sur l'efficacité de l'action

ARC-AGI-3 est construit autour d'environnements de jeu nouveaux, abstraits et au tour par tour. Les agents doivent explorer sans instructions, déduire comment le monde fonctionne, identifier des objectifs à partir de rares récompenses et planifier des actions en plusieurs étapes. Les environnements sont calibrés de manière à ce que les humains puissent en résoudre 100 %, ce qui fait de la performance humaine la référence en matière de mesures de référence.

Astra n'a pas seulement résolu la plupart des niveaux, il les a résolus efficacement. Selon le prix ARC, le modèle a utilisé moins d'actions que l'humain médian testé sur 96 % des niveaux, dépassant la référence humaine en termes d'efficacité des actions sur l'ensemble de l'ensemble.

Les aspects économiques de la comparaison sont frappants. Les participants au test humain étaient payés 115 $ par session de 90 minutes plus 5 $ par partie terminée, soit environ 12,78 $ par partie tentée. Une évaluation complète d’Astra coûte cinq chiffres, selon la configuration. Mais ARC Prize a noté un problème contre-intuitif : un effort de raisonnement plus élevé coûte généralement moins cher, car Astra résout les jeux en moins d'actions, réduisant ainsi le nombre total d'appels de modèles et de jetons brûlés par exécution.

Un modèle qui construit son propre langage

Au-delà des scores, le Prix ARC a mis en avant un comportement qualitatif observé par l'équipe. Astra a systématiquement transformé des environnements inconnus en modèles de monde symboliques compacts, représentant les mécanismes de jeu comme des règles logiques et développant son propre raccourci spécifique au domaine pour suivre l'état et planifier les actions.

C’est précisément la compétence pour laquelle ARC-AGI-3 a été conçu. Alors que les générations précédentes du benchmark testaient un raisonnement fluide sur de nouveaux modèles, la troisième génération teste si un agent peut explorer, modéliser, fixer des objectifs et exécuter des plans dans des environnements qu'il n'a jamais vus - les composants répertoriés par le prix ARC comme l'exploration, la modélisation, la définition d'objectifs, ainsi que la planification et l'exécution.

La toile de fond de l'ère AGI

Les résultats du benchmark sont arrivés au milieu d’une rhétorique maximale de la part d’OpenAI lui-même. Lors d'un point de presse avant le lancement de jeudi, le président de la société, Greg Brockman, a déclaré qu'il n'était "pas déraisonnable de penser que nous sommes maintenant dans l'ère AGI", sans toutefois faire de déclaration officielle, selon la couverture du lancement par The New Stack. Il a décrit l'AGI comme un « concept de mission ou un concept spirituel » plutôt que comme un déclencheur contractuel.

Aidan Clark, chercheur chez OpenAI, a déclaré qu'Astra était le plus grand programme de formation de l'entreprise à ce jour - le premier pré-entraîné sur plus de 100 000 GPU sur le site de Stargate au Texas - et la première version d'OpenAI dans laquelle les modèles précédents jouaient un rôle important dans la supervision du processus de formation. L'accès reste par étapes : le déploiement commence avec les clients entreprises du programme Daybreak, avec une disponibilité Plus, Pro, Business et Enterprise ainsi qu'un accès API et AWS promis dans les prochains jours.

L'astérisque sur la partition

La prudence s’impose sur plusieurs fronts. Les performances ARC-AGI-3 d'Astra dépendent fortement de la configuration du faisceau, comme le montrent les deux chiffres principaux, et les faisceaux personnalisés qui préservent l'état du modèle ont été un point de discorde récurrent dans les litiges de référence. L'analyse du lancement par New Stack a noté qu'Astra « enregistre de gros gains sur les tâches spécialisées, mais cela coûte cher et ne mène pas clairement le peloton de codage » – un rappel que les tests de puzzle agentiques et les charges de travail commerciales quotidiennes mesurent des choses différentes.

Le Prix ARC lui-même définit l'exercice comme une mesure de « l'écart résiduel » entre l'IA actuelle et l'AGI, définissant l'AGI comme la capacité d'acquérir n'importe quelle compétence qu'un humain peut, aussi efficacement qu'un humain. Un score presque parfait dans des conditions favorables ne suffit pas à combler cet écart. Et entre 17 000 et 50 000 dollars par évaluation, seuls les laboratoires disposant de ressources suffisantes peuvent se permettre d'exécuter le test de référence à cette échelle - bien que les données de coût de l'ARC Prize montrent qu'un raisonnement plus intelligent peut en réalité réduire la facture.

Pourquoi c'est important

L’efficacité de l’action est un véritable nouvel axe de comparaison. Un modèle qui résout tous les niveaux mais gaspille des milliers d’appels est moins utile – et plus coûteux – qu’un modèle qui agit comme Astra l’a fait ici : explorer délibérément, compresser ce qu’il apprend et agir en conséquence. Quelle que soit la conclusion sur le débat AGI, les données du Prix ARC montrent que les agents frontaliers rivalisent désormais avec les humains non seulement sur la question de savoir s'ils peuvent résoudre de nouveaux problèmes, mais aussi sur la manière dont ils les résolvent de manière économique.

Gardez une longueur d'avance sur l'IA

Chaque résultat de référence, lancement de modèle et débat sur la sécurité, suivi au fur et à mesure — lire plus d'actualités sur l'IA →