OpenAI a publié GPT-6.1 Sol le 29 septembre, retirant GPT-6 Sol sept jours seulement après les débuts de ce modèle, selon la société d'analyse comparative indépendante Artificial Analysis. L'échange a coïncidé avec la conférence des développeurs DevDay de la société, au cours de laquelle CNET a rapporté que les participants pouvaient commencer à utiliser GPT-6.1 Sol immédiatement aux côtés des agents Dots nouvellement lancés et d'un ensemble de modifications d'abonnement.
Un remplacement de produit phare à produit phare dans un délai de sept jours est inhabituel, même selon les normes accélérées de 2026, et les tests de référence suggèrent pourquoi OpenAI a évolué rapidement. Pour une couverture continue des lancements de modèles, des combats de référence et de la guerre des prix qui les sous-tend, AI Buzz Wire suit les développements importants au fur et à mesure qu'ils se produisent.
Un bond mesurable en sept jours
L'analyse artificielle rapporte que GPT-6.1 Sol gagne 4 points sur l'indice d'intelligence de l'entreprise par rapport à GPT-6 Sol et 5 points par rapport à GPT-5.6 Sol, atterrissant seulement 1 point en dessous de GPT-6 Astra, le modèle le plus performant d'OpenAI. L'évaluation de l'entreprise combine le raisonnement, le travail intellectuel, les mathématiques et les tâches agentiques en un seul score comparatif.
Les sous-scores montrent où se concentrent les gains. GPT-6.1 Sol a amélioré 4 points dans AA-Briefcase v1.1 et 5 points dans GDPval-AA v2.1, qui testent tous deux le travail des connaissances agentiques. Un bond de 12 points dans Terminal-Bench 4.0 indique des performances sensiblement meilleures dans les environnements de terminaux réels, tandis que Humanity's Last Exam a augmenté de 5 points et GDP.pdf a augmenté de 6.
Un chiffre se démarque pour quiconque utilise des modèles pour la recherche : la précision sur AA-Omniscience a grimpé de 8 points tandis que le taux d'hallucinations a chuté de 60 pour cent à 54 pour cent. Les deux chiffres restent élevés en termes absolus, mais la direction du déplacement est importante pour les flux de travail où une mauvaise réponse sûre est pire que pas de réponse.
Même prix, moins cher en pratique
En ce qui concerne les prix, GPT-6.1 Sol conserve la grille tarifaire de GPT-6 Sol de 2 $ par million de jetons d'entrée et de 10 $ par million de jetons de sortie, mais la remise en lecture du cache passe de 90 % à 95 %. Artificial Analysis note que le prix global de GPT-6.1 Sol pour les charges de travail agents est donc légèrement inférieur à celui de GPT-6 Sol, prolongeant ainsi une série de réductions de prix effectives qui ont commencé lorsque GPT-6 Sol a été lancé avec une réduction de 50 % par rapport à GPT-5.6 Sol.
La trajectoire des prix est la véritable histoire ici. En l’espace de deux versions, OpenAI a réduit à deux reprises environ de moitié le coût effectif de sa ligne frontière de milieu de gamme, tout en augmentant la qualité à chaque fois.
Coût par tâche : 0,72 $ contre 3,26 $
C’est dans le coût par tâche que l’écart avec GPT-6 Astra devient flagrant. À effort maximum, l'analyse artificielle fixe GPT-6.1 Sol à 0,72 $ par tâche d'indice d'intelligence, soit moins d'un quart des 3,26 $ de GPT-6 Astra. Par rapport à son propre prédécesseur, les économies sont de 31 % (1,05 $ pour GPT-6 Sol) et contre GPT-5.6 Sol, elles atteignent 64 % (1,99 $).
Selon l'entreprise, chaque niveau d'effort de GPT-6.1 Sol repousse la frontière de Pareto en matière de rentabilité, ce qui signifie que pour un niveau d'intelligence donné, aucune option moins chère n'existe parmi les modèles qu'elle suit. Le tableau de l'efficacité des jetons est plus mitigé : GPT-6.1 Sol consomme environ 10 à 30 % de jetons de sortie de plus que GPT-6 Sol à tous les niveaux d'effort, bien que ses paramètres d'effort faible et moyen restent optimaux pareto pour l'efficacité des jetons une fois que l'intelligence supérieure est prise en compte. En codage, le modèle a gagné 3 points par rapport à GPT-6 Sol à effort maximum sur l'indice des agents de codage de l'entreprise.
Pourquoi le délai d'exécution de sept jours est important
La liste plus large de DevDay renforce la même image. Le rapport de CNET a structuré la conférence autour de trois éléments que les développeurs pourraient utiliser immédiatement : GPT-6.1 Sol, les agents Dots et les plans d'abonnement retravaillés, plutôt que d'un aperçu de recherche à distance. Le message adressé aux développeurs était la disponibilité aujourd'hui, et non la possibilité demain.
Les cadences phares signalent brièvement que la contrainte concurrentielle est passée des cycles de formation au raffinement post-formation et au service des infrastructures. Une mise à niveau ponctuelle livrée en une semaine ressemble plus à un point de contrôle optimisé et à une nouvelle grille de prix qu'à un modèle de base partant de zéro, et ses concurrents se comportent de la même manière : Google a annoncé Gemini 4 Argon le 30 septembre, un modèle frontière qui atteint initialement les cyberdéfenseurs de confiance via son programme Fairwind au même taux de 2 $/10 $ par million de jetons.
Pour les développeurs, trois points pratiques découlent des chiffres vérifiés. Premièrement, les charges de travail agents avec une réutilisation importante du cache bénéficient immédiatement de la remise sur le cache de 95 %. Deuxièmement, les budgets devraient modéliser la consommation de jetons de production plus élevée avant de migrer, car le prix par jeton reste inchangé même si le modèle réfléchit plus longtemps. Troisièmement, Astra reste le plafond pour les tâches pour lesquelles le dernier point d'intelligence vaut un coût 4 fois supérieur – le cas de GPT-6.1 Sol est que pour la plupart des travaux, ce n'est pas le cas.
La mise en garde mérite d'être répétée : ces chiffres proviennent d'un seul évaluateur indépendant, quelle que soit la rigueur de sa méthodologie, et les scores de l'indice récompensent des combinaisons de charges de travail spécifiques. Les équipes ayant des charges de travail exigeantes doivent réexécuter leurs propres évaluations avant de réacheminer le trafic de production.
---
Gardez une longueur d'avance sur l'IARecevez les dernières actualités, analyses et avancées en matière d'IA, le tout en un seul endroit.
Lire plus d'actualités sur l'IA →