OpenAI a baissé les prix de l'API sur deux de ses trois modèles GPT-5.6 le 30 juillet 2026, réduisant ainsi le niveau le moins cher de 80 % à peine trois semaines après que la famille ait atteint la disponibilité générale. Cette décision montre à quel point le principal fabricant de modèles se livre une concurrence agressive pour des charges de travail à volume élevé et sensibles aux coûts – et à quel point ses clients comptent désormais chaque jeton. Pour en savoir plus sur le changement plus large dans l’économie de l’IA, suivez nos derniers développements en matière d’IA.

Ce qui a changé

Selon la grille tarifaire publiée par OpenAI et le journal des modifications de l'API, les prix standard par million de jetons sont désormais les suivants :

  • GPT-5.6 Luna : 20 centimes d'entrée et 1,20 $ de sortie, contre 1 $ et 6 $ – une réduction de 80 %
  • GPT-5.6 Terra : 2 $ et 12 $, contre 2,50 $ et 15 $ – une réduction de 20 %
  • GPT-5.6 Sol (le produit phare) : 5 $ et 30 $, inchangés

Les trois niveaux ont été lancés en disponibilité générale le 9 juillet 2026 aux tarifs les plus élevés, ce qui place le retarification à seulement 21 jours de la vie commerciale de la famille. Reuters et CNBC ont tous deux confirmé les réductions, et Axios a indiqué que la réduction la plus importante concernait le modèle Luna.

Les réductions s'appliquent à tous les niveaux de service

Les réductions ne se limitent pas aux prix affichés. Ils couvrent toutes les options de la grille tarifaire :

  • Les Traitements par lots et Flex, tous deux moitié moins chers, placent Luna à 10 cents en entrée et à 60 cents en sortie par million de jetons.
  • Les lectures d'entrée en cache, avec une réduction de 90 %, tombent à deux cents par million de jetons sur Luna et à 20 cents sur Terra.
  • Les requêtes à contexte long, facturées au double du tarif d'entrée et 1,5 fois le débit, atterrissent à 40 cents et 1,80 $ pour Luna.

Pour les équipes qui acheminent déjà la classification groupée, l'extraction ou les longues boucles d'agents via les niveaux les moins chers, les mêmes appels coûtent désormais une fraction de ce qu'ils faisaient un jour plus tôt.

Comment les coupes se comparent à Anthropic

À 20 cents d'entrée et 1,20 $ de sortie, Luna est désormais inférieur au modèle publié le moins cher d'Anthropic, Haiku 4.5, d'environ cinq fois en entrée et quatre fois en sortie, selon la page de tarification d'Anthropic. Le nouveau tarif de Terra se situe en dessous des 3 $ et 15 $ que Claude Sonnet 5 devrait facturer une fois son prix de lancement expiré le 31 août 2026.

En haut des deux gammes, Sol coûte toujours plus cher en sortie que l'Opus 5 d'Anthropic, dont le prix est de 5 $ et 25 $.

Le traitement prioritaire passe en mode rapide

La même entrée du journal des modifications a supprimé le « Traitement prioritaire » et l'a remplacé par « Mode rapide ». Pour le modèle phare Sol, OpenAI indique que le mode rapide fonctionne jusqu'à 2,5 fois la vitesse standard pour deux fois le prix, et que le commutateur est rétrocompatible – les demandes sont déjà marquées pour un itinéraire prioritaire vers le mode rapide sans changement de code.

Les tarifs du mode rapide sont de 10 $ et 60 $ pour Sol, de 4 $ et 24 $ pour Terra, et de 40 cents et 2,40 $ pour Luna. Notamment, Anthropic vend le même produit sous le même nom et dans les mêmes conditions, et les deux grilles tarifaires convergent désormais également vers l'inférence régionale : OpenAI facture une majoration de 10 % sur les modèles publiés à compter du 5 mars 2026 lorsqu'un client a besoin de la résidence des données, tandis qu'Anthropic facture l'inférence uniquement aux États-Unis à 1,1 fois son tarif standard.

Pourquoi les niveaux les moins chers sont devenus moins chers

Un jour avant la coupure, OpenAI a publié un article d'ingénierie décrivant les optimisations de sa pile d'inférence. Cinq membres du personnel technique de l'entreprise ont écrit que Sol, exécuté dans son outil de codage Codex, avait réécrit les noyaux de GPU de production – un travail qui, selon OpenAI, réduisait les coûts de service de bout en bout de 20 %. Le modèle a également repensé son propre projet de modèle de décodage spéculatif à travers des centaines d'expériences, un changement reconnu pour avoir augmenté l'efficacité de la génération de jetons de plus de 15 %.

Ce sont les propres chiffres d'OpenAI pour sa propre pile, mais ils pointent vers le même centre de coûts que les adresses de réduction de prix : le groupe d'agents derrière Codex et ChatGPT. OpenAI limite la sortie de l'outil à 10 000 jetons par défaut et conserve l'historique visible du modèle en ajout uniquement, de sorte qu'une boucle d'agent qui renvoie ses instructions à chaque étape atteint le cache d'invite au lieu de payer l'intégralité des taux d'entrée. La société a clôturé le message en s'engageant à transmettre « des améliorations sous le capot à nos utilisateurs sous la forme d'informations plus largement disponibles et plus rentables ». La grille tarifaire a suivi un jour plus tard.

Partenaires cloud et facturation

OpenAI a noté que les acheteurs acheminant le trafic via Amazon Bedrock sont facturés par AWS et que ces tarifs peuvent différer de ceux de sa propre carte publiée. À mesure que de plus en plus d'entreprises centralisent l'accès aux modèles via un seul fournisseur de cloud, l'écart entre la tarification directe d'OpenAI et ce que les clients paient réellement via des intermédiaires importera autant que les chiffres eux-mêmes.

Un marché qui compte chaque jeton

Les réductions surviennent alors que les acheteurs d’entreprise vérifient les dépenses d’inférence plus étroitement que jamais. Plus tôt dans la semaine, des reportages ont montré comment l'ère du « tokenmaxxing » effréné – augmenter le volume sans surveiller les coûts – s'estompe à mesure que les factures d'IA des entreprises augmentent sur les principales plates-formes. La décision d'OpenAI de répercuter ses économies de coûts internes sur les clients, plutôt que d'encaisser la marge, est un signal clair de l'endroit où elle pense que la bataille concurrentielle se déroule désormais : non pas à la frontière, où Sol impose toujours des prix plus élevés, mais sur les niveaux bon marché et à volume élevé où se trouve réellement la majeure partie du trafic de production.

Le prix de Sol étant inchangé, la décision en direct pour les développeurs reste exactement là où OpenAI l'a placée depuis le lancement de la famille : quel niveau nécessite chaque demande. La différence est que le coût d’une mauvaise décision a considérablement diminué.

---

Gardez une longueur d'avance sur l'IA

Recevez les dernières actualités, analyses et avancées en matière d'IA, le tout en un seul endroit.

Lire plus d'actualités sur l'IA →