OpenAI a discrètement réduit la fenêtre de contexte de travail pour son agent de codage Codex et la famille de modèles GPT-5.6 sous-jacente, réduisant la limite utilisable d'environ 372 000 jetons à 272 000 jetons. Le changement, apparu via une pull request fusionnée sur le référentiel Codex open source de l'entreprise, a suscité de vives réactions de la part des développeurs qui s'appuient sur de vastes contextes pour analyser des bases de code entières en un seul passage.

Cet ajustement reflète une tension familière dans le secteur de l’IA, où les entreprises équilibrent le coût de l’inférence à contexte long par rapport à la commodité qu’elle offre aux utilisateurs. Pour la dernière Couverture de l'industrie de l'IA, cette décision souligne à quel point même de petites modifications apportées aux métadonnées du modèle peuvent se répercuter sur des millions de flux de travail de développement.

Qu'est-ce qui a changé et où cela a été repéré

La réduction est devenue visible dans le fichier de métadonnées de modèle intégré du référentiel Codex, `codex-rs/models-manager/models.json`. Une pull request intitulée « Backport actualiser les métadonnées du modèle groupé vers 0,144 », rédigée par l'ingénieur OpenAI sayan-oai et fusionnée le 18 juillet 2026, a actualisé les métadonnées que les clients stables du Codex utilisent pour comprendre les capacités de chaque modèle.

Le fichier actuel affiche une valeur « context_window » de 272 000 jetons dans la gamme GPT-5.6, y compris les variantes GPT-5.6-Sol, GPT-5.6-Terra et GPT-5.6-Luna, ainsi que les anciennes entrées GPT-5.5 et GPT-5.2. Selon une discussion sur Hacker News, où le changement a suscité plus de 350 votes positifs, la limite de travail antérieure s'élevait à environ 372 000 jetons. Certains modèles conservent un « max_context_window » plus élevé, pouvant aller jusqu'à un million de jetons, mais la fenêtre par défaut que les clients demandent réellement se limite désormais à 272 000.

Cette distinction est importante. La fenêtre contextuelle maximale représente ce que le modèle pourrait théoriquement accepter, tandis que la « fenêtre_contexte » de travail est ce que le client Codex est configuré pour envoyer par défaut. En pratique, cela signifie que les développeurs qui fournissaient auparavant à l'agent des centaines de milliers de jetons de code source atteindront désormais le plafond plus tôt.

Pourquoi la longueur du contexte est importante pour les agents de codage

Pour un agent de codage comme Codex, la fenêtre contextuelle n'est pas une métrique vaniteuse. Il détermine la quantité de référentiel que le modèle peut « voir » à la fois lors du raisonnement sur un bogue, de la génération d'une fonctionnalité ou de la refactorisation d'un module. Une suppression de 100 000 jetons signifie environ 75 000 mots de code, commentaires et documentation en moins chargés dans une seule invite.

En termes concrets, cela peut faire la différence entre un agent comprenant un microservice complet de bout en bout et devant fonctionner avec une vue partielle et tronquée. Les développeurs travaillant sur de grands monorepos ou effectuant des migrations inter-fichiers de grande envergure sont les plus touchés, car leurs tâches dépendent de la conservation simultanée de nombreux fichiers dans leur contexte.

Le changement survient alors que les outils de codage agent se livrent une concurrence agressive sur la quantité de contexte qu'ils peuvent gérer. Les concurrents ont commercialisé d’énormes fenêtres contextuelles comme argument de vente clé, présentant la possibilité d’ingérer des bases de code entières comme la voie vers une véritable ingénierie logicielle autonome. Le retrait d'OpenAI réduit cet écart au niveau par défaut.

Coût, qualité et économie d'un contexte long

La motivation probable est le coût. Les contextes plus longs sont considérablement plus coûteux à traiter, à la fois en termes de calcul et de latence, car le modèle doit s'occuper de chaque jeton de l'entrée. Les taux d’échec élevés « une aiguille dans une botte de foin » ont également tendance à s’infiltrer à mesure que les contextes s’étirent, ce qui signifie que les modèles manquent parfois des informations enfouies profondément dans une longue invite. Le plafonnement de la fenêtre par défaut peut réduire ces problèmes de précision tout en réduisant les dépenses d'inférence.

OpenAI n'a pas publié d'annonce distincte expliquant la réduction. Le changement s'est propagé uniquement via l'actualisation des métadonnées et le rétroportage vers la ligne de version 0.144, qui est la branche livrée à la plupart des utilisateurs non alpha du Codex. Ce déploiement discret est en soi remarquable : une décision qui affecte directement la productivité des développeurs a été communiquée via une différence de code plutôt que par un article de blog ou un journal des modifications.

Pour les équipes, l’implication pratique est simple. Les tâches qui s'inscrivaient auparavant dans une seule passe de contexte peuvent désormais nécessiter de diviser le travail en morceaux plus petits, de récupérer les fichiers pertinents de manière plus sélective ou d'accepter que l'agent dispose d'un champ de vision plus étroit. Certains développeurs peuvent contourner la limite en s'appuyant sur le « max_context_window » supérieur lorsqu'il est disponible, bien que cela nécessite généralement une configuration explicite.

Un modèle plus large d'ajustements silencieux

Le contexte du Codex s'inscrit dans un modèle industriel plus large dans lequel les laboratoires d'IA ajustent les paramètres de leurs modèles entre les lancements majeurs. Les tailles de fenêtres, les limites de débit et les comportements par défaut sont fréquemment ajustés via des mises à jour de l'infrastructure qui ne font jamais l'objet d'un communiqué de presse. Les développeurs qui dépendent de ces systèmes surveillent de plus en plus les référentiels sous-jacents et les réponses des API pour détecter les premiers signaux.

La décision d'OpenAI met également en évidence le fossé entre le marketing et la réalité. Un modèle peut prendre en charge une longueur de contexte de titre, mais la fenêtre effective exposée par les produits peut être considérablement plus petite, façonnée par les décisions de coûts que les fournisseurs prennent au nom des utilisateurs.

Gardez une longueur d'avance sur l'IA

Les paramètres du modèle changent constamment et les outils dont dépendent les développeurs peuvent changer du jour au lendemain. Pour obtenir des rapports opportuns sur les versions, les changements de capacités et les aspects économiques de l'IA de pointe, suivez les dernières actualités de l'IA sur AI Buzz Wire.

Lire plus d'actualités sur l'IA →