DeepSeek a mis à jour sa gamme d'API avec un nouveau modèle phare, V4 Pro, tout en augmentant fortement les prix sur sa plate-forme – un tournant décisif par rapport à la stratégie de prix très bas qui a rendu le laboratoire chinois célèbre et contraint ses concurrents à une guerre des prix. Pour une industrie qui a considéré chaque baisse de prix de DeepSeek comme un événement déterminant pour le marché, le renversement est tout aussi important. Suivez notre couverture de l’actualité de l’IA pour connaître les dernières nouveautés sur le marché des modèles.
La documentation officielle de l'API de la société, mise à jour cette semaine, répertorie désormais deux modèles : deepseek-v4-flash, exécutant la version DeepSeek-V4-Flash-0731, et deepseek-v4-pro, exécutant la nouvelle version DeepSeek-V4-Pro-0813. Les deux offrent une fenêtre contextuelle d'un million de jetons, jusqu'à 384 000 jetons de sortie maximale et des modes double réflexion et non-réflexion, et les deux peuvent être utilisés comme modèles backend dans des outils d'agent tels que Claude Code, GitHub Copilot et OpenCode. DeepSeek propose également un aperçu pour les développeurs de « DeepSeek Harness », une boîte à outils destinée aux développeurs d'agents. Pour plus de contexte sur cette histoire, consultez notre couverture de l'industrie de l'IA.
Combien coûte la V4 Pro
Le nouveau produit phare coûte exactement trois fois le prix de Flash à chaque niveau, selon les tarifs publiés par DeepSeek. Pour 1 million de jetons, V4 Pro coûte 0,022 USD pour les jetons d'entrée en cache et 0,66 USD pour les entrées non mises en cache pendant les heures creuses, et 1,98 USD pour 1 million de jetons de sortie. Au sommet, ces chiffres doublent pour atteindre 0,044 $, 1,32 $ et 3,96 $. V4 Flash, en comparaison, coûte 0,007 $/0,014 $ pour les accès au cache, 0,22 $/0,44 $ pour les échecs de cache et 0,66 $/1,32 $ pour la sortie.
Les heures de pointe sont définies comme étant de 01h00 à 04h00 et de 06h00 à 10h00 UTC, les tarifs hors pointe étant fixés exactement à la moitié de la pointe. La simultanéité est également hiérarchisée : les clients Flash reçoivent 2 500 requêtes simultanées, tandis que les comptes Pro sont limités à 500.
Les prix ont été multipliés par dix
Le lancement clôture une semaine au cours de laquelle la transformation des prix de DeepSeek est devenue impossible à manquer. Le Wall Street Journal a rapporté le 14 août que DeepSeek avait multiplié par quatre les prix des modèles d’IA. InfoWorld a rapporté le même jour que les prix de certains V4 avaient été multipliés par plus de 10, citant la demande d'IA qui met à rude épreuve la capacité de l'entreprise. Engadget a déclaré à ses lecteurs que les modèles étaient « sur le point de coûter quatre fois plus cher ».
Le 17 août, Tech Times a rapporté que les prix de l'API V4 quadruplaient désormais aux heures de pointe, tandis que le Séoul Economic Daily de Corée du Sud estimait que les augmentations les plus fortes pouvaient être multipliées par 12 et décrivait cette décision comme une course à l'IA en Chine se tournant vers le profit. Le Global Times, affilié à l'État chinois, a décrit ces augmentations comme faisant partie d'une campagne en faveur d'une « commercialisation plus saine » – un signal que Pékin considère l'économie unitaire durable, et pas seulement la part de marché, comme la priorité de ses champions de l'IA.
De l'arme de guerre des prix au produit premium
Le changement de stratégie est radical. DeepSeek a bâti sa réputation mondiale sur des prix agressifs : fin juillet, son nouveau modèle V4 Flash a été comparé au GPT-5.6 Luna d'OpenAI à un coût 60 % inférieur, accélérant une course vers le bas qui a étranglé tous les fournisseurs d'API. Désormais, le même laboratoire facture des tarifs majorés : le prix de sortie maximal de V4 Pro, de 3,96 dollars par million de jetons, est bien supérieur à ce que les clients de l'ère Flash étaient habitués à payer.
L’introduction de fenêtres de pointe et hors pointe est en soi un outil de gestion de capacité. En facturant le double pendant les heures les plus chargées, et en réduisant la simultanéité pour le modèle premium, DeepSeek rationne le calcul vers des charges de travail à marge plus élevée, un manuel familier des fournisseurs de cloud et des marchés de l'électricité.
Un portefeuille à deux niveaux pour l'ère des agents
La répartition entre les deux modèles est conçue pour différents acheteurs. Flash, avec sa limite de simultanéité de 2 500 requêtes et sa tarification minimale en cas d'accès au cache, est positionné pour le trafic de production à volume élevé et les applications sensibles aux coûts. Pro, avec 500 requêtes simultanées et un prix triple, cible les charges de travail lourdes de raisonnement où la fenêtre contextuelle d'un million de jetons et le plafond de sortie de 384 000 jetons sont importants : longues sessions d'agent, analyse de base de code volumineuse et pipelines lourds en documents.
DeepSeek courtise également les développeurs là où ils travaillent déjà. Les deux modèles sont utilisables directement comme backends dans Claude Code, GitHub Copilot et OpenCode, et l'API parle à la fois les formats compatibles OpenAI et Anthropic, ce qui signifie que les migrations des fournisseurs occidentaux peuvent être un changement de configuration sur une seule ligne. La nouvelle version préliminaire du développeur « DeepSeek Harness » étend cette stratégie aux constructeurs de harnais d'agents.
Ce que cela signifie pour les développeurs
Pour les développeurs qui ont créé des applications sensibles aux coûts en partant du principe que DeepSeek serait toujours l’option la plus avantageuse, le message est que l’ère de la baisse incessante des prix des jetons est révolue, du moins dans le laboratoire chinois. Les architectures respectueuses du cache paient désormais un taux d'entrée 30 fois inférieur à celui des appels en cas d'absence de cache sur les deux modèles, ce qui rend la discipline de mise en cache rapide bien plus précieuse que le choix du modèle. Et pour le marché plus large, le pivot de DeepSeek supprime du marché le fixateur de prix le plus agressif – un cadeau discret pour OpenAI, Anthropic et Google, qui se sont battus toute l'année sur les coûts autant que sur les capacités.
La question de savoir si les références du V4 Pro justifient la prime reste à tester par des évaluateurs indépendants. Ce qui est déjà clair, c'est la logique commerciale : après deux ans passés à subventionner l'utilisation mondiale de l'IA, DeepSeek veut être payé pour cela.
---
Restez à la Pointe de l'IALes dernières actualités, analyses et percées en IA — au même endroit.
Lire plus d'actualités IA →