Le laboratoire chinois d'intelligence artificielle DeepSeek a publié le V4-Flash « 0731 » le 31 juillet 2026, une version recyclée de son modèle budgétaire qui correspond presque au GPT-5.6 Luna d'OpenAI sur des benchmarks tiers à un coût environ 60 % inférieur. Cette version, qui met l'API bêta publique du modèle en disponibilité générale, est la dernière salve dans une guerre des prix qui s'intensifie entre les fournisseurs chinois de poids ouvert et les laboratoires frontaliers occidentaux. Pour une couverture continue des guerres de modèles, consultez nos dernières actualités sur l'IA.
Selon The Decoder, la nouvelle version obtient 50 points à l'indice d'intelligence d'analyse artificielle, soit un bond de dix points par rapport au précédent V4-Flash lancé en avril 2026. Cela la place à seulement un point derrière le GPT-5.6 Luna de niveau budgétaire d'OpenAI, bien qu'il coûte environ 60 % de moins par tâche, même après la récente baisse de prix de 80 % d'OpenAI.
Conçu pour le travail agent
Les gains les plus importants ont concerné les tâches agentiques, la capacité d'effectuer de manière autonome un travail en plusieurs étapes dans le monde réel. TechNode a rapporté que le modèle obtient un score de 82,7 sur Terminal Bench 2.1 et de 54,4 sur DeepSWE, deux benchmarks conçus pour mesurer dans quelle mesure une IA peut utiliser des outils, écrire du code et résoudre des problèmes d'ingénierie sans se tenir la main.
Sur GDPval, un benchmark qui teste des modèles sur des travaux de bureautiques complexes, V4-Flash grimpe de 1 189 à 1 559 points Elo. DeepSeek a également déclaré que le modèle hallucine moins souvent que son prédécesseur et utilise environ 12 % de jetons en moins pour effectuer les mêmes tâches.
Même architecture, poids plus intelligents
La mise à niveau conserve la même structure sous-jacente : 284 milliards de paramètres au total, dont 13 milliards actifs à tout moment, et une fenêtre contextuelle d'un million de jetons. Plutôt que d'agrandir le modèle, DeepSeek l'a recyclé, optimisant ainsi les performances avec la même empreinte. Les poids du modèle sont publiés sous la licence permissive du MIT sur Hugging Face, poursuivant ainsi l'approche de poids ouvert de DeepSeek.
DeepSeek a pris soin de définir la portée de la version. La mise à jour s'applique uniquement à l'API V4-Flash ; l'API V4-Pro de niveau supérieur et les modèles servis via l'application grand public et le site Web de DeepSeek restent inchangés. La nouvelle API Flash ajoute également la prise en charge de l'API Responses et est adaptée pour être utilisée avec Codex, élargissant ainsi son attrait pour les développeurs créant des agents de codage.
L'avantage de la réduction du cache
Une partie importante de l’avantage en termes de coûts de DeepSeek provient de ses mécanismes de tarification. La société offre une remise sur le cache de 98 pour cent – bien au-dessus des 90 pour cent standard du secteur – ce qui signifie que les parties répétées ou prévisibles d’une demande sont facturées à une petite fraction du tarif normal. Combiné avec moins de jetons par tâche, le coût effectif de nombreuses charges de travail diminue considérablement.
Cette structure tarifaire constitue un défi direct pour OpenAI, qui a elle-même réduit ses prix pour défendre sa part de marché. Le résultat est un marché où la qualité proche des frontières devient une marchandise, et où la concurrence est de plus en plus déterminée par l'efficacité des infrastructures et l'économie des unités plutôt que par la capacité brute.
Une guerre des prix sans plancher
Cette publication intensifie ce que les analystes décrivent désormais comme une véritable guerre des prix. OpenAI a réduit les prix du GPT-5.6 Luna de 80 % pour défendre sa base de développeurs, seulement pour que DeepSeek réponde avec un modèle comparable et encore beaucoup moins cher. Chaque cycle fait baisser le coût effectif du renseignement proche des frontières, et l’écart entre les modèles performants les moins chers et les plus chers ne cesse de se réduire.
La dynamique est inhabituelle dans un logiciel. Sur la plupart des marchés, un avantage de coût de 60 pour cent à qualité presque égale permettrait de conquérir rapidement des parts de marché. Ici, l'avantage est égalé et rééquilibré en quelques semaines, laissant les développeurs avec un classement en constante évolution. La parité de référence, autrefois réservée aux laboratoires pionniers, est de plus en plus disponible auprès des challengers à poids ouvert prêts à publier à la fois leurs poids et leurs prix.
Ce que cela signifie pour les développeurs
Pour les développeurs, l’implication pratique est claire : les modèles agents performants deviennent rapidement moins chers. Un modèle capable de naviguer de manière autonome dans un terminal, d’écrire et de déboguer du code et de gérer des tâches bureautiques complexes – le tout pour une fraction de centime par demande – change l’économie de la création de produits basés sur l’IA.
La version ouverte signifie également que les équipes peuvent exécuter le modèle sur leur propre matériel, évitant ainsi entièrement les frais d'API par jeton pour les charges de travail sensibles. Alors que DeepSeek, OpenAI et d’autres continuent d’échanger des coups sur le prix et les performances, les gagnants sont les constructeurs qui disposent désormais d’un menu croissant de modèles performants et abordables parmi lesquels choisir.
Gardez une longueur d'avance sur la courbe de l'IA
Le paysage de l’intelligence artificielle évolue plus rapidement que jamais, et les entreprises qui suivent ces évolutions très tôt acquièrent un avantage durable. Pour une couverture continue et vérifiée par la source des versions de modèles, des cycles de financement et des évolutions politiques, suivez nos dernières actualités sur l'IA.
Lire plus d'actualités sur l'IA →