Le laboratoire d'IA chinois DeepSeek a discrètement livré deepseek-v4-flash-vision-exp, une version expérimentale de son modèle V4-Flash qui peut accepter des images à côté du texte, comblant ainsi l'une des lacunes les plus flagrantes de sa famille de modèles phares. La version, documentée sur les pages API officielles de la société, arrive quelques semaines seulement après l'actualisation des V4-Flash-0731 et V4-Pro-0813 et offre aux développeurs un moyen très demandé d'insérer des captures d'écran, des graphiques et des photos directement dans l'un des modèles de pointe les moins chers de l'industrie. Pour les équipes qui suivent les derniers développements de l'IA, c'est un autre signal que DeepSeek a l'intention d'égaler ses rivaux occidentaux fonctionnalité par fonctionnalité tout en les vendant agressivement en termes de prix.
Que fait le nouveau modèle
Selon la documentation de l'API de DeepSeek, « deepseek-v4-flash-vision-exp » permet aux utilisateurs de « demander au modèle de décrire des images, de lire du texte à partir de captures d'écran, d'analyser des graphiques, et bien plus encore ». Le modèle accepte les fichiers JPEG, PNG, GIF et WebP, avec le format détecté à partir du contenu réel du fichier plutôt que du nom du fichier ou du type MIME déclaré – un détail petit mais réfléchi qui évite les bogues d'extension incompatibles.
Les développeurs peuvent transmettre des images de trois manières : des URL de données en ligne codées en base64 (soumises à une limite de corps de requête de 48 Mio), des URL externes accessibles publiquement (jusqu'à 8 192 caractères, 32 Mio par image, avec une fenêtre de téléchargement de 60 secondes) ou via l'API Files. Tout utilise le format standard Chat Completions compatible OpenAI, et le modèle est également accessible via le point de terminaison compatible Anthropic de DeepSeek, ce qui signifie que le code SDK Claude existant peut changer de backend avec des modifications minimes.
Tarification : vision avant-gardiste aux taux des matières premières
Le modèle expérimental hérite de la grille tarifaire agressive du V4-Flash. Les jetons d'entrée coûtent 0,22 $ par million en dehors des heures de pointe et 0,44 $ en période de pointe pour les échecs de cache, tombant à seulement 0,007 $ par million pour les accès au cache pendant les heures creuses. Les jetons de sortie sont au prix de 0,66 $ par million en dehors des heures de pointe et de 1,32 $ en période de pointe. Les images sont converties en jetons en fonction de leurs dimensions et facturées avec les jetons de texte.
Ce prix est important car il réduit considérablement les offres multimodales comparables des principaux fournisseurs américains, poursuivant ainsi la guerre des prix que DeepSeek a menée toute l'année. Le modèle reprend également les principales spécifications de la famille : une fenêtre contextuelle d'un million de jetons, jusqu'à 384 000 jetons de sortie maximale, la prise en charge des modes de réflexion et de non-réflexion, la sortie JSON, les appels d'outils et une limite de concurrence de 2 500 – des spécifications qui le positionnent comme un véritable cheval de bataille pour les charges de travail de production à grand volume plutôt que comme un jouet de recherche.
Pourquoi les développeurs en avaient désespérément besoin
Le lancement a atterri sur Hacker News, où il a rapidement rassemblé plus de 450 points – et l'enthousiasme a une origine spécifique. Le V4-Flash-0731 en mode texte de DeepSeek avait développé la réputation de croire qu'il pouvait voir. Plusieurs développeurs ont signalé que le modèle supposerait qu'il avait des capacités de vision, puis improviserait des solutions de contournement élaborées lorsqu'il découvrirait que ce n'était pas le cas, notamment en inventant des outils d'analyse d'images basés sur du texte et en extrayant des captures d'écran d'appareils connectés avant de se rendre compte qu'il n'avait aucun moyen de les visualiser.
"J'ai entendu dire que DeepSeek v4 Flash 0731 supposait souvent qu'il avait des capacités de vision et recourait ensuite à l'invention d'outils d'analyse d'images basés sur du texte lorsqu'il découvrait qu'il ne pouvait pas voir", a écrit un commentateur, faisant écho aux rapports de plusieurs autres. Pour toute personne utilisant le modèle comme agent dans des pipelines de codage ou d’automatisation, la nouvelle variante de vision devrait éliminer toute une catégorie d’échecs dus à la confusion.
La prise 800x800
La sortie n'est pas sans limites, et les critiques les plus vives sur Hacker News ont ciblé un chiffre : la résolution de l'image. La documentation indique qu'avant l'inférence, chaque image est automatiquement redimensionnée afin que son nombre total de pixels corresponde à peu près à une image de 800 x 800, en préservant ses proportions.
"C'est utile, mais pour l'OCR et beaucoup d'autres applications, il doit être un peu plus élevé (par exemple : mettre une page complète au format A4/Lettre)", a soutenu un développeur, un autre répondant sans ambages que la limite de 800 x 800 "tue beaucoup de cas d'utilisation". Pour les documents denses, les analyses de pleine page ou le débogage fin de l’interface utilisateur, le plafond de résolution pourrait pousser les développeurs vers des alternatives à plus haute résolution – et plus coûteuses. Une solution de contournement populaire suggérée dans le fil de discussion : divisez les grandes pages en mosaïques et alimentez-les séparément.
L’autre question ouverte est celle de l’ouverture. DeepSeek a bâti sa réputation en publiant des pondérations ouvertes, mais la société n'a pas précisé si la variante Vision suivrait. Les commentateurs ont émis l'hypothèse que cela pourrait provenir de la récente recherche de la société « Penser avec des primitives visuelles », pour laquelle des pondérations auraient été promises, mais rien n'a été confirmé. Notamment, le modèle est répertorié comme expérimental – le suffixe « -exp » – signalant que DeepSeek s'attend à itérer.
Une sortie discrète mais stratégique
La baisse de vision continue d'être une période chargée pour le laboratoire basé à Hangzhou, qui a passé le mois d'août à livrer des mises à jour régulières : V4-Flash-0731, le framework DeepSeek Harness orienté agent, la mise à jour V4-Pro-0813 et maintenant la saisie multimodale. Plutôt qu’un seul lancement à succès, DeepSeek exécute une cadence de versions rapides et incrémentielles qui maintiennent ses modèles dans les chaînes d’outils des développeurs – la même stratégie d’accaparement de terres que les laboratoires occidentaux poursuivent avec les agents de codage.
Pour l’industrie de l’IA dans son ensemble, le message est familier mais reste inconfortable pour les opérateurs historiques : les capacités qui justifiaient autrefois des prix plus élevés – la compréhension d’images dans un contexte d’un million de jetons – arrivent désormais à quelques centimes par million de jetons. L'étiquette expérimentale donne à DeepSeek la possibilité d'affiner le modèle, mais les développeurs ont déjà commencé à le intégrer dans des flux de travail basés sur des captures d'écran. La question n’est plus de savoir si DeepSeek peut égaler l’ensemble des fonctionnalités multimodales de ses concurrents, mais de savoir à quelle vitesse le reste du marché s’adapte à ses prix.
Gardez une longueur d'avance sur l'IA
Pour les dernières versions de modèles d'IA, les batailles de référence et les analyses du secteur, ajoutez AI Buzz Wire à vos favoris.
Lire plus d'actualités sur l'IA →