Le laboratoire d'IA chinois DeepSeek a publié V4.1-Flash, un modèle multimodal à poids ouvert qui associe un squelette de 552 milliards de paramètres à une compression de mémoire parmi les plus agressives jamais livrées dans un système de classe frontière. Le modèle a été mis en ligne mercredi avec une licence du MIT sur Hugging Face et un rapport technique qui l'accompagne, a rapporté Reuters, couronnant une série de gros titres pour le laboratoire basé à Hangzhou.

Cette version est plus qu’une simple modification de version. DeepSeek a simultanément retiré son niveau phare V4 Pro, et TechNode a signalé que les demandes adressées à V4 Pro sont désormais acheminées vers V4.1-Flash – une déclaration de confiance frappante dans un modèle qui porte le nom « Flash » mais affiche des chiffres de référence égaux ou supérieurs au modèle qu'il remplace. Pour plus de contexte sur cette histoire, consultez notre couverture de l'industrie de l'IA.

Un "Flash" plus gros avec une facture de mémoire plus petite

Selon la carte modèle officielle, DeepSeek-V4.1-Flash est un modèle Mixture-of-Experts (MoE) avec 552 milliards de paramètres de base plus un composant de mémoire conditionnelle « Engram » de 196 milliards de paramètres qui est peu accessible via une recherche basée sur des jetons. Malgré sa taille, le modèle n'active que 8 milliards de paramètres par jeton pendant le pré-remplissage et 16 milliards pendant le décodage, soit moins de paramètres actifs que son prédécesseur à 284 B paramètres, qui en exécutait 13 milliards de manière constante.

La pièce maîtresse de l'architecture est ce que DeepSeek appelle une conception de Causal Encoder-Decoder (CED) : un transformateur à 40 couches divisé en un encodeur causal à 20 couches suivi d'un décodeur à 20 couches. Étant donné que le cache KV global du décodeur est projeté à partir des états cachés du codeur final plutôt que accumulé couche par couche, la mémoire nécessaire pour soutenir de longues conversations diminue considérablement.

Les chiffres de compression constituent le titre. Avec la mise en cache KV principale du FP4 au format E2M1, l'empreinte globale du cache KV tombe à 890 octets par jeton, soit environ un quart de DeepSeek-V4-Flash. Une technique appelée SWA Bounded Replay reconstruit les états d'attention manquants en rejouant uniquement la fenêtre de jetons la plus récente, réduisant ainsi le cache KV persistant à environ un huitième du modèle Flash précédent. Selon la carte modèle, la réduction est d'environ quatre fois par rapport au V4-Flash et de 437 fois par rapport à DeepSeek-V1. Les composants supplémentaires incluent Compressed Sparse Attention 2 (CSA2), qui attribue à chaque couche d'attention l'un des trois modes statiques, et le décodage spéculatif DSpark pour une génération plus rapide.

Sous le capot, chaque couche MoE combine un expert partagé avec 384 experts en déroute, activant six experts en déroute par jeton.

Benchmarks : en avance sur le produit phare à la retraite

D'après les évaluations du modèle de base figurant dans le rapport technique, la V4.1-Flash dépasse la V4 Pro, beaucoup plus grande, lors de plusieurs tests clés : 74,1 sur MMLU-Pro contre 73,5, 79,4 sur HumanEval contre 76,8, 60,6 sur BigCodeBench et 93,0 sur GSM8K. Le South China Morning Post a rapporté que DeepSeek affirme que le nouveau modèle battit Kimi K3 sur les critères de cybersécurité et de codage, une affirmation notable dans un domaine de modèle ouvert chinois qui comprend également le GLM-5.3 de Z.ai et la gamme Qwen d'Alibaba.

Avec un effort de raisonnement maximal, le modèle d'instruction obtient un score de 90,9 sur GPQA Diamond – impressionnant, bien que toujours en retard sur les principaux systèmes frontières référencés dans le propre tableau de comparaison de DeepSeek, GPT-5.6 Sol à 94,1 et Claude Opus 5,0 à 93,4. Kimi K3 se situe à 92,9. La lecture honnête : il s’agit d’un modèle frontalier à des prix ouverts, et non d’une table rase des laboratoires fermés.

La V4.1-Flash est également véritablement multimodale. Un encodeur de vision DeepSeek-ViT, formé à partir de zéro, alimente les images via un projecteur à deux couches, et le modèle a été formé conjointement sur le texte et les images dès le début de la pré-formation. Il obtient un score de 56,5 sur MMMU-Pro et de 95,6 sur DocVQA.

Conçu pour les agents, tarifé en fonction du volume

Les choix de conception indiquent clairement le public cible : les charges de travail agents, où les modèles lisent d'énormes contextes et agissent sur de longs horizons. Le modèle prend en charge des fenêtres contextuelles allant jusqu'à un million de jetons, a été formé sur un corpus multimodal de 45 000 milliards de jetons et offre un cadran d'effort de raisonnement contrôlable en continu de 1 à 100 qui échange le coût d'inférence contre la précision. La couverture du Decoder a souligné que les économies de mémoire réduisent spécifiquement le coût d'exécution des agents d'IA, des charges de travail qui passent beaucoup plus de temps à lire les entrées qu'à générer des sorties.

La réaction de la communauté a été catégorique. Le fil de discussion de lancement sur Hacker News a attiré plus de 650 points, et un fil de discussion précédent intitulé "DeepSeek lance le flash v4.1 moins cher et plus performant que le v4 pro" en a collecté près de 400 de plus. Les commentateurs qui exécutent des modèles localement ont noté que les paramètres Engram peuvent même être déchargés sur des SSD rapides, ouvrant ainsi la voie à une inférence proche de la frontière sur le matériel grand public.

Seeking Alpha a décrit les enjeux commerciaux sans ambages, le qualifiant de modèle ultra-low-cost qui présente des défis pour les laboratoires frontaliers américains – un rappel que la guerre des prix dans l'inférence de l'IA ne montre aucun signe de refroidissement.

Un moment délibéré pour l'annonce

Le timing est révélateur. Un jour avant le lancement, Reuters a rapporté que DeepSeek avait fait appel à CITIC Securities pour organiser une introduction en bourse sur le marché STAR de Shanghai, à la suite d'informations antérieures selon lesquelles les revenus du laboratoire avaient décuplé avant une éventuelle cotation. L’expédition d’un modèle ouvert qui fera la une des journaux quelques jours plus tard maintient cet élan.

Cette publication intervient également dans un contexte de surveillance accrue des sociétés chinoises d’IA. Plus tôt cette semaine, des agences américaines, dont la NSA, la CISA et le FBI, ont nommé six sociétés chinoises d'IA dans un avis sur la distillation de modèles à l'échelle industrielle – un rappel que les victoires techniques de DeepSeek s'accompagnent désormais d'un bagage géopolitique.

Rien de tout cela n’obscurcit l’histoire de l’ingénierie. Avec le retrait de V4 Pro et son trafic acheminé vers un modèle moins cher et plus puissant, DeepSeek a avancé l'argument le plus clair possible selon lequel en 2026, la frontière intéressante de l'IA pourrait non seulement être de savoir qui construit le plus grand modèle, mais aussi qui exploite le plus de capacités par gigaoctet de mémoire.

---

Restez à la Pointe de l'IA

Les dernières actualités, analyses et percées en IA — au même endroit.

Lire plus d'actualités IA →