Un développeur indépendant a démontré que le modèle Flash V4 de DeepSeek, un système composé d'experts de 304 milliards de paramètres, peut fonctionner en production sur un seul GPU AMD MI300X, atteignant 168,6 jetons par seconde en décodage à flux unique sans aucune quantification de poids ni déchargement. Le travail, publié sur GitHub et apparu en tête de Hacker News le 4 août 2026, offre la preuve la plus claire à ce jour que le matériel d'AMD peut servir un modèle ouvert à l'échelle frontière sans compter sur Nvidia.

Le référentiel, géré par le développeur Ryan Zhou, comprend une pile Docker Compose complète, des superpositions de fichiers épinglés et des tables de réglage pour exécuter le point de contrôle DeepSeek-V4-Flash-0731 sur un MI300X. Pour les lecteurs qui suivent les dernières nouvelles de l'IA sur la guerre des puces entre AMD et Nvidia, le résultat est significatif car il remet en question l'hypothèse selon laquelle l'inférence de frontière nécessite le matériel le plus récent et le plus cher de Nvidia.

Les chiffres

Les performances de référence, mesurées sur une pile logicielle épinglée à l'aide de la version nocturne ROCm de vLLM, racontent une histoire convaincante sur ce qu'un seul accélérateur AMD peut faire :

  • Décodage en flux unique : 168,6 jetons par seconde, suffisamment rapide pour le chat en temps réel et les charges de travail d'agent.
  • Débit de pré-remplissage : environ 7 900 à 8 500 jetons par seconde avec des noyaux optimisés, ce qui signifie que les invites longues sont traitées en moins d'une seconde.
  • Huit flux simultanés : 542 jetons par seconde au total, avec 90,3 jetons par seconde par flux.
  • Rafale de 64 flux : 830 jetons par seconde au total, sans erreurs de mémoire insuffisante ni panne moteur.
  • Longueur du contexte : 256 000 jetons validés lors des tests, l'architecture prenant en charge jusqu'à un million.

L'ensemble du modèle occupe 156,67 Go de mémoire à large bande passante, s'inscrivant entièrement dans le pool HBM3 de 192 Go du MI300X. Aucune quantification supplémentaire ou déchargement de poids n'a été nécessaire, ce qui préserve la précision totale du modèle.

Pourquoi le MI300X fonctionne

L'AMD MI300X possède deux attributs qui rendent possible le déploiement d'un modèle aussi grand sur un seul GPU. Il dispose de 192 Go de mémoire HBM3, 2,4 fois la capacité d'un Nvidia H100 SXM5 et de 5,3 téraoctets par seconde de bande passante mémoire. Un article distinct rédigé par un développeur identifié comme Fergus Finn, qui a jeté les bases de ce déploiement, estime que le MI300X coûte environ la moitié du prix du matériel Nvidia comparable au prix catalogue.

Pour ce point de contrôle particulier de 304 milliards de paramètres, la capacité de la mémoire est le facteur décisif. Le modèle s'intègre entièrement dans la mémoire sur puce, laissant de la place pour un pool de cache de valeurs-clés GPU de 20 Go et un niveau CPU de 96 Go pour les entrées de cache de préfixe expulsées. Une carte peut gérer deux à huit flux simultanés typiques et des rafales allant jusqu'à 64 flux, ce qui est suffisant pour de nombreuses charges de travail d'inférence de production.

Les obstacles de l'ingénierie

Exécuter DeepSeek V4 Flash sur MI300X n’était pas simple. La recette officielle de vLLM couvre le matériel Nvidia et les GPU AMD plus récents tels que le MI325X et le MI355X, mais pas une configuration de production mono-MI300X pour le point de contrôle du 31 juillet.

Le référentiel documente plusieurs problèmes d'ingénierie qui ont dû être résolus. Le MI300X utilise une variante du format numérique FP8 qui diffère de la norme utilisée par les puces AMD les plus récentes, et un noyau qui suppose une mauvaise sémantique peut produire des résultats multipliés par deux. Le développeur a également dû corriger le routage mixte d'experts à haute concurrence, la vérification spéculative causale et la synchronisation clé-valeur du processeur, dont plusieurs restent non corrigés dans le vLLM en amont.

Le référentiel ajoute des superpositions d'exactitude, une configuration de service validée avec une rédaction spéculative, des tables de réglage AITER GEMM pour les formes de puces qui manquaient dans les tables packagées et une stratégie clé-valeur hybride qui combine un cache GPU avec un déchargement du CPU.

Ce que cela signifie pour la guerre des puces

La démonstration arrive à un moment charnière pour les ambitions d'AMD en matière d'IA. Nvidia contrôle l'écrasante majorité du marché des accélérateurs d'IA, soutenu par son écosystème logiciel CUDA, que de nombreux développeurs considèrent comme un fossé qu'AMD a du mal à franchir. SemiAnalysis a examiné cette question directement dans une analyse de juillet 2026 intitulée « AMD peut-elle briser le fossé CUDA ? et la réponse reste contestée.

Mais des projets open source comme celui-ci réduisent le fossé de perception. Si un seul MI300X peut servir un modèle à l’échelle frontière à des vitesses compétitives, l’argument du coût en faveur d’AMD devient plus difficile à écarter. AMD a également développé son propre portefeuille de modèles ouverts, en lançant Instella-MoE-16B, un modèle entièrement ouvert formé à partir de zéro sur ses propres GPU Instinct, et en s'associant à Zyphra sur une plate-forme MI355X de 15 mégawatts.

Pendant ce temps, DeepSeek lui-même a réduit le coût de l’IA frontalière. Le modèle V4 Flash était déjà le modèle connu le moins cher selon l'analyse du cabinet de recherche, correspondant au GPT-5.6 Luna à un coût 60 % inférieur. Combiné avec du matériel AMD moins cher, la rentabilité de la fourniture de grands modèles en dehors de l'écosystème Nvidia s'améliore rapidement.

L'avantage de l'Open Source

Le référentiel souligne un thème plus large du développement de l'IA en 2026 : les modèles ouverts et les outils d'inférence open source permettent aux ingénieurs indépendants de reproduire et d'optimiser des déploiements qui étaient autrefois le domaine exclusif des laboratoires bien financés. En publiant la configuration complète, les tables de réglage et les bogues spécifiques corrigés en cours de route, le travail abaisse la barrière pour quiconque envisage du matériel AMD pour des charges de travail d'IA sérieuses.

Gardez une longueur d'avance sur l'IA

La bataille entre AMD et Nvidia pour l'inférence de l'IA s'intensifie, et les contributions open source comme ce déploiement modifient discrètement le paysage concurrentiel. Pour connaître les derniers développements de l'IA en matière de matériel, de modèles ouverts et d'infrastructure, restez fidèle à notre couverture.

Lire plus d'actualités sur l'IA →