Een onafhankelijke ontwikkelaar heeft aangetoond dat het V4 Flash-model van DeepSeek, een mix van experts met 304 miljard parameters, in productie kan draaien op een enkele AMD MI300X GPU, waarbij 168,6 tokens per seconde worden bereikt bij single-stream decodering zonder enige gewichtskwantisering of offloading. Het werk, gepubliceerd op GitHub en op 4 augustus 2026 bovenaan Hacker News verschenen, biedt het duidelijkste bewijs tot nu toe dat de hardware van AMD een open model op grensschaal kan bedienen zonder afhankelijk te zijn van Nvidia.

De repository, onderhouden door ontwikkelaar Ryan Zhou, bevat een complete Docker Compose-stack, vastgezette bestandsoverlays en afstemmingstabellen voor het uitvoeren van het DeepSeek-V4-Flash-0731-controlepunt op één MI300X. Voor lezers die het laatste AI-nieuws (https://aibuzzwire.news) over de chipoorlog tussen AMD en Nvidia volgen, is het resultaat significant omdat het de veronderstelling in twijfel trekt dat frontier-inferentie de nieuwste en duurste hardware van Nvidia vereist.

De cijfers

De gebenchmarkte prestaties, gemeten op een vastgezette softwarestack met behulp van de ROCm nightly build van vLLM, vertellen een overtuigend verhaal over wat een enkele AMD-accelerator kan doen:

  • Single-stream decodering: 168,6 tokens per seconde, snel genoeg voor realtime chat en agentische werklasten.
  • Doorvoersnelheid vooraf invullen: ongeveer 7.900 tot 8.500 tokens per seconde met afgestemde kernels, wat betekent dat lange prompts in minder dan een seconde worden verwerkt.
  • Acht gelijktijdige streams: Totaal 542 tokens per seconde, met 90,3 tokens per seconde per stream.
  • 64-stream burst: totaal 830 tokens per seconde, zonder geheugenfouten en zonder motorstoringen.
  • Contextlengte: 256.000 tokens gevalideerd tijdens het testen, waarbij de architectuur maximaal één miljoen tokens ondersteunt.

Het hele model neemt 156,67 gigabyte geheugen met hoge bandbreedte in beslag, wat volledig past binnen de 192 gigabyte HBM3-pool van de MI300X. Er was geen extra kwantisering of gewichtsvermindering nodig, waardoor de volledige nauwkeurigheid van het model behouden blijft.

Waarom de MI300X werkt

De AMD MI300X beschikt over twee kenmerken die de implementatie van een enkel-GPU-model van deze omvang mogelijk maken. Het heeft 192 gigabyte HBM3-geheugen, 2,4 keer de capaciteit van een Nvidia H100 SXM5 en 5,3 terabytes per seconde aan geheugenbandbreedte. Een afzonderlijk artikel van een ontwikkelaar geïdentificeerd als Fergus Finn, dat de basis legde voor deze implementatie, schatte dat de MI300X ongeveer de helft kost van vergelijkbare Nvidia-hardware tegen de catalogusprijs.

Voor dit specifieke controlepunt met 304 miljard parameters is de geheugencapaciteit de beslissende factor. Het model past volledig in on-chip geheugen, waardoor er ruimte overblijft voor een GPU-cachepool van 20 gigabyte GPU en een CPU-laag van 96 gigabyte voor verwijderde prefix-cache-items. Eén kaart kan twee tot acht typische gelijktijdige streams en bursts van maximaal 64 streams verwerken, wat voldoende is voor veel productie-inferentieworkloads.

De technische hindernissen

Het uitvoeren van DeepSeek V4 Flash op MI300X was niet eenvoudig. Het officiële vLLM-recept heeft betrekking op Nvidia-hardware en nieuwere AMD GPU's zoals de MI325X en MI355X, maar niet op een enkele MI300X-productieconfiguratie voor het controlepunt van 31 juli.

De repository documenteert verschillende technische problemen die moesten worden opgelost. De MI300X gebruikt een variant van het FP8-getalformaat dat afwijkt van de standaard die wordt gebruikt door nieuwere AMD-chips, en een kernel die uitgaat van de verkeerde semantiek kan resultaten opleveren met een factor twee. De ontwikkelaar moest ook een mix van experts-routing met hoge gelijktijdigheid, causale speculatieve verificatie en CPU-sleutel-waarde-synchronisatie repareren, waarvan er verschillende nog steeds niet zijn opgelost in upstream vLLM.

De repository voegt correctheidsoverlays toe, een gevalideerde serveerconfiguratie met speculatief opstellen, AITER GEMM-afstemmingstabellen voor chipvormen die de verpakte tabellen misten, en een hybride sleutelwaardestrategie die een GPU-cache combineert met CPU-offload.

Wat het betekent voor de chipoorlog

De demonstratie komt op een cruciaal moment voor AMD's ambities op het gebied van AI. Nvidia beheerst de overgrote meerderheid van de AI-acceleratormarkt, ondersteund door zijn CUDA-software-ecosysteem, dat door veel ontwikkelaars wordt gezien als een gracht waar AMD moeite mee heeft om te overwinnen. SemiAnalysis onderzocht die vraag rechtstreeks in een analyse uit juli 2026 met de titel "Kan AMD de CUDA-gracht doorbreken?" en het antwoord blijft omstreden.

Maar open-sourceprojecten als deze verkleinen de perceptiekloof. Als een enkele MI300X een model op grensschaal met concurrerende snelheden kan bedienen, wordt het kostenargument voor AMD moeilijker te verwerpen. AMD heeft ook zijn eigen open modelportfolio opgebouwd, door Instella-MoE-16B uit te brengen, een volledig open model dat helemaal opnieuw is getraind op zijn eigen Instinct GPU's, en samen te werken met Zyphra op een 15 megawatt MI355X-platform.

Ondertussen heeft DeepSeek zelf de kosten van grensverleggende AI omlaag gebracht. Volgens analyses van een onderzoeksbureau was het V4 Flash-model al het goedkoopste bekende model dat werd uitgevoerd en kwam overeen met GPT-5.6 Luna tegen 60 procent lagere kosten. Gecombineerd met goedkopere AMD-hardware verbetert de economie van het bedienen van grote modellen buiten het Nvidia-ecosysteem snel.

Het open source-voordeel

De repository onderstreept een breder thema in de AI-ontwikkeling in 2026: open-weight modellen en open-source inferentietools maken het voor onafhankelijke ingenieurs mogelijk om implementaties te repliceren en te optimaliseren die ooit het exclusieve domein waren van goed gefinancierde laboratoria. Door de volledige configuratie, afstemmingstabellen en de specifieke bugs die gaandeweg zijn opgelost te publiceren, verlaagt het werk de barrière voor iedereen die AMD-hardware overweegt voor serieuze AI-workloads.

Blijf AI een stap voor

De strijd tussen AMD en Nvidia om AI-inferentie wordt heviger, en open source-bijdragen zoals deze implementatie veranderen stilletjes het concurrentielandschap. Voor de nieuwste AI-ontwikkelingen op het gebied van hardware, open modellen en infrastructuur kunt u ons volgen.

Lees meer AI-nieuws →