En oberoende utvecklare har visat att DeepSeeks V4 Flash-modell, en blandning av experter med 304 miljarder parametrar, kan köras i produktion på en enda AMD MI300X GPU och uppnå 168,6 tokens per sekund i enkelströmsavkodning utan någon viktkvantisering eller avlastning. Verket, publicerat på GitHub och hamnat på toppen av Hacker News den 4 augusti 2026, erbjuder de tydligaste bevisen hittills på att AMD:s hårdvara kan tjäna en öppen modell i gränsöverskridande skala utan att förlita sig på Nvidia.

Förvaret, som underhålls av utvecklaren Ryan Zhou, inkluderar en komplett Docker Compose-stack, fästa filöverlagringar och inställningstabeller för att köra DeepSeek-V4-Flash-0731-kontrollpunkten på en MI300X. För läsare som spårar de brytande AI-nyheterna om chipkriget mellan AMD och Nvidia, är resultatet betydande eftersom det utmanar antagandet att gränsöverskridande slutledning kräver Nvidias senaste och dyraste hårdvara.

Siffrorna

Den benchmarkade prestandan, mätt på en fast mjukvarustapel med hjälp av ROCm nightly build av vLLM, berättar en fängslande historia om vad en enskild AMD-accelerator kan göra:

  • Single-stream-avkodning: 168,6 tokens per sekund, tillräckligt snabbt för chatt i realtid och agenter.
  • Förfyllningskapacitet: cirka 7 900 till 8 500 tokens per sekund med inställda kärnor, vilket innebär att långa uppmaningar bearbetas på långt under en sekund.
  • Åtta samtidiga strömmar: 542 tokens per sekund sammanlagt, med 90,3 tokens per sekund per stream.
  • 64-strömsskur: 830 tokens per sekund sammanlagt, utan minnesfel och inga motorfel.
  • Kontextlängd: 256 000 tokens validerade i testning, med arkitekturen som stöder upp till en miljon.

Hela modellen upptar 156,67 gigabyte minne med hög bandbredd, vilket helt passar in i MI300X:s 192-gigabyte HBM3-pool. Ingen ytterligare kvantisering eller viktavlastning behövdes, vilket bevarar modellens fulla noggrannhet.

Varför MI300X fungerar

AMD MI300X har två attribut som gör det möjligt att använda en enda GPU-modell. Den har 192 gigabyte HBM3-minne, 2,4 gånger kapaciteten hos en Nvidia H100 SXM5 och 5,3 terabyte per sekund minnesbandbredd. En separat skrivelse av en utvecklare identifierad som Fergus Finn, som lade grunden för denna utbyggnad, uppskattade att MI300X kostar ungefär hälften så mycket som jämförbar Nvidia-hårdvara till listpris.

För just denna kontrollpunkt på 304 miljarder parametrar är minneskapaciteten den avgörande faktorn. Modellen passar helt och hållet i on-chip-minnet, vilket lämnar utrymme för en 20-gigabyte GPU-nyckelvärde-cachepool och en 96-gigabyte CPU-tier för vräkta prefix-cache-poster. Ett kort kan hantera två till åtta typiska samtidiga strömmar och skurar på upp till 64 strömmar, vilket räcker för många produktionsinferensarbetsbelastningar.

Ingenjörshinder

Att köra DeepSeek V4 Flash på MI300X var inte okomplicerat. Det officiella vLLM-receptet täcker Nvidia-hårdvara och nyare AMD GPU:er som MI325X och MI355X, men inte en enda-MI300X-produktionskonfiguration för kontrollpunkten den 31 juli.

Förvaret dokumenterar flera tekniska problem som måste lösas. MI300X använder en variant av nummerformatet FP8 som skiljer sig från standarden som används av nyare AMD-chips, och en kärna som utgår från fel semantik kan ge resultat med en faktor två. Utvecklaren var också tvungen att fixa routing bland experter vid hög samtidighet, kausal spekulativ verifiering och CPU-nyckel-värdesynkronisering, av vilka flera förblir ofixade i uppströms vLLM.

Lagret lägger till korrekthetsöverlagringar, en validerad serverkonfiguration med spekulativ utkast, AITER GEMM-justeringstabeller för chipformer som de paketerade tabellerna saknade och en hybrid nyckel-värdestrategi som kombinerar en GPU-cache med CPU-avlastning.

Vad det betyder för chipskriget

Demonstrationen kommer till ett avgörande ögonblick för AMD:s ambitioner inom AI. Nvidia kontrollerar den överväldigande majoriteten av AI-acceleratormarknaden, stödd av sitt CUDA-programvaruekosystem, som många utvecklare ser som en vallgrav som AMD har kämpat för att korsa. SemiAnalysis undersökte den frågan direkt i en analys från juli 2026 med titeln "Kan AMD bryta CUDA-vallgraven?" och svaret förblir omtvistat.

Men projekt med öppen källkod som det här tar bara bort perceptionsgapet. Om en enda MI300X kan tjäna en modell i gränsöverskridande skala i konkurrenskraftiga hastigheter, blir kostnadsargumentet för AMD svårare att avfärda. AMD har också byggt ut sin egen portfölj med öppna modeller, släppt Instella-MoE-16B, en helt öppen modell tränad från grunden på sina egna Instinct GPU:er, och samarbetar med Zyphra på en 15 megawatt MI355X-plattform.

Samtidigt har DeepSeek själv drivit ner kostnaderna för frontier AI. V4 Flash-modellen var redan den billigaste välkända modellen att köra enligt analysföretagets analys, och matchade GPT-5.6 Luna till 60 procent lägre kostnad. I kombination med billigare AMD-hårdvara förbättras ekonomin med att servera stora modeller utanför Nvidias ekosystem snabbt.

Fördelen med öppen källkod

Förvaret understryker ett bredare tema i AI-utvecklingen 2026: modeller med öppen vikt och inferensverktyg med öppen källkod gör det möjligt för oberoende ingenjörer att replikera och optimera implementeringar som en gång var den exklusiva domänen för välfinansierade labb. Genom att publicera den fullständiga konfigurationen, inställningstabellerna och de specifika buggar som fixats längs vägen, sänker arbetet barriären för alla som överväger AMD-hårdvara för allvarliga AI-arbetsbelastningar.

Ligg före AI

Kampen mellan AMD och Nvidia för AI-inferens intensifieras, och bidrag med öppen källkod som den här implementeringen förändrar tyst konkurrenslandskapet. För den senaste AI-utvecklingen inom hårdvara, öppna modeller och infrastruktur, håll dig till vår täckning.

Läs mer AI-nyheter →