Nezávislý vývojář prokázal, že model V4 Flash od DeepSeek, systém expertů s 304 miliardami parametrů, může běžet ve výrobě na jediném GPU AMD MI300X a dosáhnout 168,6 tokenů za sekundu v jednoproudovém dekódování bez kvantování hmotnosti nebo snižování zátěže. Práce publikovaná na GitHubu a zveřejněná na vrcholu Hacker News 4. srpna 2026 nabízí dosud nejjasnější důkaz, že hardware AMD může sloužit hraničnímu otevřenému modelu, aniž by se spoléhal na Nvidii.
Úložiště, které spravuje vývojář Ryan Zhou, obsahuje kompletní zásobník Docker Compose, překryvy připojených souborů a ladicí tabulky pro spuštění kontrolního bodu DeepSeek-V4-Flash-0731 na jednom MI300X. Pro čtenáře sledující nejnovější zprávy o AI o čipové válce mezi AMD a Nvidií je výsledek významný, protože zpochybňuje předpoklad, že hraniční závěry vyžadují nejnovější a nejdražší hardware Nvidie.
Čísla
Srovnávací výkon, měřený na připojeném softwarovém zásobníku pomocí nočního sestavení ROCm vLLM, vypráví přesvědčivý příběh o tom, co dokáže jediný akcelerátor AMD:
- Dekódování jedním proudem: 168,6 tokenů za sekundu, dostatečně rychlé pro chat v reálném čase a pracovní zátěž agentů.
- Propustnost předvyplnění: přibližně 7 900 až 8 500 tokenů za sekundu s vyladěnými jádry, což znamená, že dlouhé výzvy jsou zpracovány za méně než sekundu.
- Osm souběžných streamů: Souhrnně 542 tokenů za sekundu, s 90,3 tokeny za sekundu na stream.
- Shluk 64 streamů: Souhrn 830 tokenů za sekundu, bez chyb z nedostatku paměti a bez selhání motoru.
- Délka kontextu: 256 000 tokenů ověřených testováním, přičemž architektura podporuje až jeden milion.
Celý model zabírá 156,67 gigabajtů paměti s velkou šířkou pásma a zcela zapadá do 192GB HBM3 fondu MI300X. Nebylo potřeba žádné další kvantování nebo odlehčení, což zachovává plnou přesnost modelu.
Proč MI300X funguje
AMD MI300X má dva atributy, které umožňují nasazení modelu s jedním GPU tak velkého rozsahu. Má 192 gigabajtů paměti HBM3, 2,4krát větší kapacitu než Nvidia H100 SXM5 a šířku pásma paměti 5,3 terabajtů za sekundu. Samostatný zápis vývojáře identifikovaného jako Fergus Finn, který položil základy pro toto nasazení, odhaduje, že MI300X stojí zhruba o polovinu méně než srovnatelný hardware Nvidia za katalogovou cenu.
Pro tento konkrétní kontrolní bod s 304 miliardami parametrů je rozhodujícím faktorem kapacita paměti. Model se zcela vejde do paměti na čipu a ponechává prostor pro 20gigabajtovou mezipaměť klíče a hodnoty GPU a 96gigabajtovou vrstvu CPU pro vyřazené položky mezipaměti prefixů. Jedna karta dokáže zpracovat dva až osm typických souběžných toků a shluků až 64 toků, což je dost pro mnoho produkčních inferencí.
Inženýrské překážky
Spuštění DeepSeek V4 Flash na MI300X nebylo přímočaré. Oficiální recept vLLM zahrnuje hardware Nvidia a novější GPU AMD, jako jsou MI325X a MI355X, ale ne jedinou produkční konfiguraci MI300X pro kontrolní bod 31. července.
Úložiště dokumentuje několik technických problémů, které bylo třeba vyřešit. MI300X používá variantu číselného formátu FP8, který se liší od standardu používaného novějšími čipy AMD, a jádro, které předpokládá špatnou sémantiku, může produkovat výsledky až dvakrát. Vývojář také musel opravit směrování směsi odborníků na vysokou souběžnost, kauzální spekulativní ověřování a synchronizaci klíč-hodnota CPU, z nichž několik zůstává v upstream vLLM neopraveno.
Úložiště přidává překryvy správnosti, ověřenou konfiguraci poskytování se spekulativním navrhováním, ladící tabulky AITER GEMM pro tvary čipů, které v zabalených tabulkách chyběly, a hybridní strategii klíč-hodnota, která kombinuje mezipaměť GPU s vytížením CPU.
Co to znamená pro válku s čipy
Ukázka přichází v klíčovém okamžiku pro ambice AMD v oblasti umělé inteligence. Nvidia ovládá drtivou většinu trhu s akcelerátory AI, podpořený svým softwarovým ekosystémem CUDA, který mnoho vývojářů považuje za příkop, který se AMD snažilo překonat. SemiAnalysis zkoumala tuto otázku přímo v analýze z července 2026 nazvané "Může AMD prolomit příkop CUDA?" a odpověď zůstává sporná.
Ale projekty s otevřeným zdrojovým kódem, jako je tento, se omezují na propast ve vnímání. Pokud jediný MI300X může sloužit hraničnímu modelu při konkurenčních rychlostech, argument o nákladech pro AMD bude obtížnější odmítnout. AMD také buduje své vlastní otevřené modelové portfolio, vydává Instella-MoE-16B, plně otevřený model trénovaný od nuly na vlastních GPU Instinct, a spolupracuje se Zyphrou na 15megawattové platformě MI355X.
Mezitím samotný DeepSeek snižuje náklady na hraniční umělou inteligenci. Model V4 Flash byl již nejlevnějším známým modelem, který fungoval podle analýzy výzkumné firmy a odpovídal GPT-5.6 Luna za cenu nižší o 60 procent. V kombinaci s levnějším hardwarem AMD se ekonomika obsluhy velkých modelů mimo ekosystém Nvidia rychle zlepšuje.
Výhoda Open Source
Úložiště podtrhuje širší téma ve vývoji umělé inteligence v roce 2026: modely s otevřenou váhou a nástroje pro odvození open source umožňují nezávislým inženýrům replikovat a optimalizovat nasazení, která byla kdysi výhradní doménou dobře financovaných laboratoří. Zveřejněním úplné konfigurace, ladicích tabulek a konkrétních chyb opravených v průběhu práce snižuje bariéru pro každého, kdo uvažuje o hardwaru AMD pro vážnou pracovní zátěž AI.
Udržujte si náskok před AI
Bitva mezi AMD a Nvidií o odvození AI se přiostřuje a příspěvky s otevřeným zdrojovým kódem, jako je toto nasazení, tiše posouvají konkurenční prostředí. Pro nejnovější vývoj AI v oblasti hardwaru, otevřených modelů a infrastruktury zůstaňte s naším pokrytím.
Přečtěte si další zprávy o AI →