Un dezvoltator independent a demonstrat că modelul Flash V4 de la DeepSeek, un sistem mixt de experți cu 304 de miliarde de parametri, poate rula în producție pe un singur GPU AMD MI300X, realizând 168,6 jetoane pe secundă în decodare cu un singur flux fără nicio cuantificare sau descărcare de greutate. Lucrarea, publicată pe GitHub și care apare în partea de sus a Hacker News pe 4 august 2026, oferă cea mai clară dovadă de până acum că hardware-ul AMD poate servi unui model deschis la scară de frontieră fără a se baza pe Nvidia.
Depozitul, întreținut de dezvoltatorul Ryan Zhou, include o stivă completă Docker Compose, suprapuneri de fișiere fixate și tabele de reglare pentru rularea punctului de control DeepSeek-V4-Flash-0731 pe un MI300X. Pentru cititorii care urmăresc știrile de ultimă oră AI privind războiul cu cipuri dintre AMD și Nvidia, rezultatul este semnificativ, deoarece contestă ipoteza că inferența de frontieră necesită cel mai recent și mai scump hardware Nvidia.
Numerele
Performanța evaluată, măsurată pe o stivă de software fixată folosind versiunea de noapte ROCm a vLLM, spune o poveste convingătoare despre ceea ce poate face un singur accelerator AMD:
- Decodificare un singur flux: 168,6 jetoane pe secundă, suficient de rapid pentru chat în timp real și încărcături de lucru agentice.
- Debitul de precompletare: aproximativ 7.900 până la 8.500 de jetoane pe secundă cu nuclee reglate, ceea ce înseamnă că solicitările lungi sunt procesate în mai puțin de o secundă.
- Opt fluxuri simultane: 542 de jetoane pe secundă agregate, cu 90,3 jetoane pe secundă pe flux.
- Rafală de 64 de fluxuri: 830 de jetoane pe secundă agregate, fără erori de memorie insuficientă și fără defecțiuni ale motorului.
- Lungimea contextului: 256.000 de jetoane validate în testare, arhitectura acceptând până la un milion.
Întregul model ocupă 156,67 gigaocteți de memorie cu lățime de bandă mare, încadrându-se în întregime în pool-ul HBM3 de 192 gigaocteți al MI300X. Nu a fost necesară nicio cuantizare suplimentară sau descărcare de greutate, ceea ce păstrează acuratețea deplină a modelului.
De ce funcționează MI300X
AMD MI300X posedă două atribute care fac posibilă implementarea unui singur GPU a unui model atât de mare. Are 192 gigaocteți de memorie HBM3, de 2,4 ori capacitatea unui Nvidia H100 SXM5 și 5,3 terabytes pe secundă de lățime de bandă a memoriei. Un articol separat al unui dezvoltator identificat ca Fergus Finn, care a pus bazele acestei implementări, a estimat că MI300X costă aproximativ jumătate mai mult decât hardware-ul Nvidia comparabil la prețul de listă.
Pentru acest punct de control special de 304 de miliarde de parametri, capacitatea de memorie este factorul decisiv. Modelul se încadrează în întregime în memoria de pe cip, lăsând loc pentru un pool de memorie cache pentru valori-cheie GPU de 20 de gigaocteți și un nivel CPU de 96 de gigaocteți pentru intrările din cache-prefix eliminate. O singură cartelă poate gestiona două până la opt fluxuri simultane tipice și rafale de până la 64 de fluxuri, ceea ce este suficient pentru multe sarcini de lucru de inferență de producție.
Obstacolele de inginerie
Rularea DeepSeek V4 Flash pe MI300X nu a fost simplă. Rețeta oficială vLLM acoperă hardware-ul Nvidia și GPU-urile AMD mai noi, cum ar fi MI325X și MI355X, dar nu o singură configurație de producție MI300X pentru punctul de control din 31 iulie.
Depozitul documentează mai multe probleme de inginerie care trebuiau rezolvate. MI300X folosește o variantă a formatului numeric FP8 care diferă de standardul utilizat de cipurile AMD mai noi, iar un nucleu care presupune o semantică greșită poate produce rezultate cu un factor de doi. Dezvoltatorul a trebuit, de asemenea, să repare rutarea amestecului de experți la concurență ridicată, verificarea speculativă cauzală și sincronizarea cheie-valoare a CPU, dintre care multe rămân neremediate în vLLM din amonte.
Depozitul adaugă suprapuneri de corectitudine, o configurație de servire validată cu schiță speculativă, tabele de reglare AITER GEMM pentru formele de cip care lipseau din tabelele ambalate și o strategie hibridă cheie-valoare care combină un cache GPU cu descărcarea CPU.
Ce înseamnă pentru războiul chipurilor
Demonstrația ajunge într-un moment crucial pentru ambițiile AMD în AI. Nvidia controlează majoritatea covârșitoare a pieței acceleratoarelor AI, susținută de ecosistemul său software CUDA, pe care mulți dezvoltatori îl văd ca un șanț pe care AMD s-a străduit să-l traverseze. SemiAnalysis a examinat această întrebare direct într-o analiză din iulie 2026 intitulată „Poate AMD să spargă șanțul CUDA?” iar răspunsul rămâne contestat.
Dar proiecte open-source ca acesta scad decalajul de percepție. Dacă un singur MI300X poate servi unui model la scară de frontieră la viteze competitive, argumentul costurilor pentru AMD devine mai greu de respins. AMD și-a construit, de asemenea, propriul portofoliu de modele deschise, lansând Instella-MoE-16B, un model complet deschis antrenat de la zero pe propriile GPU-uri Instinct și în parteneriat cu Zyphra pe o platformă MI355X de 15 megawați.
Între timp, DeepSeek în sine a redus costurile AI de frontieră. Modelul V4 Flash a fost deja cel mai ieftin model bine-cunoscut de rulat conform analizei firmei de cercetare, potrivindu-se cu GPT-5.6 Luna la un cost cu 60% mai mic. În combinație cu hardware-ul AMD mai ieftin, economia deservirii modelelor mari în afara ecosistemului Nvidia se îmbunătățește rapid.
Avantajul Open Source
Depozitul subliniază o temă mai amplă în dezvoltarea AI în 2026: modelele open-weight și instrumentele de inferență open-source fac posibil inginerilor independenți să reproducă și să optimizeze implementările care au fost cândva domeniul exclusiv al laboratoarelor bine finanțate. Prin publicarea configurației complete, a tabelelor de reglare și a erorilor specifice remediate pe parcurs, munca scade bariera pentru oricine ia în considerare hardware-ul AMD pentru sarcini serioase de AI.
Rămâi înaintea AI
Bătălia dintre AMD și Nvidia pentru inferența AI se intensifică, iar contribuțiile open-source precum această implementare schimbă în liniște peisajul competitiv. Pentru cele mai recente evoluții AI în hardware, modele deschise și infrastructură, rămâneți cu acoperirea noastră.
Citiți mai multe știri AI →