Pangembang independen wis nduduhake manawa model DeepSeek's V4 Flash, sistem campuran-para-parameter 304-miliar-parameter, bisa mlaku ing produksi ing siji GPU AMD MI300X, entuk 168.6 token per detik ing dekoding aliran siji tanpa jumlah bobot utawa muatan. Karya kasebut, sing diterbitake ing GitHub lan muncul ing ndhuwur Hacker News tanggal 4 Agustus 2026, menehi bukti sing paling jelas manawa hardware AMD bisa ngladeni model mbukak skala wates tanpa ngandelake Nvidia.

Repositori, sing dikelola dening pangembang Ryan Zhou, kalebu tumpukan Docker Compose lengkap, overlay file sing disematake, lan tabel tuning kanggo mbukak checkpoint DeepSeek-V4-Flash-0731 ing siji MI300X. Kanggo maca sing nelusuri bejat AI warta ing perang chip antarane AMD lan Nvidia, asil pinunjul amarga nantang asumsi yen inferensi wates mbutuhake hardware paling anyar lan paling larang Nvidia.

Angka

Kinerja benchmarked, diukur ing tumpukan piranti lunak pinned nggunakake ROCm mbangun wengi saka vLLM, nyritakake crita milutaken bab apa siji akselerator AMD bisa nindakake:

  • Single-stream decode: 168,6 token per detik, cukup cepet kanggo chatting nyata-wektu lan workloads agen.
  • Prefill throughput: udakara 7.900 nganti 8.500 token per detik kanthi kernel sing disetel, tegese panjaluk sing dawa diproses sajrone sedetik.
  • Wolung aliran bebarengan: 542 token per detik aggregate, karo 90,3 token per detik saben stream.
  • 64-stream bledosan: 830 token per detik aggregate, tanpa kasalahan metu saka memori lan ora engine gagal.
  • Dawa konteks: 256.000 token divalidasi ing testing, kanthi arsitektur ndhukung nganti siji yuta.

Model kabeh duwe memori bandwidth dhuwur 156,67 gigabyte, pas kabeh ing kolam renang HBM3 192-gigabyte MI300X. Ora ana kuantisasi tambahan utawa bobot mundhut sing dibutuhake, sing njaga akurasi lengkap model kasebut.

Apa MI300X Works

AMD MI300X duweni rong atribut sing nggawe panyebaran siji-GPU saka model bisa dadi gedhe. Wis 192 gigabyte memori HBM3, 2,4 kaping kapasitas saka Nvidia H100 SXM5, lan 5,3 terabyte per detik bandwidth memori. Tulisan kapisah dening pangembang sing diidentifikasi minangka Fergus Finn, sing nggawe dhasar kanggo panyebaran iki, kira-kira rega MI300X kira-kira setengah saka hardware Nvidia sing padha karo rega dhaptar.

Kanggo titik pamriksan 304 milyar parameter iki, kapasitas memori minangka faktor sing nemtokake. Model kasebut cocog banget ing memori on-chip, ninggalake ruangan kanggo blumbang cache nilai kunci GPU 20 gigabyte lan tingkat CPU 96 gigabyte kanggo entri cache prefix sing dibuwang. Siji kertu bisa nangani loro nganti wolung aliran bebarengan sing khas lan bledosan nganti 64 aliran, sing cukup kanggo akeh beban kerja inferensi produksi.

Rintangan Teknik

Mlaku DeepSeek V4 Flash ing MI300X ora gampang. Resep vLLM resmi nyakup hardware Nvidia lan GPU AMD sing luwih anyar kayata MI325X lan MI355X, nanging dudu konfigurasi produksi siji-MI300X kanggo checkpoint 31 Juli.

Repositori nyathet sawetara masalah teknik sing kudu ditanggulangi. MI300X nggunakake varian format nomer FP8 sing beda karo standar sing digunakake dening chip AMD sing luwih anyar, lan kernel sing nganggep salah semantik bisa ngasilake asil kanthi faktor loro. Pangembang uga kudu ndandani rute campuran-ahli kanthi konkurensi dhuwur, verifikasi spekulatif sebab-akibat, lan sinkronisasi nilai-kunci CPU, sawetara sing tetep ora tetep ing vLLM hulu.

Repositori nambah overlay bener, konfigurasi porsi sing wis divalidasi kanthi rancangan spekulatif, tabel tuning AITER GEMM kanggo bentuk chip sing ora ana ing tabel sing dikemas, lan strategi nilai kunci hibrida sing nggabungake cache GPU karo CPU offload.

Apa Tegese kanggo Perang Chip

Demonstrasi kasebut teka ing wayahe penting kanggo ambisi AMD ing AI. Nvidia ngontrol mayoritas pasar akselerator AI, didhukung dening ekosistem piranti lunak CUDA, sing akeh pangembang ndeleng minangka parit sing angel dilewati AMD. SemiAnalysis nliti pitakonan kasebut langsung ing analisis Juli 2026 kanthi judhul "Apa AMD bisa ngrusak parit CUDA?" lan jawabane tetep dibantah.

Nanging proyek-proyek open-source kaya chip siji iki ing jurang pemahaman. Yen MI300X siji bisa ngladeni model skala wates kanthi kecepatan sing kompetitif, argumen biaya kanggo AMD dadi luwih angel dibuwang. AMD uga wis mbangun portofolio model mbukak dhewe, ngeculake Instella-MoE-16B, model mbukak kanthi dilatih saka awal ing GPU Instinct dhewe, lan partner karo Zyphra ing platform MI355X 15 megawatt.

Kangge, DeepSeek dhewe wis nyuda biaya AI perbatasan. Model V4 Flash wis dadi model paling murah sing kondhang miturut analisis perusahaan riset, cocog karo GPT-5.6 Luna kanthi biaya 60 persen luwih murah. Digabungake karo hardware AMD sing luwih murah, ekonomi ngladeni model gedhe ing njaba ekosistem Nvidia saya tambah kanthi cepet.

Kaluwihan Open Source

Repositori kasebut negesake tema sing luwih jembar ing pangembangan AI 2026: model bobot mbukak lan alat inferensi sumber terbuka ndadekake para insinyur independen bisa niru lan ngoptimalake penyebaran sing biyen dadi domain eksklusif laboratorium sing didanai kanthi apik. Kanthi nerbitake konfigurasi lengkap, tabel tuning, lan bug tartamtu sing didandani, karya kasebut nyuda alangan kanggo sapa wae sing mikirake hardware AMD kanggo beban kerja AI sing serius.

Tetep Ahead saka AI

Perang antarane AMD lan Nvidia kanggo inferensi AI saya tambah akeh, lan kontribusi open-source kaya penyebaran iki kanthi tenang ngganti lanskap kompetitif. Kanggo pangembangan AI paling anyar ing hardware, model mbukak, lan infrastruktur, tetep nganggo liputan kita.

Waca liyane AI warta →