Pembangun bebas telah menunjukkan bahawa model V4 Flash DeepSeek, sistem campuran pakar 304 bilion parameter, boleh dijalankan dalam pengeluaran pada GPU AMD MI300X tunggal, mencapai 168.6 token sesaat dalam penyahkodan satu aliran tanpa sebarang pengkuantitian berat atau pemunggahan. Kerja yang diterbitkan di GitHub dan muncul di bahagian atas Berita Hacker pada 4 Ogos 2026, menawarkan bukti paling jelas bahawa perkakasan AMD boleh menyediakan model terbuka skala sempadan tanpa bergantung pada Nvidia.

Repositori, yang diselenggara oleh pembangun Ryan Zhou, termasuk timbunan Docker Compose yang lengkap, tindanan fail yang disematkan dan jadual penalaan untuk menjalankan pusat pemeriksaan DeepSeek-V4-Flash-0731 pada satu MI300X. Bagi pembaca yang menjejaki berita terbaharu AI mengenai perang cip antara AMD dan Nvidia, hasilnya adalah ketara kerana ia mencabar andaian bahawa inferens sempadan memerlukan perkakasan Nvidia yang terkini dan paling mahal.

Nombor

Prestasi yang ditanda aras, diukur pada timbunan perisian yang disematkan menggunakan binaan ROCm setiap malam bagi vLLM, menceritakan kisah yang menarik tentang perkara yang boleh dilakukan oleh pemecut AMD tunggal:

  • Penyahkod strim tunggal: 168.6 token sesaat, cukup pantas untuk sembang masa nyata dan beban kerja agen.
  • Prefill throughput: lebih kurang 7,900 hingga 8,500 token sesaat dengan kernel yang ditala, bermakna gesaan yang panjang diproses dalam masa kurang dari satu saat.
  • Lapan strim serentak: 542 token sesaat agregat, dengan 90.3 token sesaat setiap strim.
  • 64-strim letusan: 830 token sesaat agregat, tanpa ralat kehabisan memori dan tiada kegagalan enjin.
  • Panjang konteks: 256,000 token disahkan dalam ujian, dengan seni bina menyokong sehingga satu juta.

Keseluruhan model ini menduduki 156.67 gigabait memori lebar jalur tinggi, sesuai sepenuhnya dalam kumpulan HBM3 192-gigabait MI300X. Tiada pengkuantitian tambahan atau pemunggahan berat diperlukan, yang mengekalkan ketepatan penuh model.

Mengapa MI300X Berfungsi

AMD MI300X mempunyai dua atribut yang menjadikan penggunaan GPU tunggal model sebesar ini mungkin. Ia mempunyai 192 gigabait memori HBM3, 2.4 kali ganda kapasiti Nvidia H100 SXM5, dan 5.3 terabait sesaat lebar jalur memori. Tulisan berasingan oleh pembangun yang dikenal pasti sebagai Fergus Finn, yang meletakkan asas untuk penggunaan ini, menganggarkan bahawa MI300X berharga kira-kira separuh daripada perkakasan Nvidia yang setanding pada harga senarai.

Untuk pusat pemeriksaan 304 bilion parameter ini, kapasiti memori adalah faktor penentu. Model ini sesuai sepenuhnya dalam memori pada cip, meninggalkan ruang untuk kumpulan cache nilai kunci GPU 20 gigabait dan peringkat CPU 96 gigabait untuk entri cache awalan yang dialih keluar. Satu kad boleh mengendalikan dua hingga lapan aliran serentak biasa dan letusan sehingga 64 aliran, yang cukup untuk banyak beban kerja inferens pengeluaran.

Halangan Kejuruteraan

Menjalankan DeepSeek V4 Flash pada MI300X adalah tidak mudah. Resipi vLLM rasmi meliputi perkakasan Nvidia dan GPU AMD yang lebih baharu seperti MI325X dan MI355X, tetapi bukan konfigurasi pengeluaran MI300X tunggal untuk pusat pemeriksaan 31 Julai.

Repositori mendokumenkan beberapa masalah kejuruteraan yang perlu diselesaikan. MI300X menggunakan varian format nombor FP8 yang berbeza daripada piawaian yang digunakan oleh cip AMD yang lebih baharu, dan kernel yang menganggap semantik yang salah boleh menghasilkan keputusan dengan faktor dua. Pembangun juga perlu membetulkan penghalaan campuran pakar pada keselarasan tinggi, pengesahan spekulatif penyebab dan penyegerakan nilai kunci CPU, beberapa daripadanya kekal tidak dibetulkan dalam vLLM huluan.

Repositori menambah tindanan ketepatan, konfigurasi penyajian yang disahkan dengan penggubalan spekulatif, jadual penalaan AITER GEMM untuk bentuk cip yang tiada jadual berpakej dan strategi nilai kunci hibrid yang menggabungkan cache GPU dengan pemuatan CPU.

Maksudnya untuk Perang Cip

Demonstrasi ini tiba pada saat yang penting untuk cita-cita AMD dalam AI. Nvidia mengawal sebahagian besar pasaran pemecut AI, disokong oleh ekosistem perisian CUDAnya, yang dilihat ramai pembangun sebagai parit yang sukar diharungi oleh AMD. SemiAnalysis meneliti soalan itu secara langsung dalam analisis Julai 2026 bertajuk "Bolehkah AMD memecahkan parit CUDA?" dan jawapannya tetap dipertikaikan.

Tetapi projek sumber terbuka seperti satu cip ini jauh dari jurang persepsi. Jika MI300X tunggal boleh menyampaikan model skala sempadan pada kelajuan kompetitif, hujah kos untuk AMD menjadi lebih sukar untuk diketepikan. AMD juga telah membina portfolio model terbukanya sendiri, mengeluarkan Instella-MoE-16B, model terbuka sepenuhnya yang dilatih dari awal pada GPU Instinctnya sendiri, dan bekerjasama dengan Zyphra pada platform MI355X 15 megawatt.

Sementara itu, DeepSeek sendiri telah mengurangkan kos AI sempadan. Model V4 Flash sudah pun menjadi model terkenal paling murah untuk dijalankan mengikut analisis firma penyelidikan, memadankan GPT-5.6 Luna pada kos 60 peratus lebih rendah. Digabungkan dengan perkakasan AMD yang lebih murah, ekonomi menyediakan model besar di luar ekosistem Nvidia bertambah baik dengan pantas.

Kelebihan Sumber Terbuka

Repositori menggariskan tema yang lebih luas dalam pembangunan AI 2026: model berwajaran terbuka dan alatan inferens sumber terbuka membolehkan jurutera bebas meniru dan mengoptimumkan penggunaan yang pernah menjadi domain eksklusif makmal yang dibiayai dengan baik. Dengan menerbitkan konfigurasi penuh, jadual penalaan dan pepijat khusus yang telah diperbaiki di sepanjang jalan, kerja itu mengurangkan halangan bagi sesiapa sahaja yang mempertimbangkan perkakasan AMD untuk beban kerja AI yang serius.

Kekal Mendahului AI

Pertempuran antara AMD dan Nvidia untuk inferens AI semakin sengit, dan sumbangan sumber terbuka seperti penggunaan ini secara senyap-senyap mengubah landskap persaingan. Untuk perkembangan AI terkini dalam perkakasan, model terbuka dan infrastruktur, kekal dengan liputan kami.

Baca lebih banyak berita AI →