Bağımsız bir geliştirici, DeepSeek'in 304 milyar parametreli uzmanlardan oluşan bir sistem olan V4 Flash modelinin, üretimde tek bir AMD MI300X GPU üzerinde çalışabildiğini ve tek akışlı kod çözmede herhangi bir ağırlık ölçümü veya boşaltma olmadan saniyede 168,6 token elde edebildiğini gösterdi. GitHub'da yayınlanan ve 4 Ağustos 2026'da Hacker News'in üst sıralarında yer alan çalışma, AMD'nin donanımının Nvidia'ya güvenmeden sınır ölçeğinde açık bir model sunabileceğinin henüz en net kanıtını sunuyor.
Geliştirici Ryan Zhou tarafından bakımı yapılan depo, tam bir Docker Compose yığını, sabitlenmiş dosya katmanları ve bir MI300X'te DeepSeek-V4-Flash-0731 kontrol noktasını çalıştırmak için ayar tabloları içerir. AMD ile Nvidia arasındaki çip savaşına ilişkin son dakika yapay zeka haberlerini takip eden okuyucular için sonuç önemli çünkü sınır çıkarımının Nvidia'nın en yeni ve en pahalı donanımını gerektirdiği varsayımına meydan okuyor.
Sayılar
ROCm'nin gecelik vLLM yapısı kullanılarak sabitlenmiş bir yazılım yığınında ölçülen kıyaslamalı performans, tek bir AMD hızlandırıcının neler yapabileceği hakkında ilgi çekici bir hikaye anlatıyor:
- Tek akışlı kod çözme: Saniyede 168,6 jeton, gerçek zamanlı sohbet ve aracılı iş yükleri için yeterince hızlı.
- Önceden doldurma verimi: Ayarlanmış çekirdeklerle saniyede yaklaşık 7.900 ila 8.500 jeton, yani uzun istemler bir saniyenin çok altında bir sürede işlenir.
- Sekiz eşzamanlı akış: Toplamda saniyede 542 jeton, akış başına saniyede 90,3 jeton.
- 64 akış patlaması: Bellek yetersiz hatası ve motor arızası olmadan saniyede toplam 830 jeton.
- Bağlam uzunluğu: Bir milyona kadar destekleyen mimariyle testlerde 256.000 jeton doğrulandı.
Modelin tamamı 156,67 gigabaytlık yüksek bant genişliğine sahip bellek kaplıyor ve tamamen MI300X'in 192 gigabaytlık HBM3 havuzuna sığıyor. Modelin tam doğruluğunu koruyan hiçbir ek nicelik belirlemeye veya ağırlık boşaltmaya ihtiyaç duyulmadı.
MI300X Neden Çalışıyor?
AMD MI300X, bu kadar büyük bir modelin tek GPU dağıtımını mümkün kılan iki özelliğe sahiptir. 192 gigabayt HBM3 belleğe, Nvidia H100 SXM5'in 2,4 katı kapasiteye ve saniyede 5,3 terabayt bellek bant genişliğine sahiptir. Bu dağıtımın temelini atan, Fergus Finn olarak tanımlanan bir geliştiricinin ayrı bir yazısında, MI300X'in liste fiyatındaki karşılaştırılabilir Nvidia donanımının kabaca yarısı kadar maliyeti olduğu tahmin ediliyor.
Bu 304 milyar parametreli kontrol noktası için bellek kapasitesi belirleyici faktördür. Model tamamen çip üzerindeki belleğe sığar ve 20 gigabaytlık GPU anahtar/değer önbellek havuzuna ve çıkarılan önek önbellek girişleri için 96 gigabaytlık CPU katmanına yer bırakır. Bir kart, iki ila sekiz tipik eşzamanlı akışı ve 64'e kadar akıştan oluşan patlamaları işleyebilir; bu, birçok üretim çıkarımı iş yükü için yeterlidir.
Mühendislik Engelleri
MI300X'te DeepSeek V4 Flash'ı çalıştırmak kolay olmadı. Resmi vLLM tarifi, Nvidia donanımını ve MI325X ve MI355X gibi daha yeni AMD GPU'ları kapsıyor, ancak 31 Temmuz kontrol noktası için tek bir MI300X üretim yapılandırmasını kapsamıyor.
Depo, çözülmesi gereken çeşitli mühendislik problemlerini belgeliyor. MI300X, FP8 sayı formatının yeni AMD yongaları tarafından kullanılan standarttan farklı bir çeşidini kullanıyor ve yanlış semantiğin iki kat sonuç üretebileceğini varsayan bir çekirdek kullanıyor. Geliştiricinin ayrıca yüksek eşzamanlılık, nedensel spekülatif doğrulama ve CPU anahtar-değer senkronizasyonunda uzman karışımı yönlendirmesini düzeltmesi gerekiyordu; bunların birçoğu yukarı akış vLLM'de sabitlenmeden kaldı.
Depo, doğruluk katmanlarını, spekülatif taslak hazırlamayla doğrulanmış bir sunum yapılandırmasını, paketlenmiş tablolarda eksik olan çip şekilleri için AITER GEMM ayarlama tablolarını ve GPU önbelleğini CPU boşaltmayla birleştiren hibrit bir anahtar-değer stratejisi ekler.
Çip Savaşı İçin Ne İfade Ediyor
Gösteri, AMD'nin yapay zeka konusundaki hedefleri açısından çok önemli bir zamanda gerçekleşiyor. Nvidia, birçok geliştiricinin AMD'nin aşmaya çalıştığı bir hendek olarak gördüğü CUDA yazılım ekosistemi tarafından desteklenen yapay zeka hızlandırıcı pazarının ezici çoğunluğunu kontrol ediyor. SemiAnalytics, Temmuz 2026'da "AMD CUDA hendeğini kırabilir mi?" başlıklı bir analizde bu soruyu doğrudan inceledi. ve cevap tartışmalı olmaya devam ediyor.
Ancak bunun gibi açık kaynaklı projeler algı boşluğunu bir nebze olsun ortadan kaldırıyor. Tek bir MI300X, sınır ölçeğinde bir modele rekabetçi hızlarda hizmet edebiliyorsa, AMD'nin maliyet argümanının reddedilmesi zorlaşır. AMD aynı zamanda kendi açık model portföyünü de oluşturuyor, kendi Instinct GPU'ları üzerinde sıfırdan eğitilmiş tamamen açık bir model olan Instella-MoE-16B'yi piyasaya sürüyor ve 15 megawatt MI355X platformunda Zyphra ile ortaklık yapıyor.
Bu arada DeepSeek'in kendisi de ileri düzey yapay zekanın maliyetini düşürüyor. V4 Flash modeli, araştırma firmasının analizine göre halihazırda çalıştırılan en ucuz ve bilinen modeldi ve GPT-5.6 Luna ile yüzde 60 daha düşük maliyetle eşleşiyordu. Daha ucuz AMD donanımıyla birlikte, büyük modellerin Nvidia ekosistemi dışında sunulmasının ekonomisi hızla gelişiyor.
Açık Kaynak Avantajı
Depo, 2026 yapay zeka geliştirmede daha geniş bir temanın altını çiziyor: Açık ağırlıklı modeller ve açık kaynaklı çıkarım araçları, bağımsız mühendislerin bir zamanlar iyi finanse edilen laboratuvarların özel alanı olan dağıtımları çoğaltmasını ve optimize etmesini mümkün kılıyor. Tam konfigürasyonun, ayar tablolarının ve bu süreçte giderilen belirli hataların yayınlanmasıyla bu çalışma, AMD donanımını ciddi yapay zeka iş yükleri için düşünen herkes için engelleri kaldırıyor.
Yapay Zekanın Önünde Olun
Yapay zeka çıkarımı için AMD ve Nvidia arasındaki mücadele yoğunlaşıyor ve bu dağıtım gibi açık kaynak katkıları, rekabet ortamını sessizce değiştiriyor. Donanım, açık modeller ve altyapı alanındaki en son yapay zeka gelişmeleri için kapsamımızı takip edin.
Daha fazla AI haberini okuyun →