Niezależny programista wykazał, że model DeepSeek V4 Flash, będący mieszanką ekspertów składający się z 304 miliardów parametrów, może działać w środowisku produkcyjnym na pojedynczym procesorze graficznym AMD MI300X, osiągając 168,6 tokenów na sekundę w dekodowaniu w jednym strumieniu bez kwantyzacji wagi ani odciążania. Praca, opublikowana w GitHub i umieszczona na czołówce Hacker News 4 sierpnia 2026 r., stanowi najwyraźniejszy jak dotąd dowód na to, że sprzęt AMD może obsługiwać otwarty model na pionierską skalę bez polegania na Nvidii.

Repozytorium, obsługiwane przez programistę Ryana Zhou, zawiera kompletny stos Docker Compose, przypięte nakładki plików i tabele dostrajania do uruchamiania punktu kontrolnego DeepSeek-V4-Flash-0731 na jednym MI300X. Dla czytelników śledzących najnowsze wiadomości o sztucznej inteligencji na temat wojny chipów między AMD a Nvidią wynik jest znaczący, ponieważ podważa założenie, że wnioskowanie na granicy wymaga najnowszego i najdroższego sprzętu Nvidii.

Liczby

Testowana wydajność, mierzona na przypiętym stosie oprogramowania przy użyciu nocnej kompilacji vLLM ROCm, opowiada fascynującą historię o tym, co może zrobić pojedynczy akcelerator AMD:

  • Dekodowanie w jednym strumieniu: 168,6 tokenów na sekundę, wystarczająco szybko, aby obsługiwać czaty w czasie rzeczywistym i obciążenia agenta.
  • Przepustowość wstępnego napełniania: około 7900 do 8500 tokenów na sekundę przy dostrojonych jądrach, co oznacza, że ​​długie monity są przetwarzane w czasie znacznie krótszym niż sekunda.
  • Osiem równoczesnych strumieni: łącznie 542 tokenów na sekundę, przy 90,3 tokenów na sekundę na strumień.
  • Seria 64 strumieni: łącznie 830 tokenów na sekundę, bez błędów braku pamięci i awarii silnika.
  • Długość kontekstu: 256 000 tokenów zweryfikowanych w testach, przy architekturze obsługującej do jednego miliona.

Cały model zajmuje 156,67 gigabajtów pamięci o dużej przepustowości, mieszcząc się w całości w 192-gigabajtowej puli HBM3 MI300X. Nie była konieczna żadna dodatkowa kwantyzacja ani odciążanie, co pozwala zachować pełną dokładność modelu.

Dlaczego MI300X działa

AMD MI300X posiada dwie cechy, które umożliwiają wdrożenie tak dużego modelu z jedną kartą graficzną. Ma 192 gigabajty pamięci HBM3, 2,4 razy większą pojemność niż Nvidia H100 SXM5 i 5,3 terabajtów na sekundę przepustowości pamięci. W oddzielnym artykule dewelopera zidentyfikowanego jako Fergus Finn, który położył podwaliny pod to wdrożenie, oszacowano, że MI300X kosztuje mniej więcej połowę tego, co porównywalny sprzęt Nvidia po cenie katalogowej.

W przypadku tego konkretnego punktu kontrolnego zawierającego 304 miliardy parametrów, decydującym czynnikiem jest pojemność pamięci. Model mieści się w całości w pamięci wbudowanej, pozostawiając miejsce na 20-gigabajtową pulę pamięci podręcznej GPU i 96-gigabajtową warstwę procesora na usunięte wpisy w pamięci podręcznej prefiksów. Jedna karta może obsłużyć od dwóch do ośmiu typowych jednoczesnych strumieni i serie do 64 strumieni, co jest wystarczające w przypadku wielu obciążeń produkcyjnych.

Przeszkody inżynieryjne

Uruchomienie DeepSeek V4 Flash na MI300X nie było proste. Oficjalny przepis vLLM obejmuje sprzęt Nvidia i nowsze procesory graficzne AMD, takie jak MI325X i MI355X, ale nie dotyczy konfiguracji produkcyjnej z jednym MI300X dla punktu kontrolnego z 31 lipca.

Repozytorium dokumentuje kilka problemów inżynieryjnych, które należało rozwiązać. MI300X wykorzystuje wariant formatu liczb FP8, który różni się od standardu stosowanego w nowszych chipach AMD, oraz jądro, które zakłada niewłaściwą semantykę, może generować wyniki dwukrotnie. Deweloper musiał także naprawić routing złożony z ekspertów przy dużej współbieżności, przyczynową weryfikację spekulatywną i synchronizację klucz-wartość procesora, z których kilka pozostaje nienaprawionych w nadrzędnym vLLM.

Repozytorium dodaje nakładki poprawności, sprawdzoną konfigurację serwowania z szkicowaniem spekulatywnym, tabele dostrajania AITER GEMM pod kątem kształtów chipów, których brakowało w spakowanych tabelach, a także hybrydową strategię klucz-wartość, która łączy pamięć podręczną GPU z odciążeniem procesora.

Co to oznacza dla wojny chipów

Demonstracja przypada na kluczowy moment dla ambicji AMD w zakresie sztucznej inteligencji. Nvidia kontroluje przeważającą większość rynku akceleratorów AI, wspierana przez ekosystem oprogramowania CUDA, który wielu programistów postrzega jako fosę, którą AMD z trudem przekroczyła. SemiAnalytics zbadało to pytanie bezpośrednio w analizie z lipca 2026 r. zatytułowanej „Czy AMD może przełamać fosę CUDA?” a odpowiedź pozostaje sporna.

Jednak projekty typu open source, takie jak ten, niwelują lukę w postrzeganiu. Jeśli pojedynczy MI300X może obsłużyć model o pionierskiej skali przy konkurencyjnych prędkościach, argument AMD dotyczący kosztów staje się trudniejszy do odrzucenia. AMD rozwija także własne portfolio modeli otwartych, wypuszczając Instella-MoE-16B, w pełni otwarty model wyszkolony od podstaw na własnych procesorach graficznych Instinct i współpracując z Zyphrą w zakresie 15-megawatowej platformy MI355X.

Tymczasem sam DeepSeek obniża koszty pionierskiej sztucznej inteligencji. Według analiz firmy badawczej model V4 Flash był już najtańszym dobrze znanym modelem do uruchomienia, dorównując GPT-5.6 Luna przy cenie o 60 procent niższej. W połączeniu z tańszym sprzętem AMD, ekonomika obsługi dużych modeli poza ekosystemem Nvidia szybko się poprawia.

Przewaga otwartego oprogramowania

Repozytorium podkreśla szerszy temat rozwoju sztucznej inteligencji w 2026 r.: modele o otwartym formacie i narzędzia do wnioskowania typu open source umożliwiają niezależnym inżynierom replikowanie i optymalizację wdrożeń, które kiedyś były wyłączną domeną dobrze finansowanych laboratoriów. Publikując pełną konfigurację, tabele dostrajania i konkretne błędy naprawione po drodze, praca obniża barierę dla każdego, kto rozważa sprzęt AMD do poważnych obciążeń AI.

Wyprzedź sztuczną inteligencję

Walka pomiędzy AMD i Nvidią o wnioskowanie AI nasila się, a rozwiązania typu open source, takie jak to wdrożenie, po cichu zmieniają krajobraz konkurencji. Aby zapoznać się z najnowszymi osiągnięciami sztucznej inteligencji w zakresie sprzętu, otwartych modeli i infrastruktury, pozostań w naszym zasięgu.

Przeczytaj więcej aktualności o sztucznej inteligencji →