Незалежний розробник продемонстрував, що модель DeepSeek V4 Flash, експертна система з 304 мільярдами параметрів, може працювати у виробництві на одному графічному процесорі AMD MI300X, досягаючи 168,6 токенів на секунду при однопотоковому декодуванні без квантування ваги чи розвантаження. Робота, опублікована на GitHub і з’явилася на вершині Hacker News 4 серпня 2026 року, пропонує найяскравіші докази того, що апаратне забезпечення AMD може обслуговувати відкриту модель передового масштабу, не покладаючись на Nvidia.

Репозиторій, який підтримує розробник Райан Чжоу, містить повний стек Docker Compose, закріплені накладення файлів і таблиці налаштування для запуску контрольної точки DeepSeek-V4-Flash-0731 на одному MI300X. Для читачів, які слідкують за [найновішими новинами штучного інтелекту] (https://aibuzzwire.news) про війну чіпів між AMD і Nvidia, результат є значущим, оскільки він ставить під сумнів припущення про те, що передові висновки потребують найновішого та найдорожчого апаратного забезпечення Nvidia.

Числа

Еталонна продуктивність, виміряна на стеку закріпленого програмного забезпечення за допомогою нічної збірки vLLM ROCm, розповідає переконливу історію про те, що може зробити один прискорювач AMD:

  • Однопотокове декодування: 168,6 токенів на секунду, достатньо швидко для чату в реальному часі та агентських навантажень.
  • Пропускна здатність попереднього заповнення: приблизно від 7900 до 8500 токенів на секунду з налаштованими ядрами, тобто довгі підказки обробляються набагато менше секунди.
  • Вісім одночасних потоків: сукупно 542 токени в секунду, 90,3 токена в секунду на потік.
  • 64-потоковий пакет: сукупно 830 токенів на секунду, без помилок нестачі пам’яті та збоїв механізму.
  • Довжина контексту: 256 000 токенів, перевірених під час тестування, з підтримкою архітектури до одного мільйона.

Вся модель займає 156,67 гігабайт пам’яті з високою пропускною здатністю, що повністю вміщується в 192-гігабайтний пул HBM3 MI300X. Додаткове квантування або розвантаження ваги не було потрібно, що зберігає повну точність моделі.

Чому MI300X працює

AMD MI300X має дві властивості, які роблять можливим розгортання такої великої моделі з одним GPU. Він має 192 гігабайти пам'яті HBM3, що в 2,4 рази перевищує ємність Nvidia H100 SXM5, і пропускну здатність пам'яті 5,3 терабайт на секунду. В окремому коментарі розробника на ім’я Фергюс Фінн, який заклав основу для цього розгортання, підраховано, що MI300X коштує приблизно вдвічі менше, ніж порівнянне обладнання Nvidia за прейскурантною ціною.

Для цієї конкретної контрольної точки з 304 мільярдами параметрів ємність пам’яті є вирішальним фактором. Модель повністю поміщається у вбудованій пам’яті, залишаючи місце для 20-гігабайтного пулу кешу ключів і значень графічного процесора та 96-гігабайтного рівня ЦП для видалених записів кешу префіксів. Одна карта може обробляти від двох до восьми типових одночасних потоків і пакетів до 64 потоків, чого достатньо для багатьох робочих навантажень виробничого висновку.

Інженерні перешкоди

Запустити DeepSeek V4 Flash на MI300X було непросто. Офіційний рецепт vLLM охоплює апаратне забезпечення Nvidia та новіші графічні процесори AMD, такі як MI325X і MI355X, але не виробничу конфігурацію MI300X для контрольної точки 31 липня.

Репозиторій документує кілька інженерних проблем, які необхідно було вирішити. MI300X використовує варіант числового формату FP8, який відрізняється від стандарту, що використовується в новіших чіпах AMD, і ядро, яке передбачає неправильну семантику, може давати результати в два рази. Розробнику також довелося виправити маршрутизацію суміші експертів із високим рівнем паралелізму, причинно-наслідкову спекулятивну перевірку та синхронізацію ключ-значення ЦП, деякі з яких залишаються невиправленими у вихідній версії vLLM.

Репозиторій додає коректні накладки, перевірену конфігурацію обслуговування з спекулятивним проектуванням, таблиці налаштування AITER GEMM для форм мікросхем, яких бракувало в упакованих таблицях, і гібридну стратегію ключ-значення, яка поєднує кеш графічного процесора з розвантаженням ЦП.

Що це означає для війни чіпів

Демонстрація відбувається в ключовий момент для амбіцій AMD у сфері ШІ. Nvidia контролює переважну більшість ринку прискорювачів штучного інтелекту, що підтримується екосистемою програмного забезпечення CUDA, яку багато розробників сприймають як рів, який AMD намагається подолати. SemiAnalysis розглянув це питання безпосередньо в аналізі від липня 2026 року під назвою «Чи може AMD зламати рів CUDA?» і відповідь залишається оскарженою.

Але проекти з відкритим вихідним кодом, подібні до цього, лише зменшують розрив у сприйнятті. Якщо один MI300X може обслуговувати модель передового масштабу з конкурентоспроможною швидкістю, аргумент щодо вартості для AMD стає важче відхилити. AMD також створює власне портфоліо відкритих моделей, випускаючи Instella-MoE-16B, повністю відкриту модель, навчену з нуля на власних графічних процесорах Instinct, і співпрацюючи з Zyphra на 15-мегаватній платформі MI355X.

Тим часом сам DeepSeek знижує вартість передового ШІ. Згідно з аналізом дослідницької компанії, модель V4 Flash вже була найдешевшою моделлю з усіх відомих, що збігалася з GPT-5.6 Luna за ціною на 60 відсотків нижчою. У поєднанні з дешевшим обладнанням AMD економіка обслуговування великих моделей за межами екосистеми Nvidia швидко покращується.

Перевага відкритого вихідного коду

Репозиторій підкреслює ширшу тему розробки штучного інтелекту до 2026 року: відкриті моделі та інструменти висновку з відкритим вихідним кодом дають змогу незалежним інженерам відтворювати та оптимізувати розгортання, які колись були виключною сферою добре фінансованих лабораторій. Публікуючи повну конфігурацію, таблиці налаштування та конкретні помилки, виправлені на цьому шляху, ця робота знижує бар’єр для тих, хто розглядає апаратне забезпечення AMD для серйозних навантажень ШІ.

Будьте попереду ШІ

Боротьба між AMD і Nvidia за висновок штучного інтелекту посилюється, а внески з відкритим кодом, як це розгортання, тихо змінюють конкурентний ландшафт. Щоб дізнатися про останні розробки штучного інтелекту у сфері апаратного забезпечення, відкритих моделей та інфраструктури, слідкуйте за нашими новинами.

Читати більше новин AI →