Независимый разработчик продемонстрировал, что модель DeepSeek V4 Flash, система, состоящая из 304 миллиардов параметров, может работать на одном графическом процессоре AMD MI300X, достигая 168,6 токенов в секунду при однопоточном декодировании без какого-либо весового квантования или разгрузки. Работа, опубликованная на GitHub и появившаяся в верхней части Hacker News 4 августа 2026 года, предлагает ярчайшие доказательства того, что оборудование AMD может служить открытой модели передового масштаба, не полагаясь на Nvidia.
Репозиторий, поддерживаемый разработчиком Райаном Чжоу, включает в себя полный стек Docker Compose, закрепленные файлы и таблицы настройки для запуска контрольной точки DeepSeek-V4-Flash-0731 на одном MI300X. Для читателей, отслеживающих последние новости искусственного интеллекта о войне чипов между AMD и Nvidia, результат важен, поскольку он бросает вызов предположению о том, что для вывода о передовых технологиях требуется новейшее и самое дорогое оборудование Nvidia.
Числа
Тестовая производительность, измеренная на закрепленном программном стеке с использованием ночной сборки vLLM ROCm, рассказывает убедительную историю о том, на что способен один ускоритель AMD:
- Однопотоковое декодирование: 168,6 токенов в секунду, достаточно быстро для чата в реальном времени и агентских рабочих нагрузок.
- Пропускная способность предварительного заполнения: примерно от 7900 до 8500 токенов в секунду с настроенными ядрами, что означает, что длинные запросы обрабатываются менее чем за секунду.
- Восемь одновременных потоков: 542 токена в секунду в совокупности, по 90,3 токена в секунду на поток.
- Пакет из 64 потоков: совокупная скорость 830 токенов в секунду, без ошибок нехватки памяти и сбоев механизма.
- Длина контекста: 256 000 токенов, проверенных в ходе тестирования; архитектура поддерживает до одного миллиона.
Вся модель занимает 156,67 гигабайт высокоскоростной памяти, полностью вписываясь в 192-гигабайтный пул HBM3 MI300X. Никакого дополнительного квантования или разгрузки веса не потребовалось, что сохраняет полную точность модели.
Почему MI300X работает
AMD MI300X обладает двумя качествами, которые делают возможным развертывание такой большой модели с одним графическим процессором. Он имеет 192 гигабайта памяти HBM3, что в 2,4 раза больше, чем у Nvidia H100 SXM5, и пропускную способность памяти 5,3 терабайта в секунду. В отдельной статье разработчика по имени Фергус Финн, которая заложила основу для этого развертывания, оценивается, что MI300X стоит примерно вдвое дешевле, чем сопоставимое оборудование Nvidia по прейскурантной цене.
Для этой конкретной контрольной точки с 304 миллиардами параметров решающим фактором является объем памяти. Модель полностью помещается во встроенную память, оставляя место для 20-гигабайтного кэш-пула ключей и значений графического процессора и 96-гигабайтного уровня ЦП для удаленных записей префиксного кэша. Одна карта может обрабатывать от двух до восьми типичных одновременных потоков и до 64 потоков, что достаточно для многих рабочих нагрузок производственного вывода.
Инженерные препятствия
Запустить DeepSeek V4 Flash на MI300X было непросто. Официальный рецепт vLLM охватывает оборудование Nvidia и новые графические процессоры AMD, такие как MI325X и MI355X, но не распространяется на производственную конфигурацию с одним MI300X для контрольной точки 31 июля.
В репозитории задокументировано несколько инженерных проблем, которые необходимо было решить. MI300X использует вариант числового формата FP8, который отличается от стандарта, используемого в новых чипах AMD, а ядро, предполагающее неправильную семантику, может выдавать результаты, отличающиеся в два раза. Разработчику также пришлось исправить смешанную маршрутизацию экспертов при высоком уровне параллелизма, причинно-спекулятивную проверку и синхронизацию значений ключей ЦП, некоторые из которых остались неисправленными в восходящем vLLM.
В репозиторий добавлены наложения корректности, проверенная конфигурация обслуживания с спекулятивным составлением, таблицы настройки AITER GEMM для форм чипов, которые отсутствовали в упакованных таблицах, а также гибридная стратегия «ключ-значение», которая сочетает в себе кэш графического процессора с разгрузкой процессора.
Что это значит для войны чипов
Демонстрация происходит в решающий момент для амбиций AMD в области искусственного интеллекта. Nvidia контролирует подавляющую часть рынка ускорителей искусственного интеллекта, опираясь на свою программную экосистему CUDA, которую многие разработчики рассматривают как ров, который AMD изо всех сил пытается пересечь. SemiAnaлиз непосредственно изучил этот вопрос в анализе от июля 2026 года под названием «Может ли AMD сломать ров CUDA?» и ответ остается спорным.
Но проекты с открытым исходным кодом, подобные этому, сокращают разрыв в восприятии. Если один MI300X может обслуживать модель передового масштаба с конкурентоспособной скоростью, аргумент в пользу стоимости AMD становится все труднее отвергнуть. AMD также создает собственное портфолио открытых моделей, выпустив Instella-MoE-16B, полностью открытую модель, обученную с нуля на собственных графических процессорах Instinct, и сотрудничая с Zyphra над 15-мегаваттной платформой MI355X.
Тем временем сама DeepSeek снижает стоимость передового искусственного интеллекта. Согласно анализу исследовательской фирмы, модель V4 Flash уже была самой дешевой известной моделью, которая соответствовала GPT-5.6 Luna при цене на 60 процентов ниже. В сочетании с более дешевым оборудованием AMD экономика обслуживания больших моделей за пределами экосистемы Nvidia быстро улучшается.
Преимущество открытого исходного кода
Репозиторий подчеркивает более широкую тему разработки ИИ в 2026 году: модели с открытым исходным кодом и инструменты вывода с открытым исходным кодом позволяют независимым инженерам копировать и оптимизировать развертывания, которые когда-то были исключительной прерогативой хорошо финансируемых лабораторий. Публикуя полную конфигурацию, таблицы настройки и конкретные ошибки, исправленные в ходе работы, работа снижает барьер для всех, кто рассматривает оборудование AMD для серьезных рабочих нагрузок ИИ.
Будьте впереди ИИ
Битва между AMD и Nvidia за выводы ИИ усиливается, а вклады с открытым исходным кодом, подобные этому развертыванию, незаметно меняют конкурентную среду. Чтобы узнать о последних разработках в области искусственного интеллекта в области аппаратного обеспечения, открытых моделей и инфраструктуры, следите за нашими новостями.
Подробнее новости AI →