Un desarrollador independiente ha demostrado que el modelo V4 Flash de DeepSeek, un sistema de combinación de expertos de 304 mil millones de parámetros, puede ejecutarse en producción en una sola GPU AMD MI300X, logrando 168,6 tokens por segundo en decodificación de flujo único sin ninguna cuantificación de peso ni descarga. El trabajo, publicado en GitHub y que apareció en la cima de Hacker News el 4 de agosto de 2026, ofrece la evidencia más clara hasta el momento de que el hardware de AMD puede servir a un modelo abierto a escala de frontera sin depender de Nvidia.
El repositorio, mantenido por el desarrollador Ryan Zhou, incluye una pila Docker Compose completa, superposiciones de archivos anclados y tablas de ajuste para ejecutar el punto de control DeepSeek-V4-Flash-0731 en un MI300X. Para los lectores que siguen las últimas noticias sobre IA sobre la guerra de chips entre AMD y Nvidia, el resultado es significativo porque desafía la suposición de que la inferencia de frontera requiere el hardware más reciente y caro de Nvidia.
Los números
El rendimiento evaluado, medido en una pila de software fijada utilizando la versión nocturna ROCm de vLLM, cuenta una historia convincente sobre lo que puede hacer un solo acelerador AMD:
- Decodificación de flujo único: 168,6 tokens por segundo, lo suficientemente rápido para chat en tiempo real y cargas de trabajo de agencia.
- Rendimiento de precarga: aproximadamente entre 7900 y 8500 tokens por segundo con kernels optimizados, lo que significa que las solicitudes largas se procesan en menos de un segundo.
- Ocho transmisiones simultáneas: 542 tokens por segundo agregados, con 90,3 tokens por segundo por transmisión.
- Ráfaga de 64 transmisiones: 830 tokens por segundo agregados, sin errores de falta de memoria ni fallas del motor.
- Longitud del contexto: 256.000 tokens validados en pruebas, y la arquitectura admite hasta un millón.
El modelo completo ocupa 156,67 gigabytes de memoria de alto ancho de banda, encajando completamente dentro del grupo HBM3 de 192 gigabytes del MI300X. No fue necesaria ninguna cuantificación adicional ni descarga de peso, lo que preserva la precisión total del modelo.
Por qué funciona el MI300X
El AMD MI300X posee dos atributos que hacen posible la implementación de una sola GPU en un modelo de este tamaño. Tiene 192 gigabytes de memoria HBM3, 2,4 veces la capacidad de una Nvidia H100 SXM5 y 5,3 terabytes por segundo de ancho de banda de memoria. Un artículo separado de un desarrollador identificado como Fergus Finn, que sentó las bases para esta implementación, estimó que el MI300X cuesta aproximadamente la mitad que el hardware Nvidia comparable a precio de lista.
En este punto de control de 304 mil millones de parámetros, la capacidad de la memoria es el factor decisivo. El modelo cabe completamente en la memoria del chip, dejando espacio para un grupo de caché de valores clave de GPU de 20 gigabytes y un nivel de CPU de 96 gigabytes para entradas de caché de prefijo desalojadas. Una tarjeta puede manejar de dos a ocho flujos simultáneos típicos y ráfagas de hasta 64 flujos, lo que es suficiente para muchas cargas de trabajo de inferencia de producción.
Los obstáculos de la ingeniería
Ejecutar DeepSeek V4 Flash en MI300X no fue sencillo. La receta oficial de vLLM cubre el hardware de Nvidia y las GPU AMD más nuevas, como MI325X y MI355X, pero ni una sola configuración de producción de MI300X para el punto de control del 31 de julio.
El repositorio documenta varios problemas de ingeniería que debían resolverse. El MI300X utiliza una variante del formato numérico FP8 que difiere del estándar utilizado por los chips AMD más nuevos, y un núcleo que asume una semántica incorrecta puede producir resultados con un factor de dos. El desarrollador también tuvo que corregir el enrutamiento de una combinación de expertos con alta concurrencia, la verificación especulativa causal y la sincronización de valores clave de la CPU, varios de los cuales permanecen sin corregir en vLLM ascendente.
El repositorio agrega superposiciones de corrección, una configuración de servicio validada con dibujo especulativo, tablas de ajuste AITER GEMM para formas de chips que faltaban en las tablas empaquetadas y una estrategia híbrida de clave-valor que combina un caché de GPU con descarga de CPU.
Qué significa para la guerra de los chips
La demostración llega en un momento crucial para las ambiciones de AMD en IA. Nvidia controla la inmensa mayoría del mercado de aceleradores de IA, respaldado por su ecosistema de software CUDA, que muchos desarrolladores ven como un foso que AMD ha luchado por cruzar. SemiAnalysis examinó esa pregunta directamente en un análisis de julio de 2026 titulado "¿Puede AMD romper el foso de CUDA?" y la respuesta sigue siendo controvertida.
Pero proyectos de código abierto como este reducen la brecha de percepción. Si un solo MI300X puede servir a un modelo de escala fronteriza a velocidades competitivas, el argumento del costo para AMD se vuelve más difícil de descartar. AMD también ha estado construyendo su propia cartera de modelos abiertos, lanzando Instella-MoE-16B, un modelo completamente abierto entrenado desde cero en sus propias GPU Instinct, y asociándose con Zyphra en una plataforma MI355X de 15 megavatios.
Mientras tanto, la propia DeepSeek ha estado reduciendo el coste de la IA de vanguardia. El modelo V4 Flash ya era el modelo conocido más barato de ejecutar según el análisis de la firma de investigación, igualando al GPT-5.6 Luna con un costo un 60 por ciento menor. Combinado con hardware AMD más barato, la economía de servir modelos grandes fuera del ecosistema de Nvidia está mejorando rápidamente.
La ventaja del código abierto
El repositorio subraya un tema más amplio en el desarrollo de la IA en 2026: los modelos de peso abierto y las herramientas de inferencia de código abierto están haciendo posible que ingenieros independientes repliquen y optimicen implementaciones que alguna vez fueron dominio exclusivo de laboratorios bien financiados. Al publicar la configuración completa, las tablas de ajuste y los errores específicos corregidos a lo largo del camino, el trabajo reduce la barrera para cualquiera que esté considerando hardware AMD para cargas de trabajo serias de IA.
Manténgase por delante de la IA
La batalla entre AMD y Nvidia por la inferencia de IA se está intensificando y las contribuciones de código abierto como esta implementación están cambiando silenciosamente el panorama competitivo. Para conocer los últimos desarrollos de IA en hardware, modelos abiertos e infraestructura, siga nuestra cobertura.
Leer más noticias sobre IA →