Um desenvolvedor independente demonstrou que o modelo V4 Flash da DeepSeek, um sistema de mistura de especialistas de 304 bilhões de parâmetros, pode ser executado em produção em uma única GPU AMD MI300X, alcançando 168,6 tokens por segundo em decodificação de fluxo único sem qualquer quantização ou descarregamento de peso. O trabalho, publicado no GitHub e aparecendo no topo do Hacker News em 4 de agosto de 2026, oferece a evidência mais clara de que o hardware da AMD pode servir a um modelo aberto em escala de fronteira sem depender da Nvidia.

O repositório, mantido pelo desenvolvedor Ryan Zhou, inclui uma pilha Docker Compose completa, sobreposições de arquivos fixadas e tabelas de ajuste para executar o ponto de verificação DeepSeek-V4-Flash-0731 em um MI300X. Para os leitores que acompanham as notícias de última hora sobre IA sobre a guerra de chips entre AMD e Nvidia, o resultado é significativo porque desafia a suposição de que a inferência de fronteira requer o hardware mais recente e mais caro da Nvidia.

Os Números

O desempenho avaliado, medido em uma pilha de software fixa usando a versão noturna ROCm do vLLM, conta uma história convincente sobre o que um único acelerador AMD pode fazer:

  • Decodificação de fluxo único: 168,6 tokens por segundo, rápido o suficiente para bate-papo em tempo real e cargas de trabalho de agente.
  • Taxa de transferência de pré-preenchimento: aproximadamente 7.900 a 8.500 tokens por segundo com kernels ajustados, o que significa que prompts longos são processados ​​em menos de um segundo.
  • Oito streams simultâneos: 542 tokens por segundo agregados, com 90,3 tokens por segundo por stream.
  • Busca de 64 fluxos: 830 tokens por segundo agregados, sem erros de falta de memória e sem falhas de mecanismo.
  • Comprimento do contexto: 256.000 tokens validados em testes, com a arquitetura suportando até um milhão.

Todo o modelo ocupa 156,67 gigabytes de memória de alta largura de banda, cabendo inteiramente no pool HBM3 de 192 gigabytes do MI300X. Nenhuma quantização adicional ou transferência de peso foi necessária, o que preserva a precisão total do modelo.

Por que o MI300X funciona

O AMD MI300X possui dois atributos que tornam possível a implantação de uma única GPU de um modelo tão grande. Possui 192 gigabytes de memória HBM3, 2,4 vezes a capacidade de uma Nvidia H100 SXM5 e 5,3 terabytes por segundo de largura de banda de memória. Um artigo separado de um desenvolvedor identificado como Fergus Finn, que lançou as bases para esta implantação, estimou que o MI300X custa cerca de metade do preço de hardware comparável da Nvidia ao preço de tabela.

Para este ponto de verificação específico de 304 bilhões de parâmetros, a capacidade da memória é o fator decisivo. O modelo cabe inteiramente na memória no chip, deixando espaço para um pool de cache de valor-chave de GPU de 20 gigabytes e uma camada de CPU de 96 gigabytes para entradas de cache de prefixo removidas. Uma placa pode lidar com dois a oito fluxos simultâneos típicos e rajadas de até 64 fluxos, o que é suficiente para muitas cargas de trabalho de inferência de produção.

Os obstáculos de engenharia

Executar o DeepSeek V4 Flash no MI300X não foi simples. A receita oficial do vLLM cobre hardware Nvidia e GPUs AMD mais recentes, como MI325X e MI355X, mas não uma configuração de produção de MI300X único para o ponto de verificação de 31 de julho.

O repositório documenta vários problemas de engenharia que tiveram que ser resolvidos. O MI300X usa uma variante do formato numérico FP8 que difere do padrão usado pelos chips AMD mais recentes, e um kernel que assume a semântica errada pode produzir resultados por um fator de dois. O desenvolvedor também teve que corrigir o roteamento misto de especialistas em alta simultaneidade, verificação especulativa causal e sincronização de valor-chave da CPU, vários dos quais permanecem não corrigidos no vLLM upstream.

O repositório adiciona sobreposições de correção, uma configuração de serviço validada com desenho especulativo, tabelas de ajuste AITER GEMM para formatos de chip que faltavam nas tabelas empacotadas e uma estratégia híbrida de valor-chave que combina um cache de GPU com descarregamento de CPU.

O que isso significa para a guerra dos chips

A demonstração chega num momento crucial para as ambições da AMD em IA. A Nvidia controla a esmagadora maioria do mercado de aceleradores de IA, apoiada por seu ecossistema de software CUDA, que muitos desenvolvedores veem como um fosso que a AMD tem lutado para atravessar. A SemiAnalysis examinou essa questão diretamente em uma análise de julho de 2026 intitulada “A AMD pode quebrar o fosso CUDA?” e a resposta permanece contestada.

Mas projetos de código aberto como este eliminam a lacuna de percepção. Se um único MI300X puder servir um modelo em escala de fronteira em velocidades competitivas, o argumento do custo para a AMD se tornará mais difícil de descartar. A AMD também vem construindo seu próprio portfólio de modelos abertos, lançando o Instella-MoE-16B, um modelo totalmente aberto treinado do zero em suas próprias GPUs Instinct, e fazendo parceria com a Zyphra em uma plataforma MI355X de 15 megawatts.

Enquanto isso, o próprio DeepSeek tem reduzido o custo da IA ​​de fronteira. O modelo V4 Flash já era o modelo conhecido mais barato para operar, de acordo com a análise da empresa de pesquisa, igualando o GPT-5.6 Luna com um custo 60% menor. Combinado com hardware AMD mais barato, a economia de servir modelos grandes fora do ecossistema Nvidia está melhorando rapidamente.

A vantagem do código aberto

O repositório destaca um tema mais amplo no desenvolvimento de IA para 2026: modelos de peso aberto e ferramentas de inferência de código aberto estão possibilitando que engenheiros independentes repliquem e otimizem implantações que antes eram domínio exclusivo de laboratórios bem financiados. Ao publicar a configuração completa, tabelas de ajuste e bugs específicos corrigidos ao longo do caminho, o trabalho reduz a barreira para qualquer pessoa que considere hardware AMD para cargas de trabalho sérias de IA.

Fique à frente da IA

A batalha entre a AMD e a Nvidia pela inferência de IA está se intensificando, e contribuições de código aberto como esta implantação estão mudando silenciosamente o cenário competitivo. Para os últimos desenvolvimentos de IA em hardware, modelos abertos e infraestrutura, fique com nossa cobertura.

Leia mais notícias sobre IA →