一位独立开发人员已经证明,DeepSeek 的 V4 Flash 模型是一个 3040 亿参数的专家混合系统,可以在单个 AMD MI300X GPU 上运行在生产环境中,在单流解码中实现每秒 168.6 个令牌,而无需任何权重量化或卸载。这项工作发布在 GitHub 上,并于 2026 年 8 月 4 日登上 Hacker News 的顶部,提供了迄今为止最明确的证据,表明 AMD 的硬件可以在不依赖 Nvidia 的情况下为前沿规模的开放模型提供服务。
该存储库由开发人员 Ryan Zhou 维护,包括完整的 Docker Compose 堆栈、固定文件覆盖以及用于在一台 MI300X 上运行 DeepSeek-V4-Flash-0731 检查点的调整表。对于关注 AMD 和 Nvidia 之间芯片大战的人工智能突发新闻 的读者来说,这一结果意义重大,因为它挑战了前沿推理需要 Nvidia 最新、最昂贵的硬件的假设。
数字
使用 ROCm 每晚构建的 vLLM 在固定软件堆栈上测量的基准性能,讲述了一个关于单个 AMD 加速器可以做什么的引人入胜的故事:
- 单流解码: 每秒 168.6 个令牌,速度足以满足实时聊天和代理工作负载。
- 预填充吞吐量: 使用经过调整的内核每秒大约 7,900 到 8,500 个令牌,这意味着长提示在一秒内就能得到处理。
- 八个并发流: 每秒总计 542 个令牌,每个流每秒 90.3 个令牌。
- 64 流突发: 每秒聚合 830 个令牌,没有内存不足错误,也没有引擎故障。
- 上下文长度: 测试中验证了 256,000 个令牌,架构支持多达 100 万个令牌。
整个型号占用 156.67 GB 的高带宽内存,完全适合 MI300X 的 192 GB HBM3 池。不需要额外的量化或重量减轻,从而保持了模型的全部准确性。
为什么 MI300X 有效
AMD MI300X 拥有两个属性,使单 GPU 部署如此大规模的模型成为可能。它拥有 192 GB 的 HBM3 内存,是 Nvidia H100 SXM5 容量的 2.4 倍,内存带宽为每秒 5.3 TB。一位名为 Fergus Finn 的开发人员在另一篇文章中为此次部署奠定了基础,该文章估计 MI300X 的成本大约是同类 Nvidia 硬件标价的一半。
对于这个特殊的 3040 亿个参数检查点,内存容量是决定性因素。该模型完全适合片上内存,为 20 GB 的 GPU 键值缓存池和 96 GB 的 CPU 层留出空间,用于清除前缀缓存条目。一张卡可以处理两到八个典型的并发流和最多 64 个流的突发,这足以满足许多生产推理工作负载。
工程障碍
在 MI300X 上运行 DeepSeek V4 Flash 并不简单。官方 vLLM 配方涵盖 Nvidia 硬件和较新的 AMD GPU,例如 MI325X 和 MI355X,但不包括 7 月 31 日检查点的单一 MI300X 生产配置。
该存储库记录了几个必须解决的工程问题。 MI300X 使用 FP8 数字格式的变体,该格式与较新的 AMD 芯片使用的标准不同,并且假设错误语义的内核可能会产生两倍的结果。开发人员还必须修复高并发下的专家混合路由、因果推测验证和 CPU 键值同步,其中一些问题在上游 vLLM 中仍未修复。
该存储库添加了正确性覆盖、具有推测性起草的经过验证的服务配置、针对封装表所缺少的芯片形状的 AITER GEMM 调整表,以及将 GPU 缓存与 CPU 卸载相结合的混合键值策略。
这对芯片大战意味着什么
这次演示正值 AMD 在人工智能领域的雄心壮志的关键时刻。 Nvidia 控制着人工智能加速器市场的绝大多数,并得到其 CUDA 软件生态系统的支持,许多开发人员将其视为 AMD 难以跨越的护城河。 SemiAnalysis 在 2026 年 7 月题为“AMD 能否打破 CUDA 护城河?”的分析中直接研究了这个问题。答案仍然存在争议。
但像这样的开源项目消除了这种认知差距。如果单个 MI300X 能够以具有竞争力的速度为前沿规模模型提供服务,那么 AMD 的成本论点就变得更难以忽视。 AMD 还一直在构建自己的开放模型组合,发布了 Instella-MoE-16B,这是一个在自己的 Instinct GPU 上从头开始训练的完全开放模型,并与 Zyphra 合作开发 15 兆瓦 MI355X 平台。
与此同时,DeepSeek 本身也一直在降低前沿人工智能的成本。根据研究公司的分析,V4 Flash 型号已经是最便宜的知名型号,与 GPT-5.6 Luna 相比,成本低 60%。结合更便宜的 AMD 硬件,为 Nvidia 生态系统之外的大型模型提供服务的经济性正在迅速提高。
开源优势
该存储库强调了 2026 年人工智能开发的一个更广泛的主题:开放权重模型和开源推理工具使独立工程师能够复制和优化部署,而这些部署曾经是资金充足的实验室的专属领域。通过发布完整的配置、调优表以及在此过程中修复的特定错误,这项工作降低了任何考虑使用 AMD 硬件来处理严重 AI 工作负载的人的障碍。
保持人工智能领先地位
AMD 和 Nvidia 之间的人工智能推理之战正在加剧,像这种部署这样的开源贡献正在悄然改变竞争格局。有关硬件、开放模型和基础设施方面的最新人工智能发展,请继续关注我们的报道。
阅读更多人工智能新闻 →