독립 개발자는 3,040억 매개변수의 전문가 혼합 시스템인 DeepSeek의 V4 플래시 모델이 단일 AMD MI300X GPU에서 프로덕션 환경에서 실행될 수 있으며 가중치 양자화 또는 오프로딩 없이 단일 스트림 디코딩에서 초당 168.6개의 토큰을 달성할 수 있음을 입증했습니다. GitHub에 게시되고 2026년 8월 4일 Hacker News 상단에 게재된 이 작업은 AMD의 하드웨어가 Nvidia에 의존하지 않고도 최첨단 규모의 개방형 모델을 제공할 수 있다는 가장 명확한 증거를 제공합니다.
개발자 Ryan Zhou가 유지 관리하는 리포지토리에는 하나의 MI300X에서 DeepSeek-V4-Flash-0731 체크포인트를 실행하기 위한 완전한 Docker Compose 스택, 고정된 파일 오버레이 및 튜닝 테이블이 포함되어 있습니다. AMD와 Nvidia 사이의 칩 전쟁에 관한 AI 속보를 추적하는 독자들에게 이 결과는 중요합니다. 왜냐하면 이 결과는 프론티어 추론을 위해서는 Nvidia의 최신이자 가장 비싼 하드웨어가 필요하다는 가정에 도전하기 때문입니다.
숫자
vLLM의 ROCm 야간 빌드를 사용하여 고정된 소프트웨어 스택에서 측정한 벤치마크 성능은 단일 AMD 가속기가 무엇을 할 수 있는지에 대한 설득력 있는 이야기를 말해줍니다.
- 단일 스트림 디코드: 초당 168.6개의 토큰으로 실시간 채팅 및 에이전트 워크로드에 충분히 빠릅니다.
- 미리 채우기 처리량: 조정된 커널을 사용하면 초당 약 7,900~8,500개의 토큰입니다. 즉, 긴 프롬프트가 1초 이내에 처리됩니다.
- 8개의 동시 스트림: 초당 542개의 토큰 집계, 스트림당 초당 90.3개의 토큰.
- 64-스트림 버스트: 초당 830개 토큰을 집계하며 메모리 부족 오류나 엔진 오류가 없습니다.
- 컨텍스트 길이: 테스트에서 검증된 토큰 256,000개, 아키텍처는 최대 100만 개를 지원합니다.
전체 모델은 156.67GB의 고대역폭 메모리를 차지하며 MI300X의 192GB HBM3 풀에 완전히 들어맞습니다. 추가 양자화 또는 가중치 오프로드가 필요하지 않아 모델의 전체 정확도가 유지됩니다.
MI300X가 작동하는 이유
AMD MI300X는 모델의 단일 GPU 배포를 이렇게 대규모로 가능하게 만드는 두 가지 특성을 가지고 있습니다. 192GB의 HBM3 메모리, Nvidia H100 SXM5의 2.4배 용량, 초당 5.3TB의 메모리 대역폭을 갖추고 있습니다. 이 배포의 토대를 마련한 Fergus Finn이라는 개발자가 작성한 별도의 글에서는 MI300X의 가격이 정가 기준 Nvidia 하드웨어의 약 절반 정도라고 추정했습니다.
3,040억 개의 매개변수를 갖는 이 특정 체크포인트에서는 메모리 용량이 결정적인 요소입니다. 이 모델은 온칩 메모리에 완전히 적합하여 20GB GPU 키-값 캐시 풀을 위한 공간과 제거된 접두사 캐시 항목을 위한 96GB CPU 계층을 남겨 둡니다. 하나의 카드는 2~8개의 일반적인 동시 스트림과 최대 64개의 스트림 버스트를 처리할 수 있으며 이는 많은 프로덕션 추론 워크로드에 충분합니다.
엔지니어링 장애물
MI300X에서 DeepSeek V4 Flash를 실행하는 것은 간단하지 않았습니다. 공식 vLLM 레시피에는 Nvidia 하드웨어와 MI325X 및 MI355X와 같은 최신 AMD GPU가 포함되지만 7월 31일 체크포인트에 대한 단일 MI300X 생산 구성은 포함되지 않습니다.
저장소에는 해결해야 했던 몇 가지 엔지니어링 문제가 문서화되어 있습니다. MI300X는 최신 AMD 칩에서 사용되는 표준과 다른 FP8 숫자 형식의 변형을 사용하며 잘못된 의미 체계를 가정하는 커널은 2배의 결과를 생성할 수 있습니다. 또한 개발자는 높은 동시성, 인과관계 추측 확인 및 CPU 키-값 동기화에서 전문가 혼합 라우팅을 수정해야 했는데, 그 중 일부는 업스트림 vLLM에서 수정되지 않은 상태로 남아 있습니다.
저장소는 정확성 오버레이, 추측 초안을 사용한 검증된 서비스 구성, 패키징된 테이블에서 누락된 칩 모양에 대한 AITER GEMM 튜닝 테이블, GPU 캐시와 CPU 오프로드를 결합하는 하이브리드 키-값 전략을 추가합니다.
칩 전쟁의 의미
이번 시연은 AI에 대한 AMD의 야망을 실현하는 중추적인 순간에 이르렀습니다. Nvidia는 CUDA 소프트웨어 생태계를 바탕으로 AI 가속기 시장의 압도적인 다수를 장악하고 있습니다. 많은 개발자들이 이를 AMD가 건너기 힘든 해자로 보고 있습니다. SemiAnalytic은 "AMD가 CUDA 해자를 깰 수 있습니까?"라는 제목의 2026년 7월 분석에서 이 질문을 직접 조사했습니다. 그 대답은 여전히 논쟁의 여지가 있습니다.
그러나 이와 같은 오픈 소스 프로젝트는 인식 격차를 한 조각 줄여줍니다. 단일 MI300X가 경쟁력 있는 속도로 최전방 규모의 모델을 제공할 수 있다면 AMD의 비용 주장을 무시하기가 더 어려워집니다. AMD는 또한 자체 Instinct GPU에서 처음부터 훈련된 완전 개방형 모델인 Instella-MoE-16B를 출시하고 15메가와트 MI355X 플랫폼에서 Zyphra와 협력하여 자체 개방형 모델 포트폴리오를 구축해 왔습니다.
한편 DeepSeek 자체는 프론티어 AI 비용을 절감해 왔습니다. V4 Flash 모델은 이미 연구 회사 분석에 따르면 실행 가능한 가장 저렴하고 잘 알려진 모델로, GPT-5.6 Luna와 60% 더 낮은 비용으로 일치합니다. 저렴한 AMD 하드웨어와 결합하여 Nvidia 생태계 외부에 대형 모델을 제공하는 경제성이 빠르게 향상되고 있습니다.
오픈소스의 장점
이 저장소는 2026년 AI 개발의 더 넓은 주제를 강조합니다. 개방형 모델과 오픈 소스 추론 도구를 사용하면 독립 엔지니어가 한때 자금이 풍부한 연구실의 독점 영역이었던 배포를 복제하고 최적화할 수 있습니다. 전체 구성, 튜닝 테이블 및 수정된 특정 버그를 게시함으로써 이 작업은 심각한 AI 워크로드를 위해 AMD 하드웨어를 고려하는 모든 사람의 장벽을 낮춰줍니다.
AI보다 앞서 나가세요
AI 추론을 위한 AMD와 Nvidia 간의 전투가 격화되고 있으며, 이러한 배포와 같은 오픈 소스 기여는 경쟁 환경을 조용히 변화시키고 있습니다. 하드웨어, 개방형 모델, 인프라 분야의 최신 AI 개발에 대해서는 당사의 보도를 계속 확인하세요.
AI 뉴스 자세히 보기 →