Một nhà phát triển độc lập đã chứng minh rằng mô hình V4 Flash của DeepSeek, một hệ thống gồm 304 tỷ tham số gồm các chuyên gia, có thể chạy trong sản xuất trên một GPU AMD MI300X duy nhất, đạt được 168,6 mã thông báo mỗi giây khi giải mã một luồng mà không cần lượng tử hóa hoặc giảm tải trọng lượng. Tác phẩm được xuất bản trên GitHub và xuất hiện trên đầu trang Hacker News vào ngày 4 tháng 8 năm 2026, đưa ra bằng chứng rõ ràng nhất rằng phần cứng của AMD có thể phục vụ mô hình mở quy mô biên giới mà không cần dựa vào Nvidia.

Kho lưu trữ do nhà phát triển Ryan Zhou duy trì bao gồm ngăn xếp Docker Compose hoàn chỉnh, lớp phủ tệp được ghim và bảng điều chỉnh để chạy điểm kiểm tra DeepSeek-V4-Flash-0731 trên một MI300X. Đối với độc giả theo dõi tin nóng về AI về cuộc chiến chip giữa AMD và Nvidia, kết quả này rất quan trọng vì nó thách thức giả định rằng suy luận biên giới yêu cầu phần cứng mới nhất và đắt nhất của Nvidia.

Những con số

Hiệu suất được đo điểm chuẩn, được đo trên ngăn xếp phần mềm được ghim bằng cách sử dụng bản dựng vLLM hàng đêm của ROCm, kể một câu chuyện hấp dẫn về những gì một bộ tăng tốc AMD có thể làm:

  • Giải mã một luồng: 168,6 mã thông báo mỗi giây, đủ nhanh cho khối lượng công việc trò chuyện và tác nhân trong thời gian thực.
  • Thông lượng điền trước: khoảng 7.900 đến 8.500 mã thông báo mỗi giây với các hạt nhân đã được điều chỉnh, nghĩa là các lời nhắc dài được xử lý trong chưa đầy một giây.
  • Tám luồng đồng thời: Tổng cộng 542 mã thông báo mỗi giây, với 90,3 mã thông báo mỗi giây trên mỗi luồng.
  • 64 luồng phát: Tổng cộng 830 mã thông báo mỗi giây, không có lỗi hết bộ nhớ và không có lỗi động cơ.
  • Độ dài bối cảnh: 256.000 mã thông báo được xác thực trong thử nghiệm, với kiến ​​trúc hỗ trợ lên tới một triệu.

Toàn bộ mô hình chiếm 156,67 gigabyte bộ nhớ băng thông cao, hoàn toàn nằm gọn trong nhóm HBM3 192 gigabyte của MI300X. Không cần lượng tử hóa hoặc giảm tải bổ sung, điều này duy trì độ chính xác hoàn toàn của mô hình.

Tại sao MI300X hoạt động

AMD MI300X sở hữu hai thuộc tính giúp cho việc triển khai một mô hình GPU đơn có quy mô lớn như vậy có thể thực hiện được. Nó có bộ nhớ HBM3 192 gigabyte, gấp 2,4 lần dung lượng của Nvidia H100 SXM5 và băng thông bộ nhớ 5,3 terabyte mỗi giây. Một bài viết riêng của một nhà phát triển được xác định là Fergus Finn, người đặt nền móng cho việc triển khai này, đã ước tính rằng MI300X có giá gần bằng một nửa so với phần cứng Nvidia tương đương ở mức giá niêm yết.

Đối với điểm kiểm tra 304 tỷ tham số cụ thể này, dung lượng bộ nhớ là yếu tố quyết định. Mô hình này hoàn toàn phù hợp với bộ nhớ trên chip, chừa chỗ cho nhóm bộ nhớ đệm khóa-giá trị GPU 20 gigabyte và tầng CPU 96 gigabyte cho các mục nhập bộ đệm tiền tố bị loại bỏ. Một thẻ có thể xử lý hai đến tám luồng đồng thời điển hình và các đợt lên tới 64 luồng, đủ cho nhiều khối lượng công việc suy luận sản xuất.

Rào cản kỹ thuật

Chạy DeepSeek V4 Flash trên MI300X không hề đơn giản. Công thức vLLM chính thức bao gồm phần cứng Nvidia và các GPU AMD mới hơn như MI325X và MI355X, nhưng không bao gồm cấu hình sản xuất MI300X duy nhất cho điểm kiểm tra ngày 31 tháng 7.

Kho lưu trữ ghi lại một số vấn đề kỹ thuật cần được giải quyết. MI300X sử dụng một biến thể của định dạng số FP8 khác với tiêu chuẩn được sử dụng bởi các chip AMD mới hơn và một hạt nhân giả định ngữ nghĩa sai có thể tạo ra kết quả sai lệch gấp đôi. Nhà phát triển cũng phải sửa lỗi định tuyến hỗn hợp các chuyên gia ở mức đồng thời cao, xác minh suy đoán nguyên nhân và đồng bộ hóa khóa-giá trị CPU, một số trong số đó vẫn chưa được sửa trong vLLM ngược dòng.

Kho lưu trữ bổ sung các lớp phủ chính xác, cấu hình phân phối đã được xác thực với tính năng soạn thảo suy đoán, bảng điều chỉnh AITER GEMM cho các hình dạng chip mà các bảng đóng gói bị thiếu và chiến lược khóa-giá trị kết hợp kết hợp bộ đệm GPU với giảm tải CPU.

Ý nghĩa của cuộc chiến chip

Cuộc trình diễn diễn ra vào thời điểm then chốt cho tham vọng của AMD trong lĩnh vực AI. Nvidia kiểm soát phần lớn thị trường máy gia tốc AI, được hỗ trợ bởi hệ sinh thái phần mềm CUDA, hệ sinh thái mà nhiều nhà phát triển coi như một con hào mà AMD đã phải vật lộn để vượt qua. SemiAnalysis đã trực tiếp xem xét câu hỏi đó trong một bài phân tích vào tháng 7 năm 2026 có tiêu đề "AMD có thể phá vỡ hào CUDA không?" và câu trả lời vẫn còn gây tranh cãi.

Nhưng các dự án nguồn mở như thế này sẽ thu hẹp khoảng cách về nhận thức. Nếu một chiếc MI300X duy nhất có thể phục vụ mô hình quy mô tiên tiến ở tốc độ cạnh tranh thì lập luận về chi phí đối với AMD sẽ trở nên khó bác bỏ hơn. AMD cũng đang xây dựng danh mục mô hình mở của riêng mình, phát hành Instella-MoE-16B, một mô hình mở hoàn toàn được đào tạo từ đầu trên GPU Bản năng của riêng mình và hợp tác với Zyphra trên nền tảng MI355X 15 megawatt.

Trong khi đó, bản thân DeepSeek đã và đang giảm chi phí cho AI biên giới. Theo phân tích của công ty nghiên cứu, mẫu V4 Flash đã là mẫu phổ biến rẻ nhất chạy, phù hợp với GPT-5.6 Luna với chi phí thấp hơn 60%. Kết hợp với phần cứng AMD rẻ hơn, tính kinh tế của việc phục vụ các mẫu máy lớn bên ngoài hệ sinh thái Nvidia đang được cải thiện nhanh chóng.

Lợi thế của nguồn mở

Kho lưu trữ nhấn mạnh một chủ đề rộng hơn trong quá trình phát triển AI vào năm 2026: các mô hình trọng lượng mở và công cụ suy luận nguồn mở đang giúp các kỹ sư độc lập có thể tái tạo và tối ưu hóa các hoạt động triển khai từng là lĩnh vực độc quyền của các phòng thí nghiệm được tài trợ tốt. Bằng cách xuất bản cấu hình đầy đủ, bảng điều chỉnh và các lỗi cụ thể đã được sửa trong quá trình thực hiện, công việc này đã giảm bớt rào cản đối với bất kỳ ai xem xét phần cứng AMD cho khối lượng công việc AI nghiêm trọng.

Đi trước AI

Cuộc chiến giữa AMD và Nvidia về khả năng suy luận AI đang ngày càng gay gắt và những đóng góp nguồn mở như triển khai này đang âm thầm thay đổi bối cảnh cạnh tranh. Để biết những phát triển AI mới nhất về phần cứng, mô hình mở và cơ sở hạ tầng, hãy theo dõi tin tức của chúng tôi.

Đọc thêm tin tức về AI →