นักพัฒนาอิสระรายหนึ่งได้แสดงให้เห็นว่าโมเดล V4 Flash ของ DeepSeek ซึ่งเป็นระบบที่ผู้เชี่ยวชาญผสมผสานกันซึ่งมีพารามิเตอร์ 304 พันล้านพารามิเตอร์ สามารถรันในการผลิตบน GPU AMD MI300X ตัวเดียว โดยได้รับโทเค็น 168.6 ต่อวินาทีในการถอดรหัสแบบสตรีมเดี่ยว โดยไม่ต้องมีการกำหนดปริมาณน้ำหนักหรือการถ่ายข้อมูลใดๆ งานวิจัยนี้เผยแพร่บน GitHub และปรากฏอยู่อันดับต้นๆ ของ Hacker News เมื่อวันที่ 4 สิงหาคม 2026 นำเสนอหลักฐานที่ชัดเจนที่สุดว่าฮาร์ดแวร์ของ AMD สามารถรองรับโมเดลเปิดระดับแนวหน้าโดยไม่ต้องพึ่ง Nvidia
พื้นที่เก็บข้อมูลที่ดูแลโดยนักพัฒนา Ryan Zhou ประกอบด้วยสแต็ก Docker Compose ที่สมบูรณ์ การซ้อนทับไฟล์ที่ปักหมุด และตารางการปรับแต่งสำหรับการรันจุดตรวจสอบ DeepSeek-V4-Flash-0731 บน MI300X หนึ่งตัว สำหรับผู้อ่านที่ติดตาม ข่าวด่วน AI เกี่ยวกับสงครามชิประหว่าง AMD และ Nvidia ผลลัพธ์ที่ได้มีความสำคัญมาก เนื่องจากเป็นการท้าทายสมมติฐานที่ว่าการอนุมานระดับแนวหน้าต้องใช้ฮาร์ดแวร์ล่าสุดและมีราคาแพงที่สุดของ Nvidia
ตัวเลข
ประสิทธิภาพที่วัดประสิทธิภาพซึ่งวัดจากสแต็กซอฟต์แวร์ที่ปักหมุดไว้โดยใช้ ROCm build ของ vLLM ทุกคืน บอกเล่าเรื่องราวที่น่าสนใจเกี่ยวกับสิ่งที่ตัวเร่งความเร็วของ AMD ตัวเดียวสามารถทำได้:
- ถอดรหัสแบบสตรีมเดียว: 168.6 โทเค็นต่อวินาที เร็วเพียงพอสำหรับการแชทแบบเรียลไทม์และปริมาณงานตัวแทน
- ทรูพุตการเติมล่วงหน้า: ประมาณ 7,900 ถึง 8,500 โทเค็นต่อวินาทีด้วยเคอร์เนลที่ได้รับการปรับแต่ง ซึ่งหมายความว่าพร้อมท์ที่ยาวจะได้รับการประมวลผลในเวลาไม่ถึงวินาที
- สตรีมพร้อมกันแปดรายการ: รวม 542 โทเค็นต่อวินาที โดยมีโทเค็น 90.3 ต่อวินาทีต่อสตรีม
- 64-สตรีมต่อเนื่อง: รวม 830 โทเค็นต่อวินาที โดยไม่มีข้อผิดพลาดหน่วยความจำไม่เพียงพอ และไม่มีเครื่องยนต์ขัดข้อง
- ความยาวบริบท: โทเค็น 256,000 รายการได้รับการตรวจสอบในการทดสอบ โดยสถาปัตยกรรมรองรับได้มากถึงหนึ่งล้านโทเค็น
โมเดลทั้งหมดใช้หน่วยความจำแบนด์วิธสูง 156.67 กิกะไบต์ ซึ่งติดตั้งอยู่ภายในกลุ่ม HBM3 ขนาด 192 กิกะไบต์ของ MI300X ทั้งหมด ไม่จำเป็นต้องมีการกำหนดปริมาณหรือการถ่ายน้ำหนักเพิ่มเติม ซึ่งยังคงความถูกต้องครบถ้วนของแบบจำลอง
ทำไม MI300X ถึงใช้งานได้
AMD MI300X มีคุณสมบัติสองประการที่ทำให้การใช้งาน GPU เดี่ยวในโมเดลขนาดใหญ่ขนาดนี้เป็นไปได้ มีหน่วยความจำ HBM3 192 กิกะไบต์ ความจุ 2.4 เท่าของ Nvidia H100 SXM5 และแบนด์วิธหน่วยความจำ 5.3 เทราไบต์ต่อวินาที การเขียนบทความแยกต่างหากโดยนักพัฒนาชื่อ Fergus Finn ซึ่งเป็นผู้วางรากฐานสำหรับการปรับใช้นี้ ประเมินว่า MI300X มีราคาประมาณครึ่งหนึ่งของฮาร์ดแวร์ Nvidia ที่เทียบเคียงได้ในราคาปลีก
สำหรับจุดตรวจสอบพารามิเตอร์ 304 พันล้านพารามิเตอร์นี้ ความจุของหน่วยความจำถือเป็นปัจจัยชี้ขาด โมเดลนี้พอดีกับหน่วยความจำบนชิปทั้งหมด โดยเหลือที่ว่างสำหรับพูลแคชคีย์-ค่า GPU ขนาด 20 กิกะไบต์ และระดับ CPU ขนาด 96 กิกะไบต์สำหรับรายการแคชคำนำหน้าที่ถูกไล่ออก การ์ดหนึ่งใบสามารถรองรับสตรีมพร้อมกันทั่วไปได้สองถึงแปดสตรีม และสตรีมสูงสุด 64 สตรีม ซึ่งเพียงพอสำหรับปริมาณงานการอนุมานการผลิตจำนวนมาก
อุปสรรคทางวิศวกรรม
การเรียกใช้ DeepSeek V4 Flash บน MI300X นั้นไม่ใช่เรื่องตรงไปตรงมา สูตร vLLM อย่างเป็นทางการครอบคลุมฮาร์ดแวร์ของ Nvidia และ GPU AMD รุ่นใหม่กว่า เช่น MI325X และ MI355X แต่ไม่ใช่การกำหนดค่าการผลิต single-MI300X สำหรับจุดตรวจสอบในวันที่ 31 กรกฎาคม
พื้นที่เก็บข้อมูลบันทึกปัญหาทางวิศวกรรมหลายประการที่ต้องแก้ไข MI300X ใช้รูปแบบตัวเลข FP8 ที่แตกต่างจากมาตรฐานที่ใช้โดยชิป AMD รุ่นใหม่ และเคอร์เนลที่ถือว่าซีแมนทิกส์ผิดสามารถสร้างผลลัพธ์ได้สองเท่า นักพัฒนายังต้องแก้ไขการกำหนดเส้นทางแบบผสมของผู้เชี่ยวชาญที่ทำงานพร้อมกันสูง การตรวจสอบเชิงสาเหตุ และการซิงโครไนซ์คีย์-ค่า CPU ซึ่งหลายรายการยังคงไม่ได้รับการแก้ไขใน upstream vLLM
พื้นที่เก็บข้อมูลเพิ่มการซ้อนทับที่ถูกต้อง การกำหนดค่าการให้บริการที่ได้รับการตรวจสอบแล้วด้วยการร่างแบบเก็งกำไร ตารางการปรับแต่ง AITER GEMM สำหรับรูปร่างชิปที่ตารางที่แพ็กเกจขาดหายไป และกลยุทธ์คีย์-ค่าไฮบริดที่รวมแคช GPU กับการออฟโหลด CPU
ความหมายของสงครามชิป
การสาธิตนี้มาถึงช่วงเวลาสำคัญของความทะเยอทะยานของ AMD ในด้าน AI Nvidia ควบคุมตลาดตัวเร่งความเร็ว AI ส่วนใหญ่อย่างล้นหลาม โดยได้รับการสนับสนุนจากระบบนิเวศซอฟต์แวร์ CUDA ซึ่งนักพัฒนาหลายคนมองว่าเป็นคูน้ำที่ AMD พยายามดิ้นรนที่จะข้ามไป SemiAnalysis ตรวจสอบคำถามนั้นโดยตรงในการวิเคราะห์เดือนกรกฎาคม 2569 ที่มีชื่อว่า "AMD สามารถทำลายคูเมือง CUDA ได้หรือไม่" และคำตอบยังคงถูกโต้แย้ง
แต่โครงการโอเพ่นซอร์สเช่นนี้จะช่วยลดช่องว่างการรับรู้ หาก MI300X ตัวเดียวสามารถรองรับโมเดลระดับแนวหน้าด้วยความเร็วที่แข่งขันได้ ข้อโต้แย้งด้านต้นทุนสำหรับ AMD ก็ยากที่จะมองข้าม นอกจากนี้ AMD ยังได้สร้างพอร์ตโฟลิโอโมเดลแบบเปิดของตัวเอง โดยเปิดตัว Instella-MoE-16B ซึ่งเป็นโมเดลแบบเปิดเต็มรูปแบบที่ได้รับการฝึกฝนตั้งแต่เริ่มต้นบน Instinct GPUs ของตัวเอง และร่วมมือกับ Zyphra บนแพลตฟอร์ม MI355X ขนาด 15 เมกะวัตต์
ในขณะเดียวกัน DeepSeek ก็ได้ลดต้นทุนของ Frontier AI จากการวิเคราะห์ของบริษัทวิจัยพบว่า รุ่น V4 Flash เป็นรุ่นที่มีชื่อเสียงราคาถูกที่สุด ซึ่งตรงกับ GPT-5.6 Luna ด้วยต้นทุนที่ต่ำกว่า 60 เปอร์เซ็นต์ เมื่อรวมกับฮาร์ดแวร์ AMD ที่ราคาถูกกว่า ความคุ้มค่าในการให้บริการโมเดลขนาดใหญ่นอกระบบนิเวศของ Nvidia ก็พัฒนาขึ้นอย่างรวดเร็ว
ข้อดีของโอเพ่นซอร์ส
พื้นที่เก็บข้อมูลเน้นย้ำธีมที่กว้างขึ้นในการพัฒนา AI ในปี 2569: โมเดลแบบเปิดและเครื่องมืออนุมานแบบโอเพ่นซอร์สทำให้วิศวกรอิสระสามารถทำซ้ำและเพิ่มประสิทธิภาพการใช้งานที่ครั้งหนึ่งเคยเป็นโดเมนเฉพาะของห้องปฏิบัติการที่ได้รับทุนสนับสนุนอย่างดี ด้วยการเผยแพร่การกำหนดค่าทั้งหมด ตารางการปรับแต่ง และจุดบกพร่องเฉพาะที่ได้รับการแก้ไขตลอดการทำงาน งานนี้ช่วยลดอุปสรรคสำหรับทุกคนที่พิจารณาฮาร์ดแวร์ของ AMD สำหรับเวิร์กโหลด AI ที่ร้ายแรง
ก้าวนำหน้า AI
การต่อสู้ระหว่าง AMD และ Nvidia สำหรับการอนุมาน AI กำลังทวีความรุนแรงขึ้น และการมีส่วนร่วมของโอเพ่นซอร์สเช่นการใช้งานนี้กำลังเปลี่ยนแนวการแข่งขันอย่างเงียบ ๆ สำหรับ การพัฒนา AI ล่าสุด ในฮาร์ดแวร์ โมเดลแบบเปิด และโครงสร้างพื้นฐาน โปรดติดตามความครอบคลุมของเรา
อ่านข่าว AI เพิ่มเติม →