מפתח עצמאי הוכיח שדגם V4 Flash של DeepSeek, מערכת תערובת של 304 מיליארד פרמטרים של מומחים, יכול לרוץ בייצור על AMD MI300X GPU יחיד, ולהשיג 168.6 אסימונים לשנייה בפענוח זרם יחיד ללא כל כימות משקל או הורדה. העבודה, שפורסמה ב-GitHub ועלתה לראש האקר ניוז ב-4 באוגוסט 2026, מציעה את הראיות הברורות ביותר עד כה לכך שהחומרה של AMD יכולה לשרת מודל פתוח בקנה מידה גבול מבלי להסתמך על Nvidia.

המאגר, שמתוחזק על ידי המפתח Ryan Zhou, כולל ערימת Docker Compose מלאה, שכבות-על של קבצים מוצמדות וטבלאות כוונון להפעלת נקודת הבידוק DeepSeek-V4-Flash-0731 ב-MI300X אחד. לקוראים שעוקבים אחר חדשות הבינה המלאכותית על מלחמת השבבים בין AMD ל-Nvidia, התוצאה משמעותית מכיוון שהיא מאתגרת את ההנחה שהסקת גבולות דורשת את החומרה העדכנית והיקרה ביותר של Nvidia.

המספרים

הביצועים המותאמים, הנמדדים על ערימת תוכנה מוצמדת באמצעות המבנה הלילי ROCm של vLLM, מספרים סיפור מרתק על מה שמאיץ AMD יחיד יכול לעשות:

  • פענוח זרם יחיד: 168.6 אסימונים לשנייה, מהיר מספיק לצ'אט בזמן אמת ועומסי עבודה סוכנים.
  • תפוקה מוקדמת של מילוי: בערך 7,900 עד 8,500 אסימונים לשנייה עם גרעינים מכוונים, כלומר הנחיות ארוכות מעובדות בהרבה פחות משנייה.
  • שמונה זרמים במקביל: 542 אסימונים לשנייה מצטברים, עם 90.3 אסימונים לשנייה לכל זרם.
  • פרץ 64 זרם: 830 אסימונים לשנייה מצטבר, ללא שגיאות מחוץ לזיכרון וללא תקלות מנוע.
  • אורך ההקשר: 256,000 אסימונים מאומתים בבדיקה, כשהארכיטקטורה תומכת בעד מיליון.

הדגם כולו תופס 156.67 גיגה-בייט של זיכרון ברוחב פס גבוה, המתאים לחלוטין למאגר HBM3 של 192 גיגה-בייט של ה-MI300X. לא היה צורך בכימות נוסף או הורדת משקל, מה ששומר על הדיוק המלא של הדגם.

מדוע ה-MI300X עובד

ל-AMD MI300X יש שתי תכונות שמאפשרות פריסת גרפי יחיד של דגם גדול כל כך. יש לו 192 גיגה-בייט של זיכרון HBM3, פי 2.4 מהקיבולת של Nvidia H100 SXM5, ורוחב פס של 5.3 טרה-בייט לשנייה. כתיבה נפרדת של מפתח שזוהה כ-Fergus Finn, שהניח את הבסיס לפריסה זו, העריך כי ה-MI300X עולה בערך חצי מהחומרה המקבילה של Nvidia במחיר מחירון.

עבור המחסום המסוים הזה של 304 מיליארד פרמטרים, קיבולת הזיכרון היא הגורם המכריע. הדגם משתלב כולו בזיכרון שבשבב, ומשאיר מקום למאגר מטמון מפתח-ערך של GPU בנפח 20 ג'יגה-בייט ושכבת מעבד של 96 ג'יגה-בייט לכניסות קידומת-מטמון שפונו. כרטיס אחד יכול להתמודד עם שניים עד שמונה זרמים בו-זמניים טיפוסיים והתפרצויות של עד 64 זרמים, וזה מספיק לעומסי עבודה רבים של הסקת ייצור.

מכשולי ההנדסה

הפעלת DeepSeek V4 Flash ב-MI300X לא הייתה פשוטה. המתכון הרשמי של vLLM מכסה את חומרת Nvidia ומעבדי AMD חדשים יותר כמו MI325X ו-MI355X, אך לא תצורת ייצור יחיד של MI300X עבור נקודת הבידוק של 31 ביולי.

המאגר מתעד מספר בעיות הנדסיות שהיה צריך לפתור. ה-MI300X משתמש בגרסה של פורמט המספרים FP8 השונה מהתקן המשמש את שבבי AMD החדשים יותר, וקרנל שמניח שהסמנטיקה השגויה יכולה להפחית תוצאות בפקטור של שניים. המפתח גם נאלץ לתקן ניתוב של תערובת של מומחים במקביליות גבוהה, אימות ספקולטיבי סיבתי וסנכרון מעבד מפתח-ערך, שחלקם נותרו לא קבועים ב-vLLM במעלה הזרם.

המאגר מוסיף שכבות על נכונות, תצורת הגשה מאומתת עם שרטוט ספקולטיבי, טבלאות כוונון של AITER GEMM לצורות שבבים שחסרו בטבלאות הארוזות, ואסטרטגיית מפתח-ערך היברידית המשלבת מטמון GPU עם פריקת CPU.

מה זה אומר על מלחמת השבבים

ההדגמה מגיעה ברגע מרכזי לשאיפותיה של AMD בתחום הבינה המלאכותית. Nvidia שולטת ברוב המכריע של שוק מאיצי הבינה המלאכותית, עם חיזוק מערכת האקולוגית של תוכנת ה-CUDA שלה, שמפתחים רבים רואים בה חפיר ש-AMD התקשתה לעבור. SemiAnalysis בחנה את השאלה הזו ישירות בניתוח ביולי 2026 שכותרתו "האם AMD יכולה לשבור את חפיר ה-CUDA?" והתשובה נותרה שנויה במחלוקת.

אבל פרויקטים בקוד פתוח כמו זה מרחיקים את פער התפיסה. אם MI300X יחיד יכול לשרת מודל בקנה מידה גבול במהירויות תחרותיות, טיעון העלות של AMD נעשה קשה יותר לביטול. AMD גם בנה סל דגמים פתוחים משלה, והוציאה את Instella-MoE-16B, דגם פתוח לחלוטין שאומן מאפס על Instinct GPUs משלה, ושותפות עם Zyphra על פלטפורמת MI355X של 15 מגה וואט.

בינתיים, DeepSeek עצמה הורידה את עלות הבינה המלאכותית הגבולית. דגם ה-V4 Flash כבר היה הדגם המוכר הזול ביותר להפעלה על פי ניתוח של חברת המחקר, והתאים ל-GPT-5.6 Luna בעלות נמוכה יותר ב-60%. בשילוב עם חומרת AMD זולה יותר, הכלכלה של שירות דגמים גדולים מחוץ למערכת האקולוגית של Nvidia משתפרת במהירות.

יתרון הקוד הפתוח

המאגר מדגיש נושא רחב יותר בפיתוח בינה מלאכותית ב-2026: מודלים בעלי משקל פתוח וכלי הסקת קוד פתוח מאפשרים למהנדסים עצמאיים לשכפל ולמטב פריסות שפעם היו נחלתם הבלעדית של מעבדות ממומנות היטב. על ידי פרסום התצורה המלאה, טבלאות הכוונון והבאגים הספציפיים שתוקנו לאורך הדרך, העבודה מורידה את המחסום עבור כל מי ששוקל חומרת AMD לעומסי עבודה רציניים של AI.

הישאר לפני AI

הקרב בין AMD ו-Nvidia להסקת AI הולך ומתעצם, ותרומות קוד פתוח כמו פריסה זו משנות בשקט את הנוף התחרותי. עבור הפיתוחים האחרונים של AI בחומרה, מודלים פתוחים ותשתיות, הישאר עם הסיקור שלנו.

קרא עוד חדשות AI →