MLCommons פרסמה את תוצאות הבנצ'מרק של MLPerf Inference v6.1 ב-16 בספטמבר 2026, והכותרת הייתה שייכת לפלטפורמת הדור הבא של NVIDIA. בהגשת התצוגה המקדימה הראשונה אי פעם, מערכת Vera Rubin NVL72 סיפקה עד פי 3.7 מהתפוקה של ספינת הדגל הנוכחית GB300 NVL72 של NVIDIA, על פי ההודעה של NVIDIA, איתות מוקדם למשמעות היורשת של Blackwell Ultra עבור כלכלת הסקת AI.
ורה רובין היא פלטפורמת מרכז הנתונים הבאה של NVIDIA, על שם האסטרופיזיקאי שסיפק ראיות מפתח לחומר אפל. תוצאות התצוגה המקדימה של MLPerf הן נתוני הביצועים הציבוריים הראשונים המאורגנים באופן עצמאי עבור המערכת. For more context on this story, see our ongoing breaking AI news.
המספרים מאחורי הבכורה
NVIDIA הגישה תוצאות תצוגה מקדימה של Vera Rubin NVL72 על שניים מעומסי העבודה התובעניים ביותר בחבילת v6.1: מודל החשיבה DeepSeek-R1 ומודל שפת הראייה Qwen3-VL.
ב-Qwen3-VL, Vera Rubin NVL72 סיפקה תפוקה גבוהה עד פי 3.7 מ-GB300 NVL72 בתרחישים לא מקוונים, שרתים ואינטראקטיביים, והריצה vLLM עם מסגרת ההסקה בקוד פתוח של Dynamo של NVIDIA. ב-DeepSeek-R1, באמצעות ספריית TensorRT-LLM של NVIDIA, התפוקה הייתה גבוהה עד פי 2.5 מספינת הדגל הקודמת.
שני הנתונים מגיעים מהגשות של NVIDIA עצמה לחטיבה הסגורה של MLCommons, כלומר הם הופקו תחת הכללים המבוקרים של MLPerf, אם כי תוצאות התצוגה המקדימה הן במפורש מדידות מוקדמות של פלטפורמה שעדיין עוברת אופטימיזציה.
איך הרווחים בנויים
NVIDIA מייחסת את הקפיצה לעיצוב משותף של מחסנית מלאה על פני חומרה ותוכנה ולא בכל רכיב בודד.
בצד הסיליקון, Vera Rubin מביאה ליבות Tensor משופרות ומנוע טרנספורמר מעודכן שמאיץ את שני שלבי ההסקה - שלב המילוי המוקדם עתיר המחשוב ושלב הפענוח הקשור לזיכרון. הפלטפורמה נשענת על דיוק NVFP4, שמכווץ את טביעת הזיכרון של משקלי הדגם, תשומת הלב ומטמון ה-KV, ומעלה את התפוקה עם מה ש-NVIDIA מתארת כאובדן מינימלי של איכות הפלט.
בצד התוכנה, ההגשות השתמשו בהגשה מפורקת, המפרידה מילוי מראש ופענוח למשימות שונות, יחד עם מקביליות מומחים בקנה מידה גדול כדי לשמור על תערובת המומחים במודלים כמו DeepSeek-R1 ו-Qwen3-VL מוזנים במלואם בעבודה.
החיבור הוא העמוד השלישי. עיצוב המתלה של NVL72 קושר 72 GPUs לתחום scale-up יחיד באמצעות NVLink ו-NVLink Switch מהדור השישי, שלדברי NVIDIA מספק קצבי מנות גבוהים פי 10 וזמן השהייה נמוך פי 3 מאשר Ethernet מהמדף - הבסיס שהופך את ההגשה המפורקת בקנה מידה למעשי.
GB300 מציג קנה מידה כמעט מושלם
לספינת הדגל הנוכחית היו חדשות משלה בסבב v6.1. הגשת ה-DeepSeek-R1 של NVIDIA השתנתה מתלה GB300 NVL72 יחיד - 72 GPUs - לארבעה מתלים, 288 GPUs, והשיגה יעילות קנה מידה של 99 אחוז בתרחיש הלא מקוון, כאשר התפוקה גדלה כמעט ביחס לחומרה שנוספה.
יעילות קנה מידה היא מדד שמפעילי מרכז נתונים צופים מקרוב, כי היא קובעת אם קניית חומרה נוספת אכן קונה יותר קיבולת באופן יחסי. קנה מידה כמעט ליניארי על פני מתלים מצביע על כך שצוואר הבקבוק בקנה מידה זה נשאר ביצועים לכל GPU ולא תקשורת בין מדפים.
התוכנה ממשיכה להתערב
דפוס חוזר בסבבי MLPerf התקיים שוב: שיפורי תוכנה לבדם סיפקו עד פי 1.6 ביצועים גבוהים יותר בהגשות v6.1 של NVIDIA בהשוואה ל-v6.0, והחברה אומרת שהאופטימיזציות המשיכו לנחות לאחר מועד ההגשה של v6.1, והביאו להישגים נוספים.
עבור הקונים, המשמעות היא שמתלה נתון נהיה מהיר יותר במהלך חייו ללא רענון חומרה - NVIDIA דינמי השתמשה בו כדי לטעון שהבסיס המותקן שלו יתייקר ולא פוחת ככל שערימת התוכנה מתבגרת.
עומסי עבודה סוכנים עצב מחדש את המדדים
סבב v6.1 שיקף גם שינוי במה משמשת ההסקה. NVIDIA הצביעה על בדיקות תצוגה מקדימה של מדד ה-AgentX של SemiAnalysis, שתוכנן סביב סוכני בינה מלאכותית שמניחים, מתכננים ופועלים על פני מספר שלבים, שם היא אומרת ש-Vera Rubin NVL72 סיפק ביצועים פי 30 מ-GB300 NVL72.
MLCommons מכינה גם אמת מידה ייעודית לשינוי זה: אמת המידה הקרובה של MLPerf Endpoints שואפת לתקנן מדידה של עומסי עבודה של הסקת מסקנות שבדיקות תפוקה מסורתיות לוכדות בצורה גרועה. ככל שהמסק עובר מצ'אט חד-פעמי למפגשים ארוכים של סוכנים מרובי-שלבים, זמן ההשהיה והעקביות האינטראקטיבית חשובים לא פחות מהאסימונים הגולמיים לשנייה - ובנצ'מרקים נבנים מחדש בהתאם.
נביוס והמערכת האקולוגית מגיעים מוקדם
ספקית הענן Nebius גם הגישה תוצאות תצוגה מקדימה של Vera Rubin NVL72, ש-NVIDIA הדגישה כעדות לביצועים מוקדמים של מערכת אקולוגית. הגשות מוקדמות של צד שלישי הן בדרך כלל סימן לכך שמערכות הדור הבא עוברות מדגימת מעבדה לזמינות רחבה יותר, אם כי לא הפוסט של NVIDIA ולא המהדורה של MLCommons מציינים תזמון של זמינות כללית.
למה זה חשוב לכלכלת בינה מלאכותית
NVIDIA ממסגרת את התוצאות במונחי הכנסה: כל מתלה NVL72 של Vera Rubin מייצר משמעותית יותר אסימונים, משרת יותר משתמשים ומוריד עלות לאסימון ביחס ל-GB300 NVL72 מתלה. בתעשייה שבה הביקוש להסקת מסקנות מונע על ידי מודלים של הגיון ועומסי עבודה של סוכנים שצורכים סדרי גודל יותר מחשוב לכל שאילתה מאשר צ'אט פשוט, תפוקה לכל מדף היא המספר שקובע כמה משתמשים תקציב מרכז נתונים קבוע יכול לשרת.
האזהרות הרגילות חלות: אלו הן הגשות של ספקים בסבב תצוגה מקדימה, בשני דגמים שנבחרו על ידי NVIDIA, עם אופטימיזציות שעדיין נוחתות. אבל הכיוון הוא חד משמעי. ההסתכלות הראשונה של MLPerf על ורה רובין מציעה שלטיפוס הביצועים שהגדיר תשתית AI מאז 2023 אין רמה באופק - ושמחזור הרענון הבא יאפס שוב את הכלכלה של שירות AI בקנה מידה.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →