MLCcommons ने 16 सप्टेंबर 2026 रोजी MLPerf Inference v6.1 बेंचमार्क निकाल जारी केले आणि हेडलाइन NVIDIA च्या पुढच्या पिढीच्या प्लॅटफॉर्मची होती. त्याच्या पहिल्या-वहिल्या पूर्वावलोकन सबमिशनमध्ये, Vera Rubin NVL72 सिस्टमने NVIDIA च्या सध्याच्या GB300 NVL72 फ्लॅगशिपच्या थ्रूपुटच्या 3.7 पट पर्यंत वितरित केले, NVIDIA च्या घोषणेनुसार, ब्लॅकवेल अल्ट्राचा उत्तराधिकारी AI अनुमान अर्थशास्त्रासाठी काय अर्थ असेल याचे प्रारंभिक संकेत.
वेरा रुबिन हे NVIDIA चे पुढील डेटा-सेंटर प्लॅटफॉर्म आहे, ज्याला खगोलभौतिकशास्त्रज्ञाचे नाव देण्यात आले आहे ज्यांनी गडद पदार्थासाठी महत्त्वाचे पुरावे दिले आहेत. MLPerf पूर्वावलोकन परिणाम हे सिस्टमसाठी पहिले सार्वजनिक, स्वतंत्रपणे आयोजित केलेले कार्यप्रदर्शन डेटा आहेत. For more context on this story, see our ongoing latest AI developments.
पदार्पणाच्या मागे असलेले अंक
NVIDIA ने v6.1 सूटमधील दोन सर्वात मागणी असलेल्या वर्कलोड्सवर Vera Rubin NVL72 पूर्वावलोकन परिणाम सबमिट केले: DeepSeek-R1 तर्क मॉडेल आणि Qwen3-VL दृष्टी-भाषा मॉडेल.
Qwen3-VL वर, Vera Rubin NVL72 ने GB300 NVL72 पेक्षा 3.7 पट जास्त थ्रूपुट ऑफलाइन, सर्व्हर आणि परस्परसंवादी परिस्थितींमध्ये वितरित केले, NVIDIA च्या डायनॅमो ओपन-सोर्स इन्फरन्स फ्रेमवर्कसह vLLM चालवले. DeepSeek-R1 वर, NVIDIA ची TensorRT-LLM लायब्ररी वापरून, थ्रूपुट मागील फ्लॅगशिपपेक्षा 2.5 पट जास्त होते.
दोन्ही आकडे NVIDIA च्या MLCcommons' क्लोज्ड डिव्हिजनच्या स्वतःच्या सबमिशनमधून आले आहेत, याचा अर्थ ते MLPerf च्या ऑडिट केलेल्या नियमांनुसार तयार केले गेले आहेत, जरी पूर्वावलोकन परिणाम स्पष्टपणे प्लॅटफॉर्मचे प्रारंभिक मोजमाप अजूनही ऑप्टिमाइझ केले जात आहेत.
नफा कसा बांधला जातो
NVIDIA ने कोणत्याही एकाच घटकाऐवजी हार्डवेअर आणि सॉफ्टवेअरमध्ये फुल-स्टॅक को-डिझाइनला श्रेय दिले आहे.
सिलिकॉनच्या बाजूने, वेरा रुबिन वर्धित टेन्सर कोर आणि एक अद्ययावत ट्रान्सफॉर्मर इंजिन आणते जे अनुमानाच्या दोन्ही टप्प्यांना गती देते — कॉम्प्युट-हेवी प्रीफिल फेज आणि मेमरी-बाउंड डीकोड फेज. प्लॅटफॉर्म NVFP4 अचूकतेवर झुकते, जे मॉडेल वजन, लक्ष आणि केव्ही कॅशेचे मेमरी फूटप्रिंट कमी करते, जे NVIDIA आउटपुट गुणवत्तेचे किमान नुकसान म्हणून वर्णन करते त्यासह थ्रूपुट वाढवते.
सॉफ्टवेअरच्या बाजूने, सबमिशनमध्ये डिसॅग्रिगेटेड सर्व्हिंगचा वापर केला गेला, जे वेगवेगळ्या टास्कमध्ये प्रीफिल आणि डीकोड वेगळे करते, तसेच DeepSeek-R1 आणि Qwen3-VL सारख्या मॉडेल्समध्ये तज्ञांच्या मिश्रणाचे मिश्रण ठेवण्यासाठी मोठ्या प्रमाणात तज्ञ समांतरतेसह.
इंटरकनेक्ट हा तिसरा खांब आहे. NVL72 रॅक डिझाईन सहाव्या पिढीतील NVLink आणि NVLink स्विच वापरून 72 GPUs एकाच स्केल-अप डोमेनमध्ये जोडते, जे NVIDIA म्हणते की ऑफ-द-शेल्फ इथरनेट पेक्षा 10 पट जास्त पॅकेट दर आणि 3 पट कमी लेटन्सी प्रदान करते - हे फाउंडेशन रॅक-स्केल डिसॅरेगेक्टिक सर्व्हिसिंग करते.
GB300 जवळ-परफेक्ट स्केलिंग दाखवते
v6.1 फेरीत वर्तमान फ्लॅगशिपची स्वतःची बातमी होती. NVIDIA चे DeepSeek-R1 सबमिशन सिंगल GB300 NVL72 रॅक — 72 GPUs — वरून चार रॅक, 288 GPUs पर्यंत स्केल केले गेले, ऑफलाइन परिस्थितीत 99 टक्के स्केलिंग कार्यक्षमता प्राप्त केली, थ्रूपुट जोडलेल्या हार्डवेअरच्या प्रमाणात जवळजवळ वाढत आहे.
स्केलिंग कार्यक्षमता ही एक मेट्रिक डेटा-सेंटर ऑपरेटर बारकाईने पाहते कारण अधिक हार्डवेअर खरेदी केल्याने प्रत्यक्षात प्रमाणानुसार अधिक क्षमता खरेदी होते की नाही हे ते ठरवते. आंतर-रॅक संप्रेषणाऐवजी या स्केलमधील अडथळे प्रति-GPU कार्यप्रदर्शन राहतील असे सूचित करते.
सॉफ्टवेअर कंपाऊंडिंग ठेवते
MLPerf फेऱ्यांमध्ये एक आवर्ती पॅटर्न पुन्हा आयोजित केला गेला: एकट्या सॉफ्टवेअर सुधारणांनी NVIDIA च्या v6.1 सबमिशनमध्ये v6.0 च्या तुलनेत 1.6 पट जास्त कामगिरी केली आणि कंपनी म्हणते की v6.1 सबमिशनच्या अंतिम मुदतीनंतर ऑप्टिमायझेशन चालू राहिले, ज्यामुळे आणखी फायदा झाला.
खरेदीदारांसाठी, तात्पर्य असा आहे की दिलेला रॅक त्याच्या आयुष्यभरात हार्डवेअर रीफ्रेशशिवाय जलद होतो — एक डायनॅमिक NVIDIA ने असा युक्तिवाद केला आहे की सॉफ्टवेअर स्टॅक परिपक्व होताना त्याच्या इन्स्टॉल बेसचे अवमूल्यन होण्याऐवजी त्याचे मूल्य वाढते.
एजंटिक वर्कलोड्स बेंचमार्कला आकार देतात
v6.1 राउंड देखील कोणत्या अनुमानासाठी वापरला जात आहे त्यात बदल दर्शवितो. NVIDIA ने SemiAnalysis च्या AgentX बेंचमार्कवरील पूर्वावलोकन चाचणीकडे लक्ष वेधले, जे AI एजंट्सच्या आसपास डिझाइन केलेले आहे, ज्यामुळे अनेक पायऱ्यांवर योजना आखल्या जातात आणि कृती करतात, जिथे ते म्हणतात की Vera Rubin NVL72 ने GB300 NVL72 च्या 30 पट कामगिरी दिली.
MLCcommons देखील या शिफ्टसाठी समर्पित बेंचमार्क तयार करत आहे: आगामी MLPerf एंडपॉइंट्स बेंचमार्कचे उद्दिष्ट एजंटिक अनुमान वर्कलोड्सचे मापन प्रमाणित करणे आहे जे पारंपारिक थ्रूपुट चाचण्या खराबपणे कॅप्चर करतात. एकल-प्रॉम्प्ट चॅटमधून दीर्घ-मल्टी-स्टेप एजंट सत्रांकडे अनुमान हलवल्यामुळे, विलंबता आणि परस्पर सुसंगतता रॉ टोकन्स प्रति सेकंद जितकी महत्त्वाची आहे — आणि त्यानुसार बेंचमार्क पुन्हा तयार केले जात आहेत.
नेबियस आणि इकोसिस्टम लवकर येतात
क्लाउड प्रदाता नेबियसने Vera Rubin NVL72 पूर्वावलोकन परिणाम देखील सादर केले, जे NVIDIA ने मजबूत प्रारंभिक इकोसिस्टम कामगिरीचा पुरावा म्हणून हायलाइट केले. प्रारंभिक तृतीय-पक्ष सबमिशन हे सामान्यत: पुढील-पिढीच्या सिस्टीम प्रयोगशाळेच्या सॅम्पलिंगमधून व्यापक उपलब्धतेकडे वाटचाल करत असल्याचे लक्षण आहे, जरी NVIDIA ची पोस्ट किंवा MLCcommons चे प्रकाशन सामान्य-उपलब्धता वेळ निर्दिष्ट करत नाही.
एआय इकॉनॉमिक्ससाठी हे महत्त्वाचे का आहे
NVIDIA कमाईच्या अटींनुसार परिणाम फ्रेम करते: प्रत्येक Vera Rubin NVL72 रॅक लक्षणीयरीत्या अधिक टोकन व्युत्पन्न करतो, अधिक वापरकर्त्यांना सेवा देतो आणि GB300 NVL72 रॅकच्या तुलनेत प्रति टोकन किंमत कमी करतो. ज्या उद्योगात तर्कसंगत मॉडेल्स आणि एजंट वर्कलोड्स द्वारे अनुमानाची मागणी चालविली जात आहे जी साध्या चॅटपेक्षा प्रति क्वेरी अधिक मोजणीच्या ऑर्डरचा वापर करतात, प्रति-रॅक थ्रूपुट ही संख्या आहे जी निश्चित डेटा-सेंटर बजेट किती वापरकर्त्यांना सेवा देऊ शकते हे निर्धारित करते.
नेहमीच्या सावधगिरी लागू होतात: हे NVIDIA द्वारे निवडलेल्या दोन मॉडेल्सवर पूर्वावलोकन फेरीत विक्रेता सबमिशन आहेत, ऑप्टिमायझेशन अजूनही उतरत आहेत. पण दिशा अस्पष्ट आहे. MLPerf चे Vera Rubin वरील पहिले दृश्य 2023 पासून AI पायाभूत सुविधा परिभाषित केलेल्या कामगिरीच्या चढाईला सूचित करते - आणि पुढील रॅक-रिफ्रेश सायकल पुन्हा मोठ्या प्रमाणावर AI सेवा देण्याचे अर्थशास्त्र रीसेट करेल.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →