MLCommons ilitoa matokeo ya benchmark ya MLPerf Inference v6.1 mnamo Septemba 16, 2026, na kichwa cha habari kilikuwa cha jukwaa la kizazi kijacho la NVIDIA. Katika uwasilishaji wake wa hakikisho la kwanza kabisa, mfumo wa Vera Rubin NVL72 uliwasilisha hadi mara 3.7 ya uboreshaji wa kinara wa sasa wa NVIDIA wa GB300 NVL72, kulingana na tangazo la NVIDIA, ishara ya mapema ya nini mrithi wa Blackwell Ultra atamaanisha kwa uchumi wa uelekezaji wa AI.
Vera Rubin ni jukwaa linalofuata la kituo cha data cha NVIDIA, lililopewa jina la mtaalamu wa anga ambaye alitoa ushahidi muhimu wa mambo meusi. Matokeo ya onyesho la kukagua ya MPerf ni data ya kwanza ya utendaji ya umma, iliyopangwa kwa kujitegemea ya mfumo. For more context on this story, see our ongoing artificial intelligence updates.
Nambari za Nyuma ya Mwanzo
NVIDIA iliwasilisha matokeo ya onyesho la kukagua ya Vera Rubin NVL72 kwenye mizigo miwili ya kazi inayohitajika sana katika safu ya v6.1: muundo wa hoja wa DeepSeek-R1 na muundo wa lugha ya maono ya Qwen3-VL.
Kwenye Qwen3-VL, Vera Rubin NVL72 iliwasilisha hadi mara 3.7 upitishaji wa juu zaidi ya GB300 NVL72 katika hali za nje ya mtandao, seva na mwingiliano, inayotumia vLLM na mfumo wa maelekezo wa chanzo huria wa NVIDIA wa Dynamo. Kwenye DeepSeek-R1, kwa kutumia maktaba ya NVIDIA ya TensorRT-LLM, uboreshaji ulikuwa hadi mara 2.5 kuliko ubora wa awali.
Nambari zote mbili zinatokana na mawasilisho ya NVIDIA yenyewe kwa Kitengo Kilichofungwa cha MLCommons, kumaanisha kwamba zilitolewa chini ya sheria zilizokaguliwa za MLPerf, ingawa matokeo ya muhtasari ni vipimo vya mapema vya jukwaa ambalo bado linaboreshwa.
Jinsi Faida Zinavyojengwa
NVIDIA inahusisha kuruka kwa muundo-shirikishi kamili kwenye maunzi na programu badala ya sehemu yoyote.
Kwa upande wa silicon, Vera Rubin huleta Mihimili ya Tensor iliyoboreshwa na Injini ya Kibadilishaji iliyosasishwa ambayo huharakisha hatua zote mbili za makisio - awamu ya kujaza mzito wa compute na awamu ya kusimbua inayofungamana na kumbukumbu. Jukwaa hutegemea usahihi wa NVFP4, ambayo hupunguza kumbukumbu ya uzani wa mfano, umakini na kashe ya KV, na kuongeza matokeo na kile NVIDIA inaelezea kama upotezaji mdogo wa ubora wa matokeo.
Kwa upande wa programu, mawasilisho yalitumia huduma iliyogawanywa, ambayo hutenganisha ujazo wa awali na kusimbua kwenye kazi tofauti, pamoja na usambamba wa kiwango kikubwa cha wataalamu ili kuweka tabaka za mchanganyiko wa wataalam katika miundo kama vile DeepSeek-R1 na Qwen3-VL imejaa kazi.
Muunganisho ni nguzo ya tatu. Muundo wa rack wa NVL72 huunganisha GPU 72 kwenye kikoa cha kuongeza kiwango kimoja kwa kutumia NVLink ya kizazi cha sita na NVLink Switch, ambayo NVIDIA inasema inatoa viwango vya juu vya pakiti mara 10 na muda wa kusubiri wa chini mara 3 kuliko Ethernet ya nje ya rafu - msingi unaofanya huduma ya kiwango cha rack iliyogawanywa kuwa ya vitendo.
GB300 Inaonyesha Upeo wa Karibu-Kamili
Bendera ya sasa ilikuwa na habari zake katika raundi ya v6.1. Uwasilishaji wa DeepSeek-R1 wa NVIDIA ulipunguzwa kutoka rack moja ya GB300 NVL72 - GPU 72 - hadi raki nne, GPU 288, na kufikia asilimia 99 ya ufanisi wa kuongeza katika hali ya nje ya mtandao, na uboreshaji unakua karibu kulingana na maunzi yaliyoongezwa.
Ufanisi wa kuongeza ni kipimo cha waendeshaji wa kituo cha data ambacho hutazama kwa karibu kwa sababu huamua ikiwa kununua maunzi zaidi hununua uwezo zaidi sawia. Uwekaji wa mstari wa karibu kwenye rafu unapendekeza kizuizi katika kiwango hiki kinasalia na utendaji wa kila GPU badala ya mawasiliano baina ya rack.
Programu Inaendelea Kuchanganya
Mtindo unaojirudia katika raundi za MPerf uliofanyika tena: uboreshaji wa programu pekee ulileta utendakazi hadi mara 1.6 katika mawasilisho ya v6.1 ya NVIDIA ikilinganishwa na v6.0, na kampuni inasema uboreshaji uliendelea kutekelezwa baada ya tarehe ya mwisho ya kuwasilisha v6.1, na kuleta faida zaidi.
Kwa wanunuzi, maana yake ni kwamba rafu fulani inakua haraka maishani mwake bila kusasisha maunzi - NVIDIA mahiri imetumia kusema kuwa msingi wake uliosakinishwa unathaminiwa badala ya kushuka thamani kadiri rafu ya programu inavyoendelea kukomaa.
Mizigo ya Kazi ya Kiajenti Tengeneza Upya Vigezo
Mzunguko wa v6.1 pia ulionyesha mabadiliko katika marejeleo yanayotumiwa. NVIDIA ilielekeza kwenye jaribio la kukagua kwenye kigezo cha SemiAnalysis's AgentX, kilichoundwa karibu na mawakala wa AI kwa sababu hiyo, kupanga na kuchukua hatua katika hatua nyingi, ambapo inasema Vera Rubin NVL72 aliwasilisha mara 30 utendakazi wa GB300 NVL72.
MLCommons pia inatayarisha kigezo maalum cha mabadiliko haya: alama inayokuja ya MPerf Endpoints inalenga kusawazisha upimaji wa mizigo ya kimaelekezo ya mawakala ambayo majaribio ya kawaida ya upitishaji yanapata vibaya. Mawazo yanaposogezwa kutoka kwa gumzo la papo hapo kuelekea vikao virefu vya wakala wa hatua nyingi, muda wa kusubiri na uthabiti shirikishi huwa ni muhimu kama tokeni mbichi kwa sekunde - na vigezo vinajengwa upya ipasavyo.
Nebius na Mfumo wa Ikolojia Huwasili Mapema
Mtoa huduma wa Wingu Nebius pia aliwasilisha matokeo ya onyesho la kukagua Vera Rubin NVL72, ambayo NVIDIA iliangazia kama ushahidi wa utendakazi wa mapema wa mfumo ikolojia. Mawasilisho ya mapema ya wahusika wengine kwa kawaida ni ishara kwamba mifumo ya kizazi kijacho inahama kutoka kwa sampuli za maabara kuelekea upatikanaji mpana, ingawa hakuna chapisho la NVIDIA wala toleo la MLCommons linalobainisha muda wa upatikanaji wa jumla.
Kwa Nini Ni Muhimu kwa AI Economics
NVIDIA huweka matokeo katika masharti ya mapato: kila rafu ya Vera Rubin NVL72 inazalisha tokeni nyingi zaidi, hutumikia watumiaji zaidi na inapunguza gharama kwa kila tokeni ikilinganishwa na rack ya GB300 NVL72. Katika tasnia ambayo mahitaji ya makisio yanaendeshwa na miundo ya hoja na mzigo wa kazi wa mawakala ambao hutumia maagizo ya ukubwa zaidi kukokotoa kwa kila hoja kuliko gumzo rahisi, matokeo ya kila safu ni nambari inayobainisha ni watumiaji wangapi ambao bajeti ya kituo cha data inaweza kutumika.
Mawazo ya kawaida yanatumika: haya ni mawasilisho ya wauzaji katika duru ya onyesho la kukagua, kwenye miundo miwili iliyochaguliwa na NVIDIA, huku uboreshaji ukiwa bado unatua. Lakini mwelekeo hauna utata. Mtazamo wa kwanza wa MLPerf kwa Vera Rubin unapendekeza upandaji wa utendaji ambao umefafanua miundombinu ya AI tangu 2023 haina uwanda unaoonekana - na kwamba mzunguko unaofuata wa uboreshaji utaweka upya uchumi wa kutumikia AI kwa kiwango.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →