MLCommons släppte MLPerf Inference v6.1 benchmarkresultat den 16 september 2026, och rubriken tillhörde NVIDIAs nästa generations plattform. I sin första förhandsinlämning någonsin levererade Vera Rubin NVL72-systemet upp till 3,7 gånger genomströmningen av NVIDIAs nuvarande flaggskepp GB300 NVL72, enligt NVIDIAs tillkännagivande, en tidig signal om vad efterföljaren till Blackwell Ultra kommer att betyda för AI-inferensekonomi.

Vera Rubin är NVIDIAs nästa datacenterplattform, uppkallad efter astrofysikern som gav nyckelbevis för mörk materia. MLPerf-förhandsgranskningsresultaten är de första offentliga, oberoende organiserade prestandadata för systemet. For more context on this story, see our ongoing AI industry coverage.

Siffrorna bakom debuten

NVIDIA skickade in Vera Rubin NVL72-förhandsgranskningsresultat för två av de mest krävande arbetsbelastningarna i v6.1-sviten: DeepSeek-R1-resonemangsmodellen och Qwen3-VL-visionspråksmodellen.

På Qwen3-VL levererade Vera Rubin NVL72 upp till 3,7 gånger högre genomströmning än GB300 NVL72 över offline-, server- och interaktiva scenarier, och körde vLLM med NVIDIAs Dynamo open-source inferensramverk. På DeepSeek-R1, med hjälp av NVIDIAs TensorRT-LLM-bibliotek, var genomströmningen upp till 2,5 gånger högre än det tidigare flaggskeppet.

Båda siffrorna kommer från NVIDIAs egna inlämningar till MLCommons' Closed Division, vilket innebär att de producerades under MLPerfs granskade regler, även om förhandsgranskningsresultaten uttryckligen är tidiga mätningar av en plattform som fortfarande är optimerad.

Hur vinsterna byggs

NVIDIA tillskriver hoppet till full-stack co-design över hårdvara och mjukvara snarare än någon enskild komponent.

På kiselsidan tar Vera Rubin med sig förbättrade Tensor-kärnor och en uppdaterad transformatormotor som accelererar båda faserna av inferens – den beräkningstunga förfyllningsfasen och den minnesbundna avkodningsfasen. Plattformen stöder sig på NVFP4-precision, vilket minskar minnesfotavtrycket för modellvikter, uppmärksamhet och KV-cache, vilket ökar genomströmningen med vad NVIDIA beskriver som minimal förlust av utskriftskvalitet.

På mjukvarusidan använde inlämningarna disaggregerad visning, som separerar förfyllning och avkodning till olika uppgifter, tillsammans med storskalig expertparallellism för att hålla blandningen av expertskikt i modeller som DeepSeek-R1 och Qwen3-VL fullt matade med arbete.

Sammankopplingen är den tredje pelaren. NVL72-rackdesignen knyter samman 72 GPU:er till en enda uppskalningsdomän med hjälp av sjätte generationens NVLink och NVLink Switch, som NVIDIA säger levererar 10 gånger högre pakethastigheter och 3 gånger lägre latens än från hyllan Ethernet – grunden som gör disaggregerad servering i rackskala praktisk.

GB300 visar nästan perfekt skalning

Det nuvarande flaggskeppet hade sina egna nyheter i v6.1-omgången. NVIDIAs DeepSeek-R1-inlämning skalade från ett enda GB300 NVL72-rack — 72 GPU:er — till fyra rack, 288 GPU: er, vilket uppnådde 99 procent skalningseffektivitet i offline-scenariot, med genomströmningen som växte nästan i proportion till den tillsatta hårdvaran.

Skalningseffektivitet är ett mått som datacenteroperatörer följer noga eftersom det avgör om köp av mer hårdvara faktiskt köper proportionellt mer kapacitet. Nästan linjär skalning över rack tyder på att flaskhalsen i denna skala förblir prestanda per GPU snarare än kommunikation mellan rack.

Programvaran fortsätter att sammansättas

Ett återkommande mönster i MLPerf-omgångarna höll sig igen: enbart mjukvaruförbättringar gav upp till 1,6 gånger högre prestanda i NVIDIAs v6.1-inlämningar jämfört med v6.0, och företaget säger att optimeringar fortsatte att landa efter v6.1-inlämningsdeadline, vilket gav ytterligare vinster.

För köpare är innebörden att ett givet rack blir snabbare under sin livstid utan en hårdvaruuppdatering – en dynamisk NVIDIA har använt för att hävda att dess installerade bas uppskattas snarare än försvagas när mjukvarustacken mognar.

Agentiska arbetsbelastningar Forma om riktmärkena

V6.1-omgången återspeglade också en förändring i vad slutledning används för. NVIDIA pekade på förhandstestning av SemiAnalysis AgentX-riktmärke, designad kring AI-agenter som resonerar, planerar och agerar över flera steg, där det står att Vera Rubin NVL72 levererade 30 gånger prestanda jämfört med GB300 NVL72.

MLCommons förbereder också ett dedikerat riktmärke för detta skifte: det kommande MLPerf Endpoints riktmärket syftar till att standardisera mätning av agentiska slutledningsarbetsbelastningar som traditionella genomströmningstester fångar dåligt. När slutledningar går från en snabb chatt till långa agentsessioner i flera steg, spelar latens och interaktiv konsekvens lika mycket som råa tokens per sekund – och riktmärken byggs om därefter.

Nebius och ekosystemet anländer tidigt

Molnleverantören Nebius skickade också in Vera Rubin NVL72-förhandsgranskningsresultat, vilket NVIDIA lyfte fram som bevis på stark tidiga ekosystemprestanda. Tidiga inlämningar från tredje part är vanligtvis ett tecken på att nästa generations system går från labbsampling till bredare tillgänglighet, även om varken NVIDIAs inlägg eller MLCommons release specificerar tidpunkten för allmän tillgänglighet.

Varför det är viktigt för AI-ekonomi

NVIDIA ramar in resultaten i intäktstermer: varje Vera Rubin NVL72-rack genererar betydligt fler tokens, betjänar fler användare och sänker kostnaden per token jämfört med ett GB300 NVL72-rack. I en bransch där efterfrågan på slutsatser drivs av resonemangsmodeller och agentarbetsbelastningar som förbrukar storleksordningar mer beräkning per fråga än enkel chatt, är genomströmning per rack det antal som avgör hur många användare en fast datacenterbudget kan tjäna.

De vanliga varningarna gäller: det här är leverantörsbidrag i en förhandsgranskningsrunda, på två modeller valda av NVIDIA, med optimeringar som fortfarande landar. Men riktningen är entydig. MLPerfs första titt på Vera Rubin antyder att prestandastigningen som har definierat AI-infrastrukturen sedan 2023 inte har någon platå i sikte – och att nästa rack-uppdateringscykel återigen kommer att återställa ekonomin för att betjäna AI i stor skala.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →